Análise bioinformática: análise de novo ou alinhamento por referência

Introdução

A bioinformática desenvolve métodos para armazenar, processar e interpretar dados biológicos. Com o avanço do sequenciamento de nova geração (NGS), tornou-se possível gerar grandes volumes de dados de genômica e transcriptômica com menor custo e em menos tempo. Nesse sentido, para processar e analisar essas leituras (reads), são utilizados principalmente duas estratégias computacionais: a análise de novo e o alinhamento por referência, ambas essenciais para a montagem, anotação e caracterização das sequências biológicas. 

O que é a análise de novo?

A análise de novo (mais especificamente, montagem de novode novo assembly) é o processo de reconstrução de uma sequência genômica ou transcriptômica sem utilizar um modelo previamente conhecido. Nesse sentido, as leituras de sequenciamento (reads) são organizadas e unidas com base apenas nas sobreposições e relações entre si.

O que é o alinhamento por referência?

Por outro lado, o alinhamento por referência (reference-based alignment ou read mapping) é uma abordagem computacional em que as leituras são comparadas e posicionadas sobre um genoma ou transcriptoma de referência já existente. O objetivo desse processo é determinar a posição exata de origem de cada read no modelo padrão, o que possibilita identificar variantes, avaliar a cobertura e comparar amostras.

Análise de novo ou alinhamento por referência: quais as diferenças? 

As principais diferenças entre essas abordagens estão nos requisitos de entrada, no modo de processamento e nas suas aplicações:

  • Análise de novo: Não depende de uma sequência de referência, permitindo descobrir novas sequências, isoformas e regiões ausentes em modelos conhecidos. Entretanto, essa estratégia exige maior capacidade computacional e pode gerar montagens redundantes.
  • Alinhamento por referência: Utiliza um genoma ou transcriptoma já mapeado, o que torna as análises mais rápidas, precisas e econômicas, desde que haja um modelo de boa qualidade. Contudo, a eficiência dessa abordagem depende diretamente da representatividade dessa referência. Sendo assim, se o modelo for incompleto ou muito diferente do organismo analisado é possível que sejam introduzidos vieses.

Como escolher a abordagem mais adequada para cada projeto 

A decisão entre utilizar a análise de novo ou o alinhamento por referência depende da disponibilidade de uma sequência de referência e dos objetivos do estudo:

  • A análise de novo é mais indicada quando não existe um modelo confiável ou quando o foco é descobrir novas sequências, transcritos e isoformas.
  • Já o alinhamento por referência é a opção preferencial se existe uma sequência de referência bem caracterizada. Essa escolha possibilita realizar mapeamentos, quantificar a expressão gênica e identificar variantes de forma orientada, rápida e eficiente.

Conclusão

A análise de novo e o alinhamento por referência são abordagens complementares e fundamentais para a bioinformática. Como cada estratégia atende a necessidades específicas, a escolha da metodologia correta é determinante para garantir resultados confiáveis. Portanto, avaliar fatores como a disponibilidade de um genoma de referência, o organismo em estudo e as perguntas biológicas do projeto permite definir o fluxo de trabalho mais adequado. Por isso, é importante contar com conhecimento técnico e planejamento desde as etapas iniciais para transformar dados de sequenciamento em descobertas úteis.

Como a Protos Biotec Jr. pode ajudar?

Na Protos Biotec Jr., contamos com uma equipe capacitada para auxiliar no planejamento e na execução de análises bioinformáticas, sempre considerando os objetivos e as particularidades de cada projeto.

Se você busca uma análise bioinformática alinhada às necessidades da sua pesquisa, entre em contato com a Protos Biotec Jr. e descubra como podemos apoiar no processamento e na interpretação dos seus dados de sequenciamento.

Referências

JAIN, Prachi; KRISHNAN, Neeraja M.; PANDA, Binay. Augmenting transcriptome assembly by combining de novo and genome-guided tools. PeerJ, v. 2013, n. 1, e133, 2013. DOI: https://doi.org/10.7717/peerj.133.

LI, Xuan; KONG, Yimeng; ZHAO, Qiong-Yi; LI, Yuan-Yuan; HAO, Pei. De novo assembly of transcriptome from next-generation sequencing data. Quantitative Biology, v. 4, n. 2, p. 94–105, 2016. DOI: https://doi.org/10.1007/s40484-016-0069-y.

ROBINSON, Peter N.; PIRO, Rosario M.; JÄGER, Marten (eds.). Computational exome and genome analysis. Boca Raton: CRC Press, Taylor & Francis Group, 2018.