23 de junho de 2012
Seqüenciamento de DNA pool é uma estratégia rápida e de custo eficaz para detectar variantes raras associadas com fenótipos complexos em grandes grupos. Aqui descrevemos a análise computacional de pool, o seqüenciamento da próxima geração de 32 genes relacionados ao câncer, utilizando o pacote de software SPLINTER. Este método é escalável, e aplicável a qualquer fenótipo de interesse.
O objetivo geral deste procedimento é identificar genes dentro de uma população de indivíduos que apresentam uma predominância de variação funcional rara. Isso é realizado primeiramente reunindo uma população de amostras de DNA. O segundo passo é criar e sequenciar uma biblioteca de sequenciamento de próxima geração.
Em seguida, realiza-se o alinhamento das leituras à sequência de referência e a criação de um modelo de erro. O passo final é a análise computacional utilizando o algoritmo splinter. Em última instância, a análise splinter de sequenciamento em massa de próxima geração é utilizada para identificar genes dentro de populações que apresentam uma predominância de variação funcional rara, demonstrando o procedimento.
Hoje será Francesco Vilania, que é aluno de pós-graduação no laboratório do meu orientador e colaborador, Rob Mitra, e ele será acompanhado por Enrique Ramos, um aluno de pós-graduação no meu laboratório. A principal vantagem dessa técnica em relação a métodos existentes, como genótipos individuais únicos, é que ela permite detectar com grande precisão variantes de sequência raras em uma população mista de moléculas de DNA, sem exigir qualquer informação prévia. Este método pode ajudar a responder perguntas fundamentais nas áreas de genética e genômica, como determinar a frequência de variantes raras que causam doenças em estudos de grandes coortes.
Cada experimento de fragmentação requer a presença de um controle negativo e positivo para obter precisão ideal; prepare a mistura de reação de PCR utilizando a DNA polimerase PFU ultra high fidelity. O controle negativo é um produto de PCR de qualquer sequência de DNA conhecida por não apresentar variação genética, como um vetor clonado.
Aqui, é utilizado um amplicon de 1.934 pares de bases do vetor M13 MP18. O controle positivo pode ser qualquer conjunto de variantes de sequência previamente validadas, presentes em toda a população. Se esses dados não estiverem disponíveis, este laboratório projetou um controle positivo artificial, consistindo em um produto de PCR de 331 pares de bases a partir de uma mistura de sequências modificadas clonadas no vetor PGMT easy, conforme listado nesta tabela.
Essas sequências são combinadas para simular diversas frequências alélicas menores de variantes verdadeiras dentro do grupo de pacientes. Após a amplificação por PCR das amostras, conforme discutido no protocolo escrito que acompanha este vídeo, purifique cada produto de PCR dos primers em excesso utilizando a purificação rápida em coluna Kyogen Kayak ou placas-filtro de 96 poços com manifold a vácuo para limpeza em larga escala. Após a purificação, quantifique cada produto de PCR utilizando técnicas padrão.
Prepare-se para combinar todos os produtos de PCR e controles em um pool normalizado pelo número de moléculas. O agrupamento por concentração resultará na super-representação de amplicons pequenos em relação aos produtos maiores. Em vez disso, una um número normalizado de moléculas por amplicon.
Escolha números arbitrários que sejam grandes o suficiente para manter a precisão durante a pipetagem. Retire os produtos de PCR e os controles. A ligação dos produtos de PCR é necessária porque a fragmentação de pequenos produtos de PCR provavelmente causará um viés na representação em direção às suas extremidades.
Por esse motivo, ligamos os produtos de PCR de encolhimento em um vetor grande antes de sua fragmentação. Prepare a mistura para ligação de extremidades rombas utilizando T four Ligase, T four PNK e PEG conforme listado no protocolo. Incube a reação a 22 graus Celsius por 17 horas.
Em seguida, incubar a 65 graus Celsius por 20 minutos e manter a quatro graus Celsius. Depois disso, verifique a ligação carregando 50 nanogramas da amostra em um gel de agarose. Uma ligação bem-sucedida resultará em uma banda de alto peso molecular presente na trilha.
Prepare-se para a fragmentação do DNA por meio de uma estratégia de sonicação aleatória diluindo a amostra em uma proporção de 10 para 1 no Buffer Qiagen PB para torná-la menos viscosa. Em seguida, fragmente o grande cone de produtos de PCR utilizando um bio-ruptor com nó diagonal de 24 amostras, sonique em alta potência durante 25 minutos com 40 segundos ligados e 20 segundos desligados por minuto. Verifique os resultados da fragmentação do DNA em um gel de agarose e prossiga com o sequenciamento iluminoso conforme descrito no texto.
Para iniciar o sequenciamento, faça o alinhamento das leituras. Converta os arquivos brutos de sequenciamento, leituras, para o formato scarf ou comprima-os. A compressão é opcional.
Economiza tempo e espaço para as etapas subsequentes de análise sem perder nenhuma informação relevante. Utilizando a ferramenta de alinhamento incluída, alinhe as leituras brutas à sequência de referência anotada mais rápida. Específicos das regiões direcionadas incluem as reações de PCR, bem como os controles positivo e negativo.
O formato de entrada deve estar no formato scarf ou comprimido. Em seguida, realize a marcação de arquivos conforme descrito no texto. Cada execução gera um perfil único de erro de sequenciamento a ser caracterizado para chamada precisa de variantes, a fim de modelar os erros para cada execução.
Um controle interno conhecido por apresentar variação de sequência é incluído em cada biblioteca de amostras em pool. A partir do arquivo marcado alinhado, gere um arquivo de modelo de erro utilizando a ferramenta incluída com a sequência de referência do controle negativo; todas as sequências do controle negativo podem ser usadas, ou, alternativamente, apenas um subconjunto, quando especificado pelas extremidades cinco prima e três prima. Leituras únicas e contagens pseudos devem ser sempre aplicadas.
A ferramenta gerará três arquivos nomeados conforme o parâmetro do nome do arquivo de saída, terminando com zero, um ou dois. Esses arquivos correspondem respectivamente a um modelo de erro de ordem zero, primeira e segunda ordem para chamada de variantes com splinter. O modelo de erro de segunda ordem deve sempre ser utilizado para a visualização do perfil de taxa de erro da execução.
O script Pearl utilizado para gerar o gráfico do modelo de erro pode ser empregado para criar um gráfico de erro em PDF a partir do arquivo do modelo de erro de ordem zero. O arquivo de gráfico revelará tendências específicas de erros por execução e poderá ser utilizado para inferir o número máximo de bases lidas para a análise. A seção a seguir demonstrará como executar o splinter no arquivo alinhado utilizando o modelo de erro para detectar variantes de sequência raras.
O primeiro passo na análise é executar o splinter no arquivo alinhado utilizando a sequência de referência e o modelo de erro. Bases individuais de leitura podem ser excluídas da análise se forem identificadas como defeituosas. O valor de corte de P determina o quão rigorosa será a análise de chamada de variantes.
Um valor mínimo de corte de menos 1,301 é um bom ponto de partida. A opção de tamanho do grupo otimiza a discriminação sinal-ruído do algoritmo ao eliminar a variância potencial com frequências de alelos menores do que a de um único alelo no grupo real. A opção de tamanho do grupo deve ser definida para o valor mais próximo que seja maior do que o número real de alelos analisados no experimento.
A variância detectada em frequências mais baixas será ignorada como ruído. Após inserir todos os parâmetros e nomes de arquivos, execute o splinter. Este arquivo retorna todos os acertos estatisticamente significativos ao longo da amostra, com uma descrição da posição e do tipo de variante.
Valor de P por frequência de fita de DNA da variante e cobertura total por fita de DNA. O frasco da lista é usado pelo splinter para normalizar a cobertura entre as amostras. O primeiro campo indica o amplicon de interesse, enquanto o segundo campo indica a posição na qual a mutação está presente.
N indica que o restante da sequência não contém nenhuma mutação. Uma normalização, a análise do controle positivo é fundamental para maximizar a sensibilidade e a especificidade de uma corrida específica. Isso é importante porque muito provavelmente o valor inicial de corte de menos 1,301 não será suficiente para eliminar todos os falsos positivos.
Cada análise de fragmentos mostrará o valor P real para cada variante identificada, o qual não poderia ser previsto previamente. No entanto, toda a análise pode ser repetida utilizando o valor P menos rigoroso exibido na saída inicial para as posições de bases verdadeiras positivas conhecidas. Isso servirá para reter todos os verdadeiros positivos, excluindo a maioria, senão todos, os falsos positivos, que normalmente apresentam valores P muito menos significativos em comparação com os verdadeiros positivos.
Para automatizar este processo, pode-se usar o script do testador de corte. O script do testador de corte requer um arquivo de saída do Splinter e uma lista de hits de controle positivo no formato de um arquivo delimitado por tabulação, como o utilizado para normalização. A saída resultante será uma lista de pontos de corte que progressivamente atingem o ideal.
A última linha representa o corte mais ideal para a execução e pode, portanto, ser usada para análise de dados. O resultado ideal é alcançar sensibilidade e especificidade iguais a um. No entanto, se isso não for alcançado, a análise de fragmentos pode ser otimizada alterando o número de bases de leitura incorporadas.
O corte final pode ser aplicado aos dados usando o script cutoff cut, que filtrará o arquivo de saída splinter, removendo os resultados abaixo do valor de corte ótimo. Esta etapa gerará o arquivo final de saída splinter, que conterá os snips e indels presentes na amostra. Observe que a saída para inserções é ligeiramente diferente daquela para substituições ou deleções.
A precisão em função da cobertura para um único alelo em uma amostra agrupada é visualizada neste tipo de gráfico. A precisão é estimada pela área sob a curva, abreviada como AUC (área sob a curva característica de operação do receptor), e varia de uma precisão aleatória de 0,5 a uma precisão perfeita de 1,0. Neste exemplo, a AUC é representada em função da cobertura por alelo para a detecção de alelos mutantes únicos em grupos de 200 a 501.000 alelos.
Aqui, uma UC é representada como uma função do total de inserções, deleções e substituições. Este gráfico de erro mostra a probabilidade de incorporação de uma base incorreta em uma posição específica. O perfil de erro revela taxas baixas de erro com uma tendência crescente em direção à extremidade três prima da leitura de sequenciamento.
Nucleotídeos de referência notavelmente diferentes exibem diferentes probabilidades de erro. Este gráfico revela a precisão do splinter na estimativa da frequência alélica para posições que tiveram cobertura superior a 25 vezes por alelo. Uma comparação entre as frequências alélicas de DNA em pool estimadas pelo splinter e as contagens alélicas medidas por estudos de associação genômica ampla ou resultados de GWAS.
Em uma correlação muito alta, uma população de 974 indivíduos foi selecionada e direcionada para sequenciamento em mais de 20 quilobases. O programa Splinter foi aplicado para a detecção de variantes raras. Após o protocolo padrão, cada indivíduo teve seu genotipagem previamente realizado por concordância gwas entre a genotipagem de variantes marcadas e novas variantes.
As chamadas na amostra agrupada foram excelentes. Três variantes, das quais duas eram raras na população, foram identificadas como *de novo* a partir dos resultados do sequenciamento e foram validadas por meio de pirosequenciamento individual; as frequências do alelo minoritário ou a concordância matemática entre o pirosequenciamento e o sequenciamento agrupado foram excelentes. Após concluir a identificação de suas variantes raras na amostra agrupada, muitas pessoas desejam saber quais são as consequências funcionais das variantes que identificaram.
Assim, a anotação da sua variância torna-se a próxima etapa do processo após um desenvolvimento. Esta técnica abriu caminho para pesquisadores na área de sequenciamento de DNA estudarem variantes raras de forma rápida e econômica, possibilitando a caracterização de variantes raras em estudos com grandes populações. Após assistir a este vídeo, você deverá ter uma boa compreensão de como detectar variantes de sequência raras em uma amostra de DNA em pool utilizando o splinter.
O sequenciamento de DNA em pool é um método eficiente para identificar variantes genéticas raras associadas a características complexas em grandes populações. Este artigo detalha a análise computacional de dados de sequenciamento em pool provenientes de 32 genes relacionados ao câncer, utilizando o pacote de software SPLINTER.
A detecção de variantes genômicos raros em populações grandes é fundamental para a validação de alvos na pesquisa de doenças complexas, onde variantes comuns não conseguem explicar a variabilidade fenotípica. A abordagem de sequenciamento em pool habilitada pelo SPLINTER fornece um método escalonável e economicamente viável para investigar hipóteses terapêuticas mediante a identificação de variantes funcionais de baixa frequência, sem necessidade de conhecimento prévio sobre as variantes. Isso contribui para a redução de riscos na fase inicial da descoberta, permitindo a estimativa da frequência alélica e a confirmação de variantes em coortes relevantes para a doença, orientando diretamente a priorização de portfólios e estudos mecanicistas subsequentes.
O método se insere no continuum de descoberta, desde a geração de hipóteses até a identificação de compostos promissores, fornecendo saídas de detecção de variantes que orientam a seleção de alvos e a preparação de ensaios.