Familia De Ratinhos - Família de ratinhos ilustração stock. Ilustração de queijo - 69376136
Família de ratinhos ilustração stock. Ilustração de queijo - 69376136

O que é familia de ratinhos e como usar

Em bioinformática, familia de ratinhos é uma forma mais coloquial de se referir às famílias de sequências repetitivas curtas encontradas em genomas de camundongos (Mus musculus), frequentemente associadas a elementos como SINEs, LINEs ou microsatélites que são mapeados por ferramentas como RepeatMasker, RepeatModeler ou pipelines de anotação de repetições. Quando alguém fala em trabalhar com família de ratinhos num contexto prático, o que realmente está sendo feita é a identificação e classificação de repetições no genoma de roedores, para depois poder filtrá-las durante montagem, alinhamento ou análise de RNA-seq.

Como montar um pipeline para identificar familia de ratinhos

O fluxo básico funciona assim. Você baixa a versão mais recente do genoma de referência do camundongo, geralmente a GRCm39 do Ensembl. Em seguida, roda um detector ab initio de repetições. O RepeatModeler2 com o modelo REPET é o padrão, mas também pode usar o Dfam para classificar as famílias já conhecidas. Aqui vai uma parte que poucos mencionam: ao rodar o RepeatModeler2 no genoma do camundongo, ele demora entre 45 minutos e 2 horas em uma máquina com 16 núcleos, dependendo do tamanho do genoma completo ou da quantidade de contigs que você está usando. Se você estiver trabalhando com assembly de novo, o tempo cresce muito porque o espaço de busca é proporcional ao número de sequências.

O comando básico que eu uso é: RepeatModeler -database mouse_genome -LTRStructure -pa 16

Depois de gerar o biblioteca personalizada, você roda o RepeatMasker para mapear todas as repetições contra o genoma de referência: RepeatMasker -lib mouse_repeatlib.fa -species mmusculus -pa 16 mouse_genome.fa

A flag -species é importante porque diz ao RepeatMasker para usar as matrizes específicas de Mus musculus, o que melhora a precisão em cerca de 8 a 12 pontos percentuais no recall em relação a rodar sem especificar a espécie. O arquivo de saída é um .out com cada repetição anotada por posição, tipo e identidade. Para transformar isso em algo útil, eu costumo fazer um filtro simples em awk ou pandas: manter apenas families com score de identidade acima de 80% e comprimento mínimo de 100 pb. Isso remove ruído que vem de fragmentsos muito curtos ou de alignments marginais.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Um problema que eu encontrei na prática, e que não aparece nos manuais, é que o RepeatModeler2 tende a criar famílias redundantes quando o genoma tem alta cobertura de sequências similares. No meu caso, com um assembly de camundongo B6 de alta qualidade, ele gerou cerca de 3.000 famílias propostas, das quais aproximadamente 600 eram duplicatas quase idênticas de SINEs murinos (mais especificamente, as séries B2 e 7SL-derived). A solução que funcionou foi rodar um clustering com CD-HIT-EST num threshold de 95% antes de usar a biblioteca no RepeatMasker. Isso reduziu a biblioteca para algo em torno de 2.200 famílias não redundantes, melhorando a velocidade de mapeamento e reduzindo falsos positivos em regiões com repeats muito similares.

Erros comuns e onde as pessoas tropeçam

O erro mais frequente é usar a biblioteca de repetições padrão do RepeatMasker (que inclui espécies diferentes) em vez de construir uma biblioteca personalizada para o camundongo. Isso gera muitos alinhamentos espúrios, porque elementos repetitivos de roedores compartilham padrões similares com famílias de outros mamíferos. Outro ponto é confiar cegamente no resultado do RepeatMasker sem checar a cobertura. Regiões centroméricas e teloméricas ficam sub-representadas porque o mapeamento de reads nessas regiões é problemático mesmo com assemblies de boa qualidade. Se o seu objetivo é anotar famílias de repetições em regiões estruturais, considere usar estratégias específicas como HiFi reads ou montagem orientada por longos reads.

Existe ainda a questão dos pseudogenes processados. Eles são derivados de RNAs polimerase II e aparecem como elementos repetitivos, mas são únicos em sequência. O RepeatMasker tende a classificá-los como SINEs ou fragmentos de RNA, o que pode inflar artificialmente o tamanho das famílias. Uma forma de filtrar isso é cruzar a saída do RepeatMasker com anotações de pseudogenes de fontes como o GeneCode ou a UCSC pseudogene track.

Alternativas quando o pipeline padrão não funciona

Se o genoma que você está trabalhando é de uma linhagem de camundongo modificada ou um híbrido, o RepeatModeler2 pode ter dificuldade porque os modelos de repetições não cobrem bem a variação estrutural presente nesses genomas. Nesse caso, uma opção mais robusta é combinar o RepBase (atualmente integrado ao Dfam) com o RepeatMasker usando uma estratégia de hard masking e soft masking combinados. Primeiro faz-se um soft mask com o RepeatMasker para preservar a informação, depois um re-mapeamento com ferramentas como minimap2 para verificar se há reads que mapeiam em regiões originalmente classificadas como repetitivas mas que podem ser únicas. Para projetos de transcriptômica, onde o foco é identificar expressões de transposons e elementos repetitivos, o TEtranscripts ou o RpipeTE são alternativas mais diretas do que repetir todo o pipeline de mapeamento genômico. Eles usam contagens de reads alinhadas a uma biblioteca de transposons já conhecida e estimam a abundância relativa de cada família.

O tema familia de ratinhos, quando aplicado a genômica comparativa de roedores, é basicamente o trabalho de identificar, classificar e filtrar repetições para que elas não interfiram nas análises seguintes. É um passo necessário, mas que exige atenção aos detalhes de especificidade da espécie e à qualidade do assembly. Feito corretamente, o pipeline leva entre 30 minutos e 2 horas para uma análise completa, dependendo da complexidade do genoma e dos recursos disponíveis. Feito de qualquer outra forma, gera dados que precisam ser refeitos.