Entendendo cognatos na prática
A maior parte das pessoas acha que cognatos são aquelas palavras parecidas entre línguas que facilitam a tradução. E funciona até certo ponto, mas o assunto é muito mais chato do que parece quando você começa a se deparar com exceções. Cognatos são palavras de diferentes idiomas que compartilham uma origem etimológica comum. Em termos simples, elas vêm da mesma raiz e evoluíram de forma separada ao longo do tempo. A palavra portuguesa "hospital" e o inglês "hospital" são cognatos porque ambas vêm do latim "hospitale". A, "noite" em português e "night" em inglês são cognatos, ambos descendentes do proto-indo-europeu *noghts.
O que sao cognatos e por que isso importa
Isso é relevante principalmente para tradutores, historiadores da língua, linguistas e qualquer pessoa que trabalhe com processamento de língua natural. Reconhecer cognatos permite acelerar significativamente o trabalho de localização e redução de ambiguidades em corpus multilíngues. Porém, há uma armadilha enorme: os cognatos falsos. Esses são os verdadeiros vilões. Palavras que parecem ser cognatos mas não são, ou que foram semanticamente corrompidas ao longo do tempo. O clássico exemplo é "embarazada" em espanhol, que muitos falantes de português acham que significa "embaraçada", mas na verdade significa "grávida". Isso acontece porque ambas as palavras vêm do latim "inbarare", mas evoluíram de formas completamente diferentes.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Outro caso que encontro com frequência: "currently" em inglês não tem relação com "currentemente" em português da forma que muitos assumem. Ambas vêm do latim "currere", mas a palavra inglesa se deslocou semanticamente para indicar tempo presente, enquanto a portuguesa manteve uma conexão mais forte com ideia de correnteza e fluxo. São cognatos, sim, mas usá-los como equivalentes diretos em tradução automática gera lixo. No meu trabalho com análise comparativa de léxico, já perdi horas tentando entender por que um modelo de alinhamento de palavras insistia em mapear "actual" (inglês) com "atual" (português) quando o contexto claramente demandava "real" ou "efetivo". O problema é que "actual" em inglês significa "atual" no sentido de "presente", mas também pode significar "real" no sentido de " factual". Em português, "atual" não cobre esse segundo sentido. A solução foi criar um filtro baseado em contexto semântico local, considerando não apenas a forma lexical mas também as palavras vizinhas e a estrutura da frase. Isso reduziu drasticamente os falsos positivos.
Uma nuance que muitos passam despercebidos: cognatos nem sempre precisam ter forma idêntica. Às vezes a transformação fonética é tão profunda que a relação fica oculta. "Pé" em português e "foot" em inglês são cognatos, mas ninguém percebe isso de primeira vista. Ambos descendem do proto-indo-europeu *pōds, que passou por transformações sonoras regulares em cada ramo. O inglês germânico transformou o *p em /f/ e o latim manteve o /p/. Isso é regularidade fonética, não acaso. Se você está construindo um recurso ou estudando cognatos para algum projeto, o jeito mais eficiente é começar por listas consolidadas como o MultiWordNet ou o SENSEMMA, que já mapeiam equivalências lexicais entre línguas românicas e germânicas. Esses recursos costumam incluir tanto cognatos verdadeiros quanto falsos cognatos identificados, o que poupa muito tempo de pesquisa manual.
Os pontos fracos desses métodos tradicionais são claros: eles cobrem mal línguas com menos representação digital, como variedades africanas de português ou línguas indígenas americanas. Além disso, a maioria das listas de cognatos não considera variação diacrônica — ou seja, cognatos que eram válidos num período histórico mas deixaram de sê-lo. Se você trabalha com textos históricos, isso é um problema real. Para contornar, recomendo combinar análise etimológica manual com ferramentas computacionais. O Etymonline é bom para inglês e francês, o Dicionário Etimológico da Língua Portuguesa do FERLH é essencial para o português, e o Wiktionary tem contribuições decentes para outras línguas. Cruzar essas fontes costuma dar resultados mais confiáveis do que confiar em qualquer único recurso.