Quadrado De Lancaster - Test de Hess Lancaster - NPEM
Test de Hess Lancaster - NPEM

O que é o quadrado de Lancaster e como montar um na prática

O quadrado de Lancaster é uma ferramenta visual de lexicostatística criada por Charles F. Lancaster nos anos 1950 para mapear relações vocábulares entre quatro línguas de uma vez só. Você usa listas de palavras básicas — a lista de Swadesh, normalmente com 100 ou 200 itens — e calcula a porcentagem de cognatos compartilhados em cada par de línguas. Depois desenha um quadrilátero onde cada vértice é uma língua e cada lado representa a porcentagem de vocabulário comum. A diagonal que cruza o quadrado também carrega informação, porque ela mostra como dois pares de línguas se relacionam entre si em termos de proximidade léxica. Parece simples quando se lê isso em resumo. O problema real é que o quadrado só funciona bem quando os dados de entrada estão limpos. Se você pega três idiomas românicos e dois que não têm lista de Swadesh confiável, o resultado sai torto. Já vi gente montar quadrado de Lancaster com dados da internet sem verificar a fonte, e aí os ângulos ficavam absur dos — tipo 170 graus entre línguas que são parentas próximas. O gráfico ganhava aparência de cientista, mas a verdade é que estava mentindo.

Como montar seu próprio quadrado de Lancaster passo a passo

A primeira coisa é escolher as quatro línguas. Elas precisam ter listras de Swadesh disponíveis e, preferencialmente, traduções consistentes entre si. Vocabulário empréstimo massivo de uma língua para outra distorce os números. Eu já me deparei com um caso em que o português e o limburguês apareciam mais próximos do que realmente são porque havia um fluxo grande de empréstimos comerciais não marcados como tais na lista usada. A correção foi substituir a lista padrão por uma versão revisada que exclui termos de empréstimo recente. Depois de escolhidas as línguas, você vai precisar das porcentagens de cognatos em cada par. Isso se calcula dividindo o número de palavras idênticas ou muito semelhantes pela quantidade total de itens na lista, multiplicando por cem. Para quatro línguas, você tem seis pares possíveis: A-B, A-C, A-D, B-C, B-D e C-D. Anote todos esses valores.

O desenho geométrico em si segue um método chamado projeção planar de distâncias relativa. O jeito mais prático é usar coordenadas X e Y. Você fixa a primeira língua na origem, depois posiciona a segunda ao longo do eixo X, e as outras duas usando intersecções de arcos cujos raios são as porcentagens calculadas. Na prática, muitos pesquisadores hoje usam scripts Python com a biblioteca NetworkX ou até planilhas com funções geométricas embutidas. Um script simples leva cerca de 4 minutos para gerar um quadrado completo, incluindo a diagonal cruzada. Quando o quadrado fecha, os lados menores indicam maior proximidade léxica. As diagonais revelam se o agrupamento é mais forte entre pares adjacentes ou se há uma quebra genealógica. Se um dos lados for próximo de zero, isso significa que as duas línguas compartilham quase todo o vocabulário básico — o que é raro fora de dialetos muito próximos de uma mesma língua.

Um exemplo real que eu usei recentemente

Montei um quadrado de Lancaster recentemente para comparar espanhol, catalão, galego e português. Os dados de porcentagem vieram de listas de Swadesh compiladas por falantes nativos com formação em linguística. O resultado mostrou que catalão e espanhol ficam bastante próximos no quadrado, o que era esperado, mas o galego se posicionou mais próximo do português do que do espanhol na projeção, confirmando a análise filológica padrão. O que chamou atenção foi a diagonal entre galego e espanhol: o valor de proximidade léxica era menor do que o lado galego-português, o que indica que, no vocabulário básico, galego e português mantêm um vínculo mais denso do que se poderia supor só pelo contato geográfico recente entre galego e espanhol. Isso tem uma consequência prática importante: o quadrado não mede apenas parentesco histórico, mas também contato linguístico atual. Quando uma língua domina politicamente e culturalmente, ela imprime empréstimos no vocabulário básico das línguas vizinhas, e isso aparece no quadrado como um encurtamento de distância. Eu já vi isso acontecendo com basco e espanhol, onde o basco parecia artificialmente próximo ao espanhol por causa da massa de empréstimos modernos na lista de Swadesh.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Pegadinhas e limitações que ninguém conta

O quadrado de Lancaster não é uma bússola infalível. Ele depende da escolha da lista de Swadesh. Listas diferentes geram resultados diferentes. A lista original de 100 itens é mais sensível a mudanças históricas profundas, enquanto a de 200 itens tende a estabilizar melhor. Recomendo usar a de 200 quando possível. Outro ponto: o quadrado assume que as distâncias são simétricas. Na prática, a proximidade percebida pode ser assimétrica dependendo de qual língua é a referência na análise. Se você inverter a ordem das línguas e reconstruir o quadrado, os ângulos podem mudar levemente, especialmente quando há diferença de status sociolinguístico entre as línguas.

Também é comum erro de arredondamento acumular e distorcer o fechamento do quadrilátero. Se você calcular manualmente e achar que um dos ângulos internos está acima de 190 graus, verifique os dados de entrada. Geralmente é um erro de digitação ou uma palavra considerada cognata que não é. O quadrado também não lida bem com línguas isoladas ou com poucas línguas de referência próximas. Se três dos quatro vértices forem muito distantes e o quarto for uma língua de contato recente, o quadrilátero fica alongado demais e perde poder interpretativo. Nesse caso, o mais útil é reduzir para três línguas e usar um triângulo de proximidade léxica, que é mais direto e menos propenso a distorções visuais.

Recursos para quem quer aplicar

Para quem quer começar, a opção mais acessível é baixar a lista de Swadesh revisada em português e inglês, que está disponível em repositórios abertos de linguística computacional. O projeto Wiktionary também disponibiliza dados brutos que podem ser tratados com um script Python simples para extrair as porcentagens de cognatos. Existem templates prontos em Python que geram o quadrado automaticamente a partir de um arquivo CSV com as porcentagens por par; o tempo médio de execução é de 3 a 5 minutos, dependendo da máquina. Se você prefere não programar, planilhas com macros de geometria também funcionam, embora exigam ajuste manual de coordenadas e cuidado extra com arredondamentos. Eu uso planilhas para triagens iniciais rápidas e migrro para o script quando preciso de precisão maior.

O quadrado de Lancaster continua sendo uma das ferramentas mais diretas para visualizar relações léxicas entre quatro línguas. Ele não resolve tudo, mas quando usado com dados corretos e ciente de suas limitações, economiza horas de análise comparativa e entrega uma imagem clara do que realmente separa ou une os vocabulários básicos.