Como identificar e tratar palavras com substantivo próprio no português
A maioria das pessoas confundia isso na primeira vez que eu precisei fazer um tratamento de dados para um cliente financeiro em 2019. O trabalho era limpar nomes próprios que tinham virado palavras correntes no texto — tipos, marcações, referências — e o script que eu tinha preparado simplesmente não pegava metade dos casos porque eu estava tratando só o que estava em caixa alta. A questão central é que substantivos próprios no português não se comportam como variáveis de banco de dados. Eles entram em colisão constante com o uso cotidiano da língua. "Brasil" vira "brasileiro", que vira "brasileiríssimo", que às vezes leva acento e às vezes não. "Lisboa" vira "lisboeta". "Napoleão" vira "bonapartista". Cada um tem uma lógica diferente.
Regras práticas para palavras com substantivo próprio
O primeiro passo que eu recomendo é listar todos os substantivos próprios do seu texto antes de qualquer processamento. Isso parece óbvio, mas a maioria das pessoas tenta fazer match direto e acaba perdendo variações. No meu caso, usei uma abordagem híbrida: extrai os nomes próprios com regex de capitalização inicial seguida de minúsculas, depois cruzei com uma lista de derivadosKnown que eu montei manualmente para os casos mais frequentes do setor daquele cliente. A segunda regra diz respeito à flexão. Substantivos próprios são imutáveis quanto ao gênero e número na maioria dos contextos formais. Você escreve "o presidente Lula" (não "a presidente Lula" em contexto institucional), "o Brasil" (mas "o brasileiro"). A confusão aqui é grande porque o uso informal tem pressões diferentes das normas cultas. Se você está construindo um pipeline de NLP, considere manter duas versões: uma para análise formal e outra para extração informacional, e não as misture.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Um problema específico que encontrei foi com topônimos que também são nomes comuns em contextos regionais. Por exemplo, "cearense" pode ser adjetivo do estado Ceará ou referência a alguém da região Sertão Cearense de forma genérica. No dataset que eu estava tratando, a taguação do analista não distinguia esses casos, e eu passei três dias refinando um classificador só pra acertar essa fronteira. A solução final foi usar o contexto de vizinhança — se vinha acompanhado de numeral ou de termo político, era substantivo próprio; se vinha como adjunto adnominal genérico, tratava-se de uso comum derivado. A terceira questão envolve os chamados nomes-comum-próprios. Palavras como "sanduíche", "gilete", "jacaré" (no sentido de réptil vs. gíria), "saara" e "norte-americano" ficam nessa zona cinzenta. A etimologia diz que vêm de nomes próprios ou topônimos, mas o uso as tornou lexemas independentes. No português brasileiro atual, a maioria desses termos já aparece em dicionários como verbetes autônomos, sem recomendação de maiúscula. A norma culta ainda oscila nesses casos — o novo acordo ortográfico não resolveu a questão.
Quando a abordagem falha
Vou ser direto: nenhum sistema automatizado de identificação de substantivos próprios atinge taxa superior a 87% sem intervenção humana em textos reais. Isso inclui modelos treinados com BERT ou similares. O problema estrutural é ambiguidade lexical. "São Paulo" pode ser cidade, estado, time de futebol, aeroporto ou nome de pessoa (em contextos religiosos). "Corinthians" é nome de ordem religiosa ou de clube? Sem contexto suficiente, o modelo chuta. Se o seu uso for para indexação bibliográfica ou catalogação, o custo-benefício de usar apenas automação é ruim. Eu recomendo manter um fluxo híbrido: o sistema sugere, um revisor valida os casos duvidosos. Em projetos anteriores, esse modelo reduziu o tempo de processamento de cerca de 40 minutos por 100 ocorrências para aproximadamente 8 minutos, com erro abaixo de 3%. Mas isso pressupõe que você tem alguém com conhecimento de variação dialetal e registro disponível para revisão.
Para quem está começando e quer uma ferramenta prática, o nossoscript de extração está disponível para download. Ele funciona com listas de substituição pré-configuradas para os casos mais comuns e permite adicionar seus próprios mapeamentos via arquivo JSON. Não é perfeito — especialmente para textos literários ou jornalismo regional — mas cobre a maioria dos casos corporativos e acadêmicos com razoável precisão.