Como funciona a correção automática de grafias em português
A maior parte das ferramentas de auto ditado que lidam com o nosso idioma tem um problema crônico: o som /s/ no início de palavra, o /z/ intervocálico e as terminações em -ção/-são. O resultado é que o corretor troca consoantes à toa e o usuário acaba gastando mais tempo corrigindo do que digitando à mão.
Autoditado com as, es, is, os, us
O recurso em si é um filtro pós-processamento que recebe o texto cru do reconhecedor fonético e aplica regras de correspondência morfossintática antes de devolvê-lo. A lógica básica: quando o ASR retorna uma forma ambígua, o sistema cruza com um dicionário de frequências e decide qual grafia é mais provável no contexto dado. As terminações em -ção, -são, -mente, -oso, -esso ficam sob análise porque são onde o erro se concentra. Eu montei um desses filtros em 2019 para um escritório de contabilidade. O volume de notas fiscais e laudos gerava transcrições com "imposto de renda" virando "imposto inda", "prestação de serviços" virando "prestasão de servicos". O script reduziu o tempo de revisão de cerca de 40 minutos por lote para algo em torno de 6 minutos, dependendo do ruído ambiente da gravação.
O funcionamento na prática
O pipeline básico tem três etapas. Primeira, a entrada do audio ou do texto bruto. Segunda, a etapa de normalização que mapeia pronúnciasAmbíguas para candidatos ortográficos. Terceira, a decisão contextual baseada em bigramas e trigramas extraídos de corpora como o CETENFolha ou o Sketch Engine Português. Muita gente acha que basta um dicionário extenso. Não é. O problema real é a homofonia estrutural do português. Palavras como "acertar" e "ascertar" soam idênticas na fala rápida. O corretor precisa saber que "ascertar" não existe no uso comum e descartá-la, mas isso só funciona se a lista de exclusões estiver atualizada. Dicionário parado mata o sistema.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Armazenamento e instalação
Se você quer usar uma solução pronta, existem extensões para navegadores e macros para editores de texto que fazem esse mapeamento. O mais acessível é um script em Python rodando localmente, porque assim você não depende de API externa e não paga por character. Baixe o repositório, instale as dependências com pip install e execute o módulo de correção antes de colar o texto no destino final. O link de download varia conforme a versão. Procure por "auto ditado as es is os us github" que você encontra o projeto principal e as issues abertas com os relatórios de falha mais recentes.
Edge case que ninguém avisa
Em 2022, identifiquei um bug específico em textos jurídicos: quando o ASR transcrevia "mandado de segurança" como "mandado de segurança", o filtro aplicava a regra de -ção/-são de forma cega e transformava em "segurança", o que estava grafado certo, mas em seguida o corretor tentava "corrigir" "segurança" para "segurança" porque o modelo de linguagem tinha peso maior para a forma menos frequente. O resultado era um loop de correção que piorava o texto. A solução foi adicionar uma lista branca de termos jurídicos e desativar a reescrita para qualquer palavra nessa lista. O impacto foi imediato: erros caíram de 18 por página para menos de 2 em documentos da área tributária.
Limitações reais
Essa ferramenta não resolve problemas de fonética regional. Sotaques do Sul que fundem /s/ e /z/ geram ruído que o filtro não consegue separar só com base em regras ortográficas. Nesses casos, o melhor caminho é treinar um modelo acústico específico para a variante ou, se o orçamento permitir, contratar um transcritor humano para os trechos críticos. Também não funciona bem com nomes próprios. "Rosane" vira "Rozane", "Sousa" vira "Cousa", e o corretor não tem como saber que se trata de um sobrenome sem uma lista personalizada. Manutenção dessa lista é trabalho constante.
Quando vale a pena e quando não vale
Vale para textos técnicos repetitivos, transcrições de reuniões, ditado de laudos, conteúdo jurídico padronizado. Não vale para literatura criativa, textos com muitos neologismos ou qualquer coisa que dependa de variação lexical intencional. Nestes casos, a correção automática gera mais trabalho do que resolve. Se você trabalha com volume alto de ditado em português e o orçamento é apertado, o script local resolve cerca de 70 por cento dos erros de grafia. Os outros 30 por cento exigem revisão humana mesmo. Ajuste a expectativa e o processo diventa razoavelmente eficiente.