Ditado Ortográfico - Ditado Ortográfico 3 - GABARITO | PDF
Ditado Ortográfico 3 - GABARITO | PDF

Guia prático de ditado ortográfico: o que funciona de verdade

Ditado ortográfico é simplesmente a transcrição de áudio para texto com correção automática da grafia. Na prática, você envia um arquivo de som e recebe um arquivo de texto formatado, pronto para uso em legendas, processos judiciais ou publicação editorial. Não é mágica, mas também não é tão trivial quanto parecer à primeira vista.

O que é ditado ortográfico na prática

O serviço pega uma gravação — pode ser uma entrevista gravada num celular, uma reunião gravada no Teams, ou até um áudio de voz natural — e converte cada fala em texto escrito, corrigindo a grafia das palavras. O resultado varia drasticamente dependendo do software usado e da qualidade do áudio original. Ferramentas gratuitas como o Google Docs mesmo ditado por voz entregam algo aceitável para ditados curtos, mas falham rapidamente quando há sotaque marcado, múltiplos falantes ou ruído de fundo. O mercado tem opções pagas que fazem isso direito. Sonix, Rev, e o trascriptor da Netflix, se você tiver acesso, são referências. No Brasil, a plataforma TranscribeBR e o Sapiens fazem trabalho competente para português brasileiro. O ponto que a maioria dos iniciantes ignora é que ditado ortográfico não é só uma questão de software — é uma questão de preparação do áudio. Quanto melhor a gravação, menor o esforço pós-transcrição. Um áudio limpo com dictado ortográfico pode ser revisado em 15 minutos. Um áudio ruim pode levar horas.

Como eu lido com isso no dia a dia

Eu começo sempre separando os falantes antes de enviar o áudio para transcrição. A maioria das ferramentas reconhece "falante 1" e "falante 2" de forma automática, mas quando duas pessoas falam quase ao mesmo tempo ou se interrompem, a transcrição fica uma bagunça impossível de organizar depois. Eu uso o Audacity só para marcar os pontos onde a troca de interlocutor acontece — isso leva dois minutos e economiza vinte minutos de retrabalho. Depois da transcrição automática, eu reviso o texto mantendo o áudio rodando em segundo plano. É muito mais rápido assim do que tentar memorizar o conteúdo e revisar depois. Eu corro o texto todo dando zoom nos trechos problemáticos: nomes próprios, termos técnicos, números. Aqui vai algo que ninguém conta: nomes próprios e jargões são onde a maior parte dos erros acontece. O motor de reconhecimento foi treinado com português padrão, não com nomes de localidades do interior ou com siglas setoriais. Eu criei um glossário personalizado no Sonix e ele passou a reconhecer corretamente termos como "BACEN", "CVM" e "SEFAZ-SP" sem corrigir para formas erradas.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Um problema real que eu enfrentei e como resolvi

Num caso específico, eu tinha um áudio de depoimento jurídico com um testemunho falante de sotaque muito marcado do sertão nordestino. A transcrição automática entregou algo como "ele disse que ia até o município vizinho pra resolver a questão" e depois cortava palavras inteiras. O sistema basicamente desistia de transcrever trechos inteiros. A solução foi segmentar o áudio em pedaços menores de cerca de trinta segundos cada, aplicar uma equalização simples no Audacity para destacar as frequências da voz (cortar graves abaixo de 100Hz e agudos acima de 8kHz) e então rodar cada trecho duas vezes: uma com o ditado ortográfico padrão e outra com o modo "música" ou "cantado" que algumas plataformas oferecem, porque esse modo tende a ser mais tolerante a pronúncias fora do padrão. Combinei os dois textos manualmente. Levou uns quarenta minutos no total, mas foi muito mais rápido do que tentar transcrever do zero.

Dicas que realmente importam

Grave em WAV se puder. MP3 comprime demais e o software de ditado ortográfico perde informações fonéticas importantes. Se tiver que usar MP3, pelo menos use bitrate mínimo de 192kbps. Mantenha o microfone a cerca de vinte centímetros da boca. Não precisa ser profissional, mas o ruído de ar direto no microfone destrói a precisão do reconhecimento. Separe os falantes antes de transcrever. Use marcadores de tempo no áudio. Revisão com áudio rodando junto é imbatível. Crie glossários personalizados para termos recorrentes do seu setor. E não confie cegamente no resultado — sempre, sem exceção, passe o texto final por uma revisão humana.

Quando ditado ortográfico não funciona

Há situações em que o ditado ortográfico simplesmente não presta. Áudio com música de fundo forte. Reuniões com cinco ou mais pessoas falando ao mesmo tempo sem estrutura clara. Gravações feitas em ambiente aberto com vento. Nesses casos, o melhor investimento é contratar um transcritor humano. Pode custar entre R$30 e R$80 por hora de áudio, mas o resultado é confiável e você não perde tempo revisando coisas que o computador não conseguiu processar. Também existe o limite do tamanho do arquivo. Plataformas gratuitas costumam travar em arquivos acima de cem megabytes. Se você tem reuniões longas gravadas em alta qualidade, vai precisar dividir o áudio antes de enviar, o que adiciona trabalho manual extra.

Links úteis

Para quem quer testar sem pagar, o Google Docs tem ditado integrado: abra um documento novo, vá em Ferramentas > Ditado por voz. Para projetos sérios, a Sonix (sonix.ai) e a Rev (rev.com) são as opções mais usadas. No Brasil, vale dar uma olhada na plataforma da TranscribeBR e também nas soluções da Sapiens AI, que tem modelo treinado especificamente para português brasileiro. O ditado ortográfico evoluiu bastante nos últimos anos, mas ainda é uma ferramenta complementar, não substituta completa da revisão humana. Use como base e revise com atenção. O resultado final depende disso.