Divisão silábica: o que realmente acontece com as consoantes
A palavra saudade se separa em sílabas assim: sa-u-da-de. Quatro sílabas, todas abertas, sem nenhuma armadilha. O "s" vai com o "a" porque inicia a sílaba, o "d" do meio também inicia sua sílaba respectiva. Nada de hiato, nada de ditongo, só o que a regra básica prevê.
Como fazer separar a palavra saudade corretamente
Vou direto ao ponto porque não tenho paciência pra introdução. A separação silábica segue três regras principais que cobrem 95% dos casos. Primeira: consoante solta entre duas vogais pertence à sílaba seguinte. Segunda: encontros consonantais que não são dígrafos se separam quando não formam parte de um grupo fonológico reconhecido. Terceira: ditongos e tritongos permanecem na mesma sílaba e não se partem. Aplicando isso a saudade, temos V-CV-CV-CV, onde V é vogal e C é consoante. Cada "d" funciona como iniciador de sílaba nova porque vem precedido de vogal. Resultado final: sa | u | da | de.
O problema é que a maioria das pessoas erra justamente no que parece simples. Eu tive um cliente que estava implementando um sistema de hifenização automática para um editor de textos e o algoritmo separava a palavra como "sau-da-de". Um erro grave. O analisador fonológico dele tratava o ditongo aberto "au" como se fosse um hiato, empurrando o "u" pra sílaba seguinte junto com o "d". Corrigi usando a regra de ditongos decrescentes: "au" é ditongo decrescente (semivogal + vogal), fica inteiro na primeira sílaba. Depois disso, o resto da pipeline funcionou sem atritos. Outro detalhe que ninguém menciona nos manuais: a separação silábica para hifenização e a separação estritamente fonológica não são idênticas em todos os casos. Para hifenização, o que vale é a grafia, não a pronúncia. Se você fosse separar "pássaro", a grafia manda "pás-sa-ro" mesmo que na fala coloquial soe como "pa-sa-ro". Isso é importante saber se você tá construindo algo que lida com geração automática de hifens.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Outra coisa contra-intuitiva: palavras com prefixo que termina em consoante e raiz que começa com a mesma consoante. Por exemplo, "sub-bloco". A regência ortográfica mantém as duas "b" e a separação é sub-blo-co, mas muitos algoritmos ingênuos colapsam pra "su-blo-co" por causa da fusão gráfica. Não confunda separação silábica real com fusão morfossintática. Se o seu objetivo é só saber onde colocar o hífen, a resposta curta é: nunca use hífen em "saudade" porque ela nunca será partida no final de linha numa composição normal. Mas se você está validando a divisibilidade — por exemplo, pra um gerador de exercícios de português — a forma correta de hifenização é sau-da-de, respeitando a sílaba máxima.
O maior gargalo que encontro na prática é quando o texto vem de OCR ou transcrição automática. Palavras como "saudade" aparecem como "saudada" ou com espaços internos ruins. Um filtro prévio de normalização ortográfica resolve antes da etapa de segmentação silábica. Sem isso, o sistema entra em loop de correção e gasta processamento desnecessário. Para quem precisa de uma referência rápida e confiável, o Vocabulário Ortográfico da Língua Portuguesa (VOLP) da Academia Brasileira de Letras tem a listagem oficial. A divisão silábica também aparece no Novo Acordo Ortográfico e nas gramáticas de referência como a de Cunha e Cintra. Evite sites que só copiam um do outro — a maior parte deles erra os dígrafos e trata "rr", "ss", "ch", "lh", "nh" como consoantes simples separáveis, o que é errado.
Se você quer implementar isso do zero, a abordagem mais robusta usa um dicionário léxico como base de dados e aplica regras de contorno de sílaba baseadas em estrutura CV. Não tente fazer parser genérico que funcione pra todas as palavras sem consultar um lexicon — o custo de erro sobe pra algo perto de 12% em corpus natural, principalmente em palavras Com hibridismos e estrangeirismos. Com dicionário próprio, cai pra menos de 0,3%. Uma dica prática que economiza tempo: se o seu caso de uso é só separação silábica de palavras portuguesas padrão, use uma biblioteca pronta como o syllabifier da NLTK (com o módulo adaptado para português) ou o morfeus2. Evita reimplementar a lógica que já está resolvida há anos e ainda ganha a correção contínua da comunidade.