Conversão de folhetos de cordel para PDF: o que funciona e o que quebra
A literatura de cordel brasileira tem uma estrutura visual muito específica que não sobrevive bem a conversões automáticas. A página é estreita, os versos seguem esquemas de rima rígidos (geralmente AABB ou ABAB no heptassílabo ou octossílabo), e as xilogravuras são parte integrante da composição, não decoração. Quando você tenta transformar um folheto físico ou uma imagem escaneada em PDF, o problema imediato é que a maioria das ferramentas simplesmente estica tudo e perde a margem de leitura. O formato tradicional do folheto varia entre 11 x 19 cm. Se você usar um conversor genérico de imagem para PDF, o resultado vai vir em A4, o que mata a estética e a legibilidade dos versos justificados. A solução mais confiável que eu já encontrei envolve dois passos separados: digitalização e paginação manual.
Onde encontrar literatura de cordel em PDF para estudo
Existem acervos digitais organizados que já oferecem os folhetos em PDF, mas a qualidade varia muito. O acervo da Biblioteca Nacional Digital tem uma coleção considerável, o Centro de Memória da UFPB também digitalizou centenas de folhetos, e o projeto CORDEx da UFPE mapeou edições contemporâneas. O problema é que muitos desses PDFs são scan-only — ou seja, imagens fixas sem texto selecionável. Para pesquisa acadêmica isso pode servir, mas para análise métrica ou rimas fica inviável na prática. Se o objetivo é ter PDFs com texto extraível, o caminho mais seguro ainda é a conversão própria, apesar do trabalho que dá. Vou explicar como fazer e onde costuma dar errado.
Processo prático de conversão
Primeiro, o scan. Use pelo menos 300 DPI. Abaixo disso, o OCR reconhece mal os versos curtos e as letras miúdas das capas com xilogravura. Escaneie cada página individualmente, preferencialmente em PDF multipágina se sua biblioteca permitir, ou em PNG/TIFF se for tratar depois no software. JAMAIS use JPEG compressado para a etapa inicial — a perda de detalhes nas gravuras e nos versos finais das páginas arruína qualquer tentativa de OCR subsequente. Para o OCR em si, o Tesseract 5 com o modelo português funciona razoavelmente bem para o corpo do texto, mas ele tem dificuldade com versos quebrados no meio da frase. Um verso de cordel frequentemente termina numa linha e a continuação vem na próxima, e o Tesseract tende a colar as duas linhas como se fossem um parágrafo normal. A correção manual dessa quebra de verso consome talvez 30 a 40% do tempo total do processo, mas é o único jeito de manter a métrica legível no PDF final.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Eu usei o Calibre com o plugin de conversão de PDF para montar o arquivo final, definindo o tamanho da página para 11 x 19 cm e forçando a colunagem única com recuo na primeira linha de cada estrofe. O resultado levou cerca de 20 minutos por folheto de 16 páginas quando o OCR estava limpo, e perto de 50 minutos quando tive que corrigir os versos quebrados manualmente.
Common pitfalls e armadilhas
O erro mais frequente é tentar usar conversores online gratuitos. Eles aceitam a imagem, geram um PDF, e entregam algo que parece um documento corporativo genérico: margens enormes, fontes padronizadas, xilogravura reduzida a um selo no canto. Nada a ver com a apresentação original do folheto. Outro problema que muita gente não antecipar é a paginação. O folheto de cordel tradicional não segue a ordem lógica de leitura de um livro. A capa vem primeiro, depois as páginas internas, e muitas vezes há páginas promocionais de outros autores no final. Um conversor automático vai tratar tudo como conteúdo principal e incluir essas páginas de propaganda no meio do PDF, o que bagunça completamente a sequência dos poemas. Eu sempre removo manualmente essas páginas extras antes de importar para o Calibre, e isso economiza uns 10 minutos por projeto, mas evita meses de dor de cabeça se você for citar o material depois.
Também vale notar que PDFs gerados a partir de scan puro, mesmo que bonitos visualmente, são praticamente inúteis para busca de texto. Se o seu trabalho envolve localizar versos específicos, rimas ou menções a nomes, certifique-se de que o OCR foi aplicado corretamente. Você pode verificar isso rapidamente selecionando qualquer trecho do texto no PDF — se não der para selecionar, o arquivo é apenas imagem e você vai perder tempo tentando copiar trechos que simplesmente não existem como texto dentro do arquivo. Para quem precisa de acervos já organizados e não quer passar pelo processo de conversão, o portal Memória & Cordel da FUNDAJ em Pernambuco mantém uma coleção acessível online com boa parte dos folhetos do século XX em formato digital. A cobertura não é completa, mas para a maior parte doses sobre cordel nordestino, especialmente os que vão do período de ouro dos anos 1950 até as primeiras coletâneas regionais, atende sem esforço adicional de conversão.