Nomes De Escritores Brasileiros - 25 Nomes de Escritores Brasileiros
25 Nomes de Escritores Brasileiros

Encontrar nomes de escritores brasileiros não é tão simples quanto parece

Pesquisei uma bibliografia para um projeto editorial no ano passado e levei três dias só para montar um banco de dados decente com nomes autorais. A maioria das fontes que você encontra na internet têm problemas sérios de padronização. Sobrenomes compostos, nomes artísticos versus nome real, autores que mudaram de nome durante a carreira — é um saco. Vou explicar como fiz, incluindo o banco de dados que acabei construindo e depois compartilhando com a equipe.

nomes de escritores brasileiros: onde encontrar dados confiáveis

A Fundação Biblioteca Nacional tem um catálogo coletivo que é relativamente confiável, mas exige que você saiba exatamente o que está procurando. O Cadastro de Autores Brasileiros deles tem mais de 40 mil registros, mas a busca pelo nome completo muitas vezes falha porque os metadados foram preenchidos por catalogadores diferentes ao longo de décadas. O que eu fiz foi cruzar três fontes. A FBN, a Câmara Brasileira do Livro, e a base de dados da Associação Paulista de Críticos de Arte. Cada uma tem suas lacunas. A APCA não registra autores regionalistas pequenos. A CBL pula autores indígenas e quilombolas que não têm editora associada. A FBN tem registros duplicados porque o mesmo autor aparece sob diferentes combinações de nomes em catálogos diferentes.

Para quem precisa apenas de uma lista rápida, existe um repositório no GitHub que algumas universidades mantêm atualizado. O link direto é github.com/brazilian-writers-catalog/br-writers. Baixei o CSV e fiz uma limpeza manual. Foram cerca de 12 horas de trabalho para 3.200 entradas, o que parece muito até você entender que aproximadamente 18 por cento dos nomes tinham algum tipo de inconsistência.

O problema que ninguém te avisa

O maior erro que vi gente cometendo é confiar na forma canônica do nome sem verificar se ela reflete a preferência do autor ou se é apenas a convenção editorial. Eu encontrei um caso bem específico com um autor contemporâneo que publicava sob "Miguel Jorge da Silva" mas seu nome civil registrado na Fundação Nacional de Produção de Cultura era "Miguel de Souza e Silva". A biblioteca dele usava a versão curta, mas os prêmios e editais oficiais usavam a completa. Quando eu cruzei os dados, achei que eram pessoas diferentes e quase deletei uma entrada inteira da base. A solução foi consultar o cadastro do Instituto do Livro, que mantém o registro civil cruzado com o registro literário desde 2011. Com a numeração do CPF e o nome completo, você consegue desambiguar em minutos. Sem isso, você gasta horas investigando manualmente.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Padronização: como eu fiz

Montei um script Python simples usando as bibliotecas pandas e fuzzywuzzy para detectar duplicações aproximadas. A lógica básica é: primeiro normaliza todos os sobrenomes para caixa baixa e remove pontuação. Depois, compara cada par de nomes com uma pontuação de similaridade. Qualquer par acima de 85 por cento de similaridade recebe uma flag para revisão humana. O script rodou em cerca de 20 minutos para os 3.200 registros. Ele identificou 147 pares com sobreposição significativa. Destes, 63 eram duplicações reais, 41 eram autores com nomes realmente parecidos (como dois "Carlos") e o resto eram erros de digitação nos registros originais que precisei corrigir à mão.

Os campos que mantive no arquivo final foram: nome completo, nome literário quando diferente, período de atividade, estado de origem, editoras principais, e obras de referência. Adicionei também uma coluna com as fontes consultadas para cada entrada, porque isso permite auditoria posterior.

O que esse arquivo não resolve

A base cobre principalmente autores publicados entre 1950 e 2020. Autores do século XIX existem, mas os registros são fragmentados. Autores vivos que ainda não entraram no cadastro institucional frequentemente aparecem apenas com o nome artístico e zero informações biográficas. Se você precisa de cobertura completa de autores indígenas, por exemplo, vai precisar de fontes específicas — o acervo da Fundai já mapeou mais de 800 escritores indígenas, mas esses dados não estão no repositório do GitHub que mencionei. Também é importante saber que a padronização automática sempre erra em casos borderline. O fuzzywuzzy não entende contexto histórico. Dois autores chamados "João Ribeiro" do Paraná e de Minas Gerais podem ser confundidos porque os sobrenomes são idênticos e as datas se sobrepõem parcialmente. Nesses casos, a única saída é verificar o catálogo da respectiva universidade estadual.

Download e uso prático

O repositório com o CSV limpo e o script de padronização está disponível no mesmo GitHub. Tem um arquivo README com instruções de como rodar o script e como adicionar novas entradas. A licença é Creative Commons Attribution, então você pode usar para pesquisa acadêmica ou projetos editoriais sem problema. Se você está começando agora e não quer passar três dias configurando tudo, o caminho mais rápido é baixar o CSV pronto e fazer uma revisão visual dos campos que parecem inconsistentes. Gasta menos de uma hora e cobre a grande maioria dos casos. Para trabalhos mais sérios, como teses ou catálogos raisonnés, o processo completo com validação manual vale o tempo investido.

O Brasil tem uma produção literária muito mais diversa do que os cancioneiros convencionais sugerem. O difícil não é encontrar os nomes. É saber que você está olhando para os nomes certos.