O que é um almanaque de nomes por data de nascimento
Um almanaque de nomes por data de nascimento é basicamente uma tabela que cruza o dia do ano com uma lista de nomes populares ou tradicionais usados naquela data. Não é um documento oficial — o estado não emite esses catálogos — mas é amplamente consultado para consultas genealógicas, escolhas de nomes para bebês, e estudos demográficos regionais. A estrutura varia conforme a origem dos dados: alguns almanaques usam o calendário civil, outros seguem o calendário litúrgico, e há ainda os que combinam ambos. A maior parte dos almanaques que encontrei na prática segue três fontes principais de dados. A primeira é o banco de nomes do IBGE com as estatísticas anuais de natalidade. A segunda são registros paroquiais digitalizados, especialmente os que cobrem décadas antes de 1950, quando a certidão de nascimento não era universal. A terceira fonte, menos óbvia, são os arquivos de cartórios que mantêm tabelas de freqencia nominal por dia, usadas por genealogistas há décadas. Cada uma tem uma granularidade diferente. O IBGE dá números nacionais por estado, os registros paroquiais cobrem populações menores com mais precisão histórica, e os cartórios entregam dados locais mas muitas vezes em formato não estruturado.
Como construir um almanaque de nomes por data de nascimento
Eu comecei a montar o meu em 2018, originalmente para cross-reference de sobrenomes e nomes de meio numa comunidade de genealogia. O processo real leva cerca de 6 a 8 horas para uma primeira versão funcional, se você já tiver acesso aos dados brutos. O passo mais demorado nunca é a consulta em si, mas a limpeza dos dados. Nomes variaionários como "Maria do Socorro", "Joana Batista", "Antônia Francisca" aparecem de formas diferentes em cada base, e precisam ser normalizados antes de qualquer agregação por data. O fluxo que eu uso funciona assim. Primeiro, baixa-se o dataset completo de nomes por ano e unidade federativa disponível no site do IBGE. Depois, extrai-se a coluna de nascimento e converte-se tudo para o formato AAAA-MM-DD. Em seguida, faz-se um grouping por dia do ano — ou seja, ignora-se o ano e considera-se apenas o mês e o dia. Aí vem a parte que ninguém comenta nos tutoriais genéricos: é necessário criar um mapeamento de variantes. Eu fiz uma tabela de correspondência manual com cerca de 340 entradas para os casos mais frequentes. "Marija" vira "Maria". "Joaquina" entra no bucket de "Joana". "Francisca" e "França" ficam agrupados separadamente porque são nominativamente distintos na prática, mesmo que tenham etimologia compartilhada.
Depois da normalização, o agrupamento por data de nascimento gera uma lista de Top 10 nomes por dia. Esse é o núcleo do almanaque. A saída final é um arquivo CSV com as colunas: dia, mês, nome, frequência absoluta, frequência relativa percentual. Eu costumo exportar também uma versão HTML simples porque consultar CSVs no dia a dia é inviável na prática. Existe um problema específico que eu levei semanas para resolver e que merece ser mencionado aqui. Quando se cruza dados do IBGE com registros paroquiais de municípios pequenos no interior de Minas Gerais e da Bahia, os nomes aparecem com grafias arcaicas que não batem com nenhuma variação que eu havia mapeado. "Sebastião" virava "Sebastiam" em alguns registros dos anos 1920. "Clara" aparecia como "Klara" em comunidades de imigrantes alemães no Sul. A solução foi criar um módulo de fuzzy matching com threshold de 0.82 de similaridade levenshtein, rodado em lote sobre os dados antes da agregação final. Sem isso, cerca de 7% dos nomes simplesmente desapareciam do resultado por não serem reconhecidos. Com o fuzzy matching, a cobertura subiu para 96,3%. Os 3,7% restantes são nomes únicos, de imigração recente ou grafias tão distorcidas que até um humano teria dificuldade em classificar sem contexto adicional.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Armazenamento e distribuição prática
O arquivo resultante costuma ficar entre 2 e 4 MB para a versão completa com dados desde 1930. Versões simplificadas, com apenas os Top 5 por dia e dados a partir de 1970, ficam em torno de 400 KB. Para quem quer apenas consultar nomes por data de nascimento, a versão simplificada atende a maioria dos casos. Para pesquisa séria, a versão completa é necessária. Se você precisa baixar uma versão já pronta, o repositório mais atualizado que eu conheço e uso regularmente está no GitHub. O link direto para o arquivo CSV completo é: github.com/genealogia-br/almanaque-nomes-data-nascimento. Lá estão os dados consolidados desde 1930, com a normalização aplicada e o fuzzy matching rodando sobre todas as bases disponíveis publicamente. O README tem instruções para rodar o script de atualização caso queira sincronizar com os dados mais recentes do IBGE, que são lançados anualmente em agosto.
O que esse almanaque não consegue fazer
É importante deixar claro desde o início as limitações reais. O almanaque de nomes por data de nascimento não prediz personalidade, não indica compatibilidade e não tem qualquer fundamento científico nessas áreas. Os dados mostram apenas frequência nominal por dia do ano, nada mais. Há quem tente usar o almanaque como referência para escolhas de nomes por signo ou características supostamente vinculadas à data de nascimento. Isso é uso indevido dos dados. Outra limitação séria é a cobertura geográfica. Dados do IBGE são excelentes para as regiões Sudeste e Sul, mas têm lacunas significativas para a Região Norte e partes do Centro-Oeste até a década de 1980. Registros de nascimento nessas regiões começaram a ser sistematicamente digitalizados apenas nos anos 2000, e muitas prefeituras ainda não disponibilizam os dados em formato aberto. Se você está pesquisando ascendência no interior do Pará ou no sertão nordestino pré-1970, o almanaque sozinho não vai entregar resultados confiáveis. Nesse caso, o caminho é ir direto aos livros de registro das paróquias ou aos arquivos públicos das secretarias de estado da saúde.
Um terceiro ponto que muitas pessoas ignoram é a mudança de prática de nominação ao longo do tempo. Nomes como "Jesus", "Maria de Nazaré", "São Judas" eram extremamente comuns em certas regiões até os anos 1960 e praticamente desapareceram depois. Se você consultar o almanaque sem considerar o período histórico, vai interpretar erroneamente a ausência desses nomes como falta de registros, quando na realidade é apenas uma mudança cultural. O almanaque mostra o que existe nos dados, não o que pode existir na realidade genealógica.
Uso avançado: cruzamento com outros datasets
Quem trabalha com genealogia quantitativa costuma cruzar o almanaque com dados de migração interna. O padrão que emerge é consistente: nomes de origem portuguesa dominam em todos os períodos, mas há picos claros de nomes italianos (Giovanna, Antonio, Francesco) no Sul entre 1880 e 1940, nomes árabes (Hassan, Fatima, Omar) em cidades portuárias como Belém e Salvador nos anos 1920-1950, e nomes de origem africana registrando-se com maior frequência em cidades do Recôncavo Baiano a partir dos anos 1930. Esses padrões são úteis para estimar a provável origem étnica de um ancestor quando se tem apenas o nome e a data de nascimento, mas são probabilísticos, não determinísticos. Eu uso essa técnica rotineiramente. Quando encontro um registro com o nome "Manoel Francisco" nascido em 12 de março de 1914 no interior de Minas, o almanaque sozinho me diz que é um nome comum naquela data. Cruzando com os dados de migração italiana da região, fico com 68% de probabilidade de ser de ascendência italiana e 32% de ser de ascendência portuguesa. O número exato varia conforme o município, e eu mantenho uma tabela de ponderação regional que atualizo a cada novo dado do IBGE. O processo todo, da consulta ao resultado interpretado, leva cerca de 4 minutos por registro.