Trabalhando com dados de habitantes de Santiago do Chile
Acesso a dados populacionais para Santiago é mais complicado do que parece à primeira vista. O INE Chile publica os números, mas a granularidade varia bastante dependendo do que você precisa. Dados de setores censitários (secções) são públicos, mas a camada completa de manzanas exige cadastro e justificativa de uso acadêmico ou institucional. Já vi gente perder horas tentando raspar tabelas que na verdade estão em PDFs escaneados com tabelas mal formatadas. Se o seu foco é simples, tipo saber população por comunas, o site do INE resolve rápido. O problema aparece quando você precisa de recorte fino: bairros, micro-regiones, ou ainda cruzar com dados socioeconômicos do Casen. Aí o caminho começa a se complicar.
Entendendo habitantes santiago nos bancos oficiais
O Instituto Nacional de Estadisticas do Chile mantém duas fontes principais. A Censo 2017 ainda é a referência atual disponível publicamente, com dados demográficos, educacionais e habitacionais por comuna e setor. O Proyecciones y Estimaciones de Población entrega estimativas anuais, mas só no nível comunal. Se você precisa de algo entre esses dois níveis, a coisa fica aberta para interpretação. Santiago tem 35 comunas. O grande erro que vejo todo mundo cometendo é tratar Santiago como uma unidade só. A população da comuna de Santiago (centro) é cerca de 23 mil habitantes. A comuna de Las Condes tem quase 300 mil. Dizer "habitantes santiago" sem especificar comuna é basicamente inútil para qualquer análise séria. A mediana de idade varia de 38 anos em La Reina para 24 anos em Independencia. Dados agregados mascaram completamente essas diferenças.
Como baixar e tratar os dados na prática
O primeiro passo é ir até o site do INE na seção de censos. Lá você acha os arquivos XLS com as tabelas completas do Censo 2017. Cada tabela pode ter centenas de linhas e colunas. Meu fluxo padrão é baixar o arquivo por tema — demografia, educação, condições habitacionais — e depois juntar tudo num Python com pandas. O problema é que as colunas vêm com formatação chilena: vírgula como separador decimal, pontos como milhar. O read_csv tem que receber as configurações corretas senão você perde metade dos dados.
import pandas as pd
df = pd.read_csv('arquivo.csv', sep=';', decimal=',', thousands='.')
Depois disso, você precisa limpar os cabeçalhos. As tabelas do INE costumam ter três linhas de título antes dos dados de verdade. Um drop das primeiras linhas resolve. O campo que importa para recorte é o ID da comuna, que segue o padrão do INE. A comuna de Santiago é 1101, Providencia é 1112, Las Condes é 1130, Maipu é 1150. Memorizar esses códigos poupa muito tempo. Para dados mais recentes que não sejam projeções, o banco mais completo é o Casen, mas ele é trimestral e o download requer registro. A versão online do Casen permite consulta por região Metropolitana, mas não por comuna individual em todas as variáveis. Já precisava de renda domiciliar por comuna para um modelo de precificação imobiliária e tive que fazer interpolação usando a correlação entre o valor do Casen por comuna e os dados do censo de condições habitacionais. Funcionou, mas levou uns três dias de ajuste manual das planilhas.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Pegadinhas que ninguém avisa
A primeira é sobre delimitação territorial. As comunas mudaram de contorno entre o censo de 2002 e o de 2017. Se você estiver comparando dados de anos diferentes e usando shapefiles desatualizados, suas áreas vão falhar. Baixe sempre a atualização mais recente do Geo INE, que fornece os shapefiles das comunas e setores censitários. A segunda é sobre a classificação de área urbana versus rural. Santiago é praticamente 100% urbana, mas o INE ainda divide setores em urbanos e rurais dentro de cada comuna. Para análise metropolitana, você deve filtrar apenas setores urbanos, senão seus números de densidade ficam distorcidos. No censo 2017, a comuna de San Miguel tinha cerca de 4% da população em setores classificados como rurais pelo INE. Ignorar esse detalhe inflaciona a densidade percebida.
A terceira pegadinha é mais sutil e aconteceu comigo recentemente. Ao cruzar dados populacionais com coordenadas geográficas para gerar heatmap de densidade, percebi que algumas seções censitárias tinham coeficientes de preenchimento diferentes entre os dados demográficos e os shapefiles. O setor 123045 aparecia com 800 habitantes na tabela mas seu polígono no shapefile não cobria a mesma área. O resultado era um buraco no mapa que parecia falta de população quando na verdade era inconsistência de geocodificação. A solução foi usar apenas dados em nível comunal para o heatmap e manter os setores só para análises tabulares. Perdi granularidade, mas ganhei consistência.
Alternativas quando o INE não basta
Se você precisa de dados com atualização mais frequente que o censo decenal, existem opções complementares. O Banco Mundial e o CEPAL publicam estimativas anuais de população urbana para cidades latino-americanas, incluindo Santiago. Não é granular, mas serve para comparações internacionais. Para dados de mobilidade e fluxo diário, alguns pesquisadores têm usado dados anonimizados de operadoras de celular, mas isso exige acordo institucional e não está disponível abertamente. O Geoportal de Santiago, vinculado à municipalidade, oferece alguns dados Open Data como localização de equipamentos públicos e uso do solo. Não tem população diretamente, mas cruzar esses dados com os do censo permite análises interessantes de acesso a serviços por densidade populacional. O formato costuma ser GeoJSON ou CSV, o que facilita a importação direta em QGIS sem muita transformação.
Outro recurso subutilizado é a plataforma Datos Chile, que agrega datasets de vários órgãos públicos. Lá você acha séries temporais de migração interna, taxa de ocupação domiciliar e outros indicadores que complementam os números brutos de habitantes. A qualidade varia de acordo com a fonte, então sempre verifique a metadada de cada arquivo antes de confiar nos números. Para quem trabalha com modelagem preditiva, recomendo exportar os dados do censo para um banco estruturado mesmo que seja apenas um SQLite local. Ficar abrindo e fechando planilhas do INE todo mês gera perda de tempo desnecessária. Um esquema simples com tabelas separadas por comuna e ano, com chave primária no código do INE, facilita query rápida e evita retrabalho quando os dados forem atualizados no futuro.