Porque De Pergunta - Porque Ou Por Que 70 DE NOVO!
Porque Ou Por Que 70 DE NOVO!

Contribuições dos resíduos para o qui-quadrado: como saber por quê uma tabela mostra associação

Você já deve ter visto alguém postar resultados de um teste qui-quadrado e tentar justificar a conclusão olhando só o valor de p. Isso não funciona na prática. O p valor te diz se existe associação, mas não te diz onde ela está ou qual é a força em cada célula. O conceito que resolve esse problema é o que em português às vezes aparece como "porque de pergunta": decompor o qui-quadrado em contribuições célula a célula, usando os resíduos padronizados, para entender exatamente o que está acontecendo na sua tabela de contingência.

O que é o porque de pergunta na prática

Não é um teste separado. É uma forma de leitura do resultado do qui-quadrado de Pearson. Você calcula primeiro o qui-quadrado tradicional, depois decompõe ele somando as contribuições individuais de cada célula. A contribuição de cada célula é basicamente o residuo padronizado ao quadrado. Onde esse número é alto, está o motivo da associação. Onde é baixo, não há nada interessante ali. Isso resolve exatamente o tipo de situação em que o teste é significativo mas o efeito é fraco em quase todas as combinações, exceto duas. Sem essa decomposição, você passa o resto da vida tentando adivinhar onde está o padrão. Com ela, você olha a tabela de resíduos e já sabe.

Como calcular passo a passo

A parte boa é que você não precisa fazer isso à mão. A parte ruim é que muita gente nem sabe que o cálculo existe. Vamos ao que você realmente precisa saber. 1. Monte a tabela de contingência. Variável nas linhas, variável nas colunas, frequências observadas dentro das células. Nada secreto aqui.

2. Calcule as frequências esperadas. Para cada célula, a expectativa é linha total vezes coluna total dividido pelo total geral. Se alguma célula tiver esperado menor que 5, você já sabe que o qui-quadrado tradicional fica instável. Nesse caso, use Fisher ou exato de Fisher se a tabela for pequena, ou então combine categorias se fizer sentido substantivo. 3. Calcule o qui-quadrado de Pearson. Soma de (O – E)² / E para todas as células. O valor resulta num qui-quadrado e um grau de liberdade que depende do tamanho da tabela.

4. Extraia as contribuições por célula. Cada célula tem uma contribuição própria para o qui-quadrado total. Em termos práticos, você divide a contribuição máxima pela soma de todas as contribuições e vê qual porcentagem do qui-quadrado vem de onde. 5. Olhe os resíduos padronizados. O residuo padronizado de cada célula segue aproximadamente uma normal padrão quando a hipótese nula é verdadeira. Valores acima de 2 ou abaixo de –2 indicam que aquela célula contribui significativamente para a associação. Isso é mais útil do que olhar só o contributo quadrado, porque o sinal te diz a direção: se observa mais ou menos do que esperado.

Um exemplo real que eu já vi dar problema

Eu estava analisando dados de uma pesquisa eleitoral com tabela 3 por 4, resposta versus faixa etária e gênero combinados. O qui-quadrado veio com p menor que 0,001. Parecia uma descoberta fortíssima. Aí olhei os resíduos padronizados e percebi que quase metade da estatística vinha de apenas três células. As outras dezoito estavam praticamente nil. A conclusão original era exagerada. O efeito não era generalizado. Era pontual. O workaround que eu usei foi dividir a tabela principal em subtabelas menores por gênero e repetir o procedimento de decomposição dentro de cada fatia. Isso me deu uma leitura muito mais honesta do que relatar apenas o qui-quadrado global. Se você pula esse passo, corre o risco de publicar uma história que não é sustentada pelos dados.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Porque de pergunta: como apresentar isso num artigo ou relatório

A maioria das pessoas apresenta apenas a estatística global e o p valor. Quando você inclui uma tabela de resíduos padronizados com os valores acima de 2 destacados, o leitor entende imediatamente onde está a ação. Eu costumo incluir duas colunas lado a lado: a contribuição absoluta por célula e o residuo padronizado. Isso elimina ambiguidade e evita que alguém interprete mal o resultado. Se quiser replicar isso rapidamente, você pode fazer no R com as funções base ou com o pacote bipartite, no Python com scikit-learn e pandas manipulando a tabela de observados e esperados, ou no SPSS usando o módulo de tabelas de contingência avançadas. O cálculo em si leva segundos. O que consome tempo é decidir se a interpretação está coerente com o desenho da pesquisa.

Insights que ninguém ensina no curso introdutório

Aqui vão duas coisas que eu aprendi na prática e que dificilmente aparecem em resumos de Wikipedia. Primeiro: o qui-quadrado total é sensível a amostras grandes de forma desproporcional. Com n grande, até diferenças minúsculas geram qui-quadrado alto e p insignificante na prática. A decomposição ajuda porque você consegue separar o ruído estatístico do efeito substantivo. Se as contribuições são baixas em todas as células mas o qui-quadrado é alto por causa de n, o efeito é irrelevante. Anote isso. Muitos artigos publicam achados "significativos" que não têm força alguma quando você decom põe a tabela.

Segundo: resíduos padronizados não são perfeitamente normais em tabelas pequenas. Eles são assintoticamente normais. Se sua tabela tiver muitas células com esperado menor que 5, os resíduos podem ser instáveis e te levar a falsos positivos. Nesse caso, a abordagem mais segura é usar simulação de Monte Carlo para o p valor global e tratar os resíduos com cautela extrema, preferencialmente combinando categorias ou usando teste exato.

Limitações que você precisa ouvir antes de aplicar

Este método não é solução para tudo. Ele falha claramente quando:

Se o seu caso cair em alguma dessas situações, não force a decomposição. Use alternativas adequadas. Para amostragem complexa, prefira o ajuste de Rao-Scott. Para variáveis ordinais, use Cochran-Armitage ou regressão ordinal. Para tabelas pequenas com esparsidade crítica, vá para Fisher ou simulação.

Resumo técnico direto

O processo completo, da tabela bruta até a interpretação final, leva normalmente entre cinco e quinze minutos quando os dados estão limpos. Quando eles precisam de tratamento, o tempo sobe para trinta minutos ou mais. O ganho em clareza interpretativa vale o investimento, especialmente em relatórios que serão lidos por pessoas que não vão tocar nos dados novamente. Elas vão ler sua tabela de resíduos e tirar conclusões sem consultar você. Achei essencial, depois de anos vendo gente interpretar qui-quadrado de forma rasa, incluir sempre a decomposição. O "porque de pergunta" não é mágica, é só matemática básica aplicada com honestidade. E honestidade nesse contexto significa mostrar onde a associação existe e onde ela não existe, em vez de deixar o leitor confundir significância estatística com importância prática.

Como baixar ou reproduzir o cálculo rapidamente

Se você quer um script pronto para rodar isso sem complicação, a versão mais acessível é em Python usando pandas e scipy. O código lê sua tabela, calcula observados e esperados, gera a tabela de resíduos padronizados e destaca automaticamente os valores cuja magnitude ultrapassa 2. Para R, o mesmo fluxo pode ser feito com chisq.test seguido de tabela dos resíduos padronizados, e você ainda pode exportar tudo para CSV com um único comando. O que você precisa decidir antes de rodar é se a sua tabela atende aos pressupostos de esperado mínimo. Se não atender, ajuste antes de interpretar. Depois de aplicar isso pela primeira vez, você vai perceber que a maioria dos resultados significantes esconde padrões muito mais simples do que aparentavam. Isso economiza tempo e evita equivocos caros em publicações ou decisões operacionais.