EstatísticaparaPesquisa Falar no WhatsApp

Regressão logística

Pressupostos da regressão logística que você precisa verificar em estudos epidemiológicos

agosto 22, 2026 5 min de leitura atualizado em setembro 15, 2026

Por · CRBM-GO 5438

A regressão logística é o cavalo de batalha da epidemiologia analítica quando o desfecho é binário — doente ou não, óbito ou sobrevivência, positivo ou negativo. Justamente por ser tão usada, seus pressupostos costumam ser negligenciados. E aqui vale um esclarecimento importante: a logística não assume normalidade dos resíduos nem homocedasticidade, ao contrário da regressão linear. Confundir os dois modelos é um dos erros conceituais mais comuns.

1. O desfecho é binário e as observações são independentes

O modelo pressupõe que a variável resposta seja dicotômica e que cada observação seja independente das demais. A independência é violada, por exemplo, em dados com medidas repetidas do mesmo indivíduo ou em amostras por conglomerados. Nesses casos, a logística comum é inadequada e deve-se recorrer a modelos de efeitos mistos ou a equações de estimação generalizadas (GEE). Esse ponto se conecta ao desenho amostral — veja o efeito de desenho em amostras por conglomerados.

2. Linearidade entre preditores contínuos e o logito

Este é o pressuposto genuíno mais importante e o mais esquecido. A logística assume que cada variável contínua tem relação linear com o logito (o log da chance), não com a probabilidade em si. Se a relação for curva — digamos, a idade tendo efeito em forma de U —, forçar linearidade distorce a estimativa.

Uma forma de checar é o teste de Box-Tidwell, que adiciona ao modelo o termo x·ln(x) para cada preditor contínuo; se esse termo for significativo, a linearidade do logito está comprometida. Alternativas incluem categorizar a variável, usar polinômios ou splines.

3. Ausência de multicolinearidade severa

Preditores fortemente correlacionados entre si inflam os erros-padrão e tornam os coeficientes instáveis e difíceis de interpretar. O diagnóstico usual é o fator de inflação da variância (VIF): valores acima de 5 a 10 sinalizam problema. A solução pode ser remover uma das variáveis redundantes ou combiná-las. Esse tema aparece de novo na seleção de variáveis do modelo.

4. Tamanho de amostra adequado e ausência de separação

Amostras pequenas geram estimativas viesadas. A regra prática de eventos por variável (EPV) sugere cerca de 10 desfechos por preditor, como discutido em poder estatístico e tamanho de amostra. Há ainda o problema da separação completa ou quase completa: quando um preditor prevê o desfecho perfeitamente, o modelo não converge e os coeficientes explodem. Isso é comum com categorias de baixa frequência.

Checando no R

# VIF para multicolinearidade
library(car)
modelo <- glm(desfecho ~ idade + imc + sexo,
              data = dados, family = binomial)
vif(modelo)

# Box-Tidwell (linearidade do logito) para 'idade'
dados$idade_log <- dados$idade * log(dados$idade)
glm(desfecho ~ idade + idade_log, data = dados,
    family = binomial) |> summary()

Antes de rodar qualquer diagnóstico, garanta que seus dados estejam corretamente importados e tipados, algo tratado em como organizar e importar dados no R.

Por que isso importa no reporte

Descrever quais pressupostos foram verificados e como é parte de uma análise transparente. Diretrizes como o STROBE pedem que o tratamento das variáveis e o método de análise sejam explícitos. Verificados os pressupostos, o próximo passo é interpretar corretamente os odds ratio.

Lidando com não linearidade do logito

Quando o teste de Box-Tidwell indica que um preditor contínuo não tem relação linear com o logito, há três saídas práticas, cada uma com prós e contras. Categorizar a variável (por exemplo, transformar idade em faixas) é simples e interpretável, mas perde informação e depende de pontos de corte arbitrários. Usar termos polinomiais (idade e idade²) captura curvaturas simples, mas pode se comportar mal nas extremidades. Splines restritas (restricted cubic splines) modelam relações curvas de forma flexível e são hoje a recomendação de boa parte da literatura de modelos de predição, ao custo de interpretação menos direta. A escolha depende do objetivo: para comunicar um efeito de forma clara, categorias; para modelar fielmente, splines.

Um erro que não é pressuposto, mas parece

Convém desfazer um mito recorrente: a regressão logística não exige que os preditores sejam normalmente distribuídos. Normalidade das variáveis independentes não é pressuposto de nenhuma regressão — nem da linear. O que a linear pressupõe é normalidade dos resíduos, e a logística sequer tem esse requisito, porque modela probabilidades via distribuição binomial. Gastar tempo testando a normalidade dos preditores antes de uma logística é esforço mal direcionado; melhor investir na linearidade do logito e na ausência de multicolinearidade.

Referências

  • Hosmer DW, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3ª ed. Hoboken: Wiley; 2013.
  • Kirkwood BR, Sterne JAC. Essential Medical Statistics. 2ª ed. Blackwell; 2003.
  • Vittinghoff E, McCulloch CE. Relaxing the rule of ten events per variable in logistic and Cox regression. Am J Epidemiol. 2007;165(6):710-8.

Precisa de apoio estatístico na sua pesquisa?

Mande o projeto, a planilha ou o parecer do revisor. Devolvo escopo, prazo e preço fechado em até 2 dias úteis.