Regressão logística
Regressão logística simples e múltipla: qual a diferença e quando usar cada uma
A distinção entre regressão logística simples e múltipla parece trivial — uma tem um preditor, a outra tem vários —, mas a diferença conceitual é profunda e tem consequências diretas na interpretação dos resultados epidemiológicos. Não se trata apenas de “adicionar variáveis”: trata-se de controlar confundimento.
Regressão logística simples (univariável)
Na versão simples, o modelo tem um único preditor. O odds ratio resultante é o OR bruto (não ajustado), que expressa a associação entre a exposição e o desfecho sem considerar outros fatores. Ele é útil como análise exploratória inicial e para apresentar o quadro descritivo das associações, mas raramente é a resposta final em epidemiologia, porque quase sempre há variáveis que confundem a relação de interesse.
Um exemplo clássico: a associação bruta entre consumo de café e infarto pode aparecer positiva simplesmente porque quem toma muito café também fuma mais. O café “pega carona” no efeito do tabagismo. A logística simples não separa isso.
Regressão logística múltipla (multivariável)
Na versão múltipla, vários preditores entram simultaneamente. Cada OR passa a ser ajustado pelos demais: o efeito de cada variável é estimado mantendo as outras constantes. É isso que permite isolar o efeito da exposição de interesse do efeito dos confundidores. No exemplo acima, incluir o tabagismo no modelo “limpa” a estimativa do café.
Aqui cabe uma distinção terminológica que confunde muita gente: “múltipla” (vários preditores, um desfecho) não é o mesmo que “multivariada” (vários desfechos simultâneos). A logística com vários fatores de risco é, tecnicamente, uma regressão múltipla — ainda que a literatura frequentemente use “multivariada” de forma frouxa.
Confundimento, mediação e o cuidado com o ajuste
Ajustar por mais variáveis não garante menos viés. Para estimar um efeito total, em geral evita-se ajustar por mediadores; para investigar efeitos diretos, a análise de mediação exige outras hipóteses e métodos. O conjunto de ajuste deve considerar possíveis confundidores e colisores e ser justificado pelo conhecimento causal. Veja como selecionar variáveis em regressão logística.
Como reportar: bruto e ajustado lado a lado
Apresente estimativas brutas e ajustadas quando pertinentes ao objetivo, com intervalos de confiança e explicação das variáveis de ajuste. A diferença entre OR bruto e ajustado não comprova confundimento por si só, pois também pode refletir não colapsabilidade. O STROBE orienta explicitar o ajuste e seus motivos.
No R, na prática
# Modelo simples (bruto)
glm(desfecho ~ cafe, data = dados, family = binomial)
# Modelo múltiplo (ajustado)
glm(desfecho ~ cafe + tabagismo + idade + sexo,
data = dados, family = binomial)
Depois de estimar, a interpretação de cada coeficiente segue o que foi visto em como interpretar odds ratio, e a adequação global do modelo é avaliada como descrito em avaliação da qualidade do ajuste.
Quando o modelo simples é a escolha certa
Apesar de a análise ajustada ser o padrão em epidemiologia, há situações legítimas para a regressão simples. Em estudos genuinamente exploratórios, apresentar as associações brutas ajuda o leitor a entender o quadro geral antes do ajuste. Em amostras muito pequenas, incluir muitos preditores viola o limite de eventos por variável e produz estimativas instáveis — às vezes um modelo simples e honesto é preferível a um modelo múltiplo superajustado. E, para fins puramente descritivos, o OR bruto pode ser exatamente o que a pergunta pede. O erro não é usar a regressão simples, e sim apresentar o OR bruto de um estudo observacional como se fosse a estimativa final do efeito causal.
Interação: um terceiro cenário além de simples e múltipla
Entre a regressão simples e a múltipla “aditiva” existe um refinamento importante: os modelos com interação. Neles, o efeito de um preditor é permitido variar conforme o valor de outro. Isso vai além de apenas ajustar — permite descobrir para quem uma exposição é mais ou menos perigosa. Incluir uma interação exige amostra maior para estimar os termos adicionais com estabilidade, o que reforça a ligação com o dimensionamento amostral. Testar interações de forma indiscriminada, porém, é uma forma de múltiplos testes e deve ser feito com hipóteses definidas a priori.
Referências
- Hosmer DW, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3ª ed. Wiley; 2013.
- Rothman KJ, Greenland S, Lash TL. Modern Epidemiology. 3ª ed. Lippincott Williams & Wilkins; 2008.
- Vittinghoff E, Glidden DV, Shiboski SC, McCulloch CE. Regression Methods in Biostatistics. 2ª ed. Springer; 2012.