Regressão logística
Como selecionar variáveis para uma regressão logística multivariável
Decidir quais variáveis entram em um modelo de regressão logística é, provavelmente, a etapa que mais separa uma análise defensável de uma frágil. É tentador jogar tudo no modelo e deixar o software decidir, mas essa abordagem produz modelos instáveis, valores-p viciados e conclusões que não se replicam. A seleção de variáveis deve ser guiada primeiro pela teoria e só depois por critérios estatísticos.
Comece pelo objetivo do modelo
A estratégia certa depende de para que serve o modelo. Se o objetivo é explicar o efeito de uma exposição específica (a pergunta epidemiológica típica), a seleção deve focar em identificar e incluir confundidores. Se o objetivo é predizer um desfecho da forma mais precisa possível, os critérios mudam e passam a valorizar desempenho preditivo e parcimônia. Misturar os dois objetivos é fonte comum de erro.
A abordagem orientada por confundimento
Para investigar efeitos causais, selecione o ajuste com base no conhecimento substantivo e nas relações causais assumidas. Associação com exposição e desfecho, isoladamente, não identifica um confundidor. Uma mudança de 10% no OR após ajuste também não prova confundimento: a não colapsabilidade do OR pode produzir diferenças mesmo sem esse viés. Evite selecionar confundidores apenas por valor-p ou mudança no estimador; justifique o conjunto de ajuste antes da análise. Veja a discussão sobre não colapsabilidade e interpretação do OR.
A distinção entre confundidor e mediador, central aqui, foi introduzida em regressão logística simples e múltipla. Ferramentas como diagramas causais (DAGs) ajudam a formalizar essas decisões antes de tocar nos dados.
Os riscos da seleção automática (stepwise)
Métodos automáticos — forward, backward, stepwise — selecionam variáveis com base em critérios estatísticos iterativos. Eles são populares por serem cômodos, mas têm problemas bem documentados: capitalizam sobre o acaso, produzem intervalos de confiança artificialmente estreitos, geram valores-p enviesados e frequentemente não se replicam em novas amostras. Em amostras pequenas, o problema piora. A recomendação da literatura metodológica é usar seleção automática com muita cautela e nunca como substituto do julgamento teórico.
Eventos por parâmetro e planejamento amostral
Dez eventos por variável é uma regra histórica, não um teto universal nem garantia de estabilidade. Conte os parâmetros candidatos: categorias, interações e termos não lineares podem exigir vários coeficientes. O tamanho necessário também depende da frequência do desfecho, do desempenho esperado e do controle de sobreajuste. Para modelos de predição, use um planejamento específico, como discutido por Riley e colaboradores, em vez de converter automaticamente 80 eventos em oito variáveis permitidas.
Multicolinearidade e variáveis redundantes
Duas variáveis que medem quase a mesma coisa (peso e IMC, por exemplo) inflam os erros-padrão. Verifique o VIF, conforme descrito nos pressupostos da regressão logística, e escolha uma das redundantes com base em interpretabilidade.
Um fluxo defensável
Um caminho sólido: (1) listar candidatas a partir da literatura e de DAGs; (2) verificar EPV e multicolinearidade; (3) montar o modelo com a exposição de interesse e os confundidores justificados; (4) checar mudança no estimador; (5) documentar todas as decisões. Essa transparência é o que revisores esperam ver — e sua ausência é uma das causas frequentes de crítica, como discuto em erros estatísticos que fazem revisores rejeitarem artigos.
Diagramas causais como bússola
Uma das ferramentas mais úteis para orientar a seleção de variáveis são os diagramas acíclicos direcionados (DAGs). Eles representam graficamente as relações causais assumidas entre exposição, desfecho e demais variáveis, e permitem identificar formalmente quais variáveis devem ser ajustadas e quais não. Um DAG deixa visível, por exemplo, que ajustar por uma variável que é consequência comum da exposição e do desfecho (um “colisor”) introduz viés em vez de removê-lo — um erro sutil e contraintuitivo que a seleção baseada apenas em significância nunca evitaria. Construir o DAG antes de olhar os dados disciplina o pensamento e torna as decisões auditáveis.
Validação: o teste real de um modelo
Um modelo que ajusta bem os dados em que foi construído pode falhar em novos dados — fenômeno chamado overfitting, especialmente provável quando muitas variáveis são testadas em amostra pequena. Por isso, modelos destinados à predição devem ser validados, idealmente em uma amostra independente ou, na ausência dela, por reamostragem (bootstrap) ou validação cruzada. Reportar apenas o desempenho na amostra de desenvolvimento superestima a real capacidade do modelo. Essa etapa se conecta diretamente à avaliação da qualidade do ajuste.
Referências
- Hosmer DW, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3ª ed. Wiley; 2013.
- Peduzzi P, Concato J, Kemper E, Holford TR, Feinstein AR. A simulation study of the number of events per variable in logistic regression analysis. J Clin Epidemiol. 1996;49(12):1373-9.
- Vittinghoff E, McCulloch CE. Relaxing the rule of ten events per variable in logistic and Cox regression. Am J Epidemiol. 2007;165(6):710-8.