EstatísticaparaPesquisa Falar no WhatsApp

Regressão logística

Como avaliar a qualidade do ajuste de um modelo de regressão logística

agosto 22, 2026 5 min de leitura atualizado em setembro 16, 2026

Por · CRBM-GO 5438

Estimar uma regressão logística é fácil; saber se o modelo ajusta bem os dados é o que separa uma análise madura de uma superficial. “Qualidade do ajuste” abrange duas perguntas distintas que costumam ser confundidas: o modelo calibra bem (as probabilidades previstas batem com as observadas)? E o modelo discrimina bem (separa quem tem do que não tem o desfecho)? São coisas diferentes, e um bom modelo precisa das duas.

Teste de Hosmer-Lemeshow: calibração

O teste de Hosmer–Lemeshow compara resultados observados e previstos após agrupar as probabilidades estimadas. Um valor-p pequeno sugere discrepâncias; um valor-p alto significa apenas que o teste não detectou discrepâncias suficientes para rejeitar a hipótese de ajuste. Isso não comprova boa calibração, especialmente em amostras pequenas. Complemente a avaliação com gráfico de calibração e medidas adequadas ao objetivo do modelo.

O teste tem limitações conhecidas: é sensível ao número de grupos escolhido e perde poder em amostras pequenas, além de pouco informativo em amostras muito grandes. Por isso não deve ser usado isoladamente.

Curva ROC e AUC: discriminação

A AUC mede a discriminação e varia de 0 a 1: 0,5 indica ausência de discriminação global e 1 indica ordenação perfeita no sentido definido. Valores abaixo de 0,5 são possíveis e exigem conferir a direção das previsões e a codificação do desfecho. Avalie o intervalo de confiança e o desempenho em dados de validação; uma AUC alta não demonstra boa calibração.

Pseudo-R² e critérios de informação

Diferentemente da regressão linear, a logística não tem um R² verdadeiro. Existem pseudo-R² (McFadden, Nagelkerke, Cox-Snell), úteis para comparar modelos aninhados, mas que não devem ser interpretados como “proporção da variância explicada”. Para comparar modelos não aninhados, o AIC e o BIC são mais apropriados: valores menores indicam melhor equilíbrio entre ajuste e parcimônia.

Resíduos e observações influentes

Nem só de estatísticas globais vive o diagnóstico. Resíduos de Pearson e deviance ajudam a encontrar observações mal ajustadas, e a distância de Cook identifica pontos influentes que puxam os coeficientes. Vale sempre inspecionar os casos extremos — às vezes são erros de digitação, corrigíveis já na etapa de organização dos dados.

Colocando junto no R

modelo <- glm(desfecho ~ idade + sexo + imc,
              data = dados, family = binomial)

# Hosmer-Lemeshow
library(ResourceSelection)
hoslem.test(modelo$y, fitted(modelo), g = 10)

# AUC
library(pROC)
# Use as mesmas observações efetivamente incluídas no modelo
roc(modelo$y, fitted(modelo), levels = c(0, 1), direction = "<")

# AIC
AIC(modelo)

Ordem importa: pressupostos antes do ajuste

Avaliar qualidade de ajuste só faz sentido depois de garantir que os pressupostos do modelo foram atendidos e que a seleção de variáveis foi criteriosa. E ao reportar, apresente calibração e discriminação em conjunto, nunca apenas um dos dois — recomendação alinhada às diretrizes de reporte do EQUATOR Network, que reúne guias para diferentes tipos de estudo, inclusive modelos de predição.

Overfitting e validação interna

Uma AUC alta na própria amostra de desenvolvimento pode ser ilusória. Quando um modelo é construído e avaliado nos mesmos dados, ele tende a parecer melhor do que realmente é — capturou não só o sinal, mas também o ruído específico daquela amostra. Isso é o overfitting, e é mais grave quanto menor a amostra e maior o número de preditores testados. Para estimar o desempenho honesto, recorre-se à validação. A validação externa, em uma amostra independente, é o padrão-ouro. Na sua ausência, a validação interna por bootstrap fornece uma estimativa do “otimismo” — o quanto o desempenho aparente supera o esperado em novos dados — e permite corrigir as estimativas. Reportar desempenho sem qualquer validação é uma fragilidade que revisores de modelos de predição apontam com frequência.

Calibração e discriminação são independentes

Vale insistir: um modelo pode discriminar bem e calibrar mal, ou vice-versa. Discriminação (AUC) mede a capacidade de ordenar corretamente quem tem maior e menor risco. Calibração mede se as probabilidades previstas correspondem às frequências reais — se, entre os pacientes a quem o modelo atribuiu 20% de risco, cerca de 20% de fato tiveram o desfecho. Um modelo pode ordenar perfeitamente os pacientes (AUC alta) e ainda assim prever probabilidades sistematicamente altas ou baixas (calibração ruim). Para decisões clínicas baseadas em limiares de probabilidade, a calibração é tão importante quanto a discriminação, e gráficos de calibração são mais informativos que o teste de Hosmer-Lemeshow isolado.

Referências

  • Hosmer DW, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3ª ed. Wiley; 2013.
  • Steyerberg EW. Clinical Prediction Models. 2ª ed. Springer; 2019.
  • EQUATOR Network. Reporting guidelines. Disponível em: equator-network.org.

Precisa de apoio estatístico na sua pesquisa?

Mande o projeto, a planilha ou o parecer do revisor. Devolvo escopo, prazo e preço fechado em até 2 dias úteis.