Blog
Regressão linear múltipla: pressupostos e interpretação
Prever um desfecho numérico com vários fatores é poderoso — desde que os pressupostos do modelo sejam respeitados.
A regressão linear múltipla modela um desfecho numérico contínuo em função de duas ou mais variáveis preditoras. É a extensão natural da regressão simples e uma das análises mais úteis em pesquisa, porque permite estimar o efeito de cada fator ajustando para os demais. Mas é também um método com pressupostos que, quando ignorados, produzem conclusões erradas. Este post cobre a interpretação e as verificações essenciais. Antes de ajustar o modelo, confira a organização do banco de dados; ao apresentar os coeficientes, revise a interpretação dos intervalos de confiança.
O que o modelo estima
A regressão linear múltipla estima como o valor esperado do desfecho muda quando cada preditor varia, mantendo os outros constantes. Cada preditor recebe um coeficiente (beta), que indica quanto o desfecho muda, em média, por unidade de aumento daquela variável, com os demais preditores fixos.
Por exemplo (ilustrativo), em um modelo prevendo uma medida laboratorial a partir de idade e índice de massa corporal, o coeficiente da idade diz quanto a medida muda por ano adicional de idade, mantido o IMC constante. Essa ideia de “mantendo o resto constante” é o coração da interpretação.
Interpretando os coeficientes
- Sinal: positivo indica que o desfecho aumenta com o preditor; negativo, que diminui.
- Magnitude: depende da unidade da variável. Reescalar (por década, por dez unidades) pode facilitar a leitura.
- Intervalo de confiança e p: o IC mostra a faixa plausível para o efeito; o p, a compatibilidade com a ausência de efeito. Reporte sempre ambos.
- Variáveis categóricas: entram como comparações em relação a uma categoria de referência, e o coeficiente representa a diferença média em relação a ela.
Os pressupostos que sustentam a validade
A regressão linear repousa sobre alguns pressupostos, verificáveis principalmente pelos resíduos (as diferenças entre valores observados e previstos):
- Linearidade: a relação entre preditores e desfecho é aproximadamente linear. Gráficos de resíduos ajudam a detectar curvatura.
- Independência das observações. Dados agrupados ou medidas repetidas violam isso e pedem outros modelos.
- Homocedasticidade: a variância dos resíduos é constante ao longo dos valores previstos. Um padrão em funil no gráfico de resíduos indica violação.
- Normalidade dos resíduos: relevante para a inferência, especialmente em amostras pequenas. Avaliada com QQ-plot dos resíduos — e não da variável bruta.
- Ausência de multicolinearidade severa: preditores muito correlacionados entre si tornam os coeficientes instáveis. O VIF (fator de inflação da variância) ajuda a diagnosticar.
Regressão linear múltipla: diagnóstico do modelo
Verificar o ajuste é parte inseparável da análise. Além dos gráficos de resíduos, observam-se pontos influentes (observações que puxam o modelo desproporcionalmente, avaliadas por medidas como a distância de Cook) e o ajuste global (o R², que indica a proporção da variabilidade do desfecho explicada pelo modelo, lembrando que R² alto não garante um modelo correto nem relação causal).
Erros que aparecem com frequência
- Testar a normalidade da variável desfecho em vez dos resíduos.
- Ignorar a não linearidade, forçando uma reta onde a relação é curva.
- Superajustar (overfitting) incluindo variáveis demais para o tamanho da amostra.
- Interpretar coeficientes como causais sem que o delineamento sustente essa leitura.
- Não verificar pontos influentes, que podem sozinhos determinar o resultado.
Quando a regressão linear não é adequada
Se o desfecho é binário, use regressão logística; se é uma contagem, modelos para contagem; se é tempo até evento, análise de sobrevivência; se há estrutura hierárquica (pacientes dentro de hospitais, medidas repetidas), modelos mistos. Forçar a regressão linear em desfechos que não são contínuos e aproximadamente normais é um erro estrutural.
Há ainda uma decisão sobre a escala do desfecho. Quando a variável resposta é fortemente assimétrica — como muitas medidas de concentração e de custo —, uma transformação (por exemplo, logarítmica) pode tornar a relação mais linear e os resíduos mais bem-comportados. Isso resolve problemas de pressupostos, mas muda a interpretação dos coeficientes, que passam a se referir à escala transformada. Reportar de forma clara em qual escala o modelo foi ajustado, e traduzir o resultado de volta para uma linguagem interpretável, é parte do trabalho de comunicação da análise.
Conclusão
A regressão linear múltipla é poderosa para estimar o efeito ajustado de vários fatores sobre um desfecho contínuo, mas sua validade depende da checagem cuidadosa dos pressupostos por meio dos resíduos. Interpretação correta e diagnóstico do modelo caminham juntos.
Quer construir um modelo de regressão bem especificado e defensável na revisão? A Estatística para Pesquisa faz a modelagem e o diagnóstico com você, entregando script comentado.
Perguntas frequentes
O que o coeficiente da regressão significa?
Indica quanto o desfecho muda, em média, por unidade de aumento do preditor, mantidas as demais variáveis constantes.
Preciso que os dados sejam normais para fazer regressão linear?
O pressuposto de normalidade se aplica aos resíduos do modelo, não à variável desfecho isolada, e é mais relevante em amostras pequenas.
O que é multicolinearidade?
É a alta correlação entre preditores, que torna os coeficientes instáveis e difíceis de interpretar. O VIF ajuda a identificá-la.