Blog
Modelo misto para medidas repetidas: quando a ANOVA não basta

Modelo misto para medidas repetidas é uma estratégia para analisar dados em que várias observações pertencem à mesma pessoa, escola, hospital, município ou outro grupo. Ele é especialmente útil em estudos longitudinais, porque reconhece que medições do mesmo participante são correlacionadas e permite representar trajetórias diferentes ao longo do tempo.

Por que a ANOVA tradicional pode não bastar
A ANOVA de medidas repetidas foi desenvolvida para situações estruturadas, mas costuma exigir dados completos e pressupostos restritivos sobre a matriz de correlação. Na prática, participantes faltam a visitas, intervalos entre medições variam e o número de observações não é igual para todos. Excluir qualquer pessoa com uma visita ausente reduz a amostra e pode introduzir viés.
Modelos mistos oferecem maior flexibilidade: usam as medições disponíveis sob hipóteses explícitas, permitem tempos desiguais, incluem covariáveis que mudam ao longo do acompanhamento e modelam a dependência dentro do participante. Essa flexibilidade não dispensa planejamento; aumenta a quantidade de decisões que precisam ser justificadas.
Efeitos fixos e efeitos aleatórios
Efeitos fixos
Efeitos fixos descrevem associações médias de interesse: diferença entre grupos, mudança por unidade de tempo, efeito de idade ou interação entre grupo e tempo. O termo “fixo” não quer dizer imutável. Ele indica que estimamos coeficientes específicos para variáveis definidas no modelo e queremos interpretá-los para a população de interesse.
Efeitos aleatórios
Efeitos aleatórios descrevem variação entre unidades. Um intercepto aleatório permite que cada participante comece em um nível próprio. Uma inclinação aleatória permite que a velocidade de mudança varie entre participantes. Em estudos multicêntricos, também pode haver variação entre centros. Esses componentes determinam como a correlação interna é representada.
Um modelo com intercepto aleatório reconhece que observações da mesma pessoa tendem a ser mais semelhantes. Contudo, se as trajetórias diferem muito, apenas um intercepto pode ser insuficiente. A escolha da estrutura aleatória deve combinar conhecimento do desenho, gráficos das trajetórias e estabilidade numérica.
A interação grupo × tempo responde à pergunta central?
Em ensaios ou estudos com grupos acompanhados, a interação entre grupo e tempo costuma avaliar se a evolução difere entre grupos. O efeito principal de grupo representa uma diferença em um tempo de referência, e o efeito principal de tempo representa a mudança no grupo de referência. Interpretar apenas os efeitos principais quando existe interação pode gerar conclusões enganosas.
O tempo pode ser codificado como contínuo quando uma tendência linear é plausível, como categórico quando cada visita deve ter sua própria média ou com funções flexíveis quando a trajetória é curva. Tratar visitas irregulares como 1, 2 e 3 ignora a distância real entre elas; use o tempo real quando ele for cientificamente relevante.
Exemplo de pergunta e estrutura
Considere um estudo que mede um escore funcional no início, após três meses e após seis meses em dois grupos. Um modelo inicial pode incluir grupo, tempo, interação grupo × tempo, valor basal relevante e intercepto aleatório por participante. O contraste de interesse pode ser a diferença entre grupos na mudança até seis meses, com intervalo de confiança.
Essa especificação é mais informativa que realizar um teste separado em cada visita. Testes isolados aumentam multiplicidade, não usam toda a estrutura longitudinal e não testam diretamente diferenças de trajetória. Contrastes planejados devem ser definidos no plano de análise estatística.
Quando usar um modelo linear misto
O modelo linear misto é adequado quando o desfecho contínuo pode ser representado por uma relação aproximadamente linear nos parâmetros e os resíduos têm comportamento aceitável. Normalidade perfeita do desfecho bruto não é requisito; interessa a distribuição condicional dos resíduos e dos efeitos aleatórios, além de heterocedasticidade, observações influentes e forma funcional.
E se o desfecho for binário, contagem ou ordinal?
Para desfechos binários, como presença ou ausência de um evento, pode-se usar um modelo misto logístico. Contagens podem exigir Poisson ou binomial negativa, especialmente quando há sobredispersão. Respostas ordinais podem ser analisadas com modelos ordinais mistos. A interpretação muda: coeficientes podem estar em log-odds ou log-taxas e devem ser convertidos em medidas compreensíveis.
Modelos generalizados mistos podem ser difíceis de ajustar com poucos grupos, eventos raros ou estrutura aleatória complexa. Simplificar o modelo apenas até ele convergir, sem considerar a pergunta, pode esconder um problema de informação. Em alguns casos, equações de estimação generalizadas respondem melhor a uma pergunta marginal.
Modelo misto ou GEE?
Modelos mistos costumam produzir efeitos condicionais às unidades e descrevem a heterogeneidade por efeitos aleatórios. GEE estima efeitos médios populacionais e usa uma correlação de trabalho com erros robustos sob condições adequadas. Para desfechos lineares, interpretações podem ser semelhantes; em modelos não lineares, efeitos condicionais e marginais diferem.
A escolha não deve ser feita por qual método entrega menor valor-p. Defina se o interesse está na trajetória individual, na média populacional, na variabilidade entre centros ou em predições. Considere também o número de clusters e a qualidade das estimativas robustas.
Dados faltantes em estudos longitudinais
Uma vantagem dos modelos mistos por máxima verossimilhança é aproveitar observações incompletas sob uma hipótese como MAR, condicionada às variáveis do modelo. Isso não significa que o modelo corrige toda ausência automaticamente. Se o abandono estiver relacionado a resultados não observados, análises de sensibilidade podem ser necessárias.
Inclua preditores relevantes da ausência quando cientificamente justificáveis e examine padrões de perda por grupo e visita. Compare participantes com seguimento completo e incompleto, sem tratar um teste de significância como prova do mecanismo. O guia de dados faltantes em pesquisa detalha exclusão, imputação e sensibilidade.
Como escolher a estrutura de correlação
Interceptos e inclinações aleatórias induzem uma estrutura de correlação. Também podem ser modeladas correlações residuais, como autorregressiva, quando medições próximas são mais parecidas. Estruturas não estruturadas são flexíveis, mas consomem muitos parâmetros. Com poucas pessoas ou poucas observações, modelos complexos podem ser instáveis.
Critérios de informação, razão de verossimilhanças e diagnóstico ajudam, mas decisões devem respeitar modelos aninhados, métodos de estimação e fronteiras dos parâmetros. Comparar dezenas de estruturas e publicar apenas a vencedora aumenta o risco de sobreajuste. Registre a estratégia principal e alternativas plausíveis.
Diagnóstico do modelo
- Visualize trajetórias individuais e médias por grupo.
- Examine resíduos versus valores ajustados e versus tempo.
- Procure heterocedasticidade e observações influentes.
- Verifique a distribuição prevista para efeitos aleatórios.
- Confirme se a estrutura aleatória é sustentada pelos dados.
- Avalie convergência, singularidade e sensibilidade à especificação.
- Compare valores previstos com padrões observados.
Um aviso de singularidade pode indicar que a variância de um efeito aleatório está próxima de zero ou que o conjunto de dados não sustenta a estrutura proposta. A resposta não é ignorar o aviso. Reavalie desenho, escala do tempo, centralização de variáveis e necessidade de cada componente.
Como interpretar e apresentar
Apresente estimativas com intervalos de confiança e unidades. Para uma interação, mostre médias ou probabilidades previstas em tempos relevantes e o contraste planejado. Um gráfico com trajetórias previstas e intervalos pode comunicar melhor que uma tabela extensa de coeficientes. Explique a população, os níveis de agrupamento e o método de estimação.
Nos métodos, registre fórmula do modelo, distribuição e função de ligação, estrutura fixa e aleatória, codificação do tempo, método de estimação, tratamento de ausência e software. A análise reprodutível em R facilita revisão, atualização e resposta a pareceristas.
Erros comuns
- Ignorar a dependência e aplicar regressão comum às observações repetidas.
- Usar ANOVA após excluir qualquer participante com visita ausente.
- Interpretar grupo × tempo olhando apenas um valor-p global.
- Adicionar inclinações aleatórias sem dados suficientes.
- Selecionar estrutura exclusivamente pelo menor AIC.
- Não informar como o tempo foi codificado.
- Apresentar coeficientes sem traduzir a escala do modelo.
Quando buscar modelagem avançada
Vale buscar apoio quando há múltiplos níveis, poucos clusters, desfechos não gaussianos, tempo irregular, abandono informativo, não linearidade ou interesse em predição individual. Uma revisão antecipada permite alinhar o estimando, o cálculo amostral, o banco e os contrastes. A página de modelagem estatística avançada em R resume esse tipo de suporte.
O melhor modelo não é o mais complexo: é o que representa a pergunta, a dependência e a incerteza com hipóteses que os dados conseguem sustentar.
Antes de ajustar, faça gráficos, confira identificadores e defina qual diferença seria cientificamente relevante. Depois, avalie diagnósticos e traduza o resultado para a escala que o leitor entende. Essa sequência reduz a chance de escolher o modelo apenas depois de conhecer o resultado.