Blog
Dados faltantes em pesquisa: excluir, imputar ou modelar?

Dados faltantes em pesquisa não são apenas células vazias em uma planilha. Eles podem alterar médias, reduzir o poder estatístico, produzir estimativas enviesadas e mudar a conclusão de um TCC, dissertação, tese ou artigo. A decisão entre excluir participantes, imputar valores ou usar um modelo que acomode observações incompletas deve partir da pergunta científica e do mecanismo que gerou a ausência — não de uma regra automática do software.

Por que os dados faltantes mudam o resultado da pesquisa?
Quando uma pessoa deixa de responder uma pergunta, abandona o acompanhamento ou não realiza um exame, a amostra analisada deixa de ser exatamente a amostra planejada. Se essa ausência estiver relacionada ao desfecho ou às características do participante, analisar apenas os casos completos pode superestimar ou subestimar associações. Além disso, o tamanho efetivo da amostra pode variar entre tabelas e modelos, dificultando a comparação dos resultados.
O primeiro passo é quantificar a ausência por variável e por participante. Uma porcentagem global pequena pode esconder uma variável central com grande perda. Também é útil procurar padrões: campos que ficam vazios juntos, períodos de coleta com mais falhas, grupos com maior não resposta ou desistências concentradas depois de determinado evento. Essa investigação faz parte da auditoria e limpeza do banco de dados.
MCAR, MAR e MNAR: o mecanismo importa
MCAR: ausência completamente ao acaso
Em MCAR, a probabilidade de um valor estar ausente não depende de informações observadas nem do próprio valor ausente. É uma hipótese forte e raramente deve ser assumida apenas porque um teste não encontrou associação. Se um equipamento falhou aleatoriamente em alguns dias, por exemplo, a perda pode se aproximar desse mecanismo. Sob MCAR, a análise de casos completos pode preservar a validade, mas ainda perde precisão.
MAR: ausência explicável pelos dados observados
Em MAR, a ausência pode depender de variáveis registradas. Participantes mais jovens podem responder menos a uma pergunta, mas a idade está disponível. Métodos como imputação múltipla e máxima verossimilhança podem usar essas informações para reduzir viés, desde que o modelo inclua bons preditores da ausência e do desfecho. MAR não significa que os dados faltam aleatoriamente no sentido cotidiano.
MNAR: ausência relacionada ao valor não observado
Em MNAR, mesmo depois de considerar os dados disponíveis, a chance de ausência continua relacionada ao valor que não foi observado. Pessoas com sintomas mais intensos podem evitar responder justamente sobre esses sintomas. Nessa situação, nenhum método recupera a verdade sem hipóteses adicionais. Análises de sensibilidade são necessárias para verificar quanto as conclusões dependem de cenários plausíveis.
Excluir casos: quando é defensável e quando é arriscado
A exclusão por casos completos é simples: entram na análise apenas participantes com todas as variáveis necessárias. Ela pode ser defensável quando a proporção de ausência é pequena, o mecanismo é plausivelmente MCAR e a perda de precisão não compromete o estudo. O problema é que a exclusão costuma ser aplicada sem diagnóstico, e o software pode remover silenciosamente dezenas de observações sempre que uma variável é acrescentada ao modelo.
- Informe o número de observações disponíveis em cada análise.
- Compare características de participantes incluídos e excluídos.
- Evite excluir uma linha inteira por causa de uma variável que não será usada.
- Registre critérios antes de olhar os resultados principais.
- Faça uma análise de sensibilidade quando a perda puder mudar a conclusão.
Preencher vazios com a média, mediana ou zero geralmente não resolve o problema. A imputação simples reduz artificialmente a variabilidade, enfraquece correlações e trata valores inventados como se fossem conhecidos. Usar zero é especialmente perigoso quando zero é um valor real da escala. Essas práticas podem produzir intervalos de confiança estreitos demais.
Imputação múltipla: o que ela faz
A imputação múltipla cria vários bancos completos, substituindo cada valor ausente por valores plausíveis gerados a partir de um modelo. Cada banco é analisado separadamente e os resultados são combinados por regras que incorporam a incerteza entre imputações. Assim, o método não finge conhecer um único valor correto; ele representa a incerteza que a ausência acrescenta.
O modelo de imputação deve incluir o desfecho, os preditores do modelo final, variáveis associadas à ausência e variáveis auxiliares informativas. Tipos de variáveis precisam ser respeitados: resultados binários, ordinais e contínuos não devem receber o mesmo modelo por conveniência. O número de imputações, as verificações de convergência e a comparação das distribuições observadas e imputadas precisam ser documentados.
Modelos que usam os dados disponíveis
Em estudos longitudinais, modelos lineares mistos, modelos generalizados mistos e métodos de máxima verossimilhança podem usar todas as medições disponíveis sem eliminar automaticamente uma pessoa por uma visita ausente. Isso não torna a ausência irrelevante: a validade continua dependendo de hipóteses, frequentemente MAR. A estratégia deve estar prevista no plano de análise estatística.
Para desfechos de tempo até evento, a censura também exige hipóteses próprias. Para questionários, pode haver regras de pontuação quando poucos itens de uma escala estão ausentes. Essas regras devem vir do manual validado do instrumento; inventar um limite depois de ver os dados pode introduzir viés.
Um fluxo de decisão prático
- Mapeie a porcentagem de ausência por variável, participante, grupo e momento.
- Investigue causas operacionais e padrões associados aos dados observados.
- Defina quais variáveis entram no modelo de análise e no modelo de imputação.
- Escolha a estratégia principal com base no desenho e no mecanismo plausível.
- Compare casos completos, imputação ou modelos alternativos em análises de sensibilidade.
- Relate quantidade, padrão, método, hipóteses e impacto sobre as conclusões.
Como relatar dados faltantes no artigo
Nos métodos, descreva a quantidade esperada de participantes, a quantidade analisada em cada etapa e a estratégia usada. Informe as variáveis do modelo de imputação, o número de bancos gerados e como as estimativas foram combinadas. Nos resultados, apresente um fluxograma quando houver perdas de seguimento e mostre se as conclusões mudaram nas análises de sensibilidade.
Evite escrever apenas “os dados ausentes foram excluídos”. O leitor precisa saber quanto foi excluído, de quais variáveis, por qual razão e com que efeito. Diretrizes específicas da área podem exigir detalhes adicionais. Uma segunda opinião estatística ajuda a localizar decisões frágeis antes da submissão.
Perguntas frequentes
Existe uma porcentagem segura de dados faltantes?
Não há um corte universal. Dois por cento em um desfecho central podem ser mais preocupantes que vinte por cento em uma variável secundária. O mecanismo, a importância da variável, o tamanho da amostra e a estabilidade das conclusões são mais informativos que uma regra fixa.
Imputação múltipla sempre é a melhor escolha?
Não. Ela pode ser inadequada com amostras muito pequenas, modelos mal especificados ou mecanismos MNAR não examinados. Em alguns desenhos, máxima verossimilhança, ponderação pela probabilidade de resposta ou modelos específicos podem ser preferíveis. A escolha deve ser coerente com a pergunta e o desenho.
Posso imputar o desfecho?
Em muitos contextos, incluir o desfecho no modelo de imputação é importante, mas a decisão depende do estimando, do desenho e do protocolo. Ensaios clínicos, estudos observacionais e escalas têm exigências diferentes. O ponto central é definir a estratégia antes de escolher a que produz o resultado mais favorável.
Dados faltantes não são um problema de planilha: são uma questão sobre quem deixou de ser observado, por quê e como essa ausência afeta a inferência.
Se o banco já está pronto, comece por um diagnóstico reprodutível e preserve uma cópia bruta. Para análises mais complexas, veja também a página de modelagem estatística avançada em R.