Publicação e revisão
Erros estatísticos que fazem revisores rejeitarem seu artigo
Editores e revisores de periódicos científicos rejeitam artigos por muitos motivos, mas problemas estatísticos estão consistentemente entre os principais. A maioria deles é evitável e nasce de mal-entendidos conceituais, não de má-fé. Conhecer os erros mais frequentes é a forma mais barata de proteger seu manuscrito — e de responder melhor caso um revisor os aponte.
1. Interpretar o valor-p como probabilidade de a hipótese ser verdadeira
O erro conceitual mais comum. O valor-p não é a probabilidade de a hipótese nula ser verdadeira, nem a probabilidade de o resultado ter ocorrido por acaso. A própria American Statistical Association publicou uma declaração formal alertando para esses mal-entendidos. Confundir significância estatística com relevância clínica é um subproduto frequente desse erro — tema detalhado em o que é (e o que não é) o valor-p.
2. Reportar só o valor-p, sem tamanho de efeito nem intervalo de confiança
Um “p < 0,05” isolado diz pouco. Revisores atentos querem saber a magnitude do efeito e sua precisão. Reportar estimativas com intervalos de confiança de 95% é hoje padrão, e muitos periódicos exigem. A comparação entre as duas abordagens está em intervalo de confiança vs. valor-p.
3. Múltiplas comparações sem correção
Testar dezenas de associações e reportar as “significativas” infla drasticamente a chance de falsos positivos. Ao nível de 5%, testar 20 hipóteses independentes torna quase certo encontrar ao menos um “achado” espúrio. Se muitos testes são inevitáveis, discuta o problema e considere correções (Bonferroni, FDR) ou, no mínimo, seja transparente sobre o caráter exploratório.
4. Usar o teste errado para o tipo de dado
Aplicar teste t a dados fortemente assimétricos, tratar variável ordinal como contínua, ou ignorar o pareamento de medidas repetidas são erros que revisores metodológicos identificam rápido. A escolha do teste deve seguir o tipo de variável e a distribuição — decisão que começa já na estatística descritiva.
5. Não ajustar por confundidores
Apresentar apenas associações brutas em um estudo observacional é convite à crítica. O leitor precisa das estimativas ajustadas para julgar se a associação sobrevive ao controle de fatores concorrentes. O raciocínio de ajuste — e o cuidado de não ajustar por mediadores — está em regressão logística simples e múltipla e em seleção de variáveis.
6. Cálculo amostral ausente ou mal justificado
A falta de um cálculo amostral, ou um cálculo sem premissas explícitas, enfraquece o estudo — especialmente em ensaios e estudos comparativos. Reporte prevalência esperada, efeito, α, poder e fonte, conforme poder estatístico e tamanho de amostra.
7. Confundir odds ratio com risco relativo
Interpretar um OR como se fosse RR, sobretudo com desfecho comum, gera afirmações exageradas sobre o efeito. Esse ponto específico está em como interpretar odds ratio.
8. Métodos irreprodutíveis
Omitir qual software, versão, teste ou modelo foi usado impede a reprodução e viola diretrizes de reporte. Seguir guias como o STROBE (observacionais) e consultar o EQUATOR Network para o guia adequado ao seu desenho reduz drasticamente esse tipo de crítica. Quando ela vier mesmo assim, o texto sobre como responder revisores quando você discorda ajuda a conduzir o diálogo.
9. P-hacking e garimpo de resultados
Talvez o problema mais sério da lista, porque compromete a integridade e não apenas a técnica. P-hacking é o conjunto de práticas — muitas vezes inconscientes — que produzem significância artificial: testar múltiplos desfechos e reportar só os significativos, decidir excluir observações depois de ver o efeito que isso causa, ou parar a coleta assim que o p cruza 0,05. Todas inflam falsos positivos e minam a reprodutibilidade. A defesa mais eficaz é definir o plano de análise antes de ver os dados e, quando possível, registrá-lo previamente. O pré-registro do protocolo e dos desfechos é hoje valorizado por muitos periódicos justamente por blindar o estudo contra essas tentações.
10. Confundir ausência de significância com prova de ausência
Um resultado “não significativo” (p ≥ 0,05) não prova que não existe efeito — pode apenas refletir amostra insuficiente ou muita variabilidade. Afirmar que “os grupos são iguais” ou que “o tratamento não tem efeito” com base num p alto é uma inferência inválida. A conclusão honesta é que o estudo não encontrou evidência de efeito, e o intervalo de confiança dirá se isso significa “efeito provavelmente nulo” (IC estreito em torno de zero) ou “estudo inconclusivo” (IC largo). Essa distinção está no centro de intervalo de confiança vs. valor-p.
Referências
- Wasserstein RL, Lazar NA. The ASA’s Statement on p-Values: Context, Process, and Purpose. The American Statistician. 2016;70(2):129-133. DOI: 10.1080/00031305.2016.1154108.
- von Elm E, et al.; STROBE Initiative. The STROBE statement. Lancet. 2007;370(9596):1453-7.
- Altman DG. Practical Statistics for Medical Research. Chapman & Hall/CRC; 1991.