Blog
Intervalo de confiança vs. valor-p: o que reportar no seu artigo
Valor-p e intervalo de confiança (IC) são dois lados da mesma moeda inferencial, mas comunicam coisas diferentes — e o IC quase sempre comunica mais. Cada vez mais periódicos científicos exigem intervalos de confiança justamente porque eles respondem a perguntas que o valor-p sozinho não responde. Entender essa complementaridade melhora tanto a análise quanto a redação dos resultados.
O que cada um informa
O valor-p quantifica quão extremos seriam os resultados observados, ou mais extremos, sob a hipótese nula e as demais suposições do modelo. Ele não fornece a probabilidade de a hipótese ser verdadeira, nem mede sozinho magnitude ou precisão. Transformá-lo em uma decisão binária com um corte fixo descarta informação.
O intervalo de confiança apresenta a estimativa e sua incerteza sob o modelo adotado. No procedimento frequentista de 95%, a cobertura se refere à proporção de intervalos que conteriam o parâmetro em repetições do estudo, sob as suposições. Não atribui 95% de probabilidade ao parâmetro dentro do intervalo específico já calculado.
Por que o IC é mais informativo
Em um exemplo ilustrativo com aproximação normal, uma diferença estimada de 1,0 com erro-padrão 0,5 e outra de 10,0 com erro-padrão 5,0 produzem a mesma estatística de teste: 2. O valor-p bilateral é aproximadamente 0,046 nos dois casos. Os ICs de 95% são, respectivamente, 0,02 a 1,98 e 0,2 a 19,8. O mesmo valor-p acompanha magnitudes e incertezas absolutas diferentes; por isso, apresente estimativa, intervalo e unidade da medida.
A conexão matemática entre os dois
A correspondência entre IC de 95% e valor-p bilateral de 0,05 vale quando intervalo e teste usam o mesmo método, modelo e hipótese. Nesse caso, excluir o valor nulo corresponde à rejeição no nível de 5%. Testes unilaterais, procedimentos exatos, arredondamentos ou métodos diferentes podem produzir aparente discordância. Para diferenças, o valor nulo costuma ser 0; para razões, como o odds ratio, costuma ser 1.
Interpretando o IC corretamente
Há uma sutileza técnica que confunde muita gente. A interpretação frequentista rigorosa é sobre o procedimento: se repetíssemos o estudo muitas vezes, 95% dos intervalos assim construídos conteriam o valor verdadeiro. Não é correto dizer que “há 95% de probabilidade de o efeito estar neste intervalo específico” — o intervalo particular já contém ou não o valor real. Na prática, porém, o IC é usado como uma faixa de valores compatíveis com os dados, o que é uma leitura útil e defensável.
O que reportar no artigo
A recomendação atual é clara: reporte estimativas de efeito com intervalos de confiança de 95%, e use o valor-p como complemento, não como protagonista. Evite a linguagem de “provou” ou “não provou”. Essa abordagem alinha-se ao que a American Statistical Association recomenda e ao que diretrizes de reporte como o STROBE esperam da seção de resultados. Ao planejar isso desde o início, você integra a apresentação à análise estatística do artigo científico como um todo.
A largura do IC conta uma história
Depois de entender que o IC é mais informativo, o próximo passo é ler sua largura. Intervalos estreitos indicam estimativas precisas, geralmente fruto de amostras grandes e baixa variabilidade; intervalos largos indicam incerteza, típica de amostras pequenas. Isso liga o IC diretamente ao planejamento: definir a precisão desejada antes da coleta é, em essência, definir a largura aceitável do intervalo, o que determina o tamanho de amostra — a lógica de poder estatístico e tamanho de amostra e do cálculo amostral. Um estudo que termina com intervalos largos demais para responder à pergunta foi, no fundo, subdimensionado.
Nível de confiança e o que muda ao alterá-lo
O padrão de 95% é convenção, não obrigação. Usar 99% produz intervalos mais largos (maior segurança de conter o valor real, ao custo de menos precisão); usar 90%, intervalos mais estreitos. O importante é declarar o nível adotado e mantê-lo coerente ao longo do artigo. Há ainda uma leitura equivocada frequente: pensar que um IC de 95% “tem 95% de chance de conter o efeito”. Como discutido, a interpretação frequentista correta é sobre o procedimento a longo prazo, não sobre o intervalo específico. Na prática, tratá-lo como faixa de valores compatíveis com os dados é aceitável e útil, desde que você saiba a sutileza por trás.
Referências
- Wasserstein RL, Lazar NA. The ASA’s Statement on p-Values: Context, Process, and Purpose. The American Statistician. 2016;70(2):129-133. DOI: 10.1080/00031305.2016.1154108.
- Altman DG, Machin D, Bryant TN, Gardner MJ. Statistics with Confidence. 2ª ed. BMJ Books; 2000.
- von Elm E, et al.; STROBE Initiative. The STROBE statement. Lancet. 2007;370(9596):1453-7.