Conceitos de estatística
Valor-p: o que é, o que não é e o erro mais comum ao interpretá-lo
O valor-p é, ao mesmo tempo, o número mais usado e o mais mal compreendido da estatística aplicada. Ele aparece em praticamente todo artigo científico, orienta decisões clínicas e regulatórias, e mesmo assim é rotineiramente interpretado de forma equivocada por pesquisadores experientes. Entender o que ele realmente mede — e o que não mede — é um dos passos mais valiosos para quem faz pesquisa.
A definição correta
O valor-p é a probabilidade de observar um resultado tão extremo quanto o obtido (ou mais extremo), supondo que a hipótese nula seja verdadeira. Essa condicional é o coração da definição e a origem de quase toda confusão. O valor-p parte da premissa de que não há efeito e pergunta: se realmente não houvesse efeito, quão surpreendentes seriam os meus dados? Um p pequeno indica que os dados seriam surpreendentes sob a hipótese nula — o que se toma como evidência contra ela.
O que o valor-p NÃO é
Aqui estão os mal-entendidos que a própria American Statistical Association fez questão de combater em uma declaração formal. O valor-p não é a probabilidade de a hipótese nula ser verdadeira. Não é a probabilidade de o resultado ter ocorrido “por acaso”. Não mede o tamanho nem a importância de um efeito. E um p acima de 0,05 não prova que não há efeito — ausência de evidência não é evidência de ausência. Cada uma dessas leituras erradas leva a conclusões distorcidas, e todas são comuns na literatura.
Significância estatística ≠ relevância
Um dos maiores perigos do valor-p é a confusão entre significância estatística e relevância prática. Com uma amostra suficientemente grande, diferenças triviais atingem p < 0,05. Com uma amostra pequena, efeitos importantes podem não alcançar significância. O valor-p, sozinho, não distingue esses cenários — por isso ele precisa sempre ser acompanhado de uma medida de tamanho de efeito e de sua precisão, tema de intervalo de confiança vs. valor-p.
O problema do limiar de 0,05
O corte de 0,05 é uma convenção histórica, não uma lei da natureza. Tratar p = 0,049 como “significativo” e p = 0,051 como “não significativo” cria uma dicotomia artificial que não reflete a continuidade da evidência. A ASA recomenda explicitamente que decisões científicas não se baseiem apenas em o valor-p cruzar ou não um limiar. O contexto, o desenho do estudo, a qualidade das medidas e o conhecimento prévio devem entrar na interpretação.
Valor-p em modelos multivariáveis
Em uma regressão logística, cada preditor vem com seu valor-p, mas a decisão de manter ou remover variáveis não deve se basear apenas nele — confundidores importantes podem ser “não significativos” e ainda assim necessários, como visto em seleção de variáveis. Interpretar múltiplos valores-p sem cuidado é, aliás, um dos erros que levam à rejeição de artigos.
Como usar o valor-p com responsabilidade
O valor-p continua útil — desde que usado como uma peça de evidência entre outras, nunca como veredito automático. Reporte-o com o tamanho de efeito e o intervalo de confiança, evite a linguagem binária de “provou/não provou”, e interprete-o à luz do contexto do estudo. Essa postura é exatamente a que a comunidade estatística vem defendendo há anos.
Uma analogia para fixar a definição
Uma forma de internalizar o valor-p: imagine que a hipótese nula é “o réu é inocente”. Os dados são as evidências apresentadas no julgamento. O valor-p mede quão surpreendentes seriam essas evidências se o réu fosse realmente inocente. Evidências muito improváveis sob a inocência (p pequeno) pesam contra ela. Mas note o que o valor-p não faz: ele não diz a probabilidade de o réu ser inocente — para isso, precisaríamos de informação anterior sobre a taxa de culpados, o que a estatística bayesiana incorpora e a frequentista não. Confundir “quão surpreendentes são as evidências dada a inocência” com “qual a probabilidade de inocência dadas as evidências” é inverter a condicional — e é literalmente o erro mais comum na leitura do valor-p.
Alternativas e complementos ao valor-p
O debate sobre os limites do valor-p produziu propostas úteis. A mais consensual não é abandonar o valor-p, mas relativizá-lo: reportá-lo como número contínuo (p = 0,03, não apenas “p < 0,05”), acompanhá-lo sempre de tamanho de efeito e intervalo de confiança, e interpretá-lo no contexto. Abordagens bayesianas oferecem um enquadramento alternativo, permitindo falar diretamente da probabilidade de hipóteses, ao custo de exigir a especificação de distribuições anteriores. Independentemente da escola, o consenso é que nenhum índice único deve substituir o raciocínio científico — a mensagem central da declaração da American Statistical Association.
Referências
- Wasserstein RL, Lazar NA. The ASA’s Statement on p-Values: Context, Process, and Purpose. The American Statistician. 2016;70(2):129-133. DOI: 10.1080/00031305.2016.1154108.
- Altman DG. Practical Statistics for Medical Research. Chapman & Hall/CRC; 1991.
- Spiegelhalter D. The Art of Statistics: Learning from Data. Pelican; 2019.