Blog
Hipótese primária e múltiplas comparações: como planejar antes de analisar

Em muitos projetos de TCC, dissertação, tese e artigo científico, o problema das múltiplas comparações começa antes de abrir o R, SPSS ou qualquer outro software. Ele surge quando a pergunta de pesquisa ainda não foi transformada em uma hipótese principal clara. O banco contém muitas variáveis, vários grupos, diferentes momentos de avaliação e dezenas de combinações possíveis. Se todas forem testadas e apenas os resultados com menor valor de p receberem destaque, aumenta o risco de conclusões ocasionais parecerem descobertas planejadas.
Uma estratégia mais sólida é definir previamente qual pergunta é central, qual desfecho representa essa pergunta e quais análises são secundárias ou exploratórias. Isso não significa que todo estudo precise ter apenas um teste. Significa organizar as hipóteses de acordo com a finalidade científica e considerar a multiplicidade quando várias inferências pertencem à mesma família de conclusões.
O que é uma hipótese primária?
A hipótese primária é a proposição principal que o estudo pretende avaliar. Ela deve estar conectada ao objetivo primário, à população, à exposição ou intervenção, ao desfecho e ao contraste estatístico de interesse. Em vez de escrever apenas que há diferença entre os grupos, é melhor especificar qual variável será comparada, em qual momento e entre quais grupos.
Essa definição influencia o planejamento amostral e a interpretação. Quando o tamanho da amostra é calculado para detectar um efeito no desfecho principal, trocar o foco depois de observar os dados pode quebrar a coerência entre pergunta, planejamento e análise. Por isso, o plano estatístico deve nascer do desenho do estudo, como discutimos no guia sobre como escolher a análise estatística de uma pesquisa.
Por que muitas comparações aumentam o risco de falso positivo?
Em um teste isolado com nível de significância de 5%, existe uma probabilidade controlada de rejeitar uma hipótese nula verdadeira. Quando uma família de hipóteses é testada repetidamente e cada teste é interpretado como oportunidade independente de declarar um achado, a probabilidade de pelo menos um falso positivo na família pode aumentar. A FDA destaca esse problema em sua orientação sobre múltiplos endpoints: quanto mais endpoints inferenciais são avaliados sem estratégia apropriada, maior a preocupação com conclusões falsas.
Imagine um projeto com cinco desfechos, três momentos e duas comparações entre grupos. Dependendo do desenho, rapidamente surgem dezenas de testes. Encontrar um p menor que 0,05 em algum ponto não tem a mesma força interpretativa de encontrar o resultado previsto para a hipótese primária. Isso não torna os demais resultados inúteis; muda o grau de confirmação que podemos atribuir a eles.
Nem toda multiplicidade exige a mesma correção
Um erro comum é aplicar Bonferroni automaticamente a qualquer tabela com mais de um valor de p. A questão correta é primeiro identificar qual conjunto de testes forma uma família inferencial. Métodos como Bonferroni e Holm controlam a probabilidade de pelo menos um erro tipo I na família, conhecida como FWER. Em contextos com grande número de hipóteses, como estudos ômicos, estratégias de controle da taxa de falsas descobertas, ou FDR, podem ser mais adequadas. A escolha depende da pergunta, do desenho, da dependência entre testes e do custo científico de falsos positivos e falsos negativos.
Também é importante distinguir análises confirmatórias das exploratórias. Uma análise exploratória pode ser valiosa para gerar hipóteses, desde que seja apresentada como tal. O problema aparece quando uma comparação escolhida após examinar os dados é descrita como se tivesse sido a pergunta central desde o início.
Como estruturar hipótese primária, secundárias e exploratórias
Antes da coleta ou, em estudos com dados existentes, antes da análise inferencial principal, escreva uma pequena hierarquia. Primeiro, registre o objetivo primário e o desfecho correspondente. Depois, liste objetivos secundários que complementam a pergunta central. Por fim, separe análises exploratórias destinadas a procurar padrões ou gerar novas hipóteses.
Para cada hipótese importante, documente a variável resposta, o fator ou exposição principal, o contraste de interesse, a população analítica, o momento de avaliação e o método estatístico previsto. Se houver vários desfechos primários ou várias comparações capazes de sustentar a mesma conclusão principal, defina previamente como a multiplicidade será tratada. Em ensaios clínicos, documentos como o ICH E9 enfatizam a importância da pré-especificação dos aspectos estatísticos essenciais.
Bonferroni, Holm e FDR: qual é a diferença?
Bonferroni é conhecido por sua simplicidade: distribui o nível de erro entre os testes da família. É fácil de explicar, mas pode ser conservador, especialmente quando há muitas hipóteses. Holm utiliza uma estratégia sequencial e também controla FWER, frequentemente com maior poder do que o Bonferroni simples.
Já abordagens de FDR têm outra finalidade: controlar a proporção esperada de falsas descobertas entre os resultados declarados como descobertas. Isso é particularmente útil quando o objetivo envolve rastrear grande número de associações, como expressão gênica. Não é correto escolher o método apenas porque produz mais resultados estatisticamente significativos. A estratégia precisa refletir o objetivo inferencial.
E quando existem vários desfechos realmente importantes?
Alguns estudos não podem ser resumidos por um único desfecho. Pode haver desfechos coprimários, múltiplos primários ou um desfecho composto. Essas estruturas têm consequências diferentes. Em certos desenhos, todos os coprimários precisam demonstrar o efeito esperado; em outros, cada desfecho pode sustentar uma conclusão. A orientação da FDA sobre múltiplos endpoints apresenta essas situações e ressalta que o tratamento da multiplicidade depende da forma como os resultados serão usados para concluir sobre o efeito estudado.
Em trabalhos acadêmicos fora do contexto regulatório, a mesma lógica conceitual é útil: deixe explícito quais resultados são necessários para responder ao objetivo principal e quais ampliam a interpretação.
O papel do valor de p nesse planejamento
O problema não se resolve substituindo uma regra automática por outra. Valores de p devem ser interpretados junto com estimativas de efeito, intervalos de confiança, desenho e plausibilidade científica. O artigo sobre intervalo de confiança versus valor-p mostra por que a magnitude e a precisão do efeito acrescentam informação que uma classificação binária não oferece.
Também vale evitar o caminho inverso: testar inúmeras alternativas até alguma atingir o limiar desejado. A multiplicidade não é apenas um detalhe matemático; é uma questão de transparência sobre quantas oportunidades de encontrar um resultado favorável foram consideradas.
Como escrever isso no projeto de pesquisa
Uma seção estatística clara pode declarar que a hipótese primária avaliará a associação entre X e Y, definida previamente como análise principal; hipóteses A e B serão secundárias; e as demais análises serão exploratórias. Para uma família de comparações secundárias, por exemplo, pode ser previamente escolhido o procedimento de Holm para controle do erro familiar. O texto exato naturalmente muda conforme o desenho.
O importante é que o leitor consiga reconstruir a lógica antes de conhecer os resultados. Isso reduz decisões oportunistas e facilita a revisão por orientador, banca e periódico. Para organizar todo o processo, veja também como fazer a análise estatística do TCC passo a passo.
O que fazer se a coleta já terminou?
Nem todo pesquisador chega à análise com um protocolo estatístico detalhado. Nesse caso, não é preciso fingir que decisões posteriores foram pré-especificadas. Reconstrua a hierarquia usando o projeto original, objetivos registrados e conhecimento científico anterior aos resultados. Documente quais decisões foram tomadas depois da coleta e trate análises orientadas pelos dados como exploratórias quando apropriado.
Se a amostra também for limitada, multiplicar testes pode agravar a instabilidade das estimativas. Nosso artigo sobre como apresentar limitações de amostra pequena discute como relatar precisão e generalização sem simplesmente declarar o estudo inválido.
Checklist antes de executar dezenas de testes
Confirme se existe uma pergunta principal claramente escrita; identifique o desfecho primário; liste as hipóteses secundárias; marque análises exploratórias; defina quais testes pertencem à mesma família; escolha antecipadamente a estratégia de multiplicidade quando necessária; registre covariáveis e subgrupos planejados; reporte estimativas e intervalos de confiança; e preserve no script a sequência completa das análises, inclusive resultados que não atingiram o limiar de significância.
Esse registro torna a análise mais auditável e ajuda a evitar que uma tabela extensa se transforme em uma seleção de resultados convenientes.
Conclusão
Definir a hipótese primária é uma decisão científica, não apenas estatística. Ela conecta objetivo, desenho, amostra, desfecho e interpretação. Quando existem múltiplas comparações, a solução não é aplicar uma correção mecanicamente nem ignorar o problema. É identificar a família de inferências, separar confirmação de exploração e escolher uma estratégia coerente com a pergunta.
Uma análise bem planejada não promete resultados significativos. Ela torna mais transparente o caminho entre a pergunta e a conclusão, inclusive quando os dados não sustentam a hipótese inicial.
Referências e leitura complementar
U.S. Food and Drug Administration. Multiple Endpoints in Clinical Trials: Guidance for Industry. 2022.
International Council for Harmonisation / FDA. E9 Statistical Principles for Clinical Trials.
Streiner DL. Zen and the Art of Multiple Comparisons. Canadian Journal of Psychiatry. 2015.
Vickerstaff V, Omar RZ, Ambler G. Methods to adjust for multiple comparisons in randomised controlled trials with multiple primary outcomes. BMC Medical Research Methodology. 2019.
Imagem: foto de Luke Chesser, via Unsplash.