Estatística para Pesquisa · guia de metodologia

Guia interativo

Qual teste estatístico usar?

Responda a algumas perguntas sobre o seu objetivo e os seus dados. O guia indica o teste mais adequado, os pressupostos a checar e — quando você quiser rodar sozinho — o modo certo no StatFlow, a análise em R do nosso site.

Nível de detalhe:
Simples explica com exemplos. Técnico mostra tamanho de efeito e como reportar.
1Qual é o seu objetivo?

Checklist opcional

Receber o checklist por e-mail

O guia acima já funciona sem isto. Se quiser o checklist, deixe e-mail com consentimento. Sem spam — cancela quando quiser.

Usamos seu e-mail só para enviar o material e novidades. Cancele a qualquer momento.

Tabela de referência

Comparação de grupos

Escolha a linha pelo tipo de desfecho e o número de grupos; a coluna, pelo desenho e pelos pressupostos.

SituaçãoParamétricoNão paramétrico
2 grupos independentes
desfecho numérico
Teste t para amostras independentes (Welch se variâncias desiguais)Mann–Whitney U
2 medidas pareadas
pré/pós no mesmo sujeito
Teste t pareadoWilcoxon (postos sinalizados)
3+ grupos independentesANOVA de um fator → pós-teste TukeyKruskal–Wallis → pós-teste Dunn
3+ medidas repetidasANOVA de medidas repetidasFriedman → pós-teste Dunn/Nemenyi
1 grupo vs. referênciaTeste t de uma amostraWilcoxon de uma amostra
Desfecho categórico
2+ grupos
Qui-quadrado de independência (Fisher exato se frequências esperadas < 5); pareado 2×2 → McNemar

Relação entre variáveis

SituaçãoMétodoObservação
Duas numéricas, linear e normalCorrelação de Pearson (r)Relação linear; sensível a outliers
Duas numéricas, ordinal ou não normalCorrelação de Spearman (ρ)Relação monotônica; Kendall (τ) em amostras pequenas
Duas categóricasQui-quadrado (Fisher se esperadas < 5)Força da associação: V de Cramér
Prever desfecho numéricoRegressão linearMúltipla quando há vários preditores
Prever desfecho binárioRegressão logísticaRetorna razões de chance (odds ratio)

Antes do teste

Pressupostos que costumam derrubar a análise

  • Independência das observações — o desenho define isso.
  • Normalidade dos resíduos para métodos paramétricos (gráfico Q–Q; Shapiro–Wilk como apoio).
  • Homogeneidade de variâncias (teste de Levene) para t e ANOVA.
  • Frequências esperadas ≥ 5 no qui-quadrado; caso contrário, Fisher.
  • Linearidade para Pearson e regressão linear.

Ao relatar

Não relate só o p-valor

  • Informe sempre o tamanho de efeito (d de Cohen, η²/ω², r, V de Cramér, OR/HR) e o intervalo de confiança, não só o p.
  • Relate o p exato (ex.: p = 0,032), não "p < 0,05".
  • Com muitas comparações, aplique correção (Holm, Bonferroni ou FDR de Benjamini–Hochberg).
  • Descreva o desfecho pela medida certa: média (DP) quando simétrico; mediana [Q1–Q3] quando assimétrico ou ordinal; n (%) quando categórico.
  • Declare o teste (uni/bicaudal), como verificou os pressupostos, os dados faltantes e o software e a versão (ex.: R 4.x e pacotes).
  • Um p ≥ 0,05 não prova ausência de efeito — avalie poder, IC e o tamanho de efeito observado.

Antes de coletar

Quantos participantes você precisa?

O tamanho da amostra é decidido antes da coleta, a partir de quatro definições. Mudar qualquer uma muda o n — por isso ele precisa de justificativa no projeto e no comitê de ética.

O que você define antes

  1. Tamanho de efeito mínimo que importa — de estudo piloto, da literatura ou de convenção (Cohen).
  2. Nível de significância (α) — risco de falso-positivo; em geral 0,05.
  3. Poder (1−β) — chance de detectar o efeito, se ele existe; em geral 0,80 ou 0,90.
  4. Desenho e teste — qual teste você vai usar (veja o guia acima), número de grupos, uni ou bicaudal e razão de alocação.

Depois, acrescente uma margem para perdas e recusas (dropout).

Como as escolhas mexem no n

  • Efeito menor → precisa de mais gente.
  • Poder maior (0,90 em vez de 0,80) → mais gente.
  • α menor (0,01 em vez de 0,05) → mais gente.
  • Cada teste tem a sua fórmula: usar a errada leva a um n errado.
Calcular a amostra não garante resultado significativo — ele fixa o n para o efeito e o poder que você escolheu.

No StatFlow, o cálculo amostral vem no plano de R$ 525 (análise + cálculo amostral), com justificativa técnica (Cohen e Chow) para você adaptar ao projeto e ao comitê de ética. São R$ 28 a mais que a análise sozinha.

Duas formas de resolver

Rodar você mesmo ou com um especialista

Descobriu o teste no guia? Escolha o caminho que combina com o seu momento.

Você mesmo · self-service

StatFlow — análise em R

Já tem o banco organizado? Suba sua planilha (CSV ou Excel, até 10 MB) e o R executa o teste adequado ao seu desenho, com Tabela 1, IC, tamanho de efeito, figuras em 600 dpi, o script.R reexecutável e carimbo de integridade (SHA-256). Cobre descritiva, pareado (dois momentos), 2 a 8 grupos, correlação e categórico. Pagamento único. O pacote com análise e cálculo amostral é R$ 525.

Ver planos do StatFlow
Com você · feito por especialista

Consultoria estatística

Análise travou, o revisor pediu correções ou o desenho é complexo (medidas repetidas, regressão, sobrevivência)? Um especialista conduz, documenta em R e explica cada resultado para você integrar e apresentar a pesquisa. A autoria continua sendo sua; orçamento por escrito no mesmo dia útil.

Use este guia no seu site

Citar ou incorporar

Publicou algo que se apoia neste guia? Fique à vontade para citar ou incorporar — os trechos abaixo já vêm com o crédito e o link de volta.

Link para citar (HTML)
<a href="https://estatisticaparapesquisa.com.br/qual-teste-estatistico-usar/">Qual teste estatístico usar? — Estatística para Pesquisa</a>
Incorporar (iframe)
<iframe src="https://estatisticaparapesquisa.com.br/qual-teste-estatistico-usar/" width="100%" height="720" style="border:1px solid #ddd;border-radius:12px" title="Qual teste estatístico usar?" loading="lazy"></iframe> <p>Guia por <a href="https://estatisticaparapesquisa.com.br/">Estatística para Pesquisa</a></p>

Ajuste o endereço acima para a URL final desta página no seu site.

Dicionário rápido

Termos em linguagem simples

p-valorA chance de ver um resultado como o seu (ou mais extremo) se, na verdade, não houvesse efeito. Pequeno (ex.: < 0,05) sugere que o achado não é só sorte.
Intervalo de confiança (IC)A faixa em que o valor verdadeiro provavelmente está. Estreito = mais certeza; largo = mais incerteza.
Tamanho de efeitoO tamanho da diferença ou da relação — não só se ela existe. Responde "quão forte é?".
Hipótese nulaA suposição de que não há efeito nem diferença. O teste verifica se os dados contrariam essa ideia.
Numérica, categórica e ordinalNumérica: número (idade, peso). Categórica: rótulo sem ordem (sexo, cidade). Ordinal: ordem sem distância fixa (ruim/regular/bom, escala Likert).
Pareado x independentePareado: a mesma pessoa medida mais de uma vez (antes/depois). Independente: grupos formados por pessoas diferentes.
Paramétrico x não paramétricoParamétrico assume uma distribuição (normal) e compara médias. Não paramétrico usa a ordem dos dados e não exige normalidade.
PressupostoCondição que o teste espera que seja verdadeira (ex.: dados aproximadamente normais). Se falha, troca-se o teste.

Dúvidas frequentes

Perguntas sobre escolha de testes

Qual a diferença entre teste paramétrico e não paramétrico?

Os paramétricos (t, ANOVA, Pearson) assumem uma distribuição — em geral normalidade dos resíduos — e comparam médias. Os não paramétricos (Mann–Whitney, Kruskal–Wallis, Spearman) trabalham com postos, não exigem normalidade e servem bem a dados ordinais, assimétricos ou com outliers. Quando os pressupostos se sustentam, o paramétrico costuma ter mais poder.

Preciso testar normalidade sempre?

Inspecione a distribuição com histograma e gráfico Q–Q; o Shapiro–Wilk ajuda, mas é muito sensível em amostras grandes (rejeita por desvios triviais) e pouco informativo em amostras pequenas. Com n grande, os testes de média são robustos pelo Teorema Central do Limite. A normalidade importa nos resíduos do modelo, não na variável bruta.

Quando usar o t de Welch em vez do t de Student?

Use o Welch por padrão ao comparar dois grupos: ele não assume variâncias iguais e mantém bom desempenho quando elas diferem, perdendo quase nada quando são iguais. O t de Student clássico depende de homogeneidade de variâncias (teste de Levene).

O que fazer quando o p é maior que 0,05?

Não conclua que "não há efeito". Um p alto pode refletir amostra pequena ou baixo poder. Relate o tamanho de efeito e o intervalo de confiança: um IC largo indica incerteza, não ausência de efeito.

Preciso corrigir para comparações múltiplas?

Sim, quando você testa várias hipóteses (muitos grupos ou muitos desfechos), para controlar o erro tipo I. Use Holm ou Bonferroni para controlar o FWER, ou Benjamini–Hochberg (FDR) em análises exploratórias.

Qual teste usar para dados ordinais (escala Likert)?

Trate como ordinal: Mann–Whitney (2 grupos), Kruskal–Wallis (3 ou mais), Wilcoxon ou Friedman quando pareado, e Spearman para correlação. Para descrever, prefira mediana [Q1–Q3] a média e desvio-padrão.

Fontes e diretrizes

Para reportar com rigor

Este guia é orientativo e cobre os desenhos mais comuns em pesquisa. A escolha final depende da verificação dos pressupostos com os seus próprios dados e do desenho completo do estudo (por exemplo, delineamentos com covariáveis, fatores múltiplos, dados aninhados ou de sobrevivência), que podem exigir modelos específicos. Os serviços de análise e consultoria não substituem a orientação acadêmica nem transferem a autoria do trabalho.