EstatísticaparaPesquisa Falar no WhatsApp

Blog

Gráficos em estatística: quando usar cada tipo

setembro 23, 2026 6 min de leitura atualizado em setembro 19, 2026

Por · CRBM-GO 5438

Gráficos em pesquisa científica não são decoração: são argumento visual. Um histograma comunica distribuição em segundos; um boxplot mostra mediana, dispersão e valores extremos de uma vez; um forest plot permite comparar efeitos com precisão que nenhuma tabela oferece. Escolher o gráfico errado não é questão de estética: compromete a interpretação. Este texto cobre os tipos mais usados em pesquisa quantitativa, quando cada um se aplica e o código R para gerá-los no padrão que editores aceitam.

Quase todo apontamento de banca sobre “melhorar as figuras” quer dizer duas coisas: escolher o gráfico apropriado ao tipo de variável e reportar o suficiente para que a figura se leia sozinha. Este texto cobre os gráficos mais usados em pesquisa quantitativa em saúde e ciências sociais, quando cada um se aplica, o que precisa constar da legenda e como gerar em R com o padrão que periódicos aceitam.

A regra que decide tudo: tipo de variável

A pergunta inicial nunca é “qual gráfico é mais bonito”, mas “o que a variável é”:

O que você quer mostrarTipo de variávelGráfico recomendado
Como uma variável se distribuiContínuaHistograma, densidade ou boxplot
Frequência por categoriaCategóricaBarras (nunca pizza)
Relação entre duas variáveisDuas contínuasDispersão (scatter)
Diferença entre gruposContínua por categóricaBoxplot ou violin
Tendência no tempoContínua ao longo do tempoLinha
Efeitos combinados com ICEstimativa com incertezaForest plot
Sobrevida ao longo do tempoTempo até evento com censuraKaplan-Meier
Concordância entre medidasDuas medidas contínuasBland-Altman

Gráfico de pizza raramente cabe. O olho humano compara ângulos com precisão baixa, e uma tabela transmite os mesmos percentuais com mais clareza. Vale para relatório executivo; em artigo científico, evite.

Histograma e densidade: quando a variável é contínua

Histograma agrupa a variável em intervalos e conta quantas observações caem em cada um. A largura do intervalo (binwidth) é a decisão que muda a figura: intervalos largos escondem estrutura; estreitos criam ruído. Regras como a de Sturges ou Freedman-Diaconis dão ponto de partida, mas testar dois ou três valores diferentes é o hábito honesto.

Densidade estimada por kernel é uma alternativa suave, útil quando você quer sobrepor a distribuição de dois grupos na mesma figura. Cuidados: escolha do kernel e da largura de banda muda a aparência; sempre reporte qual foi usada.

Boxplot: o gráfico mais eficiente da estatística descritiva

O boxplot resume cinco números em uma figura: mínimo (ou limite inferior), 1º quartil, mediana, 3º quartil, máximo (ou limite superior). Pontos fora dos limites aparecem como outliers. Vantagens:

  • Mostra centro, dispersão e assimetria em um espaço mínimo.
  • Permite comparar grupos lado a lado (variável contínua por categórica).
  • Torna outliers explícitos, sem que o leitor precise procurar.

Uma variação útil é o violin plot, que sobrepõe a densidade da distribuição ao boxplot: informativo em amostras médias, mas pesa em amostras muito pequenas ou muito grandes. Para estatística descritiva em Tabela 1 e figuras complementares, boxplot ainda é o mais direto.

Gráfico de dispersão: relação entre duas variáveis contínuas

Dispersão mostra cada observação como um ponto em coordenadas (x, y). Serve para inspecionar visualmente a relação antes de calcular correlação ou regressão. Sinais que a figura revela e o número esconde:

  • Não linearidade: correlação de Pearson só captura relações lineares. O ponto em U claro fica com r próximo de 0 e conclusão errada.
  • Outliers alavancados: um ponto extremo em x puxa a reta de regressão desproporcionalmente.
  • Heterocedasticidade: variação da dispersão que aumenta com x, típica em variáveis biológicas em escala natural; sugere transformação ou modelo robusto.

Ver a dispersão antes de rodar a regressão evita interpretar coeficiente que não representa o dado.

Forest plot: efeitos com intervalo de confiança

O forest plot mostra, linha por linha, uma estimativa (ponto) com seu intervalo de confiança (barra), e uma linha de referência de “sem efeito” (OR/RR = 1 ou diferença = 0). É o padrão em meta-análise, mas também aparece em análise multivariada de pesquisa em saúde para mostrar OR ajustadas de múltiplas covariáveis em uma única figura.

Elementos que precisam estar visíveis: rótulo da linha (estudo ou variável), estimativa numérica ao lado do ponto, IC 95% numérico, escala (log ou linear), linha de referência. Sem escala e linha de referência, o leitor não sabe qual valor separa efeito de não efeito.

Kaplan-Meier: sobrevida quando há censura

Análise de sobrevida trata dados de tempo-até-evento com censura (participantes que saíram do estudo antes do evento). O Kaplan-Meier mostra a probabilidade acumulada de não ter tido o evento em função do tempo, com os degraus representando os momentos de evento e as marcas verticais representando censura.

O que precisa constar: eixo Y bem definido (probabilidade, 0–1), eixo X com unidade de tempo, curvas por grupo (quando há), número em risco por tempo abaixo do eixo (não pode faltar: sem ele, a parte final da curva é interpretada como estatística confiável quando é ruído de poucos casos) e teste de comparação (log-rank) reportado no texto ou legenda.

Bland-Altman: concordância entre duas medidas

Quando você quer comparar dois métodos de medida (novo aparelho vs. padrão-ouro, autorrelato vs. medida objetiva), correlação não responde à pergunta certa. O Bland-Altman plota a média das duas medidas no eixo X e a diferença entre elas no eixo Y, com três linhas de referência: viés médio e limites de concordância (viés ± 1,96 × DP da diferença).

É o gráfico correto para validação de instrumento e comparação de métodos. Cobra-se em periódicos de laboratório e imagem, e aparece com frequência insuficiente em teses da área.

Gráficos em R: ggplot2 e survminer

O ecossistema ggplot2 cobre praticamente todas as figuras acima com sintaxe consistente. Exemplos mínimos (dados ilustrativos):

library(ggplot2)

# histograma
ggplot(dados, aes(idade)) + geom_histogram(bins = 30)

# boxplot por grupo
ggplot(dados, aes(grupo, escore, fill = grupo)) + geom_boxplot()

# dispersão com reta de regressão e IC
ggplot(dados, aes(x, y)) + geom_point() + geom_smooth(method = "lm")

# Kaplan-Meier
library(survival); library(survminer)
fit <- survfit(Surv(tempo, evento) ~ grupo, data = dados)
ggsurvplot(fit, risk.table = TRUE, pval = TRUE, conf.int = TRUE)

Para forest plot de meta-análise, meta::forest() ou metafor::forest(). Para forest plot de modelos multivariados, ggplot2 com geom_pointrange() resolve com estética publicável. Para Bland-Altman, blandr::blandr.draw() ou ggplot2 com as três linhas de referência.

Legenda: o que precisa estar ali

Uma figura precisa se ler sozinha, sem depender do texto. A legenda cobre:

  • O que é cada elemento (ponto, barra, linha, sombra).
  • Unidade das variáveis nos eixos.
  • Denominadores (n por grupo, quando aplicável), os mesmos que aparecem na tabela descritiva de análise de questionário.
  • Teste reportado, quando a figura serve à inferência.
  • Ferramenta usada e versão, quando o método é sensível a configuração (kernel density, spline).

Erros comuns em figuras de artigo

  • Boxplot em amostra de 4–5 observações (mostre os pontos, não o resumo).
  • Pizza em pesquisa científica.
  • Kaplan-Meier sem número em risco.
  • Forest plot sem escala e sem linha de referência.
  • Bar chart com barra de erro que não diz se é DP, EPM ou IC 95%.
  • Escalas cortadas que exageram diferenças.
  • Cores que só distinguem em tela colorida (revisor imprime em preto e branco).

Próximos passos

A escolha do gráfico é a primeira decisão. A segunda é a legenda: cada figura precisa se auto-explicar sem depender do texto do artigo: título, rótulo dos eixos, unidade, tamanho amostral e, se houver barras de erro, o que elas representam (DP, IC 95%, IIQ). Para gráficos específicos como forest plot e Kaplan-Meier, os posts sobre meta-análise e análise de sobrevivência cobrem as regras de relato em detalhe.

Se as figuras da sua análise precisam sair no padrão que periódicos exigem, o plano Análise do StatFlow gera as figuras em 600 dpi junto com o script em R reexecutável e a redação de Métodos e Resultados em português. Por R$ 138, o pacote está disponível em /checkout/?add-to-cart=585.

Precisa de apoio estatístico na sua pesquisa?

Mande o projeto, a planilha ou o parecer do revisor. Devolvo escopo, prazo e preço fechado em até 2 dias úteis.