Blog
Gráficos em estatística: quando usar cada tipo
Gráficos em pesquisa científica não são decoração: são argumento visual. Um histograma comunica distribuição em segundos; um boxplot mostra mediana, dispersão e valores extremos de uma vez; um forest plot permite comparar efeitos com precisão que nenhuma tabela oferece. Escolher o gráfico errado não é questão de estética: compromete a interpretação. Este texto cobre os tipos mais usados em pesquisa quantitativa, quando cada um se aplica e o código R para gerá-los no padrão que editores aceitam.
Quase todo apontamento de banca sobre “melhorar as figuras” quer dizer duas coisas: escolher o gráfico apropriado ao tipo de variável e reportar o suficiente para que a figura se leia sozinha. Este texto cobre os gráficos mais usados em pesquisa quantitativa em saúde e ciências sociais, quando cada um se aplica, o que precisa constar da legenda e como gerar em R com o padrão que periódicos aceitam.
A regra que decide tudo: tipo de variável
A pergunta inicial nunca é “qual gráfico é mais bonito”, mas “o que a variável é”:
| O que você quer mostrar | Tipo de variável | Gráfico recomendado |
|---|---|---|
| Como uma variável se distribui | Contínua | Histograma, densidade ou boxplot |
| Frequência por categoria | Categórica | Barras (nunca pizza) |
| Relação entre duas variáveis | Duas contínuas | Dispersão (scatter) |
| Diferença entre grupos | Contínua por categórica | Boxplot ou violin |
| Tendência no tempo | Contínua ao longo do tempo | Linha |
| Efeitos combinados com IC | Estimativa com incerteza | Forest plot |
| Sobrevida ao longo do tempo | Tempo até evento com censura | Kaplan-Meier |
| Concordância entre medidas | Duas medidas contínuas | Bland-Altman |
Gráfico de pizza raramente cabe. O olho humano compara ângulos com precisão baixa, e uma tabela transmite os mesmos percentuais com mais clareza. Vale para relatório executivo; em artigo científico, evite.
Histograma e densidade: quando a variável é contínua
Histograma agrupa a variável em intervalos e conta quantas observações caem em cada um. A largura do intervalo (binwidth) é a decisão que muda a figura: intervalos largos escondem estrutura; estreitos criam ruído. Regras como a de Sturges ou Freedman-Diaconis dão ponto de partida, mas testar dois ou três valores diferentes é o hábito honesto.
Densidade estimada por kernel é uma alternativa suave, útil quando você quer sobrepor a distribuição de dois grupos na mesma figura. Cuidados: escolha do kernel e da largura de banda muda a aparência; sempre reporte qual foi usada.
Boxplot: o gráfico mais eficiente da estatística descritiva
O boxplot resume cinco números em uma figura: mínimo (ou limite inferior), 1º quartil, mediana, 3º quartil, máximo (ou limite superior). Pontos fora dos limites aparecem como outliers. Vantagens:
- Mostra centro, dispersão e assimetria em um espaço mínimo.
- Permite comparar grupos lado a lado (variável contínua por categórica).
- Torna outliers explícitos, sem que o leitor precise procurar.
Uma variação útil é o violin plot, que sobrepõe a densidade da distribuição ao boxplot: informativo em amostras médias, mas pesa em amostras muito pequenas ou muito grandes. Para estatística descritiva em Tabela 1 e figuras complementares, boxplot ainda é o mais direto.
Gráfico de dispersão: relação entre duas variáveis contínuas
Dispersão mostra cada observação como um ponto em coordenadas (x, y). Serve para inspecionar visualmente a relação antes de calcular correlação ou regressão. Sinais que a figura revela e o número esconde:
- Não linearidade: correlação de Pearson só captura relações lineares. O ponto em U claro fica com r próximo de 0 e conclusão errada.
- Outliers alavancados: um ponto extremo em x puxa a reta de regressão desproporcionalmente.
- Heterocedasticidade: variação da dispersão que aumenta com x, típica em variáveis biológicas em escala natural; sugere transformação ou modelo robusto.
Ver a dispersão antes de rodar a regressão evita interpretar coeficiente que não representa o dado.
Forest plot: efeitos com intervalo de confiança
O forest plot mostra, linha por linha, uma estimativa (ponto) com seu intervalo de confiança (barra), e uma linha de referência de “sem efeito” (OR/RR = 1 ou diferença = 0). É o padrão em meta-análise, mas também aparece em análise multivariada de pesquisa em saúde para mostrar OR ajustadas de múltiplas covariáveis em uma única figura.
Elementos que precisam estar visíveis: rótulo da linha (estudo ou variável), estimativa numérica ao lado do ponto, IC 95% numérico, escala (log ou linear), linha de referência. Sem escala e linha de referência, o leitor não sabe qual valor separa efeito de não efeito.
Kaplan-Meier: sobrevida quando há censura
Análise de sobrevida trata dados de tempo-até-evento com censura (participantes que saíram do estudo antes do evento). O Kaplan-Meier mostra a probabilidade acumulada de não ter tido o evento em função do tempo, com os degraus representando os momentos de evento e as marcas verticais representando censura.
O que precisa constar: eixo Y bem definido (probabilidade, 0–1), eixo X com unidade de tempo, curvas por grupo (quando há), número em risco por tempo abaixo do eixo (não pode faltar: sem ele, a parte final da curva é interpretada como estatística confiável quando é ruído de poucos casos) e teste de comparação (log-rank) reportado no texto ou legenda.
Bland-Altman: concordância entre duas medidas
Quando você quer comparar dois métodos de medida (novo aparelho vs. padrão-ouro, autorrelato vs. medida objetiva), correlação não responde à pergunta certa. O Bland-Altman plota a média das duas medidas no eixo X e a diferença entre elas no eixo Y, com três linhas de referência: viés médio e limites de concordância (viés ± 1,96 × DP da diferença).
É o gráfico correto para validação de instrumento e comparação de métodos. Cobra-se em periódicos de laboratório e imagem, e aparece com frequência insuficiente em teses da área.
Gráficos em R: ggplot2 e survminer
O ecossistema ggplot2 cobre praticamente todas as figuras acima com sintaxe consistente. Exemplos mínimos (dados ilustrativos):
library(ggplot2)
# histograma
ggplot(dados, aes(idade)) + geom_histogram(bins = 30)
# boxplot por grupo
ggplot(dados, aes(grupo, escore, fill = grupo)) + geom_boxplot()
# dispersão com reta de regressão e IC
ggplot(dados, aes(x, y)) + geom_point() + geom_smooth(method = "lm")
# Kaplan-Meier
library(survival); library(survminer)
fit <- survfit(Surv(tempo, evento) ~ grupo, data = dados)
ggsurvplot(fit, risk.table = TRUE, pval = TRUE, conf.int = TRUE)
Para forest plot de meta-análise, meta::forest() ou metafor::forest(). Para forest plot de modelos multivariados, ggplot2 com geom_pointrange() resolve com estética publicável. Para Bland-Altman, blandr::blandr.draw() ou ggplot2 com as três linhas de referência.
Legenda: o que precisa estar ali
Uma figura precisa se ler sozinha, sem depender do texto. A legenda cobre:
- O que é cada elemento (ponto, barra, linha, sombra).
- Unidade das variáveis nos eixos.
- Denominadores (n por grupo, quando aplicável), os mesmos que aparecem na tabela descritiva de análise de questionário.
- Teste reportado, quando a figura serve à inferência.
- Ferramenta usada e versão, quando o método é sensível a configuração (kernel density, spline).
Erros comuns em figuras de artigo
- Boxplot em amostra de 4–5 observações (mostre os pontos, não o resumo).
- Pizza em pesquisa científica.
- Kaplan-Meier sem número em risco.
- Forest plot sem escala e sem linha de referência.
- Bar chart com barra de erro que não diz se é DP, EPM ou IC 95%.
- Escalas cortadas que exageram diferenças.
- Cores que só distinguem em tela colorida (revisor imprime em preto e branco).
Próximos passos
A escolha do gráfico é a primeira decisão. A segunda é a legenda: cada figura precisa se auto-explicar sem depender do texto do artigo: título, rótulo dos eixos, unidade, tamanho amostral e, se houver barras de erro, o que elas representam (DP, IC 95%, IIQ). Para gráficos específicos como forest plot e Kaplan-Meier, os posts sobre meta-análise e análise de sobrevivência cobrem as regras de relato em detalhe.
Se as figuras da sua análise precisam sair no padrão que periódicos exigem, o plano Análise do StatFlow gera as figuras em 600 dpi junto com o script em R reexecutável e a redação de Métodos e Resultados em português. Por R$ 138, o pacote está disponível em /checkout/?add-to-cart=585.