Blog
Estatística descritiva: o que reportar em cada tipo de variável

A estatística descritiva é a etapa que resume um banco de dados antes de qualquer teste — e é também onde a maioria das Tabelas 1 falha em revisão. Média em distribuição assimétrica, percentual sem denominador explícito, desvio-padrão quando o revisor esperava intervalo interquartílico: erros previsíveis, todos corrigíveis. Este texto percorre o que reportar em cada tipo de variável, as armadilhas mais comuns e o código R para gerar a Tabela 1 no padrão que periódicos de saúde aceitam.
Quase todo TCC, dissertação ou artigo científico começa (ou deveria começar) pela descritiva. Ela é a fotografia do banco, o material da Tabela 1 e o filtro que evita rodar um teste caro sobre um dado sujo. Se você já sabe o que reportar e precisa das funções, o guia de estatística descritiva no R cobre o código passo a passo. Os números que aparecem como exemplo são ilustrativos.
O que é estatística descritiva
Estatística descritiva é o conjunto de métodos que resumem, organizam e apresentam os dados de uma amostra sem tirar inferência para a população. Fica em contraste com a estatística inferencial, que usa a amostra para estimar parâmetros e testar hipóteses. As duas convivem em qualquer análise séria: a descritiva mostra o que existe; a inferência mostra o que os dados permitem afirmar.
A confusão frequente é achar que “descritiva é o começo simples, inferencial é o trabalho de verdade”. Não é. Uma descritiva mal feita distorce a inferência inteira: variável categórica lida como contínua, média em distribuição assimétrica, percentual sem denominador — todo revisor experiente sabe o que procurar.
O que reportar em cada tipo de variável
A regra prática é: o tipo da variável decide o resumo. Não existe “sempre média e desvio”. A tabela abaixo resume o padrão adotado por diretrizes de relato como STROBE, CONSORT e recomendações de periódicos de saúde:
| Tipo de variável | O que reportar | Exemplo |
|---|---|---|
| Quantitativa simétrica (aparência normal) | Média e desvio-padrão (DP) | Idade: 42,3 (DP 11,7) anos |
| Quantitativa assimétrica | Mediana e intervalo interquartílico (IIQ) | Tempo até evento: 8 (IIQ 3–17) dias |
| Ordinal (escala Likert, escores) | Mediana e IIQ; às vezes proporção por categoria | Satisfação: 4 (IIQ 3–5) |
| Categórica (sexo, grupo) | Frequência absoluta e percentual | Feminino: 128 (61,2%) |
| Tempo até evento com censura | Mediana pelo estimador de Kaplan-Meier | Sobrevida mediana: 22 meses |
Nas variáveis contínuas, a decisão entre média/DP e mediana/IIQ não sai do teste de Shapiro-Wilk isolado. Amostras grandes rejeitam normalidade por qualquer desvio pequeno, e amostras pequenas quase nunca rejeitam. O caminho é olhar histograma, boxplot e a diferença entre média e mediana em conjunto — e escolher o resumo que representa melhor a distribuição do dado que está na sua frente.
Frequência absoluta, relativa e o problema do denominador
Para categóricas, “n (%)” é o padrão universal. Duas armadilhas aparecem sempre:
- Denominador errado. Se 12 pessoas não responderam a uma pergunta em 300 participantes, o percentual da resposta positiva é sobre 288, não sobre 300 — e a Tabela 1 precisa deixar isso explícito (“n = 288 com dado disponível”).
- Percentual em amostra pequena. “3 de 8” é 37,5%, mas essa precisão comunica uma segurança que a amostra não tem. Em n pequeno, priorize o número absoluto e apresente o percentual com uma casa decimal, no máximo.
Medidas de dispersão além do desvio-padrão
Além do DP e do IIQ, entram no arsenal descritivo:
- Amplitude (mínimo–máximo): útil para mostrar limites do banco, mas sensível a valor extremo.
- Erro-padrão da média (EPM): é uma medida de precisão da estimativa da média, não de dispersão dos dados. Reportar EPM como se fosse DP é um erro comum e engana o leitor sobre a variabilidade real.
- Coeficiente de variação (CV): DP dividido pela média, em percentual. Ajuda a comparar dispersão relativa entre variáveis em unidades diferentes.
O que a descritiva revela antes do teste
Uma tabela descritiva bem feita antecipa três coisas que só apareceriam no meio da análise inferencial:
- Comparabilidade entre grupos. Se as covariáveis de base estão desbalanceadas, isso muda a estratégia (ajuste, pareamento, análise de sensibilidade).
- Poder para o desfecho primário. Uma proporção de evento muito menor do que a esperada indica que o cálculo amostral original ficou apertado.
- Presença de outliers ou erros de digitação. Um valor de pressão arterial de 340 mmHg ou uma idade de 3 anos num estudo de adultos é diagnóstico de erro de banco, não de doença rara.
Por isso a descritiva costuma ser feita depois da limpeza e antes do primeiro teste. Rodar teste em banco não descrito é rodar teste no escuro.
Como escolher a figura certa
Cada tipo de variável tem sua figura natural: histograma e boxplot para contínuas, gráfico de barras para categóricas, gráfico de dispersão para pares contínuos. Gráfico de pizza raramente ajuda — o olho humano compara ângulos com precisão baixa, e uma tabela transmite os mesmos percentuais melhor.
Estatística descritiva no R: um exemplo mínimo
O R faz a descritiva completa com poucas linhas. O exemplo abaixo gera a Tabela 1 no padrão de periódicos de saúde:
# Tabela 1 com gtsummary — banco ilustrativo
# Instalar se necessário: install.packages("gtsummary")
library(dplyr)
library(gtsummary)
dados %>%
select(idade, sexo, tempo_seguimento, escore_dor, grupo) %>%
tbl_summary(
by = grupo, # estratifica por coluna de grupo
statistic = list(
all_continuous() ~ "{median} ({p25}–{p75})", # mediana + IIQ para contínuas
all_categorical() ~ "{n} ({p}%)" # n e % para categóricas
),
digits = all_continuous() ~ 1, # 1 casa decimal nas contínuas
missing_text = "Sem dado" # dado faltante aparece como categoria
) %>%
add_overall(last = TRUE) %>% # adiciona coluna "Total"
add_n() %>% # n por variável (útil quando há missing)
bold_labels() # destaca nomes das variáveis
Erros comuns em bancas e revisões
Os apontamentos mais frequentes de revisor sobre a parte descritiva:
- Média em variável assimétrica (idade em UTI, tempo até desfecho, renda).
- Percentual sem denominador ou com denominador variável entre linhas da Tabela 1.
- Reportar EPM em vez de DP para dar impressão de precisão maior.
- Excluir casos com dado faltante sem declarar quantos e por quê.
- Comparar grupos “olhando a Tabela 1” e concluir associação — a Tabela 1 é descritiva, não inferencial.
Referência para conferir o relato da Tabela 1
Para revisar o que deve constar dos Métodos e dos Resultados em um trabalho biomédico, consulte as diretrizes SAMPL, de Lang e Altman (2015). Elas ajudam a orientar o relato, mas não substituem as instruções da revista nem uma avaliação do desenho da pesquisa. Se precisar apenas da descrição da amostra, confira o escopo do StatFlow; para dados que exigem limpeza, imputação ou modelos complexos, avalie uma consultoria individual.
Imagem de destaque: Luke Chesser, via Unsplash. Imagem ilustrativa, não representa dados de clientes.
Próximos passos
Uma descritiva bem feita é o alicerce da análise inteira: define o que existia no banco antes de qualquer inferência, documenta as decisões de tratamento de dados e fornece o material da Tabela 1. Antes de avançar para os testes, vale garantir que cada variável está resumida com a medida certa para seu tipo — e que dados faltantes estão declarados, não ignorados.
Outros tópicos que costumam surgir nessa etapa: como definir o tamanho amostral mínimo, como montar a Tabela 1 em diferentes desenhos de estudo e quais erros estatísticos mais aparecem na revisão de artigos.