EstatísticaparaPesquisa Falar no WhatsApp

Análise em R

Estatística descritiva no R: funções, tabelas de frequência e Tabela 1

agosto 22, 2026 4 min de leitura atualizado em setembro 15, 2026

Por · CRBM-GO 5438

Antes de qualquer teste ou modelo vem a estatística descritiva: o retrato dos seus dados. Ela cumpre duas funções — comunicar ao leitor a composição da amostra e revelar problemas (valores impossíveis, distribuições assimétricas, dados faltantes) que orientam as escolhas de análise. Fazer isso bem no R é simples, desde que você escolha as medidas certas para cada tipo de variável.

Escolha a medida conforme o tipo de variável

Variáveis contínuas com distribuição aproximadamente simétrica são bem resumidas por média e desvio-padrão. Já variáveis assimétricas — comuns em saúde, como tempo de internação ou carga viral — pedem mediana e intervalo interquartil (IQR), que resistem a valores extremos. Variáveis categóricas são descritas por frequências absolutas e relativas (contagens e percentuais). Usar média em variável assimétrica ou tratar categoria como número são erros que distorcem a descrição. A tabela completa de qual medida reportar para cada tipo de variável — e os erros de Tabela 1 que revisores mais apontam — está em estatística descritiva: o que reportar.

Medidas de tendência central e dispersão no R

# variáveis contínuas
mean(dados$idade, na.rm = TRUE)
sd(dados$idade, na.rm = TRUE)
median(dados$tempo_internacao, na.rm = TRUE)
IQR(dados$tempo_internacao, na.rm = TRUE)

# panorama geral
summary(dados)

Repare no argumento na.rm = TRUE: sem ele, qualquer valor ausente faz a função retornar NA. Isso pressupõe que seus dados já foram tipados corretamente, conforme organização e importação de dados no R.

Tabelas de frequência para categóricas

table(dados$grupo)                       # contagens
prop.table(table(dados$grupo)) * 100     # percentuais
# cruzamento entre duas categóricas
table(dados$grupo, dados$sexo)

Sempre reporte o denominador quando apresentar percentuais, e deixe explícito como tratou os ausentes — se foram excluídos do denominador ou contabilizados como categoria própria.

Avaliando a distribuição antes de decidir o teste

A descritiva orienta a inferência. Um histograma ou boxplot mostra assimetria, bimodalidade e outliers a olho nu, muitas vezes de forma mais honesta que um teste formal de normalidade (que é sensível ao tamanho de amostra). Isso ajuda a decidir entre métodos paramétricos e não paramétricos:

hist(dados$idade)
boxplot(dados$imc ~ dados$grupo)

Montando a “Tabela 1”

Quase todo artigo em saúde abre a seção de resultados com uma tabela caracterizando a amostra, frequentemente estratificada por grupo. Pacotes como gtsummary ou tableone automatizam isso escolhendo medidas apropriadas por tipo de variável:

library(gtsummary)
tbl_summary(dados, by = grupo)

Uma boa Tabela 1 já demonstra o cuidado analítico do trabalho e reduz a chance de questionamentos. Quando a descrição revela desequilíbrios entre grupos, isso antecipa a necessidade de ajuste na fase inferencial — assunto de regressão logística simples e múltipla. E se você pretende publicar, alinhe a apresentação às diretrizes do STROBE, discutidas também em análise estatística para artigo científico.

Normalidade: olhe o gráfico antes do teste

Uma pergunta recorrente é como decidir se uma variável é “normal o suficiente” para métodos paramétricos. Testes formais de normalidade, como Shapiro-Wilk, têm um defeito prático: em amostras grandes, detectam desvios triviais e rejeitam a normalidade mesmo quando ela seria irrelevante; em amostras pequenas, têm pouco poder para detectar desvios reais. Por isso, a inspeção visual costuma ser mais informativa. O histograma mostra a forma da distribuição, e o gráfico Q-Q (quantil-quantil) revela desvios da normalidade de maneira sensível — pontos que se afastam da linha diagonal indicam caudas pesadas ou assimetria. No R, qqnorm(dados$idade); qqline(dados$idade) produz esse gráfico. A decisão entre paramétrico e não paramétrico deve combinar o formato observado, o tamanho da amostra e a robustez do método.

Descritiva por subgrupos e o cuidado com médias

Descrever a amostra global é o começo; frequentemente o interessante está nos subgrupos. Comparar medidas entre grupos já na descritiva antecipa os achados da inferência e revela heterogeneidade. Um alerta clássico é o paradoxo de Simpson: uma tendência que aparece no agregado pode se inverter dentro de subgrupos, quando um terceiro fator está desbalanceado entre eles. Por isso, além das médias globais, examine as distribuições estratificadas. No R, funções do dplyr como group_by() seguido de summarise() tornam isso direto, e reforçam a leitura cuidadosa que precede qualquer interpretação de associações.

Referências

  • Altman DG. Practical Statistics for Medical Research. Chapman & Hall/CRC; 1991.
  • Field A, Miles J, Field Z. Discovering Statistics Using R. Sage; 2012.
  • Wickham H, Grolemund G. R for Data Science. O’Reilly; 2017.

Precisa de apoio estatístico na sua pesquisa?

Mande o projeto, a planilha ou o parecer do revisor. Devolvo escopo, prazo e preço fechado em até 2 dias úteis.