EstatísticaparaPesquisa Falar no WhatsApp

Blog

Boxplot: o que o diagrama de caixa mostra (e o que ele esconde)

agosto 29, 2026 9 min de leitura atualizado em setembro 16, 2026

Por · CRBM-GO 5438

Poucos gráficos aparecem com tanta frequência numa defesa de tese quanto o boxplot. Ele resume um conjunto de dados em cinco números, ocupa pouco espaço na figura e permite comparar vários grupos lado a lado sem poluir a página. Daí sua presença constante em artigos, dissertações de mestrado e no TCC de quem está começando a mexer com estatística. O problema é que essa mesma economia visual costuma esconder decisões importantes sobre como os dados foram tratados, e boa parte de quem apresenta um diagrama de caixa não sabe dizer com precisão o que cada traço representa.

Complemente a leitura do gráfico com medidas descritivas adequadas a cada variável. Para aplicar essas etapas, consulte como produzir estatística descritiva e tabelas no R.

Vale começar pela anatomia, porque a maioria dos erros de interpretação nasce aí.

O que é um boxplot, de fato

O gráfico foi popularizado por John Tukey na década de 1970, dentro da tradição de análise exploratória de dados (Tukey, 1977). A ideia era ter um resumo visual que resistisse a valores extremos, algo que a média e o desvio-padrão não fazem. Por isso o boxplot se apoia em medidas de posição, não de dispersão clássica.

A caixa central é delimitada pelo primeiro quartil (Q1) na base e pelo terceiro quartil (Q3) no topo. Entre eles fica metade das observações, os 50% do meio da distribuição. A linha dentro da caixa marca a mediana, o valor que separa a amostra em duas metades iguais. A distância entre Q3 e Q1 é a amplitude interquartil, o famoso IQR, que mede o quanto os dados centrais se espalham.

Note que a mediana raramente cai no meio geométrico da caixa. Quando ela se aproxima de uma das bordas, isso já conta uma história: a distribuição é assimétrica. Mediana colada no Q1, com a metade superior da caixa mais alongada, indica cauda à direita (assimetria positiva). É uma leitura que passa despercebida por quem só procura “o valor central”.

Das bordas da caixa saem as hastes, ou whiskers. E é justamente aqui que o gráfico deixa de ser autoexplicativo.

Boxplot: anatomia (mediana, Q1, Q3, IQR, hastes e outliers) e como a mesma caixa pode esconder uma distribuição bimodal

O painel da esquerda mostra o que cada elemento significa. Os dois da direita representam o mesmo conjunto de dados: sem os pontos sobrepostos, a existência de dois grupos separados some por completo. Guarde essa imagem, porque ela sintetiza tanto a utilidade quanto o limite do gráfico.

As hastes não têm um significado único

Existe a convenção mais difundida, atribuída ao próprio Tukey: as hastes se estendem até a observação mais extrema que ainda esteja dentro de 1,5 vezes o IQR a partir dos quartis. Qualquer ponto além desse limite é desenhado individualmente e tratado como outlier. Esse é o comportamento padrão de bibliotecas como o ggplot2, no R, e o seaborn, em Python.

Só que nem todo software segue essa regra. Alguns desenham as hastes até o valor mínimo e o máximo da amostra, sem marcar outlier nenhum. Outros usam percentis fixos, como o 5º e o 95º, ou até o desvio-padrão. O resultado visual pode ser idêntico, uma caixa com dois traços, mas o que aquelas hastes representam muda completamente.

Isso tem uma consequência prática que raramente é discutida: um boxplot sem legenda sobre a convenção adotada é, a rigor, ambíguo. Quando você vê pontos soltos acima da haste, sabe que há tratamento de outliers pela regra do 1,5×IQR. Quando não vê nenhum, não dá para saber se a amostra realmente não tem valores extremos ou se o software simplesmente esticou as hastes até os extremos. Numa dissertação ou num artigo submetido a revisão por pares, essa diferença altera quantas observações o leitor entende como atípicas.

Há ainda uma camada de variação que quase ninguém menciona. O cálculo dos próprios quartis não é único. Hyndman e Fan (1996), num artigo já clássico sobre o tema, catalogaram nove métodos diferentes de estimar quantis amostrais, e o R implementa todos eles na função quantile(). O Excel usa outra abordagem ainda, e distingue entre versões inclusiva e exclusiva (QUARTIL.INC e QUARTIL.EXC). Para amostras grandes a divergência é pequena. Para amostras pequenas, as bordas da caixa podem sair visivelmente diferentes dependendo de onde você rodou a análise. Quem compara um boxplot feito no Excel com outro feito no R e estranha a diferença provavelmente está diante disso.

Como interpretar um boxplot sem se enganar

A leitura correta parte de três perguntas. Onde está o centro? Quão espalhados estão os dados? Há assimetria ou valores atípicos?

O centro é a mediana, não a média, e essa escolha importa. A mediana ignora o tamanho dos extremos, então descreve melhor o “grupo típico” quando a distribuição é torta. Comparar duas medianas por meio de dois boxplots lado a lado é uma forma honesta de contrastar grupos que não seguem a curva normal, situação corriqueira em dados biológicos e clínicos que aparecem em boa parte das pesquisas de mestrado e doutorado.

O espalhamento aparece no tamanho da caixa. Caixa alta, dados centrais dispersos. Caixa baixa e comprimida, dados concentrados. Comparar a altura das caixas entre grupos costuma ser mais informativo do que olhar as hastes, que são sensíveis a poucos pontos.

Agora os enganos frequentes. A largura da caixa, na horizontal, não significa nada por padrão. Ela não indica tamanho de amostra, a menos que você tenha pedido explicitamente um boxplot de largura variável, uma opção pouco usada que McGill, Tukey e Larsen (1978) já haviam proposto para codificar o tamanho do grupo. Muita gente também lê a caixa como se fosse “50% da amplitude dos valores”, quando ela é 50% das observações. São coisas diferentes: numa distribuição concentrada, metade dos dados pode ocupar uma fatia estreita do eixo. E há quem trate todo ponto marcado como haste como se fosse erro de medição a ser descartado. Outlier estatístico pela regra do 1,5×IQR é apenas um ponto distante da massa central. Pode ser ruído, pode ser o achado mais interessante do experimento. A régua é geométrica, não biológica.

O que o boxplot não consegue mostrar

Aqui está a limitação que mais atrapalha em pesquisa, e que os guias introdutórios costumam omitir: o boxplot é cego para a forma interna da distribuição.

Como ele depende apenas de cinco números resumo, distribuições muito distintas podem gerar caixas praticamente iguais. O caso mais grave é a bimodalidade, ilustrado no painel da direita da figura. Imagine uma variável com dois agrupamentos bem separados, digamos respondedores e não respondedores a um tratamento. Se os dois grupos se equilibram em torno de um ponto médio, o boxplot mostra uma caixa simétrica e bem-comportada, sugerindo uma distribuição única e homogênea. A estrutura de dois picos desaparece por completo. Quem confia só na caixa conclui o oposto do que os dados dizem.

Por isso, quando a forma da distribuição faz parte da pergunta, o boxplot precisa de reforço. O violino (violin plot) acrescenta a densidade estimada nas laterais e revela múltiplos picos. Sobrepor os pontos individuais, com um leve deslocamento horizontal (jitter) ou em arranjo tipo enxame (beeswarm), resolve o problema de forma ainda mais transparente, porque mostra o dado bruto em vez de uma suavização. Em amostras pequenas, essa sobreposição deixa de ser opcional. Wickham e Stryjewski (2011), num apanhado dos 40 anos do gráfico, reúnem várias dessas extensões e mostram como cada uma tenta devolver ao boxplot a informação que ele descarta.

E isso leva a outro ponto delicado. Com poucos dados, digamos menos de dez observações por grupo, os quartis ficam instáveis e a caixa passa a ser um artefato de três ou quatro números. Desenhar um boxplot bonito sobre n = 6 dá uma falsa sensação de robustez que a amostra não sustenta. Nesses casos, mostrar todos os pontos é mais sincero do que resumi-los.

Para quem precisa comparar medianas com algum critério visual, existe o boxplot com entalhe (notched box plot), também proposto por McGill, Tukey e Larsen (1978). O estreitamento em torno da mediana corresponde a um intervalo aproximado, calculado por Q2 ± 1,57 × IQR / √n, que funciona como uma faixa de confiança grosseira: quando os entalhes de dois grupos não se sobrepõem, há indício de que as medianas diferem. É um guia útil, embora não substitua o teste de hipótese apropriado. Vale lembrar que, para distribuições muito assimétricas, a regra padrão do 1,5×IQR tende a marcar pontos legítimos como outliers, e há propostas de boxplot ajustado à assimetria justamente para corrigir esse exagero.

O que levar para a sua próxima figura

Um boxplot bem feito não é o que tem menos informação, é o que declara suas escolhas. Vale explicitar na legenda qual convenção de hastes foi usada, informar o n de cada grupo e, sempre que o tamanho da amostra permitir, sobrepor os pontos. Quando existe suspeita de mais de um agrupamento nos dados, trocar ou complementar com um violino evita concluir errado.

O diagrama de caixa continua sendo uma das formas mais eficientes de comunicar posição, dispersão e assimetria de uma vez só. Ele só cobra um preço de quem trata a caixa como um resumo neutro e completo. Ela nunca foi isso. É um retrato parcial, calibrado por decisões de quem desenhou, e ler o gráfico com essa consciência é o que separa a descrição automática da análise de verdade.


Referências


Precisa de apoio na análise e na apresentação dos seus dados de pesquisa? A consultoria estatística ajuda desde a escolha do gráfico certo até a interpretação correta dos resultados, para artigos, TCC, dissertação de mestrado e tese de doutorado.

Precisa de apoio estatístico na sua pesquisa?

Mande o projeto, a planilha ou o parecer do revisor. Devolvo escopo, prazo e preço fechado em até 2 dias úteis.