Blog
Curva ROC e acurácia diagnóstica: sensibilidade, especificidade e AUC
Como avaliar se um teste diagnóstico funciona — e por que a área sob a curva resume tudo em um número.
A curva ROC é a ferramenta central para avaliar a acurácia de testes diagnósticos e de biomarcadores. Se a sua pesquisa investiga se um exame, um escore ou uma molécula consegue separar quem tem a condição de quem não tem, é da análise ROC que você vai precisar. Este post explica os conceitos sem enrolação e mostra como interpretá-los corretamente. Quando a ROC faz parte de um modelo de predição, complemente com a avaliação do ajuste da regressão logística. Para comparar instrumentos que medem a mesma quantidade, a pergunta pode exigir análise de concordância.
Sensibilidade e especificidade: os dois pilares
Todo teste diagnóstico é avaliado contra um padrão de referência (o “padrão-ouro”), que define quem realmente tem a condição. A partir daí surgem duas métricas fundamentais:
- Sensibilidade: entre os que têm a doença, a proporção que o teste identifica corretamente como positivos. Um teste muito sensível raramente deixa passar um doente (poucos falsos negativos).
- Especificidade: entre os que não têm a doença, a proporção que o teste classifica corretamente como negativos. Um teste muito específico raramente acusa um sadio (poucos falsos positivos).
Existe uma tensão entre as duas: em geral, aumentar a sensibilidade reduz a especificidade, e vice-versa. Onde esse equilíbrio é fixado depende do ponto de corte.
O ponto de corte muda tudo
Muitos testes produzem um valor contínuo (a concentração de um marcador, por exemplo). Para transformar esse valor em “positivo” ou “negativo”, define-se um ponto de corte. Cortes mais baixos captam mais doentes (mais sensibilidade), mas geram mais falsos positivos (menos especificidade). Cortes mais altos fazem o oposto. Cada corte possível produz um par de sensibilidade e especificidade — e é exatamente isso que a curva ROC representa.
O que a curva ROC mostra
A curva ROC é um gráfico que coloca a sensibilidade (no eixo vertical) contra a taxa de falsos positivos, ou seja, 1 menos a especificidade (no eixo horizontal), para todos os pontos de corte possíveis. Cada ponto da curva corresponde a um corte. Uma curva que sobe rápido em direção ao canto superior esquerdo indica um teste que alcança alta sensibilidade sem pagar muito em falsos positivos — ou seja, um bom teste. Uma curva próxima da diagonal indica um teste que não discrimina melhor que o acaso.
A área sob a curva (AUC)
A área sob a curva ROC (AUC) resume a discriminação e varia de 0 a 1. O valor 0,5 representa ausência de discriminação global; 1 representa ordenação perfeita no sentido definido. Valores abaixo de 0,5 podem ocorrer quando a direção do marcador está invertida ou o desempenho é pior que o acaso naquele sentido. A AUC não resume calibração nem utilidade clínica. Interprete-a com intervalo de confiança e confirme a codificação dos grupos e a direção do marcador; consulte a documentação do pacote pROC.
Como escolher o melhor ponto de corte
Não existe corte universalmente “melhor” — depende do que custa mais errar. Alguns critérios usados:
- Índice de Youden: busca o ponto que maximiza a soma de sensibilidade e especificidade, um critério estatístico neutro.
- Prioridade clínica: em rastreamento de doença grave e tratável, prioriza-se sensibilidade (não perder casos); em confirmação antes de um tratamento arriscado, prioriza-se especificidade.
- Valores preditivos: o valor preditivo positivo e negativo dependem da prevalência da condição na população, e por isso a mesma sensibilidade/especificidade rende desempenho prático diferente conforme o cenário.
Comparando dois testes
Quando o objetivo é comparar a acurácia de dois testes, compara-se suas AUCs com métodos estatísticos apropriados (por exemplo, o teste de DeLong para curvas correlacionadas, quando os dois testes são aplicados nos mesmos indivíduos). Reportar as AUCs com intervalos de confiança e o p da comparação é o padrão esperado por revisores.
Erros comuns
- Escolher o ponto de corte depois de ver qual dá o melhor resultado e reportá-lo sem validação, inflando o desempenho.
- Ignorar a prevalência ao interpretar valores preditivos.
- Reportar AUC sem intervalo de confiança.
- Confundir acurácia global com utilidade clínica — um teste pode ter boa AUC e ainda assim não mudar decisões.
Conclusão
A curva ROC descreve a discriminação ao longo dos pontos de corte. Para avaliar o uso de um teste, considere também sensibilidade, especificidade, valores preditivos, incerteza e consequências dos erros no contexto de aplicação.
Está avaliando um biomarcador ou teste diagnóstico? A Estatística para Pesquisa conduz a análise ROC, a escolha de corte e a comparação de curvas, com script reproduzível.
Perguntas frequentes
O que é uma boa AUC?
Quanto mais próxima de 1, melhor a discriminação; 0,5 equivale ao acaso. Não há um limiar universal — o contexto clínico e o intervalo de confiança pesam na interpretação.
Qual a diferença entre sensibilidade e especificidade?
Sensibilidade é a capacidade de identificar corretamente os doentes; especificidade, a de identificar corretamente os não doentes.
Como escolher o ponto de corte de um teste?
Depende do objetivo. O índice de Youden dá um critério estatístico; a prioridade clínica (evitar falsos negativos ou falsos positivos) ajusta a escolha ao contexto.