Blog
Análise de concordância: Kappa, ICC e Bland-Altman
A análise de concordância responde a uma pergunta simples de enunciar e fácil de errar: duas medidas do mesmo fenômeno chegam ao mesmo resultado? Isso aparece o tempo todo na pesquisa em saúde — dois radiologistas laudando o mesmo exame, um novo aparelho comparado ao padrão-ouro, o mesmo questionário aplicado duas vezes. Escolher o coeficiente errado nessa etapa é um dos motivos mais frequentes de pedido de reanálise pelos revisores. Se a pergunta envolve desempenho diagnóstico, veja também curva ROC e acurácia; para descrever as medidas antes da comparação, consulte estatística descritiva.
O ponto de partida é entender que concordância não é a mesma coisa que correlação, e que o método correto depende do tipo de variável. Os valores citados a seguir são ilustrativos e servem para mostrar como interpretar, não como cortes absolutos.
O que é análise de concordância e por que ela importa?
Concordância é o grau em que medições repetidas — feitas por avaliadores diferentes, instrumentos diferentes ou em momentos diferentes — produzem o mesmo valor. Em estudos de confiabilidade e de validação de instrumentos, ela é o desfecho principal. Sem uma boa concordância, qualquer conclusão baseada naquela medida fica sob suspeita, porque parte da variação observada é apenas ruído de medição.
Há uma armadilha clássica aqui: a correlação de Pearson alta é frequentemente apresentada como “prova” de concordância. Não é. Dois métodos podem estar perfeitamente correlacionados e, ainda assim, um medir sistematicamente acima do outro — correlação perfeita, concordância ruim.
Quando usar o coeficiente Kappa?
O coeficiente kappa é a escolha para variáveis categóricas. O exemplo típico é a concordância entre dois avaliadores que classificam casos como positivos ou negativos. O kappa tem uma virtude importante: ele desconta a concordância que aconteceria só por acaso, o que a simples porcentagem de acordo não faz.
Uma leitura orientativa e muito citada (Landis e Koch) situa valores até cerca de 0,20 como concordância fraca, 0,21–0,40 razoável, 0,41–0,60 moderada, 0,61–0,80 substancial e acima de 0,81 quase perfeita. Para desfechos ordinais, o kappa ponderado penaliza discordâncias maiores mais do que as menores. E vale a ressalva técnica: em categorias muito desbalanceadas, o kappa pode cair mesmo com alta concordância observada — o chamado paradoxo do kappa.
Quando usar o coeficiente de correlação intraclasse (ICC)?
Para variáveis contínuas, o instrumento é o coeficiente de correlação intraclasse (ICC). Ele avalia tanto a proximidade quanto a consistência das medidas, e é o padrão para confiabilidade teste-reteste e entre avaliadores em desfechos quantitativos.
O detalhe que os revisores cobram: existe mais de um ICC. A escolha entre modelos (efeitos aleatórios ou mistos), o tipo (medida única ou média de medidas) e a definição (concordância absoluta ou consistência) muda o resultado e precisa ser justificada. Relatar apenas “ICC = 0,85” sem especificar a forma usada é hoje motivo recorrente de revisão. Como referência ilustrativa, valores abaixo de 0,50 costumam indicar confiabilidade pobre; entre 0,75 e 0,90, boa; acima de 0,90, excelente.
Está montando essa análise para uma banca ou submissão e quer segurança de que o método está correto? Fale com a consultoria e peça um orçamento — entregamos análise reproduzível em R, com relatório e código.
O que o gráfico de Bland-Altman mostra?
Quando o objetivo é comparar dois métodos de medida contínua — um novo contra o de referência —, o gráfico de Bland-Altman é a ferramenta certa. Ele plota a diferença entre os dois métodos contra a média deles, revelando três coisas que um coeficiente isolado esconde: o viés médio (os métodos diferem sistematicamente?), os limites de concordância (qual a faixa esperada de discordância?) e se o erro cresce conforme a magnitude da medida.
A decisão final é clínica, não estatística: os limites de concordância são estreitos o bastante para que os métodos sejam intercambiáveis na prática? Essa pergunta precisa ser respondida antes de coletar os dados, definindo qual diferença ainda seria aceitável.
Como escolher o método certo para o seu estudo?
O roteiro é direto. Variável categórica entre avaliadores: kappa (ponderado, se ordinal). Variável contínua, confiabilidade entre avaliadores ou teste-reteste: ICC, com a forma especificada. Comparação entre dois métodos de medida: Bland-Altman, acompanhado do ICC. Se a dúvida é mais ampla, sobre qual teste usar em cada desenho, vale antes revisar o roteiro de como escolher a análise estatística.
Estudos de concordância também precisam de tamanho amostral próprio — número de sujeitos, de avaliadores e de repetições. Subdimensionar gera intervalos de confiança largos e conclusões frágeis; o cálculo do tamanho da amostra deve contemplar isso desde o protocolo. Quando o instrumento avaliado é um teste diagnóstico, a concordância conversa diretamente com métricas de acurácia e curva ROC.
Por que fazer em R?
Kappa, ICC e Bland-Altman têm variantes e pressupostos que precisam ficar explícitos. Conduzir tudo em R, de forma reproduzível, deixa registrado qual forma do ICC foi usada, quais limites de concordância foram assumidos e como cada figura foi gerada — o que sustenta a resposta aos revisores. É o que fazemos em nossos projetos de análise reproduzível em R.
Precisa de ajuda com essa análise?
Errar o método aqui custa caro: retrabalho, atraso na defesa e pedidos de reanálise dos revisores. A Estatística para Pesquisa faz a análise completa, reproduzível em R, com relatório interpretado e código versionado. Veja quanto custa uma consultoria estatística ou solicite um orçamento agora.
Referências
- Análise de concordância em estudos clínicos e experimentais. J Vasc Bras. (SciELO). (https://www.scielo.br/j/jvb/a/DVPVnQPdt8qGj8Ryhx7j8yk/?lang=pt)
- Koo TK, Li MY. A Guideline of Selecting and Reporting Intraclass Correlation Coefficients for Reliability Research. J Chiropr Med. 2016;15(2):155-163. (https://pmc.ncbi.nlm.nih.gov/articles/PMC4913118/)
Perguntas frequentes
Posso usar correlação de Pearson para avaliar concordância?
Não é adequado. A correlação de Pearson mede associação linear, não concordância: dois avaliadores podem ter correlação quase perfeita e ainda assim discordar sistematicamente (um sempre mede acima do outro). Para concordância de medidas contínuas, use ICC e o gráfico de Bland-Altman.
Qual a diferença entre Kappa e ICC?
O Kappa é para variáveis categóricas (por exemplo, laudo positivo/negativo entre dois avaliadores) e corrige a concordância pelo acaso. O ICC é para variáveis contínuas (por exemplo, medidas repetidas de pressão) e existe em várias formas, que precisam ser escolhidas conforme o desenho do estudo.
Vocês ajudam a planejar o estudo de confiabilidade?
Sim. Definimos o coeficiente correto, o número de avaliadores e medidas, o tamanho amostral do estudo de concordância e a interpretação, com análise reproduzível em R e relatório pronto para submissão.