Kappa de Cohen para tu tesis (2026): el acuerdo entre codificadores y la paradoja que te va a confundir

La kappa de Cohen mide cuánto coinciden dos codificadores por encima de lo que coincidirían al azar. Es la forma más económica de demostrar que tus categorías no salieron de tu cabeza. Y es también el coeficiente que puede darte .43 cuando tú y tu compañero coincidieron en el 88 % de los casos, sin que nadie se haya equivocado en el cálculo.

Si tu tesis es cualitativa y tu asesora te pidió «reportar el acuerdo entre codificadores», esto es lo que tienes que montar. No es un análisis extra: es un procedimiento corto que se resuelve en una tarde y que blinda tu capítulo de resultados frente a la pregunta más incómoda de la réplica, la de «¿y cómo sabemos que otra persona habría codificado igual?».

Damos por hecho que ya tienes tu sistema de categorías. Si todavía estás en la codificación abierta, axial y selectiva, ese paso previo está en la guía de análisis de datos cualitativos.

Qué mide kappa y por qué no basta con el porcentaje de acuerdo

Supón que tú y un compañero codifican cien fragmentos decidiendo si cada uno habla o no de «carga administrativa». Coinciden en 88. El acuerdo observado es 88 %. Suena excelente.

El problema es que una parte de esas coincidencias habría ocurrido de todos modos por azar. Si los dos tienden a marcar «sí» en la mayoría de los fragmentos, van a coincidir mucho sin que eso signifique que comparten el mismo criterio. Kappa corrige exactamente eso: descuenta el acuerdo esperado por azar y deja solo el acuerdo que la coincidencia de criterios explica.

Su rango va de −1 a 1. El 0 significa «coincidieron lo que se esperaría del puro azar»; el 1, coincidencia perfecta; y los valores negativos, un desacuerdo sistemático mayor al azar (rarísimo, y casi siempre señal de que uno de los dos entendió las categorías al revés).

Matriz de contingencia de dos por dos con la diagonal de coincidencias marcada
Todo el cálculo sale de una tabla cruzada: la diagonal son las coincidencias, las celdas de fuera son los desacuerdos.

Cómo se monta el ejercicio (la parte que sí decide el resultado)

El coeficiente es lo fácil. Lo que determina si tu kappa sale defendible es el diseño del ejercicio:

  1. Cierra el libro de códigos antes de empezar. Cada categoría necesita nombre, definición en una o dos oraciones, criterio de inclusión, criterio de exclusión y un fragmento de ejemplo. Sin eso, no estás midiendo acuerdo: estás midiendo telepatía.
  2. Elige al segundo codificador. Un compañero de generación, un colega del cuerpo académico o alguien del seminario de titulación. No tiene que ser experto en tu tema; tiene que entender el libro de códigos.
  3. Selecciona el subconjunto. La práctica común en tesis es entre el 10 % y el 20 % del material, elegido al azar y no «las entrevistas más claras». Documenta cómo lo elegiste.
  4. Codifiquen por separado y a ciegas. Nada de revisar juntos «para ponerse de acuerdo» antes de medir; eso destruye el sentido del ejercicio.
  5. Calcula kappa por categoría, no una sola global. Es la forma de detectar cuál definición está fallando.
  6. Reconcilia y documenta. Después de calcular, discutan los desacuerdos, ajusten las definiciones ambiguas y anoten qué cambió. Ese registro es material de tu capítulo, no basura de proceso.

Cómo se calcula

En SPSS

Necesitas una base con una fila por unidad codificada y dos columnas: la decisión del codificador 1 y la del codificador 2, con las mismas etiquetas numéricas.

  1. Analizar → Estadísticos descriptivos → Tablas cruzadas.
  2. Pon un codificador en Filas y el otro en Columnas.
  3. Entra a Estadísticos y marca Kappa.
  4. En Casillas activa los porcentajes para ver dónde se concentran los desacuerdos.
  5. Acepta. El coeficiente aparece en la tabla «Medidas simétricas», con su error estándar y su significancia.

Un requisito que se pasa por alto: la tabla tiene que ser cuadrada. Si un codificador usó una categoría que el otro nunca usó, SPSS no calcula kappa. La solución es asegurarse de que ambas variables tengan exactamente el mismo conjunto de valores declarados.

En tu software cualitativo

ATLAS.ti, NVivo y MAXQDA traen su propia función de acuerdo entre codificadores y trabajan sobre los documentos codificados directamente, sin que tengas que armar la matriz. La diferencia práctica está en qué toman como unidad de análisis —el segmento, la oración o el documento—, y eso cambia el resultado, así que declara cuál usaste. La comparación entre los tres programas está en la guía de software para análisis cualitativo.

Cómo se interpreta: los rangos de Landis y Koch

La escala de referencia que usa prácticamente toda la literatura viene de Landis y Koch (1977) y sigue vigente como criterio de lectura:

Valor de κ Fuerza del acuerdo
< 0.00 Pobre
0.01 – 0.20 Leve
0.21 – 0.40 Aceptable
0.41 – 0.60 Moderado
0.61 – 0.80 Sustancial
0.81 – 1.00 Casi perfecto

Para una tesis, un valor por encima de .60 se defiende sin problema. Entre .41 y .60 conviene explicar qué categoría bajó el promedio y qué hiciste al respecto. Por debajo de .40, el mensaje no es que tus datos sean malos: es que el libro de códigos todavía no está listo, y lo correcto es afinarlo y volver a medir.

Una advertencia que aparece en la literatura reciente: estos rangos son la convención para kappa, y no deben trasladarse mecánicamente a otros coeficientes de acuerdo que se calculan de otra manera.

La paradoja de kappa: cuando el 88 % vale .43

Aquí está el momento en el que la mayoría de los tesistas creen que se equivocaron. No es así, y el caso está publicado con números.

Dos balanzas que ilustran cómo un mismo nivel de acuerdo puede evaluarse distinto
El mismo nivel de coincidencia recibe una calificación distinta según qué tan frecuente sea la categoría.

Un estudio publicado en JTO Clinical and Research Reports en 2024 puso a dos patólogos a revisar de forma independiente 50 cortes histológicos y a decidir, para cada uno de cinco patrones, si estaba presente o ausente. La prevalencia de los patrones iba del 42 % al 97 %. El resultado fue este:

  • Cuatro patrones obtuvieron kappa entre .61 y .67, es decir «acuerdo sustancial».
  • El quinto patrón, el acinar, obtuvo la kappa más baja de todas —.43, «acuerdo moderado»— a pesar de tener el acuerdo observado más alto: 88 %.

La explicación es la prevalencia. El patrón acinar aparecía en el 97 % de los cortes, así que los dos observadores marcaban «presente» casi siempre. Cuando una categoría domina de esa manera, el acuerdo esperado por azar se dispara, y como kappa lo descuenta, el coeficiente cae aunque la coincidencia real sea excelente.

Qué hacer con esto en tu tesis, sin inventar nada:

  • Reporta siempre el acuerdo observado junto a kappa. Los dos números juntos cuentan la historia completa; kappa sola puede mentir por omisión.
  • Reporta la prevalencia de cada categoría. Es lo que le permite a tu lector interpretar una kappa baja correctamente.
  • Explica el efecto en el texto cuando te toque. Un párrafo de tres líneas señalando que la categoría X estaba presente en el 90 % del material y que por eso su kappa es más baja que su acuerdo observado convierte un aparente problema en evidencia de que entiendes tu instrumento.
  • Existen coeficientes alternativos diseñados para no sufrir ese efecto —el AC1 de Gwet es el que propone ese mismo estudio—, y puedes presentarlos junto a kappa, nunca en lugar de ella.

Kappa simple o kappa ponderada

Kappa simple trata todos los desacuerdos como igual de graves. Eso funciona con categorías nominales: «menciona apoyo familiar» o «no lo menciona».

Cuando tus categorías tienen orden —nada, poco, regular, mucho— no todos los desacuerdos pesan igual: que uno diga «poco» y el otro «regular» es mucho menos serio que «nada» contra «mucho». Para eso existe la kappa ponderada, que asigna penalizaciones distintas según qué tan lejos estén las categorías. La literatura metodológica recomienda reportar las dos versiones de ponderación —lineal y cuadrática— cuando los desacuerdos no son equivalentes, porque juntas describen mejor cómo se distribuyen las discrepancias.

Regla corta: variables nominales, kappa simple; variables ordinales con tres o más niveles, kappa ponderada.

Cómo se reporta en el capítulo

La convención es incluir el coeficiente, el acuerdo observado, el subconjunto usado y quién fue el segundo codificador (por rol, no por nombre):

«Un segundo codificador, doctorante del programa y ajeno al trabajo de campo, recodificó de forma independiente el 20 % de las entrevistas (5 de 25) con la versión 2 del libro de códigos. El acuerdo observado fue de 88 % y la kappa de Cohen de κ = .71, valor que corresponde a un acuerdo sustancial. La categoría con menor coeficiente fue «carga administrativa» (κ = .48), presente en el 91 % de los segmentos; los desacuerdos se reconciliaron en sesión conjunta y la definición se precisó antes de codificar el resto del corpus.»

El símbolo κ es una letra griega, así que va en tipografía normal y no en cursiva; el resto de las convenciones de puntuación —paréntesis, decimales, el cero inicial— están en cómo reportar una prueba estadística en APA 7.

Si tu tesis usa entrevistas o grupos focales, la lista de verificación COREQ te pide justamente este tipo de declaración sobre el equipo de codificación; la mapeamos en guías de reporte para tesis.

Errores que se pagan caros

  • Calcular kappa sin libro de códigos cerrado. El coeficiente sale, pero no significa nada: los dos estaban improvisando criterios distintos.
  • Codificar juntos y después «medir el acuerdo». Si se pusieron de acuerdo antes, el número es decorativo.
  • Reportar solo la kappa global. Oculta cuál categoría está rota, que es justo lo que el ejercicio debía revelar.
  • Confundir kappa con la confiabilidad del instrumento. El alfa de Cronbach mide consistencia interna de una escala; kappa mide acuerdo entre observadores. Son cosas distintas y se reportan por separado, como se explica en validez y confiabilidad de un instrumento y en instrumentos de recolección de datos.
  • Repetir el ejercicio hasta que salga un número bonito. Recodificar tras ajustar definiciones es legítimo y se declara; repetir en silencio hasta pegarle no lo es.
  • Presentarlo como sustituto de la triangulación. Son estrategias de rigor complementarias, no intercambiables: la diferencia está en triangulación de datos en investigación.

Cuando ya tengas el número y la reconciliación hecha, lo que suele frenar es redactar el párrafo metodológico que lo sostiene con la precisión que pide un comité. Tesify te ayuda a armar ese borrador con tus propios datos de acuerdo y con la estructura que suelen exigir los programas mexicanos; el criterio metodológico sigue siendo tuyo.

Preguntas frecuentes

¿Qué valor de kappa de Cohen es aceptable en una tesis?

Con los rangos de Landis y Koch, de .61 a .80 es acuerdo sustancial y de .81 a 1.00 casi perfecto. Para una tesis, por encima de .60 se defiende bien; entre .41 y .60 conviene explicar qué categoría bajó el promedio; por debajo de .40, lo que necesita revisión es el libro de códigos.

¿Necesito un segundo codificador para mi tesis cualitativa?

No siempre es obligatorio, pero es la forma más barata de demostrar que tus categorías no dependen de tu lectura personal. Suele bastar con que un compañero recodifique entre el 10 % y el 20 % del material usando tu libro de códigos, de forma independiente.

¿Por qué mi kappa es baja si coincidimos en casi todo?

Es la paradoja de kappa. Cuando una categoría es muy frecuente, el acuerdo esperado por azar sube y el coeficiente baja aunque el acuerdo observado sea altísimo. En un estudio publicado, el patrón con el acuerdo observado más alto (88 %) obtuvo la kappa más baja de las cinco categorías evaluadas (.43).

¿Kappa simple o kappa ponderada?

Simple si tus categorías son nominales y no hay orden entre ellas. Ponderada si son ordinales con tres o más niveles, porque permite penalizar más los desacuerdos entre categorías distantes que entre categorías vecinas.

¿Cuántas entrevistas debe recodificar el segundo codificador?

La práctica común en tesis es entre el 10 % y el 20 % del material, seleccionado al azar. Lo importante no es el porcentaje exacto sino que declares cuál usaste, cómo lo elegiste y que no hayas escogido los casos más fáciles.

¿Puedo calcular kappa si somos tres codificadores?

La kappa de Cohen está definida para dos observadores. Con tres o más se usan coeficientes diseñados para varios evaluadores, o bien se calculan kappas por pares y se reporta el conjunto. Declara cuál elegiste y por qué.

Escribe tu tesis con IA

Estructura, redacta y formatea tus referencias en APA 7 para tu tesis o tesina — con integridad académica. Registro gratuito, sin tarjeta.

Empieza gratis con Tesify →

Categorías