El ANOVA responde «¿alguno de estos grupos difiere de otro?» y ahí se detiene. Para saber cuáles necesitas una prueba post hoc, y la elección entre las tres candidatas habituales no es de gusto: la decide la prueba de Levene. Varianzas homogéneas, Tukey. Varianzas desiguales, Games-Howell. Pocas comparaciones planeadas de antemano, Bonferroni.
Con eso ya tienes la respuesta operativa. Lo que sigue es por qué, y qué se pierde en cada caso, que es lo que te van a preguntar en el examen.
El problema que las pruebas post hoc resuelven
Tienes tres grupos y quieres compararlos. La tentación es correr tres pruebas t: A contra B, A contra C, B contra C. El problema es aritmético.
Cada prueba acepta un 5 % de riesgo de declarar una diferencia que no existe. Ese riesgo no se reparte, se acumula:
| Grupos | Comparaciones por pares | Riesgo aproximado de al menos un falso positivo |
|---|---|---|
| 3 | 3 | ~14 % |
| 4 | 6 | ~26 % |
| 5 | 10 | ~40 % |
| 6 | 15 | ~54 % |
Con cinco grupos y pruebas t sueltas, tienes cerca de una posibilidad entre dos de reportar al menos un hallazgo inexistente. Las pruebas post hoc existen exactamente para eso: hacen todas las comparaciones manteniendo el riesgo global en el 5 % que declaraste.

La comparativa
| Criterio | Tukey (HSD) | Bonferroni | Games-Howell |
|---|---|---|---|
| Supone varianzas iguales | Sí | Sí | No |
| Supone grupos del mismo tamaño | Preferible, tolera desbalance moderado | No | No |
| Para qué está pensada | Todos los pares posibles | Un subconjunto de pares definido de antemano | Todos los pares con varianzas desiguales |
| Potencia con muchas comparaciones | Buena | Cae rápido | Buena |
| Riesgo de falso positivo | Controlado | Muy conservador | Controlado |
| Con muestras pequeñas | Aceptable | Aceptable | Menos estable por debajo de ~6 casos por grupo |
| Cuándo elegirla | El caso por defecto | 2 o 3 comparaciones justificadas teóricamente | Levene resultó significativa |
Tukey es el estándar y el que casi todo comité espera ver. Fue diseñada precisamente para el escenario de comparar todos los pares, y no paga el precio de potencia que paga Bonferroni.
Bonferroni reparte el nivel de significancia entre las comparaciones: con cinco comparaciones, cada una necesita un p menor a .01 en lugar de .05. Es transparente y fácil de explicar, y es la opción correcta cuando tu marco teórico predijo dos o tres contrastes concretos. Usada para comparar los quince pares de seis grupos, se vuelve tan exigente que deja pasar diferencias reales.
Games-Howell es la que casi nadie conoce y la que muchas tesis deberían estar usando. No supone varianzas iguales ni grupos balanceados, y en muestras de tamaños distintos —que es lo normal cuando aplicaste una encuesta— suele ser la opción defendible.
El criterio que decide: la prueba de Levene
El ANOVA supone homogeneidad de varianzas: que la dispersión dentro de cada grupo sea comparable. La prueba de Levene evalúa eso, y su lectura es contraintuitiva porque va al revés de lo habitual:
- Levene no significativa (p > .05): las varianzas son homogéneas. El supuesto se cumple. Tukey o Bonferroni.
- Levene significativa (p < .05): las varianzas difieren. El supuesto falla. Games-Howell, y además conviene reportar el ANOVA con el ajuste de Welch en lugar del clásico.
Aquí querer un resultado significativo te perjudica: en Levene, lo que te conviene es que no salga. Es la misma inversión lógica que aparece en las pruebas de normalidad y el motivo por el que tanta gente reporta el supuesto al revés.
Dónde está todo esto en SPSS
- Analizar > Comparar medias > ANOVA de un factor. La variable continua va en Lista de dependientes y la categórica en Factor.
- Botón Opciones: marca Descriptivos, Prueba de homogeneidad de varianzas, Welch y Gráfico de las medias.
- Botón Post hoc: el bloque superior contiene las pruebas que suponen varianzas iguales (ahí están Tukey y Bonferroni) y el bloque inferior las que no las suponen (ahí está Games-Howell). El propio cuadro de diálogo está organizado según el criterio de decisión, cosa que se nota solo cuando ya sabes qué buscar.
- Acepta, lee primero Levene, después la tabla ANOVA, y solo entonces la tabla post hoc que corresponda.
Si trabajas en otro entorno la organización cambia pero la lógica no; la comparación entre programas está en SPSS vs jamovi vs R para tesis.

El orden correcto de lectura
- Descriptivos. Medias, desviaciones y tamaño de cada grupo. Si un grupo tiene 8 casos y otro 140, anótalo: va a condicionar todo lo demás.
- Levene. Decide qué post hoc vas a leer.
- Tabla ANOVA. Si la significancia es mayor a .05, se termina aquí. No hay post hoc que reportar.
- Tamaño del efecto. Eta cuadrada parcial u omega cuadrada. El ANOVA de un factor de SPSS no la imprime por defecto; se obtiene desde el procedimiento de modelo lineal general o se calcula a mano con las sumas de cuadrados.
- La tabla post hoc que corresponde, leyendo solo los pares, no la tabla completa que duplica cada comparación.
El paso 3 es una barrera, no una sugerencia. Un post hoc reportado sin su F previa, o después de un ANOVA no significativo, es una pesca de resultados y se detecta de inmediato.
Cómo se reporta
En APA 7, primero el modelo global y después los pares. La forma completa: F(2, 211) = 7.84, p < .001, η²p = .069. Después, una frase por cada par significativo con su diferencia de medias y su intervalo de confianza, más una línea que declare qué post hoc usaste y por qué.
Esa última línea es la que convierte la elección en un argumento: «Dado que la prueba de Levene resultó significativa (p = .012), las comparaciones por pares se realizaron mediante Games-Howell.» Una sola oración y la decisión queda justificada.
La plantilla general de notación estadística en APA se aplica igual aquí; el formato de las tablas está en tablas y figuras en APA 7 y la redacción del apartado, en cómo redactar los resultados de tu tesis. La interpretación sustantiva de por qué esos dos grupos difieren pertenece a la discusión de resultados.
Cuándo ninguna de las tres es tu prueba
- Tu dependiente es categórica. Entonces no hay medias que comparar: tu prueba es la de chi-cuadrada con tablas de contingencia.
- Mediste a las mismas personas en varios momentos. Las observaciones no son independientes; necesitas un ANOVA de medidas repetidas, con su propio conjunto de comparaciones.
- Tienes dos factores. Un ANOVA factorial trae la pregunta de la interacción, y los post hoc se corren sobre efectos simples, no sobre los marginales.
- Tienes solo dos grupos. No hay nada que ajustar: una prueba t y listo.
- Tus datos violan gravemente los supuestos incluso con Welch. La ruta no paramétrica está mapeada en análisis de datos cuantitativos en la tesis.
Si además tu diseño combina grupos con predictores continuos, el modelo que los junta es la regresión lineal múltiple, y conviene revisar de paso la multicolinealidad entre esos predictores. La justificación de por qué comparas esos grupos y no otros vive en el capítulo metodológico.
Cuando la salida ya está leída y lo que falta es redactar el apartado con el registro académico correcto, Tesify ayuda con esa escritura. Lo que no hace: no elige tu prueba post hoc ni revisa tus supuestos, y esa elección es justamente la que tendrás que defender.
Preguntas frecuentes
¿Por qué necesito una prueba post hoc después del ANOVA?
Porque el ANOVA solo indica que al menos un grupo difiere de otro, sin decir cuál. Para saberlo hay que comparar los grupos por pares, y hacerlo con pruebas t sucesivas infla la probabilidad de encontrar diferencias falsas. Las pruebas post hoc hacen esas comparaciones controlando esa inflación.
¿Cuál prueba post hoc debo elegir?
Lo decide la prueba de Levene. Si las varianzas son homogéneas, Tukey es la opción estándar para comparar todos los pares. Si Levene resulta significativa, se usa Games-Howell, que no supone varianzas iguales. Bonferroni se reserva para cuando vas a hacer pocas comparaciones planeadas de antemano.
¿Qué pasa si hago varias pruebas t en lugar de un post hoc?
Cada prueba lleva su propio 5 % de riesgo de falso positivo, y ese riesgo se acumula. Con tres grupos son tres comparaciones y la probabilidad de al menos un falso positivo sube alrededor del 14 %; con cinco grupos son diez comparaciones y ronda el 40 %. Es la razón entera de que existan las pruebas post hoc.
¿Corro el post hoc aunque el ANOVA no salga significativo?
No en el procedimiento clásico: si el ANOVA no es significativo, la secuencia se detiene ahí. Buscar pares significativos después de un ANOVA no significativo es una pesca de resultados, y es exactamente lo que el jurado detecta cuando ve un post hoc reportado sin su F previa.
¿Bonferroni es más estricto que Tukey?
Sí, y esa es a la vez su virtud y su defecto. Divide el nivel de significancia entre el número de comparaciones, así que protege mucho contra falsos positivos pero pierde potencia cuando hay muchas comparaciones. Con seis o más pares, Tukey suele detectar diferencias reales que Bonferroni deja pasar.
¿Qué reporto además del resultado post hoc?
El resultado del ANOVA con sus grados de libertad, el tamaño del efecto global (eta cuadrada parcial u omega cuadrada), el resultado de la prueba de Levene que justificó tu elección de post hoc, y para cada par significativo la diferencia de medias con su intervalo de confianza.
