La prueba estadística de una tesis de Enfermería la decide el diseño, no el software: si comparas una proporción entre dos grupos, chi-cuadrada; si comparas un puntaje entre dos grupos, t de Student o U de Mann-Whitney; si mides antes y después de una intervención educativa, t pareada o Wilcoxon; si buscas factores asociados a una conducta de salud, regresión logística. La tabla de abajo cruza los ocho diseños más frecuentes de la carrera con su prueba, su alternativa no paramétrica y lo que hay que reportar.
Cómo se elige una prueba en general —descriptiva contra inferencial, el valor p, el software— está explicado en análisis de datos cuantitativos en una tesis. Este artículo responde la pregunta para los estudios que de verdad se hacen en las escuelas de Enfermería mexicanas: adherencia, sobrecarga del cuidador, agencia de autocuidado, conocimientos y actitudes, calidad de vida, satisfacción del paciente, burnout del personal, intervenciones educativas.
¿Qué tienes que saber de tu tesis antes de elegir la prueba?
Cuatro respuestas, en este orden. Con ellas la tabla de la siguiente sección te da la prueba directamente.
- ¿Cuál es tu variable de resultado y de qué tipo es? Categórica (adherente / no adherente; presencia de úlcera por presión sí / no; nivel de conocimiento alto / medio / bajo) o numérica (puntaje de la escala de Zarit, puntaje de agencia de autocuidado, calificación de un cuestionario de conocimientos, presión arterial).
- ¿Cuántos grupos comparas y cómo se formaron? Un solo grupo descrito; dos grupos independientes (dos servicios, dos turnos, hombres y mujeres); el mismo grupo medido dos veces (antes y después de una intervención); tres o más grupos.
- ¿Tu puntaje numérico se distribuye de forma aproximadamente normal? Se verifica con Shapiro-Wilk cuando la muestra es menor de 50 y con Kolmogorov-Smirnov con corrección de Lilliefors cuando es mayor. Si no es normal, la prueba cambia a su versión no paramétrica.
- ¿Cuántos participantes tienes? Con menos de 30 por grupo las pruebas no paramétricas son casi siempre la opción segura, y con celdas de menos de 5 casos en una tabla de contingencia la chi-cuadrada se sustituye por la prueba exacta de Fisher.

¿Qué prueba corresponde a cada diseño típico de Enfermería?
| Diseño típico en Enfermería | Variable de resultado | Prueba paramétrica | Alternativa no paramétrica | Qué reportas |
|---|---|---|---|---|
| Prevalencia de una condición (úlceras por presión, adherencia baja, riesgo de caídas) en un servicio | Categórica | Estadística descriptiva: proporción con intervalo de confianza al 95 % | n, %, IC 95 % | |
| Nivel de conocimientos, agencia de autocuidado o sobrecarga en un grupo | Numérica | Media y desviación estándar (o mediana y rango intercuartílico si no hay normalidad) | M, DE o Mdn, RIC | |
| Asociación entre dos variables categóricas (sexo y adherencia; turno y burnout alto/bajo) | Categórica × categórica | Chi-cuadrada de independencia | Exacta de Fisher (celdas menores de 5) | χ², gl, p, V de Cramer o razón de momios |
| Comparar un puntaje entre dos grupos independientes (dos servicios, con y sin capacitación) | Numérica, 2 grupos | t de Student para muestras independientes | U de Mann-Whitney | t, gl, p, d de Cohen; o U, z, p, r |
| Intervención educativa medida antes y después en el mismo grupo | Numérica, 2 mediciones | t de Student para muestras relacionadas | Wilcoxon de rangos con signo | t, gl, p, d; o z, p, r |
| Intervención con resultado categórico antes y después (adherente sí/no) | Categórica, 2 mediciones | McNemar | χ² de McNemar, p | |
| Comparar un puntaje entre tres o más grupos (tres turnos, tres categorías de antigüedad) | Numérica, 3+ grupos | ANOVA de un factor con prueba post hoc | Kruskal-Wallis con comparaciones por pares | F, gl, p, η²; o H, gl, p |
| Relación entre dos puntajes (agencia de autocuidado y adherencia; sobrecarga y calidad de vida) | Numérica × numérica | Correlación de Pearson | Correlación de Spearman | r o ρ, p, n |
| Factores asociados a una conducta o evento (qué predice la no adherencia) | Categórica dicotómica con varios predictores | Regresión logística binaria | OR ajustada, IC 95 %, p por variable | |
Los procedimientos en SPSS de las pruebas más usadas ya están escritos: t de Student, U de Mann-Whitney y Kruskal-Wallis, chi-cuadrada en tablas de contingencia y Pearson o Spearman. Lo que sigue son las decisiones que esos tutoriales no toman por ti porque dependen de la carrera.
¿Qué pasa con las escalas de Enfermería: son numéricas u ordinales?
Es la duda que más discusiones genera en los seminarios de tesis. Las escalas que la carrera usa —la de sobrecarga del cuidador de Zarit, la de agencia de autocuidado, la de adherencia de Morisky, el inventario de burnout de Maslach, las escalas de ansiedad y depresión, los cuestionarios de calidad de vida— producen puntajes sumados de varios reactivos tipo Likert. La práctica aceptada en la investigación en salud es tratar el puntaje total como variable numérica y aplicar pruebas paramétricas si cumple normalidad, y tratar cada reactivo individual como ordinal. Dos reglas de la carrera:
- Si la escala tiene puntos de corte publicados (sobrecarga leve, moderada, intensa; adherencia alta, media, baja), puedes analizarla también como categórica con chi-cuadrada; muchas tesis reportan las dos formas: la media del puntaje y la distribución por categorías.
- Si aplicaste una escala validada en otra población, reporta el alfa de Cronbach obtenido en tu propia muestra antes de cualquier prueba inferencial; sin ese dato, el sínodo pregunta por qué confías en el puntaje.
¿Cómo se analiza una intervención educativa de Enfermería?
Es el diseño de tesis más frecuente en la carrera y el que más se analiza mal. El esquema típico: un grupo de pacientes o cuidadores recibe sesiones educativas y se mide conocimientos o una conducta antes y después.
- Un solo grupo, antes y después. Diferencia de puntaje con t pareada o Wilcoxon; si el resultado es categórico, McNemar. Reporta la diferencia de medias con su intervalo de confianza y el tamaño del efecto, no solo el valor p: una mejora de dos puntos en un cuestionario de veinte no se interpreta igual que una de nueve.
- Dos grupos, uno con intervención y otro sin ella, medidos antes y después. Lo correcto no es comparar solo los puntajes finales ni solo los cambios: es comparar los puntajes finales ajustando por el puntaje inicial (análisis de covarianza) o, si prefieres el camino más simple y defendible en licenciatura, comparar el cambio (después menos antes) entre los dos grupos con t independiente o U de Mann-Whitney.
- Lo que ninguna prueba arregla: sin grupo de comparación no puedes atribuir el cambio a tu intervención; el paso del tiempo, el efecto de la medición y la atención recibida explican parte de la mejora. Se dice en las limitaciones, con esa redacción, y se escribe la discusión sin verbos causales, como se explica en la discusión de una tesis de Enfermería.

¿Cuándo necesito regresión logística en una tesis de Enfermería?
Cuando tu pregunta es «qué factores se asocian a…» y el resultado es dicotómico: no adherencia, presencia de úlcera por presión, caída durante la hospitalización, burnout alto. La chi-cuadrada te dice si cada factor se asocia por separado; la regresión logística te dice cuáles siguen asociados cuando se controlan entre sí, y te entrega la razón de momios ajustada con su intervalo de confianza, que es la cifra que la literatura de la carrera reporta y contra la que vas a comparar en la discusión. Regla de tamaño: al menos diez eventos (casos con el resultado) por cada variable que metas al modelo; con 30 pacientes no adherentes, tres variables como máximo.
¿Y si mi tesis es cualitativa o mixta?
Buena parte de la investigación en Enfermería es cualitativa —vivencia del cuidador, experiencia del paciente, percepción del personal— y no lleva prueba estadística: lleva análisis de contenido o temático, con la saturación y la triangulación como criterios de rigor. En un diseño mixto, la parte cuantitativa sigue la tabla de arriba y la cualitativa su propio método; el error es forzar una prueba sobre datos de entrevistas convertidos en frecuencias. Los diseños cualitativos propios de la carrera están descritos en cómo hacer una tesis de Enfermería.
¿Cómo reporto la prueba en el capítulo de resultados?
- Cada prueba con su estadístico, grados de libertad, valor p exacto (p = .032, no p < .05) y tamaño del efecto; el formato de cada una sigue las normas APA 7 para reportar estadísticos.
- Una tabla de características de los participantes antes de cualquier inferencia: edad, sexo, escolaridad, tiempo de diagnóstico o de cuidado, con n y porcentaje o media y desviación estándar.
- Las proporciones siempre con su intervalo de confianza; un jurado de salud lo espera aunque el manual de la escuela no lo pida.
- El nombre de la prueba y el nivel de significancia declarados en el capítulo de método, no descubiertos en el de resultados.
Los errores que más se señalan en las tesis de Enfermería
- Chi-cuadrada con celdas vacías. Con 40 participantes y una tabla de 3 × 3 casi siempre hay celdas menores de 5; agrupa categorías o usa Fisher.
- t de Student sin verificar normalidad en un puntaje de sobrecarga que casi siempre está sesgado.
- Correlación entre reactivos individuales en lugar de entre puntajes totales.
- Prueba equivocada para antes y después: t para muestras independientes en datos pareados, que ignora que es la misma persona.
- Solo el valor p. Sin tamaño del efecto ni intervalo de confianza, un resultado significativo con 200 participantes puede ser clínicamente irrelevante.
- Interpretar una asociación como causa en un diseño transversal.
Con el diseño identificado, la prueba elegida y el reporte en formato, el capítulo de resultados de una tesis de Enfermería suele ocupar dos o tres tablas y media docena de párrafos. Tesify te ayuda a redactar el apartado de análisis estadístico del capítulo de método, a describir cada prueba con la justificación de por qué corresponde a tu diseño y a generar de forma automática las referencias en APA 7 de las escalas, los autores y las guías que citas. Correr la prueba en SPSS o jamovi y leer lo que significa para el cuidado de tus pacientes sigue siendo tu trabajo, y es lo que te van a preguntar en el examen.
Preguntas frecuentes
¿Qué prueba uso para comparar conocimientos antes y después de una intervención educativa?
Si es el mismo grupo medido dos veces y el puntaje se distribuye de forma normal, t de Student para muestras relacionadas; si no hay normalidad o la muestra es pequeña, Wilcoxon de rangos con signo. Si el resultado es categórico (aprobado o no aprobado), McNemar. Reporta además el tamaño del efecto.
¿Puedo usar t de Student con la escala de Zarit o la de agencia de autocuidado?
Sí, con el puntaje total, siempre que verifiques la normalidad y reportes el alfa de Cronbach en tu muestra. Si el puntaje no es normal, usa U de Mann-Whitney o Wilcoxon según el diseño. Los reactivos individuales se analizan como ordinales, no con t.
¿Cuándo uso chi-cuadrada y cuándo la prueba exacta de Fisher?
Chi-cuadrada cuando todas las celdas esperadas de la tabla tienen al menos 5 casos; Fisher cuando alguna tiene menos, lo que es frecuente en tesis de Enfermería con menos de 60 participantes. Ambas responden si dos variables categóricas están asociadas.
¿Qué prueba se usa para factores asociados a la no adherencia?
Primero chi-cuadrada o t para cada factor por separado; después regresión logística binaria con los factores que resultaron asociados, para obtener razones de momios ajustadas con su intervalo de confianza al 95 %. Necesitas al menos diez casos de no adherencia por cada variable del modelo.
¿Necesito prueba estadística si mi tesis solo describe la prevalencia?
No necesitas una prueba de hipótesis, pero sí estadística descriptiva completa: la proporción con su intervalo de confianza al 95 % y la descripción de la muestra. Si además comparas la prevalencia entre grupos, entonces sí aplicas chi-cuadrada.
¿Cuántos participantes necesito para que la prueba sea válida?
Depende del tamaño del efecto que esperas y de la prueba; se calcula antes de recolectar con un programa como G*Power. Como referencia, comparar dos grupos con un efecto mediano requiere alrededor de 64 participantes por grupo con t de Student; con menos de 30 por grupo conviene planear la versión no paramétrica.
