De 120 cuestionarios, 14 vienen incompletos. La reacción automática es borrarlos y seguir. Es una salida legítima —siempre que la declares y expliques— pero casi nunca es la mejor, y hacerlo en silencio es lo que convierte un problema técnico en un problema de integridad.
Este artículo trata la parte del capítulo 4 que nadie enseña: qué haces con los huecos de tu base y, sobre todo, qué de eso tiene que quedar escrito. No es un tema menor de limpieza: es una de las decisiones que más puede mover tus resultados sin que nadie lo note.
Lo primero: por qué faltan
La metodología distingue tres mecanismos, y la diferencia entre ellos decide qué puedes hacer:
- MCAR (faltan completamente al azar). La ausencia no se relaciona con nada: se saltaron una página por descuido, se cayó la conexión. Es el escenario benigno y el menos frecuente.
- MAR (faltan al azar, condicionado a lo observado). La ausencia se relaciona con otras variables que sí mediste. Por ejemplo, los hombres de tu muestra contestaron menos la pregunta de ingresos: puedes modelar esa relación porque el sexo sí lo tienes.
- MNAR (no faltan al azar). La ausencia se relaciona con el valor que falta. Quienes ganan más son quienes no reportan su ingreso. Es el caso grave, porque el sesgo no se puede corregir con la información disponible.
No puedes demostrar cuál de los tres tienes —MNAR es, por definición, indetectable con tus datos—. Lo que sí puedes y debes hacer es argumentar cuál supones y por qué. Ese párrafo de tres líneas es exactamente lo que la literatura encuentra ausente.
El dato que conviene tener a la mano
Una revisión publicada en Frontiers in Endocrinology en 2026 analizó 88 estudios observacionales y evaluó cómo reportaban y manejaban sus datos faltantes usando los criterios de la guía STROBE. Los resultados:
- Solo el 22.7 % (n = 20) cuantificó los datos faltantes; el promedio de datos ausentes fue de 9.1 %.
- De los estudios con datos faltantes (n = 23), apenas el 52.2 % explicó las razones —principalmente mala calidad de la recolección (41.7 %) y pérdida de seguimiento (41.7 %)—.
- El análisis por casos completos fue el método predominante: 93.3 %.
- Ningún estudio articuló el mecanismo hipotetizado detrás de sus datos faltantes.
- Solo el 4.4 % (n = 1) realizó un análisis de sensibilidad.
Los autores concluyen que el reporte sigue siendo ambiguo y que los métodos empleados son insuficientes, con riesgo de introducir sesgo. Para ti eso es una oportunidad: cumplir esos seis puntos te cuesta un párrafo y te pone por encima del 95 % de lo publicado en el área revisada.

Antes de decidir: cuantifica el patrón
No preguntes «¿cuántos datos me faltan?» sino «¿dónde faltan?». Tres cifras que necesitas:
- Porcentaje por variable. Un 3 % repartido en variables de control es distinto de un 18 % concentrado en tu variable dependiente.
- Porcentaje por caso. Un participante al que le faltan 2 de 40 ítems no es lo mismo que uno al que le faltan 25.
- Patrón. ¿Los huecos están dispersos o hay bloques completos? Un bloque suele significar que la gente abandonó la encuesta en cierto punto, y ese punto es información valiosa sobre tu instrumento.
En SPSS: Analizar → Análisis de valores perdidos. Además de los porcentajes, ese módulo ofrece la prueba MCAR de Little, cuyo resultado no significativo es compatible con un mecanismo completamente aleatorio. No es una demostración —descartar MNAR es imposible—, pero es evidencia reportable.
Un caso que se confunde seguido: una casilla vacía no siempre es un dato faltante. Si la pregunta 12 solo aplicaba a quienes respondieron «sí» en la 11, los vacíos de la 12 son estructurales, no ausencias. Codifícalos distinto y explícalo, o vas a «imputar» respuestas de personas a las que nunca se les preguntó.
Las tres salidas legítimas
1. Análisis por casos completos (eliminación por lista)
Trabajas solo con quienes contestaron todo. Es lo que SPSS hace por defecto y lo que hace casi todo mundo.
Cuándo se defiende: pocos faltantes, dispersos, y un argumento razonable de MCAR.
Su costo: pierdes potencia estadística —tu n efectivo baja y con él la capacidad de detectar el efecto, lo que conecta directamente con qué hacer si tu resultado no salió significativo— y, si la ausencia no es aleatoria, sesgas la muestra hacia el perfil de quienes sí contestan todo.
2. Eliminación por pares
Cada análisis usa todos los casos que tengan las variables involucradas. Conservas más información, pero cada estadístico se calcula con un n distinto, y eso hay que reportarlo tabla por tabla. Puede generar matrices de correlación internamente inconsistentes, así que evítalo si vas a hacer análisis factorial o modelos multivariados.
3. Imputación
Estimas los valores ausentes a partir de la información disponible. Hay dos niveles muy distintos:
- Imputación simple (media, mediana, valor más frecuente, o el promedio de los demás ítems de la misma dimensión). Es fácil y es la más débil: al meter el mismo número muchas veces reduces artificialmente la varianza y debilitas las correlaciones. En escalas tipo Likert, imputar un ítem faltante con el promedio de los otros ítems de esa misma dimensión es la variante más aceptada, siempre que falten pocos ítems del bloque.
- Imputación múltiple. Genera varias versiones completas de la base, corre tu análisis en cada una y combina los resultados. Es el estándar metodológico actual bajo el supuesto MAR, porque la variabilidad entre las versiones se incorpora al error estándar en lugar de fingir certeza. Está disponible en SPSS (módulo de imputación múltiple) y en R.

Dónde está la línea de la integridad
Todo lo anterior es legítimo. Esto no lo es:
- Inventar respuestas. Llenar a mano las casillas vacías con valores «razonables» es fabricación de datos, sin matices. Qué constituye exactamente esa falta y cómo se detecta está en fabricación y falsificación de datos en una tesis.
- Probar varios métodos y reportar el que dio significativo. El método se elige antes de mirar el resultado y se declara. Comparar métodos es válido; comparar y callar los que no convinieron, no.
- Eliminar selectivamente. Borrar «los casos raros» que además resultan ser los que contradicen tu hipótesis no es limpieza de datos.
- No mencionarlo. Que tu n pase de 120 a 106 entre el capítulo 3 y el capítulo 4 sin una sola línea de explicación es la observación más fácil de hacer en una defensa.
Los seis puntos que tienes que dejar escritos
Son los mismos que revisa la guía STROBE y que la revisión de 2026 encontró incompletos casi siempre. Mapeados a una tesis:
| Qué reportar | Dónde va |
|---|---|
| Cuántos datos faltan, por variable | Inicio del capítulo de resultados |
| Por qué faltan (abandono, no respuesta, error de captura) | Mismo apartado |
| Qué mecanismo supones (MCAR, MAR o MNAR) y con qué argumento | Mismo apartado |
| Qué método aplicaste y por qué ese | Metodología, apartado de análisis de datos |
| Con qué software y con qué parámetros | Metodología |
| Si hiciste análisis de sensibilidad y qué mostró | Resultados o anexos |
El análisis de sensibilidad es el más fácil de los seis y el que casi nadie hace: corres tu análisis principal dos veces, con y sin imputación, y reportas si las conclusiones cambian. Si no cambian, tienes una frase poderosa; si cambian, tienes un hallazgo que sí importa reportar. El mapa completo de STROBE y las demás guías de reporte está en guías de reporte para tesis.
Cómo se redacta
«De los 132 cuestionarios recibidos, 12 (9.1 %) presentaron al menos un ítem sin responder. Los valores ausentes se concentraron en el bloque de ingreso familiar (8.3 % de los casos) y estuvieron dispersos en el resto del instrumento (por debajo del 2 % por variable). La prueba MCAR de Little no resultó significativa, χ²(48) = 52.31, p = .311, resultado compatible con un mecanismo completamente aleatorio, aunque no descarta un mecanismo no aleatorio en la variable de ingreso. Se aplicó imputación múltiple con cinco conjuntos en SPSS 29 para las variables de escala, y los casos con más del 20 % del instrumento sin responder (n = 3) se excluyeron del análisis. Un análisis de sensibilidad con eliminación por lista arrojó coeficientes en la misma dirección y magnitud, por lo que las conclusiones no dependen del tratamiento de los datos faltantes.»
Ese párrafo cubre los seis puntos y cierra la pregunta antes de que alguien la haga. Las convenciones de cursiva y decimales están en cómo reportar una prueba estadística en APA 7, y este apartado va justo antes del reporte de supuestos, es decir, antes de la prueba de normalidad.
Prevenir vale más que imputar
La mejor gestión de datos faltantes ocurre antes de recolectar:
- Marca como obligatorias solo las preguntas realmente indispensables. Hacer obligatorio todo aumenta el abandono completo, que es peor que un ítem vacío.
- Ofrece «prefiero no responder» en preguntas sensibles. Un dato ausente declarado es información; uno forzado es ruido.
- Acorta el instrumento. Las tasas de abandono suben con la longitud, y las plataformas te dejan ver en qué pregunta se van, como se explica en plataformas de encuestas para tesis.
- Piloteala. Los ítems que la gente salta en la piloto son los ítems mal redactados; el diseño completo está en cómo hacer una encuesta para tesis.
- Sobredimensiona la meta de recolección. Si necesitas 120 casos completos, planea 140. Cómo calcular el punto de partida está en cómo calcular el tamaño de la muestra.
Y si la ausencia de respuesta terminó siendo importante en tu estudio, eso se documenta en limitaciones y delimitaciones, no se esconde. Un dato adicional a cuidar: al eliminar o imputar casos no olvides que la base sigue conteniendo información personal, con las obligaciones que se explican en cómo anonimizar los datos personales de tu tesis.
Cuando ya tomaste la decisión, lo que queda es redactar el apartado con los seis elementos y mantener la coherencia entre el n que aparece en cada tabla. Tesify te ayuda a estructurar ese borrador con tus propios números; la decisión metodológica y su justificación siguen siendo tuyas, y son justo lo que se evalúa.
Preguntas frecuentes
¿Puedo borrar los cuestionarios incompletos?
Sí, si lo declaras y explicas por qué. Se llama análisis por casos completos y es la práctica dominante —el 93.3 % de los estudios de la revisión citada—, pero pierde potencia y puede sesgar el resultado si quienes no respondieron son distintos de quienes sí lo hicieron.
¿Cuántos datos faltantes son demasiados?
No existe un umbral universal. Lo que decide no es solo el porcentaje sino el patrón: un 5 % concentrado en tu variable dependiente es más grave que un 15 % repartido al azar en variables de control. Reporta ambas cosas.
¿Puedo rellenar los huecos con el promedio?
Se puede, pero es la opción más débil: reduce artificialmente la varianza y debilita las correlaciones. Si la usas, decláralo y presenta también el análisis sin imputación para mostrar que la conclusión no depende de ese tratamiento.
¿Qué tengo que reportar sobre los datos faltantes?
Cuántos faltan por variable, por qué faltan, qué mecanismo supones, qué método aplicaste, con qué software y si hiciste análisis de sensibilidad. Son los puntos que revisa la guía STROBE y que la mayoría de los estudios publicados deja incompletos.
¿La prueba MCAR de Little demuestra que mis datos faltan al azar?
No lo demuestra. Un resultado no significativo es compatible con ese mecanismo, pero ninguna prueba puede descartar que la ausencia dependa del valor que falta, porque ese valor precisamente no lo tienes. Repórtala como evidencia, no como prueba.
¿Y si mi tesis es cualitativa?
El problema equivalente es la información que un participante decide no dar o la entrevista que quedó incompleta. No se imputa nada: se documenta qué faltó, por qué, y cómo eso limita las categorías construidas. Es parte del rigor del diseño, no de su estadística.
