Datos faltantes en tu encuesta (2026): qué puedes hacer con integridad y qué tienes que declarar

De 120 cuestionarios, 14 vienen incompletos. La reacción automática es borrarlos y seguir. Es una salida legítima —siempre que la declares y expliques— pero casi nunca es la mejor, y hacerlo en silencio es lo que convierte un problema técnico en un problema de integridad.

Este artículo trata la parte del capítulo 4 que nadie enseña: qué haces con los huecos de tu base y, sobre todo, qué de eso tiene que quedar escrito. No es un tema menor de limpieza: es una de las decisiones que más puede mover tus resultados sin que nadie lo note.

Lo primero: por qué faltan

La metodología distingue tres mecanismos, y la diferencia entre ellos decide qué puedes hacer:

  • MCAR (faltan completamente al azar). La ausencia no se relaciona con nada: se saltaron una página por descuido, se cayó la conexión. Es el escenario benigno y el menos frecuente.
  • MAR (faltan al azar, condicionado a lo observado). La ausencia se relaciona con otras variables que sí mediste. Por ejemplo, los hombres de tu muestra contestaron menos la pregunta de ingresos: puedes modelar esa relación porque el sexo sí lo tienes.
  • MNAR (no faltan al azar). La ausencia se relaciona con el valor que falta. Quienes ganan más son quienes no reportan su ingreso. Es el caso grave, porque el sesgo no se puede corregir con la información disponible.

No puedes demostrar cuál de los tres tienes —MNAR es, por definición, indetectable con tus datos—. Lo que sí puedes y debes hacer es argumentar cuál supones y por qué. Ese párrafo de tres líneas es exactamente lo que la literatura encuentra ausente.

El dato que conviene tener a la mano

Una revisión publicada en Frontiers in Endocrinology en 2026 analizó 88 estudios observacionales y evaluó cómo reportaban y manejaban sus datos faltantes usando los criterios de la guía STROBE. Los resultados:

  • Solo el 22.7 % (n = 20) cuantificó los datos faltantes; el promedio de datos ausentes fue de 9.1 %.
  • De los estudios con datos faltantes (n = 23), apenas el 52.2 % explicó las razones —principalmente mala calidad de la recolección (41.7 %) y pérdida de seguimiento (41.7 %)—.
  • El análisis por casos completos fue el método predominante: 93.3 %.
  • Ningún estudio articuló el mecanismo hipotetizado detrás de sus datos faltantes.
  • Solo el 4.4 % (n = 1) realizó un análisis de sensibilidad.

Los autores concluyen que el reporte sigue siendo ambiguo y que los métodos empleados son insuficientes, con riesgo de introducir sesgo. Para ti eso es una oportunidad: cumplir esos seis puntos te cuesta un párrafo y te pone por encima del 95 % de lo publicado en el área revisada.

Cuadrícula de datos con huecos dispersos que representa el patrón de valores faltantes
Lo que decide la gravedad no es el porcentaje total, sino dónde se concentran los huecos.

Antes de decidir: cuantifica el patrón

No preguntes «¿cuántos datos me faltan?» sino «¿dónde faltan?». Tres cifras que necesitas:

  1. Porcentaje por variable. Un 3 % repartido en variables de control es distinto de un 18 % concentrado en tu variable dependiente.
  2. Porcentaje por caso. Un participante al que le faltan 2 de 40 ítems no es lo mismo que uno al que le faltan 25.
  3. Patrón. ¿Los huecos están dispersos o hay bloques completos? Un bloque suele significar que la gente abandonó la encuesta en cierto punto, y ese punto es información valiosa sobre tu instrumento.

En SPSS: Analizar → Análisis de valores perdidos. Además de los porcentajes, ese módulo ofrece la prueba MCAR de Little, cuyo resultado no significativo es compatible con un mecanismo completamente aleatorio. No es una demostración —descartar MNAR es imposible—, pero es evidencia reportable.

Un caso que se confunde seguido: una casilla vacía no siempre es un dato faltante. Si la pregunta 12 solo aplicaba a quienes respondieron «sí» en la 11, los vacíos de la 12 son estructurales, no ausencias. Codifícalos distinto y explícalo, o vas a «imputar» respuestas de personas a las que nunca se les preguntó.

Las tres salidas legítimas

1. Análisis por casos completos (eliminación por lista)

Trabajas solo con quienes contestaron todo. Es lo que SPSS hace por defecto y lo que hace casi todo mundo.

Cuándo se defiende: pocos faltantes, dispersos, y un argumento razonable de MCAR.

Su costo: pierdes potencia estadística —tu n efectivo baja y con él la capacidad de detectar el efecto, lo que conecta directamente con qué hacer si tu resultado no salió significativo— y, si la ausencia no es aleatoria, sesgas la muestra hacia el perfil de quienes sí contestan todo.

2. Eliminación por pares

Cada análisis usa todos los casos que tengan las variables involucradas. Conservas más información, pero cada estadístico se calcula con un n distinto, y eso hay que reportarlo tabla por tabla. Puede generar matrices de correlación internamente inconsistentes, así que evítalo si vas a hacer análisis factorial o modelos multivariados.

3. Imputación

Estimas los valores ausentes a partir de la información disponible. Hay dos niveles muy distintos:

  • Imputación simple (media, mediana, valor más frecuente, o el promedio de los demás ítems de la misma dimensión). Es fácil y es la más débil: al meter el mismo número muchas veces reduces artificialmente la varianza y debilitas las correlaciones. En escalas tipo Likert, imputar un ítem faltante con el promedio de los otros ítems de esa misma dimensión es la variante más aceptada, siempre que falten pocos ítems del bloque.
  • Imputación múltiple. Genera varias versiones completas de la base, corre tu análisis en cada una y combina los resultados. Es el estándar metodológico actual bajo el supuesto MAR, porque la variabilidad entre las versiones se incorpora al error estándar en lugar de fingir certeza. Está disponible en SPSS (módulo de imputación múltiple) y en R.
Un mismo conjunto incompleto reconstruido en varias versiones, como en la imputación múltiple
La imputación múltiple no adivina un valor: genera varias bases plausibles y refleja esa incertidumbre en el resultado.

Dónde está la línea de la integridad

Todo lo anterior es legítimo. Esto no lo es:

  • Inventar respuestas. Llenar a mano las casillas vacías con valores «razonables» es fabricación de datos, sin matices. Qué constituye exactamente esa falta y cómo se detecta está en fabricación y falsificación de datos en una tesis.
  • Probar varios métodos y reportar el que dio significativo. El método se elige antes de mirar el resultado y se declara. Comparar métodos es válido; comparar y callar los que no convinieron, no.
  • Eliminar selectivamente. Borrar «los casos raros» que además resultan ser los que contradicen tu hipótesis no es limpieza de datos.
  • No mencionarlo. Que tu n pase de 120 a 106 entre el capítulo 3 y el capítulo 4 sin una sola línea de explicación es la observación más fácil de hacer en una defensa.

Los seis puntos que tienes que dejar escritos

Son los mismos que revisa la guía STROBE y que la revisión de 2026 encontró incompletos casi siempre. Mapeados a una tesis:

Qué reportar Dónde va
Cuántos datos faltan, por variable Inicio del capítulo de resultados
Por qué faltan (abandono, no respuesta, error de captura) Mismo apartado
Qué mecanismo supones (MCAR, MAR o MNAR) y con qué argumento Mismo apartado
Qué método aplicaste y por qué ese Metodología, apartado de análisis de datos
Con qué software y con qué parámetros Metodología
Si hiciste análisis de sensibilidad y qué mostró Resultados o anexos

El análisis de sensibilidad es el más fácil de los seis y el que casi nadie hace: corres tu análisis principal dos veces, con y sin imputación, y reportas si las conclusiones cambian. Si no cambian, tienes una frase poderosa; si cambian, tienes un hallazgo que sí importa reportar. El mapa completo de STROBE y las demás guías de reporte está en guías de reporte para tesis.

Cómo se redacta

«De los 132 cuestionarios recibidos, 12 (9.1 %) presentaron al menos un ítem sin responder. Los valores ausentes se concentraron en el bloque de ingreso familiar (8.3 % de los casos) y estuvieron dispersos en el resto del instrumento (por debajo del 2 % por variable). La prueba MCAR de Little no resultó significativa, χ²(48) = 52.31, p = .311, resultado compatible con un mecanismo completamente aleatorio, aunque no descarta un mecanismo no aleatorio en la variable de ingreso. Se aplicó imputación múltiple con cinco conjuntos en SPSS 29 para las variables de escala, y los casos con más del 20 % del instrumento sin responder (n = 3) se excluyeron del análisis. Un análisis de sensibilidad con eliminación por lista arrojó coeficientes en la misma dirección y magnitud, por lo que las conclusiones no dependen del tratamiento de los datos faltantes.»

Ese párrafo cubre los seis puntos y cierra la pregunta antes de que alguien la haga. Las convenciones de cursiva y decimales están en cómo reportar una prueba estadística en APA 7, y este apartado va justo antes del reporte de supuestos, es decir, antes de la prueba de normalidad.

Prevenir vale más que imputar

La mejor gestión de datos faltantes ocurre antes de recolectar:

  • Marca como obligatorias solo las preguntas realmente indispensables. Hacer obligatorio todo aumenta el abandono completo, que es peor que un ítem vacío.
  • Ofrece «prefiero no responder» en preguntas sensibles. Un dato ausente declarado es información; uno forzado es ruido.
  • Acorta el instrumento. Las tasas de abandono suben con la longitud, y las plataformas te dejan ver en qué pregunta se van, como se explica en plataformas de encuestas para tesis.
  • Piloteala. Los ítems que la gente salta en la piloto son los ítems mal redactados; el diseño completo está en cómo hacer una encuesta para tesis.
  • Sobredimensiona la meta de recolección. Si necesitas 120 casos completos, planea 140. Cómo calcular el punto de partida está en cómo calcular el tamaño de la muestra.

Y si la ausencia de respuesta terminó siendo importante en tu estudio, eso se documenta en limitaciones y delimitaciones, no se esconde. Un dato adicional a cuidar: al eliminar o imputar casos no olvides que la base sigue conteniendo información personal, con las obligaciones que se explican en cómo anonimizar los datos personales de tu tesis.

Cuando ya tomaste la decisión, lo que queda es redactar el apartado con los seis elementos y mantener la coherencia entre el n que aparece en cada tabla. Tesify te ayuda a estructurar ese borrador con tus propios números; la decisión metodológica y su justificación siguen siendo tuyas, y son justo lo que se evalúa.

Preguntas frecuentes

¿Puedo borrar los cuestionarios incompletos?

Sí, si lo declaras y explicas por qué. Se llama análisis por casos completos y es la práctica dominante —el 93.3 % de los estudios de la revisión citada—, pero pierde potencia y puede sesgar el resultado si quienes no respondieron son distintos de quienes sí lo hicieron.

¿Cuántos datos faltantes son demasiados?

No existe un umbral universal. Lo que decide no es solo el porcentaje sino el patrón: un 5 % concentrado en tu variable dependiente es más grave que un 15 % repartido al azar en variables de control. Reporta ambas cosas.

¿Puedo rellenar los huecos con el promedio?

Se puede, pero es la opción más débil: reduce artificialmente la varianza y debilita las correlaciones. Si la usas, decláralo y presenta también el análisis sin imputación para mostrar que la conclusión no depende de ese tratamiento.

¿Qué tengo que reportar sobre los datos faltantes?

Cuántos faltan por variable, por qué faltan, qué mecanismo supones, qué método aplicaste, con qué software y si hiciste análisis de sensibilidad. Son los puntos que revisa la guía STROBE y que la mayoría de los estudios publicados deja incompletos.

¿La prueba MCAR de Little demuestra que mis datos faltan al azar?

No lo demuestra. Un resultado no significativo es compatible con ese mecanismo, pero ninguna prueba puede descartar que la ausencia dependa del valor que falta, porque ese valor precisamente no lo tienes. Repórtala como evidencia, no como prueba.

¿Y si mi tesis es cualitativa?

El problema equivalente es la información que un participante decide no dar o la entrevista que quedó incompleta. No se imputa nada: se documenta qué faltó, por qué, y cómo eso limita las categorías construidas. Es parte del rigor del diseño, no de su estadística.

Escribe tu tesis con IA

Estructura, redacta y formatea tus referencias en APA 7 para tu tesis o tesina — con integridad académica. Registro gratuito, sin tarjeta.

Empieza gratis con Tesify →

Categorías