Los seis tipos de pregunta que miden conocimiento (y los que solo miden memoria)

Abre cualquier evaluación de formación corporativa y encontrarás lo mismo: veinte preguntas de opción múltiple con cuatro respuestas, una correcta. Es el formato por defecto, se monta rápido y se corrige solo.

El problema es que ese formato mide una sola cosa —reconocer la respuesta correcta cuando la tienes delante— y hay muchas más que conviene saber de un profesional. Si alguien es capaz de ordenar los pasos de un procedimiento, de emparejar cada producto con su indicación o de identificar un equipo de protección mirándolo, eso no lo captura una pregunta de opción única.

Este artículo repasa seis tipos de pregunta, qué mide bien cada uno, qué mide mal y cuándo usarlos. Es la parte menos glamurosa del diseño de una formación y la que más cambia la calidad del resultado.

Por qué el tipo de pregunta no es un detalle

Una prueba no mide lo que el contenido dice: mide lo que la pregunta obliga a hacer. Si todas las preguntas piden reconocer una definición, la prueba certifica que la gente reconoce definiciones. Sobre si sabrá aplicar el procedimiento un martes a las nueve de la mañana, no dice nada.

Cambiar el tipo cambia la operación mental que se exige, y por tanto lo que se acredita. Es la diferencia entre un examen que da una nota y uno que da información.

1. Respuesta única

El clásico: un enunciado, cuatro opciones, una correcta.

Mide bien el recuerdo de datos concretos y, si el enunciado plantea un caso en lugar de una definición, también la capacidad de aplicar una norma a una situación. Es versátil y todo el mundo lo entiende sin explicación.

Mide mal cuando las opciones incorrectas son flojas. Si tres de las cuatro son descartables a simple vista, se acierta sin haber leído el material. La calidad de una pregunta de opción única está casi toda en sus respuestas incorrectas, no en el enunciado.

Truco: construye cada incorrecta a partir de un error real que hayas visto cometer. La respuesta de otro producto de la gama, el plazo de un procedimiento parecido, la excepción confundida con la regla. Así el informe posterior no solo dice quién falló, sino qué confundió con qué.

2. Verdadero o falso

Una afirmación, dos opciones.

Mide bien por volumen y velocidad. En treinta segundos se pueden cubrir cinco afirmaciones, lo que permite barrer mucho temario en poco tiempo. Es ideal para pruebas cortas de refuerzo y para el ritmo rápido que sostiene la atención en un campeonato.

Mide mal en aislado: hay un 50 % de acierto por azar. Una prueba de diez preguntas de verdadero o falso no distingue bien entre quien sabe y quien acierta. Compénsalo con volumen y con puntuación ajustada, o combínalo con otros tipos.

Dónde brilla: desmontar creencias erróneas extendidas. «Los datos de un cliente pueden compartirse dentro de la empresa sin restricción» es una afirmación que mucha gente marcaría como verdadera, y detectar eso vale más que cualquier definición.

3. Respuesta múltiple

Varias opciones correctas entre las presentadas; hay que marcarlas todas.

Mide bien la exhaustividad, que es una competencia distinta del recuerdo. Saber que hay que hacer tres cosas y hacer solo dos es un fallo grave en un procedimiento de seguridad, y este tipo de pregunta lo detecta mientras que la opción única no.

Mide mal si no se define cómo se puntúa el acierto parcial. Marcar dos de tres, ¿es acierto, fallo o medio punto? La decisión debe tomarse antes y comunicarse, porque cambia por completo la estrategia del participante: si el parcial no puntúa, la gente marca todo por si acaso.

Úsalo para checklists, requisitos que deben cumplirse a la vez, síntomas o criterios de una misma categoría.

4. Relacionar parejas

Dos columnas que hay que emparejar.

Mide bien algo que ningún otro tipo captura: la estructura del conocimiento. No basta con conocer los elementos, hay que saber cómo se relacionan. Producto e indicación, procedimiento y responsable, incidencia y plazo de notificación, herramienta y caso de uso.

Es especialmente valioso en catálogos amplios: cuando una empresa tiene doce referencias parecidas, el error típico no es desconocerlas, es cruzarlas. Y ese cruce es exactamente lo que una pregunta de parejas saca a la luz.

Mide mal si hay pocas parejas: con tres elementos, acertar dos determina la tercera. A partir de cinco o seis funciona bien.

5. Imagen y palabra

Se muestra una imagen y hay que identificarla o asociarla con un término.

Mide bien el reconocimiento visual, que en muchos trabajos es la competencia real y que el texto no puede evaluar. Ejemplos donde es imprescindible: identificar un equipo de protección individual correcto para una tarea, distinguir el envase de dos presentaciones parecidas del mismo fármaco, reconocer una señalización de seguridad, detectar los indicios de un correo fraudulento en una captura de pantalla.

La diferencia práctica es enorme: alguien puede recitar de memoria la definición de un correo de suplantación y no reconocer uno cuando lo tiene en la bandeja de entrada. Solo la pregunta con imagen distingue esos dos estados.

Cuidado con la calidad de la imagen y su visualización en móvil. Una captura ilegible convierte una buena pregunta en una lotería.

6. Ordenar arrastrando

Elementos desordenados que hay que colocar en la secuencia correcta.

Mide bien lo que ningún otro tipo alcanza: el proceso. Saber cuáles son los cinco pasos de un protocolo no es lo mismo que saber en qué orden van, y en un procedimiento de emergencia, de escalado o de notificación, el orden es el contenido.

Es el tipo de pregunta más exigente y el que mejor discrimina entre quien ha estudiado el procedimiento y quien lo ha ojeado. También es el que más conversación genera cuando se revisan los resultados.

Mide mal si el orden real admite variantes. Antes de usarlo, comprueba que la secuencia correcta es única; si hay dos formas válidas de hacerlo, la pregunta genera reclamaciones justificadas.

Cómo mezclarlos según el objetivo

No hay una proporción universal, pero estas tres recetas cubren la mayoría de casos:

ObjetivoMezcla recomendadaPor qué
Prueba de nivel inicialVariedad completa, todos los tiposBuscas un diagnóstico amplio: dónde está cada uno y en qué dimensión falla
Refuerzo semanalVerdadero/falso y opción única, pocas preguntasPrioridad a la velocidad y la constancia; tiene que caber en tres minutos
Certificación o nota de corteOpción única con casos, múltiple y ordenarHay que discriminar de verdad y reducir el acierto por azar

Una regla práctica: que ningún tipo supere el 50 % de la prueba. La variedad no es solo cuestión de medición, también sostiene la atención. Veinte preguntas seguidas del mismo formato aburren; alternar mantiene despierto.

Cuatro errores de redacción que invalidan cualquier tipo

Da igual el formato si la pregunta está mal escrita. Estos cuatro fallos son tan frecuentes que conviene revisarlos siempre:

  • La correcta es la más larga. Ocurre casi siempre, porque la respuesta buena es la que necesita matices. La gente lo detecta a las tres preguntas y deja de leer el contenido. Iguala la longitud de todas las opciones.
  • «Todas las anteriores». Regala la respuesta: basta con identificar dos correctas para deducirla. Elimínala.
  • Enunciados en negativo. «¿Cuál de las siguientes NO es incompatible con…» mide comprensión lectora bajo presión de tiempo, no conocimiento. Si hay que usar el negativo, destácalo visualmente y no lo combines con otra negación.
  • Pistas gramaticales. Un enunciado que termina en «un…» descarta todas las opciones femeninas. Es un fallo silencioso y muy común en preguntas generadas automáticamente sin revisión.

Este es, de paso, uno de los motivos por los que la revisión humana de las preguntas generadas con inteligencia artificial no es un trámite: son fallos que se detectan de un vistazo si alguien mira, e invisibles si nadie lo hace.

El tiempo por pregunta también mide

Es un parámetro que se configura sin pensar y tiene más efecto del que parece. Con tiempo holgado se mide conocimiento reflexivo; con tiempo ajustado se mide conocimiento disponible, el que sale sin pensar.

Para una visita comercial o una situación de seguridad, lo relevante es el segundo: nadie consulta el manual delante del cliente. Como referencia, entre quince y veinte segundos para opción única y verdadero o falso, y entre cuarenta y sesenta para parejas y ordenar, que requieren manipular varios elementos.

Preguntas frecuentes

¿Cuántas preguntas debe tener una prueba?

Depende del objetivo. Entre ocho y doce para refuerzo periódico —tiene que caber en un hueco de tres minutos— y entre veinte y treinta para una prueba de nivel o una certificación. Más de treinta y cinco cansa y la calidad de las últimas respuestas cae.

¿Conviene penalizar el fallo?

En certificación sí, porque reduce el acierto al azar. En onboarding y en refuerzo no: penalizar hace que la gente deje en blanco lo que duda, y precisamente esas dudas son la información que buscas.

¿Puede la IA generar todos estos tipos?

Sí, indicándole cuáles quieres y en qué proporción antes de generar. Los que mejor salen automáticamente son opción única, verdadero o falso y parejas. Ordenar y las de imagen suelen necesitar más ajuste humano, porque exigen verificar que la secuencia es única y que el material visual es legible.

En resumen

Una prueba compuesta solo de opción única certifica que la gente reconoce respuestas. Mezclar seis tipos permite medir además exhaustividad, estructura, reconocimiento visual y dominio del proceso, que es de lo que realmente depende hacer bien un trabajo. El coste de esa mejora es cero: es una decisión de configuración, no de presupuesto.

En Ponte a Prueba los seis tipos están disponibles en cualquier campeonato y se pueden combinar prueba a prueba. Si quieres ver cómo quedaría vuestro contenido repartido entre ellos, escríbenos.

Relacionado: qué es la formación gamificada y por qué funciona.

¿Quieres verlo con tu equipo? Te montamos una demo con tus propios materiales.

Solicita una demo