Saltar al contenido
Hablar de tu producto
EdTech y plataformas educativas

Generación de evaluaciones y bancos de preguntas con IA

Escribir buenas preguntas es caro y es la tarea que más se posterga en una plataforma educativa: por eso los cursos tienen la misma evaluación desde hace tres años, la respuesta circula por WhatsApp entre cohortes y el banco de ítems nunca crece.

La IA resuelve bien el volumen y mal la calidad si se la deja sola. Un modelo que lee una unidad produce veinte preguntas en un minuto, y quince miden si el alumno leyó el párrafo. La diferencia entre un banco útil y uno decorativo está en el proceso alrededor de la generación, no en el modelo.

Respuesta corta

Generar evaluaciones con IA sirve cuando el ítem sale del material propio, declara qué objetivo de aprendizaje mide y trae distractores que corresponden a errores conceptuales reales. Sin esas tres condiciones sale un cuestionario de superficie que mide lectura reciente, no aprendizaje. Todo ítem se revisa antes de publicarse.

Cómo funciona

01

Cada ítem se ata a un objetivo de aprendizaje

La generación parte del objetivo declarado del curso y del nivel cognitivo que se quiere medir, no del texto suelto. Sin esto no se puede saber qué cubre la evaluación ni qué le falta.

02

Los distractores salen de errores reales

Se alimentan con las respuestas incorrectas que los alumnos ya dieron en cohortes anteriores. Un distractor inventado se descarta a simple vista y convierte la pregunta en trivial.

03

Se filtra antes de que lo vea una persona

Duplicados semánticos contra el banco existente, ítems con más de una respuesta defendible y preguntas cuya respuesta está literal en el enunciado. Es un filtro automático, y saca la mitad.

04

Un docente aprueba y el ítem se calibra con uso

Después de publicado, el porcentaje de acierto y el poder discriminativo dicen si el ítem sirve. Los que todos aciertan o todos fallan salen del banco.

Qué se mide

  • Ítems generados que sobreviven la revisión docente, sobre el total generado.
  • Cobertura del banco por objetivo de aprendizaje: qué objetivos quedaron sin ítems.
  • Poder discriminativo de los ítems nuevos contra los existentes.
  • Horas de docente por evaluación nueva publicada.

Qué hace falta de tu lado

  • Objetivos de aprendizaje declarados por unidad. Si no existen, ese es el primer entregable del proyecto.
  • El histórico de respuestas incorrectas, que es lo que hace buenos a los distractores.
  • Un docente con tiempo asignado para aprobar. La revisión es el cuello de botella, no la generación.
  • Estadísticas de ítem en la plataforma: acierto y discriminación por pregunta.

Cuándo no conviene

  • Si nadie va a revisar los ítems, no se hace. Un banco de preguntas sin revisar es peor que un banco chico: mide mal y nadie se entera hasta el reclamo de una cohorte entera.
  • Si la evaluación es certificante o de ingreso, la generación puede proponer pero el proceso de validación es el que ya exige la norma, y ese no se acorta.
  • Si el curso tiene diez alumnos por cohorte, no hay estadística de ítem con la que calibrar y el banco no mejora con el uso.

Preguntas relacionadas

¿Sirve para preguntas abiertas o sólo para opción múltiple?
Sirve para las dos, pero el valor está en lugares distintos. En opción múltiple el trabajo difícil son los distractores. En pregunta abierta es la rúbrica que la acompaña, sin la cual la pregunta no se puede corregir de forma consistente ni por una persona ni por un sistema.
¿Cuántos ítems se descartan en la revisión?
En los primeros lotes, la mayoría, y eso es información útil: dice qué le falta al prompt, al material o a los objetivos declarados. La tasa de supervivencia sube cuando la generación empieza a alimentarse de los ítems que el docente ya aprobó, no cuando se cambia de modelo.
¿Puede generar una evaluación distinta por alumno?
Técnicamente sí, y hay que pensarlo dos veces. Si cada alumno recibe ítems distintos, las notas dejan de ser comparables salvo que todos los ítems estén calibrados al mismo nivel de dificultad, y eso requiere un banco maduro. La ruta razonable es variantes de ítems ya calibrados, no generación al vuelo.

Casos de uso en este sector

Próximo paso

¿Qué producto educativo querés que exista?

Contanos qué estás construyendo, qué parte todavía no funciona o qué oportunidad de IA querés evaluar. En la primera conversación te diremos por dónde empezar, qué hace falta y qué no construiríamos.

Escribinos por WhatsApp