Cómo evaluar un tutor de IA antes de abrirlo a los alumnos
El set de evaluación de un tutor educativo: los cinco tipos de caso que tiene que incluir, cómo se mide la abstención correcta y qué umbral se acuerda antes de abrir la función.
Respuesta corta
El RAG sobre contenido educativo falla por razones propias del material: el video sin transcribir queda afuera del índice, la partición ciega corta ejemplos por la mitad, el alumno pregunta con palabras que no están en el texto, la secuencia pedagógica se rompe y el material tiene versiones. Ninguna se arregla cambiando de modelo.
La recuperación aumentada funciona bien sobre documentación técnica: texto estructurado, vocabulario consistente, cada sección responde una cosa. Sobre material de un curso funciona notablemente peor, y el equipo que viene de haber hecho lo primero se sorprende.
Las causas no son de modelo. Son cinco propiedades del contenido educativo que rompen supuestos que el RAG da por sentados.
En muchas plataformas educativas, la explicación que el alumno necesita está dicha en voz, no escrita. Si el video no está transcripto, el índice contiene los apuntes complementarios y el nombre del módulo, y el tutor responde con la fracción escrita del curso mientras el alumno sabe que la respuesta estaba en la clase.
Esto se percibe como que «la IA no sabe del curso», y en realidad es que nunca se le mostró el curso.
La transcripción es el primer trabajo y el más caro del proyecto en catálogos grandes. También es el que más rinde: sin él, todo lo demás está construido sobre la mitad del material.
La forma estándar de partir un documento —cada tantos caracteres, con solapamiento— asume que el texto es homogéneo. El material educativo no lo es: está hecho de unidades que sólo tienen sentido enteras.
Un ejercicio resuelto tiene enunciado, desarrollo y resultado. Un ejemplo tiene planteo y conclusión. Una demostración tiene hipótesis y pasos. Si el corte cae en el medio, el índice queda con un fragmento que no responde nada, y lo que se recupera es la mitad del razonamiento.
La partición tiene que seguir la estructura pedagógica del material, no una cuenta de caracteres. Es trabajo manual y es la intervención con mejor relación entre esfuerzo y mejora en la recuperación.
Esta es la asimetría central del dominio, y la que menos se anticipa.
El que pregunta es exactamente el que todavía no aprendió el vocabulario. Escribe «lo del gráfico que sube y después se cae» cuando el material dice «función con máximo local». Escribe «el error ese del punto y coma» cuando el material habla de errores de sintaxis. La búsqueda semántica ayuda bastante acá, pero tiene un límite: no puede unir dos textos que no comparten ningún concepto expresado.
Lo que funciona es enriquecer el índice con el vocabulario de los alumnos: las preguntas del foro, las consultas al soporte, los mensajes de la cohorte anterior. Es contenido que la plataforma ya tiene y que casi nunca se indexa.
Un curso está diseñado para que ciertas cosas se aprendan antes que otras. La recuperación no sabe eso: si la mejor respuesta a la pregunta de un alumno de la unidad dos está en la unidad siete, la trae.
El resultado es un tutor que responde correctamente y arruina el diseño del curso, adelantando material que el alumno no está en condiciones de usar, y a veces desbloqueando contenido de un plan que no pagó.
El filtro por alcance del alumno —cursos en los que está inscripto, unidades ya abiertas— no es una restricción incómoda que se agrega después. Es parte de qué significa que la respuesta sea correcta en este dominio.
Los cursos se actualizan. Cambia una normativa, se rehace una unidad, se corrige un ejercicio. Si no hay proceso de reindexado, el índice conserva la versión vieja y el tutor la cita con total seguridad.
En educación este error es peor que en otros dominios, porque el alumno no tiene forma de detectarlo: para eso está tomando el curso. Y la cita, que es lo que hace confiable al sistema, acá lo hace convincentemente incorrecto.
El requisito es un proceso de reindexado atado a la publicación de contenido, y la fecha de la versión visible en la respuesta.
Cuando un tutor educativo responde mal, la primera pregunta no es sobre el modelo. Es dónde se rompió la cadena:
| Síntoma | Causa probable |
|---|---|
| Responde con generalidades correctas pero no del curso | El pasaje no está en el índice |
| Responde con medio razonamiento | Partición cortó la unidad |
| No encuentra nada con la pregunta del alumno, sí con la del profesor | Vocabulario |
| Responde con material de una unidad posterior | Falta filtro de alcance |
| Cita algo que ya no está en el curso | Índice desactualizado |
Ninguna de esas cinco filas mejora cambiando el modelo. Todas mejoran trabajando el contenido, que es la parte del proyecto que no se puede comprar hecha y la que decide si el tutor sirve.
El set de evaluación de un tutor educativo: los cinco tipos de caso que tiene que incluir, cómo se mide la abstención correcta y qué umbral se acuerda antes de abrir la función.
Criterios para decidir la primera función de IA de una plataforma educativa: qué resuelve cada una, cuánto cuestan, qué riesgo tienen y por qué el orden casi siempre es el mismo.
Cómo se calcula el costo de modelo por alumno activo en una plataforma educativa, qué lo dispara y las cuatro palancas que lo bajan sin degradar la respuesta.