Por qué falla el RAG sobre contenido educativo
Las cinco razones por las que la recuperación sobre material de un curso falla más que sobre documentación técnica, y qué hay que cambiar en la preparación del contenido.
Respuesta corta
Un tutor de IA se evalúa con cinco tipos de caso: preguntas con respuesta en el material, preguntas cuya respuesta correcta es «no está en el curso», la consigna evaluada textual, preguntas de una unidad no habilitada y preguntas con vocabulario de alumno. El caso que casi nadie prueba —la abstención correcta— es el que decide si el tutor es confiable.
Un tutor de IA sobre el contenido de un curso funciona bien en las pruebas que hace el equipo que lo construyó, porque el equipo prueba lo que espera que pase. Los problemas están en lo que no se espera, y en educación esos casos son bastante específicos.
Lo que sigue son los cinco tipos de caso que incluimos en el set de evaluación, y por qué el segundo es el que más importa.
El caso obvio. Preguntas sobre contenido del curso, con el pasaje correcto anotado a mano.
Se mide en dos niveles, y separarlos es importante: primero, si el pasaje correcto apareció entre los recuperados; segundo, si la respuesta generada es correcta dado ese pasaje. Sin esa separación, un fallo es ilegible: no se sabe si el sistema no encontró el material o si lo encontró y respondió mal, y son dos arreglos distintos.
Este es el caso que casi ningún equipo prueba y el que decide si el tutor es confiable.
Preguntas razonables, del mismo tema, que el material simplemente no cubre. La respuesta correcta no es una explicación: es decir que eso no está en la unidad, y ofrecer lo que sí está.
Un tutor que responde bien el tipo 1 y falla el tipo 2 es peor que no tener tutor, porque produce respuestas plausibles sobre contenido que el curso no enseñó, dirigidas a alguien que por definición no puede detectarlo. Y como el resto de las respuestas fueron buenas, el alumno tiene todas las razones para creerle.
La métrica es la tasa de abstención correcta, y se acuerda un umbral antes de abrir la función. Es el número que más discusión genera con el equipo de producto, porque abstenerse se siente como una respuesta peor.
Copiar y pegar el enunciado de cada trabajo práctico del curso y ver qué hace el tutor.
La respuesta correcta es cambiar de modo: explicar el concepto que la consigna evalúa, proponer un ejercicio análogo, y no entregar la solución. Y tiene que funcionar también con la consigna parafraseada, que es como llega en la práctica: el alumno rara vez pega el texto exacto.
Este caso no se puede generar automáticamente de forma útil. Hay que tomar las consignas reales del curso, una por una.
Preguntas cuya respuesta está en el material, pero en una unidad que ese alumno todavía no abrió, o en un curso de un plan que no compró.
La respuesta correcta vuelve a ser una negativa, por dos motivos distintos: uno pedagógico —el curso está secuenciado a propósito— y uno de producto —la búsqueda no puede filtrar contenido pago—. El segundo motivo hace que este caso sea, además, una prueba de seguridad.
Las mismas preguntas del tipo 1, pero escritas como las escribe alguien que todavía no aprendió el tema. Con la palabra imprecisa, con la descripción del gráfico en vez del nombre del concepto, con el error de tipeo.
Esta es la asimetría del dominio: el que pregunta es exactamente el que no domina el vocabulario del material. Un set escrito por el docente en el lenguaje del docente mide un sistema distinto del que van a usar los alumnos.
La fuente de estos casos no hay que inventarla: está en el foro del curso y en los tickets de soporte de las cohortes anteriores.
Tres cosas, por escrito, con producto y con el docente:
El umbral de abstención correcta. Debajo de ese número, la función no se abre, aunque el resto esté bien.
Qué es un error grave. Nuestra definición para tutores: afirmar como del curso algo que el curso no dice, y resolver una entrega evaluada. Cualquiera de las dos se trata como bloqueante, no como métrica a mejorar.
El plan de degradación. Qué hace el sistema cuando la recuperación no encuentra nada bueno. La respuesta correcta es decirlo y ofrecer contactar al docente, no intentarlo igual.
Vale la pena nombrarlo porque aparece siempre y no tiene solución técnica: el material del curso está desactualizado o tiene un error.
El tutor lo repite, porque responde con la fuente. Suena a defecto y es una función: la cita hace visible el error y lo vuelve corregible. Un tutor que respondiera de memoria lo taparía con una respuesta correcta que contradice el material, y nadie se enteraría de que la unidad tres está mal desde hace dos años.
En la práctica, la primera corrida del set de evaluación de un curso encuentra errores del curso. Es incómodo, y es de las cosas más útiles que produce el proyecto.
Las cinco razones por las que la recuperación sobre material de un curso falla más que sobre documentación técnica, y qué hay que cambiar en la preparación del contenido.
Criterios para decidir la primera función de IA de una plataforma educativa: qué resuelve cada una, cuánto cuestan, qué riesgo tienen y por qué el orden casi siempre es el mismo.
Cómo se calcula el costo de modelo por alumno activo en una plataforma educativa, qué lo dispara y las cuatro palancas que lo bajan sin degradar la respuesta.