Pruebas de colocación adaptativa y pruebas adaptativas computarizadas (CAT): TRI, calibración de arranque en frío y espacios de conocimiento
Resumen ejecutivo
- TRI tiene tres modelos anidados: 1PL/Rasch (solo dificultad b), 2PL (+ discriminación a), 3PL (+ adivinanza c) [1][2]. Solo 1PL es realista de calibrar con poca información: su puntaje bruto es un estadístico suficiente para la habilidad, así que la dificultad del ítem se puede estimar sin conocer primero la habilidad de nadie [2]. 2PL/3PL necesitan mucha más información — el propio equipo de calibración de Duolingo dice que la TRI tradicional "requires many test taker responses (e.g., hundreds) for each item" [4].
- Mecánica de CAT: seleccionar el ítem no usado que maximiza la información de Fisher en la habilidad estimada actual (informalmente, el ítem más cercano en dificultad a donde está el alumno ahora), actualizar la habilidad vía MLE (insesgado, indefinido para patrones de todo-correcto/todo-incorrecto) o Bayesiano EAP/MAP (maneja ese caso extremo vía un prior), y detenerse por un umbral de error estándar, un conteo fijo de ítems, o un umbral de confianza de clasificación [3]. El control de exposición evita que se muestre a todos el mismo mejor ítem: Sympson-Hetter bloquea probabilísticamente los ítems sobreexpuestos; "randomesque" elige al azar entre los 5-10 mejores [3][12][13]. Duolingo (2026) reemplaza el bloqueo por Thompson Sampling, integrando el límite de exposición directamente en la selección misma [5].
- El arranque en frío está nombrado y resuelto en producción: Duolingo distingue cold-start (ítem sin respuestas), jump-start (pocas respuestas piloto) y warm-start (recalibración del banco operativo), y calibra los ítems nuevos a partir de características de contenido (embeddings BERT, frecuencia léxica) vía AutoML, sin esperar cientos de respuestas [4].
- Elo es la alternativa práctica: actualiza la habilidad y el ítem en O(1) por respuesta, sin una fase de pilotaje separada; ya es el mecanismo recomendado en la investigación previa de este proyecto (tema 13, Math Garden) [9].
- ALEKS no usa una sola escala: aplica la Teoría de Espacios de Conocimiento, modelando el dominio como subconjuntos factibles de conceptos con estructura de prerrequisitos; el resultado es una posición en un grafo, no un número — el mejor precedente para el árbol de habilidades [7][8].
- El Duolingo English Test (V8) administra 18 ítems Sí/No-Vocabulario + 9 ítems de Vocabulario-en-Contexto por sesión (27 de 14 tipos de tarea totales), extraídos de bancos de 3,290 + 585 ítems [4].
- La documentación pública de NWEA MAP Growth, i-Ready, Khan Academy e IXL sobre sus algoritmos internos es mucho más escasa que la de Duolingo/ALEKS — solo confirma que son adaptativos, no las fórmulas [15][16][17].
- Un CAT de solo 5 ítems, repetido, logró una eficiencia comparable a un diseño pre-post completo en un estudio de 2024 — respalda empezar corto por tema en vez de un examen largo global [18].
- Recomendación central: dificultad experta 1-100 por ítem, selección "más cercano a la dificultad actual", actualización Elo con K decreciente, detención a los 10-15 ítems o por estabilidad, y una ruta de mejora hacia una TRI/Rasch calibrada con ≥200-400 respuestas por ítem.
Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.
Estado de verificación
Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.
[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.
Cómo se produjo esta investigación
Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.
Esto es investigación, no asesoría legal, médica ni financiera. Nada aquí reclama un resultado de aprendizaje de Math Challenge; ese estudio todavía no existe.
Findings
1. Fundamentos de la TRI — tres modelos anidados, uno realista para el arranque en frío
p(θ) = c + (1-c)·σ(a(θ-d)) da la probabilidad de acierto a partir de la habilidad θ y los parámetros del ítem: dificultad d, discriminación a, adivinanza c [1][4]. Fijar c=0, a=1 da 1PL/Rasch — la dificultad es el único parámetro libre del ítem, y su propiedad de estadístico suficiente permite estimar la dificultad del ítem por MLE condicional sin conocer primero la habilidad [2]. 2PL libera a: mayor discriminación significa que un ítem separa más limpiamente a quienes están justo debajo y justo encima de la dificultad [1]. 3PL agrega la adivinanza c, apropiada para ítems de opción múltiple (piso de ≈0.25 con cuatro opciones) [1]. Ambos necesitan sustancialmente más información por ítem que Rasch — el valor por defecto en la literatura es “cientos” de respuestas [1][4].
2. Mecánica de CAT — selección, estimación, detención, exposición
El ciclo: estimar θ a partir de las respuestas hasta el momento; elegir el ítem no usado que maximiza la información de Fisher en ese θ; administrarlo; actualizar; repetir [3]. El MLE es asintóticamente insesgado pero indefinido para patrones de respuesta perfectos/nulos; el Bayesiano EAP/MAP resuelve esto vía un prior a costa de un ligero sesgo [3]. Reglas de detención: umbral de error estándar (largo variable), conteo fijo de ítems, o umbral de confianza de clasificación para decisiones de aprobado/reprobado [3]. Sympson-Hetter genera un número aleatorio por cada ítem candidato contra un parámetro de exposición específico del ítem para bloquear probabilísticamente incluso al mejor ítem [3][12]. Randomesque selecciona de forma uniforme entre los 5-10 ítems más informativos [3]. Los estudios comparativos (Ozturk y Dogan 2015; Leroux et al. 2013, 2016) prueban estos métodos contra métodos más nuevos de “error estándar restringido progresivo” en modelos 3PL/GPC, y generalmente encuentran compensaciones entre precisión y exposición en lugar de un ganador claro [12][13][14]. El artículo S2A3 de Duolingo de 2026 reemplaza el bloqueo por Thompson Sampling, tratando los límites de exposición como restricciones estocásticas dentro de la selección del ítem [5]. El balanceo de contenido es la restricción ortogonal de que la selección también debe cumplir una mezcla de contenido objetivo, no solo maximizar la información [3].
3. El problema del arranque en frío, nombrado y resuelto por un sistema de producción en vivo
El artículo AutoIRT de Duolingo nombra exactamente la situación de Math Challenge: arranque en frío (cold-start: ítem nuevo, sin respuestas, calibrado solo a partir de características de contenido), arranque de salto (jump-start: pequeña muestra piloto mezclada con el banco operativo), arranque tibio (warm-start: recalibración a medida que cambian la población/UI/materiales de preparación) [4]. Su solución: un ensamble AutoML (bosques aleatorios, LightGBM, XGBoost, CatBoost) entrenado sobre las características de contenido del ítem, proyectado sobre parámetros TRI interpretables vía EM de Montecarlo, evitando la necesidad de cientos de respuestas en vivo antes de que un ítem sea usable [4]. Esto establece que una dificultad provisional, derivada de características/expertos, es un punto de partida profesional con una ruta de mejora real, no un atajo.
La alternativa compatible con un equipo pequeño es la calibración en línea basada en Elo: tanto AutoIRT como la literatura más amplia señalan a Elo como un procedimiento en línea de larga trayectoria para el modelo de Rasch, que actualiza las calificaciones de la persona y del ítem después de cada respuesta, sin un paso de ajuste fuera de línea [4][9]. Un artículo de EDM de 2019 (Abdi, Khosravi, Sadiq y Gasevic) extiende el Elo de un solo concepto a una forma multivariada para ítems con múltiples etiquetas, reportando una precisión predictiva mejorada [10]. El tema 13 de la propia investigación de este proyecto ya recomienda la regla HSHS de Elo/Math Garden como el precedente concreto: actualizaciones O(1) (buen ajuste para los Durable Objects), validadas en la aritmética infantil [9]. Una tercera vía, de etapa posterior: BOBCAT (Ghosh y Lan, 2021) enmarca la selección del ítem misma como optimización bi-nivel en lugar de información de Fisher pura — una mejora plausible de v2/v3 una vez que exista suficiente información registrada para entrenarla [11].
4. ALEKS y la Teoría de Espacios de Conocimiento — un grafo, no una escala
ALEKS se originó en UC Irvine en 1994 (financiado por la NSF), y fue adquirido por McGraw-Hill en 2013 [8]. La Teoría de Espacios de Conocimiento (Doignon y Falmagne) modela un dominio como un conjunto de conceptos Q; el estado de un alumno es un subconjunto factible, restringido por prerrequisitos, no cualquier subconjunto de Q [7]. Esto define un orden parcial sobre los estados factibles. El margen exterior es lo que el alumno está listo para aprender a continuación (con los prerrequisitos satisfechos); el margen interior es lo que se acaba de adquirir [7]. La evaluación de ALEKS reduce cuál estado factible ocupa un alumno, y luego recomienda el margen exterior — una ruta personalizada a través de un grafo de prerrequisitos, no un puntaje percentil [7][8]. Este es el diseño de referencia para una UI de árbol de habilidades, con la TRI/Elo manejando el ordenamiento de dificultad dentro de cada nodo.
5. Duolingo English Test — el CAT más concretamente documentado en edtech
En la versión del DET estudiada (V8), cada sesión corre 18 ítems Sí/No-Vocabulario (5 segundos cada uno, juzgando palabras reales frente a palabras falsas generadas algorítmicamente) y 9 ítems de Vocabulario-en-Contexto (20 segundos cada uno, completar el espacio en blanco) — 27 ítems de 14 tipos de tarea totales, extraídos de bancos de 3,290 y 585 ítems respectivamente [4]. θ se ubica en una escala continua con prior normal estándar (media cero, varianza uno), y el puntaje reportado es la media posterior, usando la posterior completa durante la calibración, no una estimación puntual [4]. Duolingo también ha publicado específicamente sobre IA responsable para esta prueba, enmarcando la calidad/equidad como una cadena continua de argumento de validez (definición del dominio → evaluación → generalización → explicación → extrapolación → utilización) — una forma de lista de verificación útil incluso fuera de las pruebas de admisión de alto riesgo [6].
6. NWEA, i-Ready, Khan Academy, IXL — detalle público más escaso
MAP Growth de NWEA reporta en una escala RIT propietaria (“Rasch unIT”), independiente del grado y continua; el centro de investigación de NWEA publica estudios de deriva de parámetros de ítem y de validación que presuponen una base TRI/Rasch, pero el algoritmo exacto de selección de ítems no se encontró en páginas públicas alcanzables en esta investigación [15]. Los propios materiales de Khan Academy describen el aprendizaje de dominio (mastery learning) como el modelo pedagógico, pero las mecánicas de colocación de su “Course challenge” no están detalladas en páginas de acceso abierto [16]. La página de producto de IXL declara llanamente que “the difficulty of the questions adapts automatically”, confirmando un comportamiento tipo CAT, sin publicar la escala, el conteo de ítems, ni la regla de selección [17]. El manual técnico de i-Ready no se pudo obtener en esta sesión; no se hace ninguna afirmación específica sobre él más allá de su existencia como diagnóstico adaptativo. Este vacío es en sí mismo un hallazgo: las literaturas de Duolingo y de ALEKS/académica son los planos utilizables para v1; los proveedores de diagnóstico K-12 tratan sus internos como secretos comerciales.
7. Cuántos ítems, y por tema frente a global
No existe un mínimo universal, pero dos datos acotan el rango. Los CAT de alto riesgo de largo fijo comúnmente corren decenas de ítems para lograr un objetivo estricto de error estándar [3]. Un estudio de 2024 que encadenó CAT cortos para el Force Concept Inventory encontró que administraciones adaptativas repetidas de 5 ítems (9 veces a lo largo de un semestre) alcanzaron una eficiencia “comparable to that of the pre-post method” para rastrear el cambio — específico del contexto (medición formativa repetida, no colocación de una sola vez), pero evidencia de que lo corto-y-repetido puede sustituir a lo largo-y-único [18]. Esto favorece la colocación por tema (10-15 ítems por rama, en línea con el brief del proyecto) sobre una prueba global larga y única: un niño puede colocarse en “aritmética de 3er grado” y “geometría de kínder” de forma simultánea, algo que un solo puntaje global no puede representar pero que sí pueden tanto un CAT por tema como el modelo de espacio de conocimiento de ALEKS [7].
8. Que no se sienta como un examen para un niño de 6 años
Ninguna fuente revisada aquí aborda directamente la experiencia de usuario infantil, pero dos hechos estructurales se traducen en restricciones. Debido a que el CAT apunta cada ítem cerca de la habilidad real del alumno por construcción, una colocación adaptativa bien implementada produce naturalmente una experiencia de éxito mixto en lugar de un muro de fracaso — el mecanismo mismo protege la sensación, siempre que la UI no edite encima de él (sin cuentas regresivas visibles ni zumbadores de respuesta incorrecta) [3]. Debido a que la colocación corta por tema (§7) es a la vez defendible y más adecuada para la capacidad de atención de un niño, se puede entregar como una secuencia de mini-juegos temáticos cortos en lugar de un examen continuo — construyendo sobre el precedente de Math Garden ya validado con niños del tema 13, en lugar de rederivar el tono aquí [9].
Implicaciones de diseño
- Usar dificultad provisional estilo Rasch (1PL) para v1, no 2PL/3PL. Con cero historial de respuestas, solo un único parámetro de dificultad por ítem es realista; la discriminación/adivinanza necesitan datos que v1 no tendrá [1][2][4].
- Algoritmo: dificultad etiquetada por expertos + selección por dificultad más cercana. Etiquetar cada ítem de 1 a 100 a mano. En cada paso, seleccionar el ítem no usado cuya etiqueta esté más cerca de la estimación de habilidad actual — un sustituto sin parámetros de la selección por máxima información de Fisher [3][4].
- Actualización de habilidad: Elo, no MLE/EAP.
ability += K * (outcome - expected), dondeexpectedes una función logística de (habilidad − dificultad del ítem), en línea con la forma de respuesta de Rasch; O(1) por respuesta, encaja con un Durable Object o una escritura en D1 por turno, consistente con el precedente del tema 13 [1][9]. - K decreciente dentro de una sola sesión. K grande para los primeros 3-4 ítems (convergencia rápida desde la estimación inicial sembrada por edad), K más pequeña después (estabilidad) — el análogo dentro de sesión del periodo de calificación provisional del Elo de ajedrez [9].
- Regla de detención: tope duro de 15 ítems, detención temprana desde el ítem 8 por estabilidad. Detenerse antes si las últimas 4 respuestas han alternado alrededor del mismo nivel (±1) sin deriva neta — un sustituto de “el error estándar es suficientemente pequeño” sin un modelo calibrado a partir del cual calcularlo [3].
- Colocación por tema, no un solo puntaje global, en línea con el modelo de muchos estados de ALEKS y con el propio árbol de habilidades del proyecto [7][8].
- La edad siembra solo el ítem 1; la estimación de habilidad gobierna todo lo demás. La entrada de edad es un prior, no un techo ni un piso — 2-3 respuestas deberían poder mover la estimación un nivel completo.
- Registrar cada respuesta (id del ítem, dificultad etiquetada, resultado) desde el día uno. Estos son exactamente los datos de “arranque de salto” que el equipo de Duolingo requiere antes de cualquier recalibración; sin ellos desde el lanzamiento, la implicación 9 empieza tarde [4].
- Ruta de mejora: reajustar en lote las dificultades etiquetadas hacia un modelo de Rasch real con ~200-400 respuestas/ítem, mezclando el prior experto con la estimación empírica en lugar de descartarlo, ya que el volumen por ítem será desigual [4].
- 2PL solo después de que Rasch sea estable y el volumen sea alto (“cientos” de respuestas según la literatura); omitir por completo los parámetros de adivinanza de 3PL a menos que el formato sea de opción múltiple fija, ya que de otro modo la adivinanza no es identificable [1][4].
- Control de exposición solo una vez que el tráfico supere al banco de ítems. En v1, simplemente evitar repetir un ítem dentro de una misma sesión; agregar el bloqueo estilo Sympson-Hetter o el randomesque de top-N solo cuando la telemetría muestre que un puñado de ítems domina la selección [3][12].
- UX por banda de edad: edades ~4-6 — un solo mini-juego guiado por personaje, sin puntaje/temporizador/lenguaje de “examen” visible, retroalimentación celebratoria sin importar el acierto, terminando en una transición narrativa, no una pantalla de resultados. Edades ~7-11 — una “misión de calentamiento” con una barra de progreso por conteo de ítems (nunca una barra de acierto), narrativa ligera, todavía sin mostrar puntaje numérico. Edades ~12-17 y adulto/experto — un encuadre transparente (“así podemos empezarte en el nivel correcto”) está bien y a menudo se prefiere, pero aun así evitar el lenguaje de “evaluación de tu habilidad”; una prueba adaptativa bien orientada está genuinamente más cerca de la práctica guiada que de presentar un examen una vez que está convergiendo correctamente, lo que respalda este encuadre en todas las edades [3].
- La edad es un tema y una semilla, nunca un límite duro de colocación — todo el punto de una prueba adaptativa, según el brief, es que la habilidad, no la edad, fija el nivel.
Preguntas abiertas para el dueño del proyecto
- ¿Colocación obligatoria antes de cualquier práctica, u opcional con un valor predeterminado por edad y una acción de “recalibrar” posterior?
- ¿Qué calendario de K para la actualización Elo de K decreciente — fijo (p. ej., 1.0 / 0.5 / 0.25) o ajustado empíricamente después del lanzamiento a partir de datos registrados?
- ¿Etiquetado de dificultad de ítems por un solo autor, o un proceso ligero de varios calificadores (2-3 personas, reconciliar desacuerdos) antes de publicar cualquier ítem?
- ¿Debería cada tema compartir un tope de 15 ítems, o las ramas amplias (p. ej., toda la aritmética) deberían tener un tope más largo que las estrechas (p. ej., la división larga)?
- Cuando la colocación difiere marcadamente de la edad declarada (un niño de 5 años colocado en 3er grado), ¿mostrarlo tal cual, suavizarlo, o pedirle primero confirmación al padre?
- ¿Es la recolocación periódica (cada N semanas, o después de M respuestas incorrectas en el nivel actual) una función de v1, o una adición posterior una vez que el ciclo principal esté validado?
- Dado lo escasa que es la documentación pública de NWEA/i-Ready/IXL/Khan Academy, ¿hay apetito por buscar sus manuales técnicos bajo acuerdos de datos de investigación, o la base de Duolingo/ALEKS/académica presentada aquí es suficiente por ahora?
Fuentes
- Wikipedia — Item response theory
- Wikipedia — Rasch model
- Wikipedia — Computerized adaptive testing
- Sharpnack, J., Mulcaire, P., Bicknell, K., LaFlair, G., & Yancey, K. (2024). AutoIRT: Calibrating Item Response Theory Models with Automated Machine Learning. arXiv:2409.08823
- Sharpnack, J., Tsigler, A., Lockwood, J.R., Nydick, S., & von Davier, A.A. (2026). S2A3: Thompson Sampling and Stochastic Exposure Control for High-Stakes CATs. arXiv:2606.07364
- Burstein, J., LaFlair, G.T., Yancey, K., von Davier, A.A., & Dotan, R. (2024). Responsible AI for Test Equity and Quality: The Duolingo English Test as a Case Study. arXiv:2409.07476
- Wikipedia — Knowledge space
- Wikipedia — ALEKS
- Wikipedia — Elo rating system
- Abdi, S., Khosravi, H., Sadiq, S., & Gasevic, D. (2019). A Multivariate Elo-based Learner Model for Adaptive Educational Systems. Proceedings of the 12th International Conference on Educational Data Mining (EDM 2019)
- Ghosh, A., & Lan, A. (2021). BOBCAT: Bilevel Optimization-Based Computerized Adaptive Testing. arXiv (IJCAI 2021)
- Ozturk, N.B., & Dogan, N. (2015). Investigating Item Exposure Control Methods in Computerized Adaptive Testing. Educational Sciences: Theory and Practice. ERIC EJ1057460
- Leroux, A.J., Lopez, M., Hembry, I., & Dodd, B.G. (2013). A Comparison of Exposure Control Procedures in CATs Using the 3PL Model. Educational and Psychological Measurement. ERIC EJ1019083
- Leroux, A.J., & Dodd, B.G. (2016). A Comparison of Exposure Control Procedures in CATs Using the GPC Model. Journal of Experimental Education
- Wikipedia — NWEA
- Wikipedia — Khan Academy
- IXL — Real-Time Diagnostic product page
- Yasuda, J., Hull, M.M., Mae, N., & Kojima, K. (2024). Chained computerized adaptive testing for the Force Concept Inventory. arXiv
- Math Challenge internal research, topic 13: Intelligent Tutoring Systems and Learner Modelling: BKT, DKT, PFA, and the Math Garden Elo Approach (2026-07-31), docs/research/2026-07-31-mc-13-its-knowledge-tracing-elo.md — the Elo/Math Garden precedent this document builds on rather than re-deriving
Preguntas que este documento le deja abiertas al dueño
Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.
- Mandatory placement before any practice, or optional with an age-default fallback and a later "recalibrate" action?
- What K schedule for the decreasing-K Elo update — fixed (e.g., 1.0 / 0.5 / 0.25) or tuned empirically post-launch from logged data?
- Single-author item-difficulty tagging, or a lightweight multi-rater process (2-3 people, reconcile disagreements) before any items ship?
- Should every topic share a 15-item cap, or should broad branches (e.g., all-of-arithmetic) get a longer cap than narrow ones (e.g., long division)?
- When placement disagrees sharply with stated age (a 5-year-old placing at 3rd grade), show it plainly, soften it, or ask the parent to confirm first?
- Is periodic re-placement (every N weeks, or after M wrong answers at the current tier) a v1 feature, or a later addition once the core loop is validated?
- Given how thin NWEA/i-Ready/IXL/Khan Academy's public documentation is, is there appetite to pursue their technical manuals under research-data agreements, or is the Duolingo/ALEKS/academic basis here sufficient for now?
Uno de 51 documentos de investigación, 168,346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio