Pruebas de nivel adaptativas y tests adaptativos informatizados (CAT): TRI, calibración en arranque en frío y espacios de conocimiento
Resumen ejecutivo
- TRI tiene tres modelos anidados: 1PL/Rasch (solo dificultad b), 2PL (+ discriminación a), 3PL (+ adivinanza c) [1][2]. Solo 1PL es calibrable con pocos datos: el puntuación bruto es estadístico suficiente para la habilidad, así que la dificultad se estima sin conocer la habilidad de nadie primero [2]. 2PL/3PL requieren “cientos” de respuestas por ítem según el propio equipo de psicometría de Duolingo [4].
- CAT selecciona el ítem de máxima información de Fisher para la habilidad estimada, actualiza por MLE o EAP/MAP bayesiano, y detiene por umbral de error estándar o longitud fija [3].
- Control de exposición: Sympson‑Hetter bloquea probabilísticamente ítems sobreexpuestos; “randomesque” elige al azar entre los 5‑10 mejores [3][12][13]. Duolingo (2026) reemplaza el bloqueo por Thompson Sampling, integrando el límite de exposición en la propia selección [5].
- El arranque en frío está nombrado y resuelto en producción: Duolingo distingue cold‑start (ítem sin respuestas), jump‑start (poca muestra piloto) y warm‑start (recalibración del banco operativo), y calibra ítems nuevos desde características de contenido (embeddings BERT, frecuencia léxica) vía AutoML, sin esperar cientos de respuestas [4].
- Elo es la alternativa práctica: actualiza la habilidad y el ítem en O(1) por respuesta, sin fase de piloto separada; ya es el mecanismo recomendado en la investigación previa de este proyecto (tema 13, Math Garden) [9].
- ALEKS no usa una escala única: aplica Knowledge Space Theory, modelando el dominio como subconjuntos factibles de conceptos con estructura de prerrequisitos; el resultado es una posición en un grafo, no un número — el mejor precedente para el árbol de habilidades [7][8].
- El Duolingo English Test (V8) administra 18 ítems Y/N Vocab + 9 Vocab‑in‑Context por sesión (27 de 14 tipos totales), de un banco de 3.290 + 585 ítems [4].
- La documentación pública de NWEA MAP Growth, i‑Ready, Khan Academy e IXL sobre sus algoritmos internos es mucho más escasa que la de Duolingo/ALEKS — solo confirma que son adaptativos, no las fórmulas [15][16][17].
- Un CAT de solo 5 ítems, repetido, logró eficiencia comparable a un diseño pre‑post completo en un estudio de 2024 — apoya empezar corto por tema en vez de un examen largo global [18].
- Recomendación central: dificultad experta 1‑100 por ítem, selección “más cercano a la dificultad actual”, actualización Elo con K decreciente, parada a los 10‑15 ítems o por estabilidad, y ruta de mejora hacia TRI/Rasch calibrado con ≥200‑400 respuestas por ítem.
Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.
Estado de verificación
Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.
[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.
Cómo se produjo esta investigación
Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.
Esto es investigación, no asesoría legal, médica ni financiera. Nada aquí reclama un resultado de aprendizaje de Math Challenge; ese estudio todavía no existe.
Resultados
1. Conceptos básicos de IRT — tres modelos anidados, uno realista para arranque en frío
p(θ) = c + (1‑c)·σ(a(θ‑d)) ofrece la probabilidad de respuesta correcta a partir de la habilidad θ y de los parámetros del ítem : dificultad d, discriminación a y adivinación c [1][4]. Fijar c=0, a=1 da el 1PL/Rasch — la dificultad es el único parámetro libre del ítem, y su propiedad de estadístico suficiente permite estimar la dificultad del ítem mediante MLE condicional sin conocer antes la habilidad [2]. El 2PL libera a: una mayor discriminación hace que el ítem separe con mayor claridad a los examinados justo por debajo y justo por encima de su dificultad [1]. El 3PL añade la adivinación c, apropiado para ítems de opción múltiple (≈0,25 de piso con cuatro opciones) [1]. Ambos requieren considerablemente más datos por ítem que el modelo Rasch — la práctica habitual en la literatura es “cientos” de respuestas [1][4].
2. Mecánica del CAT — selección, estimación, parada, exposición
El bucle: estimar θ a partir de las respuestas obtenidas; escoger el ítem no usado que maximice la información de Fisher en ese θ; administrarlo; actualizar; repetir [3]. El MLE es asintóticamente insesgado pero indefinido para patrones de respuestas perfectas o nulas; el EAP/MAP bayesiano lo resuelve mediante una distribución a priori a costa de un ligero sesgo [3]. Criterios de parada: umbral de error estándar (longitud variable), número fijo de ítems o umbral de confianza de clasificación para decisiones de aprobado/reprobado [3]. Sympson‑Hetter genera un número aleatorio por cada ítem candidato y lo compara con un parámetro de exposición específico del ítem para bloquear probabilísticamente incluso el ítem óptimo [3][12]. Randomesque selecciona uniformemente entre los 5‑10 ítems más informativos [3]. Estudios comparativos (Ozturk & Dogan 2015; Leroux et al. 2013, 2016) contrastan estos métodos con los más recientes de «error estándar progresivo‑restringido» sobre modelos 3PL/GPC, encontrando generalmente compromisos entre precisión y exposición más que un claro ganador [12][13][14]. El artículo de Duolingo 2026 S2A3 sustituye el bloqueo por muestreo de Thompson, tratando los límites de exposición como restricciones estocásticas dentro de la selección de ítems [5]. El balance de contenido es la restricción ortogonal que obliga a que la selección también cumpla un objetivo de mezcla de contenidos, no solo a maximizar la información [3].
3. El problema de arranque en frío, nombrado y resuelto por un sistema de producción en vivo
El artículo AutoIRT de Duolingo nombra exactamente la situación de Math Challenge: cold‑start (ítem nuevo, sin respuestas, calibrado solo a partir de características de contenido), jump‑start (pequeña muestra piloto combinada con el banco operativo) y warm‑start (recalibración a medida que la población/UI/materiales de preparación cambian) [4]. Su solución: un conjunto AutoML (bosques aleatorios, LightGBM, XGBoost, CatBoost) entrenado con características de contenido del ítem, proyectado a parámetros interpretables de IRT mediante Monte Carlo EM, evitando la necesidad de cientos de respuestas en vivo antes de que el ítem sea utilizable [4]. Esto demuestra que una dificultad provisional derivada de características/expertos constituye un punto de partida profesional con una ruta de mejora real, no un atajo.
Una alternativa compatible con equipos pequeños es la calibración en línea basada en Elo: tanto AutoIRT como la literatura más amplia citan Elo como un procedimiento en línea de larga data para el modelo Rasch, actualizando las puntuaciones de personas e ítems tras cada respuesta sin paso de ajuste offline [4][9]. Un artículo EDM 2019 (Abdi, Khosravi, Sadiq & Gasevic) amplía el Elo de un solo concepto a una forma multivariante para ítems multietiquetados, reportando mayor exactitud predictiva [10]. El tema 13 de la propia investigación de este proyecto ya recomienda la regla HSHS de Math Garden basada en Elo como precedente concreto: actualizaciones O(1) (adecuadas para Durable Objects), validadas en aritmética infantil [9]. Una tercera vía, de fase posterior: BOBCAT (Ghosh & Lan, 2021) plantea la selección de ítems como una optimización bi‑nivel en lugar de pura información de Fisher — una posible actualización v2/v3 una vez que exista suficiente registro de datos para entrenarla [11].
4. ALEKS y la teoría del espacio de conocimiento — un grafo, no una escala
ALEKS se originó en UC Irvine en 1994 (financiado por NSF) y fue adquirido por McGraw‑Hill en 2013 [8]. La teoría del espacio de conocimiento (Doignon & Falmagne) modela un dominio como conjunto de conceptos Q; el estado de un aprendiz es un subconjunto factible, limitado por prerrequisitos, no cualquier subconjunto de Q [7]. Esto define un orden parcial sobre los estados factibles. La franja exterior es lo que el aprendiz está listo para aprender a continuación (prerrequisitos satisfechos); la franja interior es lo que acaba de adquirir [7]. La valoración de ALEKS reduce cuál estado factible ocupa el aprendiz y luego recomienda la franja exterior — un camino personalizado a través de un grafo de prerrequisitos, no una puntuación percentílica [7][8]. Este es el diseño de referencia para una interfaz de árbol de habilidades, con IRT/Elo gestionando el orden de dificultad dentro del nodo.
5. Duolingo English Test — el CAT más documentado en ed‑tech
En la versión del DET estudiada (V8), cada sesión incluye 18 ítems de vocabulario Sí/No (5 s cada uno, juzgando palabras reales frente a falsas generadas algorítmicamente) y 9 ítems de vocabulario en contexto (20 s cada uno, completar el hueco) — 27 ítems para dos de los 14 tipos de tarea totales, extraídos de bancos de 3.290 y 585 ítems respectivamente [4]. θ se sitúa en una escala continua Normal de media cero y varianza uno a priori, y la puntuación reportada es la media a posteriori usando la distribución completa durante la calibración, no una estimación puntual [4]. Duolingo también ha publicado específicamente sobre IA responsable para este examen, enmarcando calidad/equidad como una cadena continua de argumentación de validez (definición del dominio → evaluación → generalización → explicación → extrapolación → utilización) — una lista útil incluso fuera de los exámenes de admisión de alto riesgo [6].
6. NWEA, i‑Ready, Khan Academy, IXL — detalle público más escaso
El MAP Growth de NWEA informa sobre una escala RIT (“Rasch unIT”), independiente del curso y continua; el centro de investigación de NWEA publica estudios de deriva de parámetros de ítems y de validación que presuponen una base IRT/Rasch, pero no se encontró el algoritmo exacto de selección de ítems en las páginas públicas accesibles en esta investigación [15]. Los materiales propios de Khan Academy describen el aprendizaje basado en la maestría como modelo pedagógico, pero sus mecánicas de «Course challenge» no se detallan en páginas accesibles públicamente [16]. La página de producto de IXL afirma claramente que “la dificultad de las preguntas se adapta automáticamente”, confirmando un comportamiento tipo CAT, sin publicar la escala, el número de ítems ni la regla de selección [17]. El manual técnico de i‑Ready no fue recuperable en esta sesión; no se hace ninguna afirmación específica más allá de su existencia como diagnóstico adaptativo. Esta ausencia constituye, a su vez, un hallazgo: la literatura de Duolingo y ALEKS/academia son los planos utilizables para la v1; los proveedores K‑12 tratan sus internos como secretos comerciales.
7. Cuántos ítems, y por tema vs. global
No existe un mínimo universal, pero dos datos delimitan el rango. Los CAT de alta relevancia de longitud fija suelen llegar a decenas de ítems para alcanzar un objetivo de error estándar estricto [3]. Un estudio 2024 que encadenó CAT cortos para el Force Concept Inventory encontró que administraciones adaptativas repetidas de 5 ítems (9 veces a lo largo de un semestre) alcanzaron una eficiencia «comparable a la del método pre‑post» para seguir el cambio — contexto específico (medición formativa repetida, no una única prueba de colocación), pero evidencia de que lo corto y repetido puede sustituir a lo largo y único [18]. Esto favorece la colocación por tema (10‑15 ítems por rama, según el encargo del proyecto) sobre una única prueba global: un niño puede situarse en «aritmética de 3.º de primaria» y «geometría de infantil» simultáneamente, algo que una puntuación global única no puede representar pero que tanto un CAT por tema como el modelo de espacio de conocimiento de ALEKS sí pueden [7].
8. No sentir que es una prueba para un niño de 6 años
Ninguna fuente revisada aborda directamente la UX infantil, pero dos hechos estructurales se traducen en restricciones. Dado que el CAT sitúa cada ítem cerca de la habilidad real del aprendiz por construcción, una colocación adaptativa bien implementada genera naturalmente una experiencia de éxito mixto en lugar de una pared de fracasos — el propio mecanismo protege la sensación, siempre que la UI no editorialice sobre él (sin cronómetros visibles ni zumbidos por respuesta errónea) [3]. Además, la colocación corta y por tema (§7) es tanto defendible como más adecuada a la capacidad de atención de un niño; puede entregarse como una sucesión de mini‑juegos temáticos breves en lugar de un examen continuo — basándose en el precedente ya validado para niños de Math Garden del tema 13, sin necesidad de redefinir el tono aquí [9].
Design implications
- Utilizar dificultad provisional al estilo Rasch (1PL) para la v1, no 2PL/3PL. Con historial de respuestas nulo, solo un parámetro de dificultad por ítem es realista; la discriminación/azar requieren datos que la v1 no dispondrá [1][2][4].
- Algoritmo: dificultad etiquetada por expertos + selección de dificultad más cercana. Etiquetar manualmente cada ítem del 1 al 100. En cada paso, seleccionar el ítem no usado cuya etiqueta esté más próxima a la estimación actual de capacidad — una alternativa sin parámetros a la selección de máxima información de Fisher [3][4].
- Actualización de la capacidad: Elo, no MLE/EAP.
ability += K * (outcome - expected),expectedes una función logística de (capacidad − dificultad del ítem), coincidiendo con la forma de respuesta de Rasch; O(1) por respuesta, se adapta a un Durable Object o a una escritura D1 por turno, coherente con el precedente del tema‑13 [1][9]. - Disminución de K dentro de una sesión. K grande para los primeros 3‑4 ítems (convergencia rápida a partir de la estimación basada en la edad), K menor después (estabilidad) — el análogo dentro de la sesión al período de valoración provisional del Elo en ajedrez [9].
- Regla de parada: límite estricto de 15 ítems, parada anticipada a partir del ítem 8 si hay estabilidad. Detenerse antes si las últimas 4 respuestas han alternado alrededor del mismo nivel (±1) sin deriva neta — un proxy de «el error estándar es suficientemente pequeño» sin un modelo calibrado para calcular el error estándar a partir de [3].
- Ubicación por tema, no una puntuación global, en consonancia con el modelo de muchos estados de ALEKS y con el árbol de habilidades propio del proyecto [7][8].
- La edad solo alimenta el ítem 1; la estimación de capacidad rige todo lo demás. La edad es un prior, no un techo ni un suelo — 2‑3 respuestas deberían poder mover la estimación un nivel completo.
- Registrar cada respuesta (identificador del ítem, dificultad etiquetada, resultado) desde el primer día. Estos son exactamente los datos de «arranque» que el equipo de Duolingo necesita antes de cualquier recalibración; sin ellos desde el lanzamiento, la implicación 9 se retrasa [4].
- Ruta de mejora: re‑ajustar por lotes las dificultades etiquetadas a un modelo Rasch real con aproximadamente 200‑400 respuestas/ítem, combinando el prior de experto con la estimación empírica en lugar de descartarlo, ya que el volumen por ítem será desigual [4].
- 2PL solo después de que el modelo Rasch sea estable y el volumen sea alto («cientos» de respuestas según la literatura); omitir por completo los parámetros de adivinanza 3PL a menos que el formato sea de opción múltiple fija, ya que la adivinanza no es identificable de otro modo [1][4].
- Control de exposición solo cuando el tráfico supera al conjunto de ítems. En la v1, basta con evitar repetir un ítem dentro de una sesión; añadir bloqueo al estilo Sympson‑Hetter o una selección aleatoria de los N mejores solo cuando la telemetría muestre que unos pocos ítems dominan la selección [3][12].
- UX por franja de edad: edades ~4‑6 — mini‑juego guiado por un solo personaje, sin puntuación, temporizador o lenguaje de «prueba» visible, retroalimentación celebratoria independientemente de la corrección, finalizando con una transición narrativa, no con una pantalla de resultados. Edades ~7‑11 — una «misión de calentamiento» con una barra de progreso del número de ítems (nunca una barra de aciertos), narrativa ligera, sin mostrar puntuación numérica. Edades ~12‑17 y adultos/expertos — encuadre transparente («para poder situarte en el nivel adecuado») está bien y suele preferirse, pero sigue evitándose el lenguaje de «evaluación de tu capacidad»; una prueba adaptativa bien dirigida se asemeja más a una práctica guiada que a un examen una vez que converge correctamente, lo que respalda este encuadre a cualquier edad [3].
- La edad es un tema y una semilla, nunca un límite rígido de ubicación — el objetivo de una prueba adaptativa según el encargo es que la capacidad, no la edad, determina el nivel.
Open questions for the project owner
- ¿Ubicación obligatoria antes de cualquier práctica, o opcional con un valor predeterminado por edad y una acción posterior de «recalibrar»?
- ¿Qué calendario de K para la actualización Elo con K decreciente — fijo (p. ej., 1,0 / 0,5 / 0,25) o ajustado empíricamente después del lanzamiento a partir de los datos registrados?
- ¿Etiquetado de dificultad de ítems por un único autor, o un proceso ligero de varios evaluadores (2‑3 personas, reconciliación de discrepancias) antes de lanzar cualquier ítem?
- ¿Debe cada tema compartir un límite de 15 ítems, o las ramas amplias (p. ej., todo aritmética) deberían tener un límite mayor que las estrechas (p. ej., división larga)?
- Cuando la ubicación difiere notablemente de la edad declarada (un niño de 5 años situado en 3.º de primaria), ¿mostrarlo de forma clara, suavizarlo o pedir primero la confirmación del progenitor?
- ¿Es la reubicación periódica (cada N semanas, o tras M respuestas erróneas en el nivel actual) una característica de la v1, o una incorporación posterior una vez validado el bucle principal?
- Dada la escasez de documentación pública de NWEA/i‑Ready/IXL/Khan Academy, ¿existe interés en obtener sus manuales técnicos bajo acuerdos de datos de investigación, o la base Duolingo/ALEKS/académica aquí es suficiente por el momento?
Fuentes
- Wikipedia — Item response theory
- Wikipedia — Rasch model
- Wikipedia — Computerized adaptive testing
- Sharpnack, J., Mulcaire, P., Bicknell, K., LaFlair, G., & Yancey, K. (2024). AutoIRT: Calibrating Item Response Theory Models with Automated Machine Learning. arXiv:2409.08823
- Sharpnack, J., Tsigler, A., Lockwood, J.R., Nydick, S., & von Davier, A.A. (2026). S2A3: Thompson Sampling and Stochastic Exposure Control for High-Stakes CATs. arXiv:2606.07364
- Burstein, J., LaFlair, G.T., Yancey, K., von Davier, A.A., & Dotan, R. (2024). Responsible AI for Test Equity and Quality: The Duolingo English Test as a Case Study. arXiv:2409.07476
- Wikipedia — Knowledge space
- Wikipedia — ALEKS
- Wikipedia — Elo rating system
- Abdi, S., Khosravi, H., Sadiq, S., & Gasevic, D. (2019). A Multivariate Elo-based Learner Model for Adaptive Educational Systems. Proceedings of the 12th International Conference on Educational Data Mining (EDM 2019)
- Ghosh, A., & Lan, A. (2021). BOBCAT: Bilevel Optimization-Based Computerized Adaptive Testing. arXiv (IJCAI 2021)
- Ozturk, N.B., & Dogan, N. (2015). Investigating Item Exposure Control Methods in Computerized Adaptive Testing. Educational Sciences: Theory and Practice. ERIC EJ1057460
- Leroux, A.J., Lopez, M., Hembry, I., & Dodd, B.G. (2013). A Comparison of Exposure Control Procedures in CATs Using the 3PL Model. Educational and Psychological Measurement. ERIC EJ1019083
- Leroux, A.J., & Dodd, B.G. (2016). A Comparison of Exposure Control Procedures in CATs Using the GPC Model. Journal of Experimental Education
- Wikipedia — NWEA
- Wikipedia — Khan Academy
- IXL — Real-Time Diagnostic product page
- Yasuda, J., Hull, M.M., Mae, N., & Kojima, K. (2024). Chained computerized adaptive testing for the Force Concept Inventory. arXiv
- Math Challenge internal research, topic 13: Intelligent Tutoring Systems and Learner Modelling: BKT, DKT, PFA, and the Math Garden Elo Approach (2026-07-31), docs/research/2026-07-31-mc-13-its-knowledge-tracing-elo.md — the Elo/Math Garden precedent this document builds on rather than re-deriving
Preguntas que este documento le deja abiertas al dueño
Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.
- Mandatory placement before any practice, or optional with an age-default fallback and a later "recalibrate" action?
- What K schedule for the decreasing-K Elo update — fixed (e.g., 1.0 / 0.5 / 0.25) or tuned empirically post-launch from logged data?
- Single-author item-difficulty tagging, or a lightweight multi-rater process (2-3 people, reconcile disagreements) before any items ship?
- Should every topic share a 15-item cap, or should broad branches (e.g., all-of-arithmetic) get a longer cap than narrow ones (e.g., long division)?
- When placement disagrees sharply with stated age (a 5-year-old placing at 3rd grade), show it plainly, soften it, or ask the parent to confirm first?
- Is periodic re-placement (every N weeks, or after M wrong answers at the current tier) a v1 feature, or a later addition once the core loop is validated?
- Given how thin NWEA/i-Ready/IXL/Khan Academy's public documentation is, is there appetite to pursue their technical manuals under research-data agreements, or is the Duolingo/ALEKS/academic basis here sufficient for now?
Uno de 51 documentos de investigación, 168.346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio