Math Challenge
Más

Espaciado, práctica de recuperación e intercalado aplicados a las matemáticas

mc-05 · Publicado: · de Math Challenge Research · 2560 palabras · 16 fuentes citadas

Resumen ejecutivo

343 palabras

Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.

Estado de verificación

Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.

[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.

Cómo se produjo esta investigación

Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.

Findings

1. Práctica intercalada en matemáticas (Rohrer & Taylor)

Los estudios de laboratorio de Rohrer y Taylor hicieron que niños practicaran cuatro tipos de problemas matemáticos ya sea de forma bloqueada (AAAA BBBB) o intercalada (ABCD ABCD). La intercalación deterioró el rendimiento durante la sesión, pero duplicó las puntuaciones en la prueba del día siguiente [1] — el patrón característico de una dificultad deseable.

Taylor & Rohrer (2010, Applied Cognitive Psychology) realizaron un ensayo controlado aleatorizado (RCT) en el aula: alumnos de 7.º curso (n=140) recibieron práctica bloqueada o intercalada durante nueve semanas y fueron evaluados sin previo aviso dos semanas después. El material con práctica intercalada obtuvo puntuaciones más altas [2][3].

Rohrer, Dedrick & Stershic (2015, J. Educational Psychology 107(3), 900‑908) llevaron a cabo un RCT de dosis‑respuesta (n=126, 7.º curso): una mayor dosis de intercalación en las mismas hojas de ejercicios elevó las puntuaciones tanto a ~2‑day como a 1‑month de retraso, sin tiempo de práctica adicional [4]. El beneficio no es un artefacto de la similitud superficial entre tipos de problemas — se mantiene incluso cuando los problemas intercalados son bastante diferentes, lo que concuerda con la idea de que la intercalación entrena la selección de estrategia, no la memorización mecánica [5]. Las encuestas a docentes valoraron la intercalación como altamente factible — solo requiere reordenar los problemas existentes [2][3].

2. Dificultades deseables de Bjork (UCLA)

Robert & Elizabeth Bjork (1994) acuñaron el término «dificultades deseables»: condiciones que ralentizan la adquisición a menudo mejoran la retención y transferencia a largo plazo, porque el rendimiento durante el aprendizaje y el propio aprendizaje son disociables [6]. Cinco dificultades cuentan con fuerte evidencia: espaciado, intercalación, práctica de recuperación, generación y práctica variada [7]. Un diseño instruccional optimizado para sesiones fluidas y sin errores (repetición masiva, bloqueo, relectura) produce un aprendizaje que se siente bien pero no perdura.

3. El efecto de la prueba (Roediger & Karpicke)

Roediger & Karpicke (2006) compararon el estudio repetido con la prueba repetida del mismo material. Inmediatamente después, los estudiantes parecían mejores (~83 % vs. ~71 % de recuerdo); una semana después el patrón se invertía (~40 % vs. ~61 %) [8]. El beneficio de la práctica de recuperación crece con el retraso antes de la prueba criterial — el mismo sello que la intercalación. Implicación: un bucle «respuesta, luego retroalimentación» debería ser el evento principal de aprendizaje, no una evaluación añadida a la instrucción.

4. Intervalos de espaciado óptimos — la línea de cresta temporal de Cepeda et al.

Cepeda, Vul, Rohrer, Wixted & Pashler (2008, Psychological Science, >1.350 sujetos) variaron la brecha entre estudio y reaprendizaje y evaluaron la retención hasta un año después. La brecha óptima no es fija — como fracción del retraso final de la prueba oscila entre ~20‑40 % para un objetivo de 1 semana y ~5‑10 % para un objetivo de 1 año [9]. El repaso intensivo antes de una prueba que se necesita recordar durante un año está sub‑espaciado; espaciar revisiones a un mes de distancia para recordar algo durante una semana está sobre‑espaciado — precisamente la tensión que los planificadores adaptativos (SM‑2, FSRS, HLR) pretenden resolver.

5. Algoritmos de repetición espaciada usados en software real

Leitner (1972). Las tarjetas se organizan en cajas (clásicamente 5) con cadencias fijas (~1, 2, 4, 7, 14 días); una respuesta correcta la promueve, una incorrecta la devuelve a la caja 1 [14].

SM‑2 (Woźniak, 1987). Cada ítem tiene un factor de facilidad (EF), que comienza en 2,5 y tiene un mínimo de 1,3. Intervalos: I(1)=1, I(2)=6, I(n)=I(n‑1)×EF a partir de entonces. Una valoración de calidad de 0‑5 ajusta EF mediante
EF’ = EF + (0,1 − (5−Q)×(0,08 + (5−Q)×0,02)); Q<3 restablece el ítem [15].

FSRS (predeterminado actual de Anki). Controla tres variables de estado por tarjeta: Estabilidad S (días hasta que la probabilidad de recuerdo decae al 90 %), Dificultad D (1‑10) y Recuperabilidad R (0‑1, que decae según una curva de ley de potencias, no exponencial). Un único control, retención deseada (típicamente 0,85‑0,95, por defecto ~0,90), dirige el planificador a invertir la curva de olvido y elegir el intervalo donde la R prevista alcanza ese objetivo. FSRS‑6 ajusta ~19‑21 pesos por alumno a partir del historial de repeticiones mediante descenso de gradiente, superando al factor de facilidad fijo de SM‑2 una vez que existen suficientes datos (~1.000+ repeticiones) [10].

Half‑Life Regression (Duolingo; Settles & Meeder, 2016, ACL). Modela la media vida de la memoria h de cada ítem como una función log‑lineal del número de aciertos y errores previos; la probabilidad de recuerdo p = 2^(−Δt/h) — una curva exponencial explícita (frente a la ley de potencias de FSRS). Reduce el error de predicción en más del 45 % frente a las líneas base y aumentó la participación diaria en un 12 % en un experimento A/B en vivo [11].

Hilo común. Los cuatro programan la siguiente exposición para el momento en que la probabilidad de recuerdo está a punto de cruzar un umbral objetivo — no antes (repetición desperdiciada), no mucho después (ya olvidado). Diferen en que la curva de olvido es fija (Leitner, SM‑2) o se ajusta por ítem/alumno (FSRS, HLR), y en la forma exponencial versus ley de potencias.

6. Umbrales de aprendizaje maestro

El aprendizaje maestro de Bloom exige una precisión de ~80‑90 % antes de avanzar, con remediación por debajo del umbral [12][13]. Un proxy barato y frecuente, sobre todo en programas de fluidez de hechos K‑12, es «N respuestas correctas consecutivas» (a menudo 3), que se restablece limpiamente ante una respuesta errónea [13]. Investigaciones recientes de tutoría adaptativa hallaron que elevar la barra de dominio de ~0,95 a ~0,98 de probabilidad estimada de dominio mejoró el rendimiento en lecciones subsiguientes dependientes — el umbral tradicional subestima los contenidos prerrequisitos [12]. La literatura sobre fluidez de hechos subraya que el dominio debe evaluarse después de un intervalo, no solo en la sesión de entrenamiento, ya que la precisión de recuerdo inmediato sobrestima el dominio duradero [13].

7. Curvas de olvido

La curva clásica de Ebbinghaus muestra una pérdida temprana pronunciada (~42 % olvidado en los primeros 20 minutos, ~67 % en las primeras 24 horas) y luego una larga cola aplanada [16]. Ebbinghaus la modeló como aproximadamente exponencial, pero el consenso moderno — y la razón por la que FSRS sustituyó su propio modelo exponencial por una curva de ley de potencias en FSRS‑4,5/6 — es que el olvido real se desacelera más rápido de lo que predice una decadencia puramente exponencial [16][10].

8. Habilidad procedimental vs. comprensión conceptual en matemáticas

El trabajo de Rohrer/Taylor se centra en la habilidad procedimental: qué método aplicar a cada problema. Se teoriza que el beneficio de la intercalación proviene de la práctica de discriminación — notar qué estrategia requiere un problema, algo que la práctica bloqueada nunca exige porque el bloque revela la estrategia [1][2][5]. Para la comprensión conceptual, el espaciado y la práctica de recuperación siguen ayudando mediante el mismo mecanismo de fortalecimiento de trazas, pero la intercalación aporta valor de transferencia — reconocer la aplicabilidad de un concepto en un contexto mixto y novedoso [6][7][8]. En resumen: la fluidez procedimental necesita recuperación espaciada y intercalada; la comprensión conceptual necesita recuperación espaciada y gana aún más con la intercalación cuando varios conceptos están activos.

Implicaciones de diseño para Math Challenge

  1. Programar por nodo de habilidad, no por pregunta. Seguimos unidades como «sustracción de 2 cifras con préstamo» como entidad programable: las habilidades matemáticas se generalizan a lo largo de muchas instancias de preguntas, a diferencia de las tarjetas de aprendizaje.

  2. Algoritmo recomendado concreto: FSRS‑lite con arranque en frío tipo Leitner. Las habilidades nuevas con <20 puntos de datos usan una escalera tipo Leitner sencilla (1 → 3 → 7 → 16 → 35 días, reinicio ante respuesta errónea, sin ajuste necesario). Cuando se acumulan suficientes intentos, se pasa a un modelo estilo FSRS sembrado con los pesos predeterminados de FSRS‑6 publicados, reajustándose periódicamente sin conexión. Se expone un único control ajustable: retención deseada = 0,90 por defecto, ajustable por tramo de curso (0,85 para las edades más jóvenes para reducir la frustración, 0,92+ para usuarios mayores/competitivos).

  3. Umbral de dominio en dos fases. Exigir 3 respuestas correctas consecutivas con dificultad creciente dentro de una habilidad como señal de «aprendida provisionalmente» (la convención habitual de fluidez de hechos [13]), pero no marcar una habilidad como «maestra» para la programación hasta que también supere una revisión espaciada correcta con una separación ≥3 días — codificando directamente la lección del efecto de prueba que las rachas de recuerdo inmediato sobreestiman el aprendizaje duradero.

  4. Nunca bloquear la práctica por habilidad una vez que haya 2 o más habilidades en rotación. Cuando una segunda habilidad está pendiente de revisión, intercalar esa habilidad con la lección actual dentro de la misma sesión (ABAB/ABCABC), en lugar de terminar los problemas de una habilidad antes de comenzar la siguiente — el cambio de mayor impacto y coste cero que respalda la literatura [1][2][4].

  5. Proporción de intercalado en la sesión: ~40‑60 % de contenido nuevo/de la lección actual mezclado con ~40‑60 % pendiente de revisión, extraído de 2‑4 otras habilidades, intercalado a nivel de pregunta (no en subbloques de 3‑4 problemas del mismo tipo). Para educación infantil, sesgar hacia 70/30 nuevo/revisión y entrelazar como máximo 2 habilidades, dadas las restricciones de la memoria de trabajo que la literatura sobre dificultades deseables señala como condición límite [6][7].

  6. Las revisiones son siempre de recuperación, nunca de reexposición pasiva. Un evento de revisión obliga al niño a producir una respuesta antes de que aparezca cualquier explicación, incluso para material «ya aprendido» [8].

  7. Escalar los intervalos de revisión según la duración que la habilidad debe mantenerse, no según una cadencia de calendario fija. Etiquetar las habilidades como «unit‑scoped» (intervalos más estrechos, ~20‑30 % de la ventana de retención) frente a «foundational» (intervalos progresivamente más amplios, ~5‑10 % de un horizonte de un año una vez bien establecidas), según la línea de referencia de Cepeda [9].

  8. Seguir la Dificultad por separado de la Estabilidad por habilidad, como hace FSRS, de modo que un niño que tiene dificultades reciba tanto un intervalo siguiente más corto como menores ganancias de estabilidad por respuesta correcta que uno que la encuentra fácil — evitando que un algoritmo de facilidad fija trate una conjetura afortunada igual que un dominio genuino.

  9. Modelar el olvido con una curva de ley de potencias, no con una exponencial pura, para estimaciones de ubicación/dificultad adaptativa de «cuánto ha olvidado este niño desde la última práctica» — una exponencial pura sobrestima el olvido en retrasos largos y lo subestima poco después del aprendizaje [16][10].

  10. Instrumentar ambas firmas de Rohrer como métricas internas. Seguir la precisión en la misma sesión y la precisión de recuerdo diferido (p. ej., un breve cuestionario de calentamiento sobre las habilidades de ayer) como KPIs separados; esperar que la precisión en sesiones intercaladas a veces parezca más baja que en sesiones bloqueadas mientras que la precisión diferida sea mayor — no permitir que una caída de precisión en la misma sesión dispare el retorno al bloqueo.

  11. Informar «practicado» frente a «aprendido» por separado a padres y docentes. Mostrar la señal de dominio en dos fases (punto 3) en lugar de la precisión bruta de la sesión, evitando la trampa donde una racha del mismo día parece dominio y luego falla en la siguiente revisión no anunciada.

  12. La retroalimentación del tutor IA debe incitar a la recuperación antes de revelar las soluciones. Ante una respuesta errónea, ofrecer primero una pista estructurada para la recuperación (efecto de generación [6][7]); reservar ejemplos trabajados completos para un segundo intento erróneo.

Preguntas abiertas para el responsable del proyecto

  1. ¿Debe el estado de programación vivir solo por niño‑por‑habilidad, o también debemos mantener un ajuste de parámetros FSRS a nivel poblacional para sembrar los horarios de los niños nuevos antes de que exista suficiente datos propios?
  2. ¿Debe la retención deseada ser un 0,90 fijo en toda la plataforma, o un control ajustable para usuarios mayores/de nivel doctorado al estilo de Anki para usuarios avanzados?
  3. ¿Debe el etiquetado de habilidades «unit‑scoped» frente a «foundational» elaborarse manualmente por nodo curricular, o inferirse a partir de la profundidad del grafo de prerrequisitos?
  4. ¿Interactúa la proporción de intercalado con el sistema de señales conductuales anti‑trampa — hace que la mezcla de tipos de habilidad facilite o dificulte la detección de patrones temporales?
  5. ¿Debe la barra de dominio en dos fases (racha + revisión diferida) bloquear el progreso al siguiente unidad curricular, o solo afectar la programación de revisiones mientras el progreso se mantiene bajo un umbral de precisión separado?

Fuentes

  1. Rohrer & Taylor, "The shuffling of mathematics problems improves learning"
  2. Taylor & Rohrer (2010), "The effects of interleaved practice," Applied Cognitive Psychology 24, 837-848
  3. IES WWC Study 89950, interleaved mathematics practice classroom RCT
  4. Rohrer, Dedrick & Stershic (2015), "Interleaved practice improves mathematics learning," Journal of Educational Psychology 107(3), 900-908
  5. Rohrer et al. (2014), "The benefit of interleaved mathematics practice is not limited to superficially similar kinds of problems"
  6. Bjork & Bjork (2011), "Making things hard on yourself, but in a good way: Creating desirable difficulties to enhance learning"
  7. "Desirable Difficulties: Bjork's 5 Principles"
  8. Roediger & Karpicke (2006), "Test-Enhanced Learning" / "The Power of Testing Memory," Perspectives on Psychological Science 1(3), 181-210
  9. Cepeda, Vul, Rohrer, Wixted & Pashler (2008), "Spacing Effects in Learning: A Temporal Ridgeline of Optimal Retention," Psychological Science
  10. FSRS algorithm documentation
  11. Settles & Meeder (2016), "A Trainable Spaced Repetition Model for Language Learning," ACL
  12. "How Much Mastery is Enough Mastery?" EDM 2025
  13. "The Importance of Math Fact Fluency: Evidence-Informed Classroom Practices"
  14. Leitner system overview
  15. SuperMemo SM-2 algorithm original specification
  16. Ebbinghaus forgetting curve

Preguntas que este documento le deja abiertas al dueño

Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.

Uno de 51 documentos de investigación, 168.346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio