Datos conductuales/de proceso en sistemas de aprendizaje: qué significan la vacilación y el tiempo, y dónde la ley de privacidad infantil traza el límite
Resumen ejecutivo
La telemetría de proceso — cuánto tarda un niño en responder, si borra y reescribe, si cambia una respuesta antes de enviarla — es información real sobre el aprendizaje, no solo ruido. Tres hallazgos robustos: (1) cambiar una respuesta en un examen de opción múltiple ayuda más de lo que perjudica — el 51 % de los cambios van de incorrecto a correcto, solo el 25 % al revés, y el 79 % de quienes cambian alguna respuesta mejora su puntuación [1]; (2) el tiempo de respuesta muy corto («rapid guessing») señala desconexión, no dominio, y el PISA lo usa para filtrar respuestas inválidas mediante el «response time effort» de Wise & Kong [4][5]; (3) «gaming the system» (adivinar sistemáticamente, pedir ayuda hasta que el sistema lo resuelve) se detecta desde los registros con buena precisión (A'=0,85–0,96), pero el propio trabajo de Baker et al. advierte que un detector usado para penalizar se vuelve blanco de manipulación [2][3].
La conclusión de diseño más importante es una prohibición: nunca uses la latencia bruta ni el recuento de borrados como penalización directa de la puntuación. Un niño reflexivo que se autocorrige es indistinguible, en datos crudos, de uno inseguro que titubea — penalizar ese patrón castiga justo el comportamiento metacognitivo que se busca fomentar. Lo defendible es usar las señales para adaptar (dificultad, pistas, ritmo) y detectar patrones agregados de desconexión, nunca eventos individuales de borrado.
En privacidad: bajo el RGPD, los datos biométricos solo son «categoría especial» (Art. 9) si se usan para identificación única [7]; la dinámica de tecleo encaja en la definición general de dato biométrico‑conductual, pero si nunca se construye un perfil que identifique a un niño por su ritmo de tecleo, se evita esa categoría reforzada — aunque el AI Act de la UE, sin ese requisito de identificación, la trataría más ampliamente [11]. El Código de Diseño Apropiado para la Edad del Reino Unido (AADC) exige perfilado desactivado por defecto y prohíbe «dark patterns» [8][9]. El Art. 28 de la DSA prohíbe publicidad por perfilado de menores, aclarando que esto no obliga a recopilar más datos para verificar la edad [6]. Minimizar aquí significa: agregar en el dispositivo, guardar características derivadas, nunca la secuencia cruda de pulsaciones.
Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.
Estado de verificación
Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.
[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.
Cómo se produjo esta investigación
Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.
Esto es investigación, no asesoría legal, médica ni financiera. Nada aquí reclama un resultado de aprendizaje de Math Challenge; ese estudio todavía no existe.
Hallazgos — Parte 1: Qué significan las señales (ciencia del aprendizaje)
1. Cambiar respuestas ayuda mucho más de lo que predice la creencia popular. El estudio «first instinct fallacy» de Kruger, Wirtz y Miller (JPSP, 2005) revisó más de 70 años de investigaciones previas y constató que en ninguno de los 33 estudios los examinados resultaron perjudicados, en promedio, por cambiar respuestas — a pesar de que el 55 % de los docentes encuestados aconsejaba lo contrario. Su propio estudio de marcas de borrador en 1.561 exámenes encontró que el 51 % de los cambios fueron de incorrecto a correcto, el 25 % de correcto a incorrecto y el 23 % de incorrecto a incorrecto; de los 1.231 estudiantes que modificaron al menos una respuesta, el 54 % resultó netamente beneficiado, el 19 % netamente perjudicado y el 27 % ni lo uno ni lo otro [1]. La creencia discordante se remonta al arrepentimiento contrafactual: abandonar una respuesta correcta genera un recuerdo doloroso de «si tan solo», haciendo que los escasos resultados negativos parezcan habituales [1]. Un cambio o borrado de respuesta no constituye, por sí mismo, evidencia de una comprensión deficiente.
2. Las respuestas rápidas, con latencia casi nula, son la verdadera señal de alerta — para el desinterés, no para el juego. El «response time effort» (RTE) de Wise y Kong mide la proporción de ítems respondidos por encima de un umbral de tiempo de solución‑comportamiento. Un meta‑análisis citado encontró que el RTE está fuertemente asociado al rendimiento, más que el esfuerzo autoinformado. Aplicado a PISA 2015, filtrar a los adivinadores rápidos elevó las medias de puntuación de los países pero apenas modificó sus posiciones en el ranking [4]. Los umbrales varían desde un corte fijo (p. ej., 5 segundos) hasta normas específicas por ítem (p. ej., el 15 % del tiempo típico de solución) [4]. El uso correcto es como un umbral inferior («demasiado rápido para reflejar compromiso»), no como una penalización graduada a lo largo de todo el rango de latencia.
3. El «gaming the system» es detectable, no monolítico, y los detectores pueden ser manipulados. Baker, Corbett, Koedinger y Roll definen el gaming como la explotación de regularidades del sistema en lugar de reflexionar sobre el contenido — adivinanzas sistemáticas, pulsar ayuda hasta que el sistema responde [2][3]. Su modelo diferencia a los estudiantes GAMED-HURT de los GAMED-NOT-HURT, estos últimos juegan sin pérdida de aprendizaje. Las características que mejor separan son: varias acciones rápidas consecutivas, altas tasas de error en pasos de opción múltiple, respuestas numéricas rápidas, peticiones breves de ayuda o errores en rápida sucesión [3]. El detector se transfirió entre cohortes de estudiantes (A’=0,76–0,92) pero funcionó mal entre interfaces de tutor‑lección sin reentrenamiento — las firmas de gaming son específicas de la interfaz [3]. Los autores advierten: un detector estático y predecible invita a los estudiantes a «aprender a manipular el detector de gaming» [3]. Una advertencia directa contra una regla de puntuación fija que asocie «comportamiento errático = trampa».
4. El «wheel‑spinning» describe a un estudiante atascado, no a uno con conducta inapropiada. El artículo de Beck y Gong en AIED 2013 denomina un fenómeno de tutores de aprendizaje maestro: un estudiante que trabaja una habilidad mucho más tiempo del que el modelo prevé para lograr la maestría, sin alcanzarla — consumiendo tiempo y motivación sin obtener beneficio. Trabajos posteriores de ACM buscaron la detección temprana para que el sistema interviniera antes de que el estudiante abandone. Un rendimiento bajo sostenido pese a numerosos intentos es una señal distinta de la vacilación puntual, y requiere un cambio de estrategia, no una puntuación menor.
5. La confusión, el aburrimiento y la frustración presentan patrones de transición característicos. El trabajo de D’Mello y Graesser sobre dinámica afectiva, muy citado, descubrió que el aburrimiento es el estado «más pegajoso» — difícil de abandonar una vez que se produce — mientras que la confusión actúa como pivote que se resuelve productivamente (hacia la re‑participación) o improductivamente (hacia la frustración y, después, el aburrimiento) según el entorno la apoye o no. Estos estados se inferían a partir de patrones de interacción (latencia, errores, búsqueda de ayuda), no de sensores. El objetivo práctico es interrumpir la espiral de aburrimiento/frustración de forma temprana mediante breves ventanas agregadas de dificultad, no mediante indicadores de evento único.
6. PISA y NAEP tratan ahora los datos de proceso como un recurso de investigación, con límites reales. El programa de datos de proceso de NAEP publica registros de interacción con marcas de tiempo — tiempo en tarea, recuentos de navegación/revisitas, uso de herramientas, secuencias de acciones — e invita a los investigadores a derivar sus propias variables conductuales en lugar de imponer interpretaciones fijas [5], lo que evidencia cuán incierta sigue estando la interpretación de los datos de proceso en bruto. El programa de adivinación rápida/RTE de PISA (hallazgo 2) es el resultado aplicado más maduro de esta línea de trabajo.
7. La fluidez y la automaticidad se manifiestan en la forma de la distribución, no en la velocidad de un solo intento. La investigación en aritmética cognitiva concibe la automaticidad como un desplazamiento de toda la distribución de tiempos de respuesta: rápida y de baja variabilidad (recuperación de memoria) frente a lenta y de alta variabilidad (cuenta/estrategias derivadas), con ocasionalmente una larga cola derecha incluso en respondientes fluidos. La fluidez nunca debe puntuarse a partir de un solo ensayo: solo un patrón estable a lo largo de muchos intentos diferencia «aún no automático» de «un día lento».
8. La dinámica de pulsaciones es una tecnología consolidada — diseñada para la autenticación, no para la puntuación en el aula. El campo estandariza el dwell time (duración de pulsación de la tecla) y el flight time (intervalo entre la liberación y la siguiente pulsación), además del tiempo de dígrafos y los patrones de corrección de errores, que se emplean para la autenticación continua con umbrales de confianza en lugar de un criterio de aprobado/reprobado [10]. El dominio sirve para identificar quién está tecleando; el interés de Math Challenge se acerca más a cómo escribe un niño ya conocido — de menor riesgo, pero adopta el mismo vocabulario de características que un regulador utilizará para preguntar «¿son estos datos biométricos?».
Hallazgos — Parte 2: Dónde la normativa de privacidad traza la línea
9. Bajo el RGPD, los datos biométricos solo se consideran «categoría especial» (art. 9) cuando se usan para identificación única. El art. 4(14) define los datos biométricos como datos personales obtenidos mediante el tratamiento técnico de rasgos físicos, fisiológicos o conductuales que permiten la identificación única; el desencadenante del art. 9 requiere que el propósito de identificación sea específico [7][11]. La dinámica de pulsaciones cubre la mitad de la definición relativa a características conductuales. El hecho determinante es el propósito: registrar latencias o recuentos de borrado para adaptar la dificultad no constituye, por sí solo, un tratamiento de categoría especial, pero crear un perfil de qué niño escribe a partir del ritmo cruzaría la línea de inmediato. El art. 3(34) de la Ley de IA de la UE elimina el requisito de identificación, de modo que sus normas de riesgo escalonado pueden aplicarse independientemente de la intención [11] — una segunda razón independiente para evitar cualquier perfil de ritmo de escritura por niño.
10. No existe un caso confirmado de la BIPA que aborde directamente la dinámica de pulsaciones. La BIPA de Illinois menciona huellas dactilares, escaneos de retina/iris, huellas de voz y geometría de mano/rostro como sus ejemplos principales; su historial de litigios colectivos se ha centrado en esas modalidades. Esta es una cuestión legal abierta, no jurisprudencia consolidada — señal para el asesoramiento legal más que una asunción definitiva.
11. El Artículo 28 del DSA prohíbe la segmentación publicitaria basada en perfiles de menores y, por separado, rechaza «recoger más datos para cumplir». El art. 28(2) prohíbe los anuncios basados en el perfilado de usuarios sabidos como menores; el art. 28(1) exige «medidas apropiadas y proporcionales» para la privacidad y seguridad; el art. 28(3) declara que no existe obligación de procesar datos adicionales solo para determinar si un usuario es menor [6]. Para un producto ya declarado para niños a partir de los 4 años, el perfilado publicitario no es un problema, pero el principio de «no recopilar datos extra para probar la edad» se generaliza: no se deben recoger tipos de datos únicamente para justificar la recogida de otros.
12. El AADC del Reino Unido establece el estándar más concreto: perfilado desactivado por defecto, minimización estricta, sin patrones oscuros. Indica a los servicios que «eviten el perfilado… salvo que sea estrictamente necesario, y desactívenlo por defecto», «recogan y conserven solo lo absolutamente necesario», y eviten «patrones oscuros… que inciten a los niños a compartir más de lo necesario» [8]. La guía de la ICO desalienta también el perfilado de niños «cuando sea posible», ya que los niños «pueden ser más fácilmente influenciables que los adultos» [9]. Cualquier uso adaptativo o de puntuación de señales conductuales debe constituir una excepción estrecha y divulgada a un perfilado desactivado por defecto.
13. La minimización de datos para la telemetría tiene una forma establecida: agregar en el dispositivo, almacenar variables derivadas, descartar flujos crudos. Se calcula un pequeño conjunto de variables derivadas, no reversibles, en el propio dispositivo — tiempo hasta la primera pulsación, ediciones antes de enviar, cambio de respuesta (bool), puntuación z del tiempo de respuesta respecto a la propia línea base del niño — y solo se transmiten esas. El propio programa de datos de proceso de NAEP publica variables de secuencia de acción derivadas, no la señal cruda del dispositivo de entrada — un precedente para el manejo responsable de datos de proceso al nivel de estado del arte de la industria de evaluaciones [5].
Signal catalogue table
| Señal | Qué indica | Cómo se calcula | Riesgo de privacidad | ¿Solo crudo o derivado? |
|---|---|---|---|---|
| Latencia total de respuesta | Fluidez, solo en agregado (hallazgo 7) | Marca temporal de renderizado vs. envío | Bajo | Derivado: z‑score vs. la propia línea base del niño |
| Tiempo hasta la primera pulsación | Latencia de recuperación vs. «todavía leyendo» | Marca temporal de renderizado vs. primera entrada | Bajo | Solo duración derivada |
| Indicador de conjetura rápida | Desconexión, según PISA RTE (hallazgo 2) | Latencia vs. umbral calibrado por ítem [4] | Bajo | Booleano derivado |
| Respuesta modificada antes de enviar (recuento) | Normalmente autocorrección, neto positivo (hallazgo 1) | Recuento de ediciones de la respuesta final | Bajo | Recuento derivado, sin contenido de la edición |
| Recuento de borrado/retroceso | Débil por sí solo; confunde revisión con ansiedad | Recuento de eventos de borrado | Medio si se combina con temporización por tecla | Solo recuento derivado — sin temporización por tecla |
| Temporización completa de pulsaciones (tiempo de permanencia/vuelo por tecla) | Conjunto de características de dinámica de pulsaciones (hallazgo 8) | Marcas temporales de pulsación/liberación por tecla | Alto — se aplica la definición biométrica conductual [11] | Nunca almacenar crudo; calcular agregados y descartar |
| Solicitudes de ayuda/pista en rápida sucesión | Posible abuso de ayuda/gaming (hallazgo 3), solo agregado | Recuento + intervalo por sesión/semana | Bajo | Tasa agregada derivada |
| Intentos repetidos sin dominio | Posible giro de rueda (hallazgo 4) — señal de intervención | Intentos vs. expectativa del modelo | Bajo | Recuento derivado |
| Forma de la distribución de tiempo de respuesta, muchos ensayos del mismo tipo de hecho | Señal verdadera de fluidez (hallazgo 7), nunca ensayo único | Media + varianza por familia de hechos | Bajo | Resumen de distribución derivado |
| Secuencias rápidas de bajo esfuerzo entre ítems | Patrón de juego agregado (hallazgo 3) | Ventana móvil sobre los últimos N ítems | Bajo‑medio si se conserva mucho tiempo | Puntuación móvil derivada, retención corta |
| Patrón de navegación/revisita | Señal de compromiso, según NAEP (hallazgo 6) | Recuento de eventos de navegación | Bajo | Recuento derivado |
Design implications
- Nunca puntuar la latencia ni el recuento de borrado directamente como penalización. Los hallazgos 1 y 7 demuestran que las respuestas lentas, corregidas o editadas son frecuentemente el mejor comportamiento cognitivo — restar puntos por «tardó mucho tiempo» o «cambió la respuesta» es pedagógicamente contrario y contradice 70+ años de investigación en pruebas.
- El único uso defensible de un umbral rígido de latencia es como filtro de desconexión, no como penalización graduada. Siguiendo el modelo RTE de PISA (hallazgo 2), marcar «demasiado rápido para haber participado» como un umbral binario calibrado por tipo de problema — no una escala deslizante que siga penalizando a medida que la velocidad disminuye hacia lo normal.
- Calcular la fluidez a partir de muchos ensayos de la misma familia de hechos, nunca a partir de un solo ensayo. La automaticidad es (media baja Y varianza baja) a lo largo de exposiciones repetidas (hallazgo 7); una única respuesta lenta pero correcta nunca debe reducir la puntuación de fluidez, solo posponerla a la espera de más datos.
- Tratar «respuesta modificada antes de enviar» como neutral‑a‑positiva, nunca como señal de alerta. Registrarla solo como un recuento (hallazgo 1); si se incorpora a la puntuación, debe reconocer la autorregulación, no restar puntos.
- Reservar la detección estilo juego para agregados entre sesiones, nunca como indicadores de evento único, y nunca exponer umbrales exactos en la interfaz. La propia advertencia de Baker et al. (hallazgo 3) indica que un detector visible y estático se aprende a evadir; si se implementa, debe activar una intervención en modo pista, no una penalización de puntuación, y sus umbrales deben revisarse periódicamente.
- Mantener «atascado» (giro de rueda), «desconectado» (patrón de juego) y «dominado» (fluido y rápido) como tres estados separados con tres respuestas distintas, no una puntuación de comportamiento compuesta: atascado → cambiar estrategia/escalar; desconectado → ajustar incentivos, no solo penalizar; fluido → avanzar en dificultad.
- Registrar a nivel de características derivadas calculadas en el dispositivo, nunca flujos de interacción crudos. Según el hallazgo 13, el tiempo de permanencia/vuelo por pulsación nunca debe salir del dispositivo ni persistir más allá del cálculo del agregado único; los datos sincronizados se limitan a recuentos, booleanos y resúmenes distribucionales.
- Nunca crear un modelo que identifique qué niño está en el teclado a partir del ritmo de escritura, ni siquiera internamente. Según el hallazgo 9, esta es la línea clara que convierte una cuestión biométrica conductual ambigua en una cuestión inequívoca del RGPD Art. 9 — y no es una característica que el producto necesite, puesto que el niño ya está autenticado mediante su cuenta.
- Establecer por defecto todo el puntuado/perfilado derivado de comportamientos en desactivado, con excepciones estrechas y divulgadas, replicando la norma de desactivación por defecto del perfilado de la AADC (hallazgo 12) — cumplir el régimen más estricto aplicable a nivel mundial en lugar de protecciones geográficas.
- Establecer un período de retención corto para los registros de temporización de sesión semi‑crudos, separado del modelo de dominio/fluidez a largo plazo — por ejemplo, 30–90 días para calcular estadísticas móviles, y luego conservar solo la puntuación agregada por competencia. Este rango es una propuesta que el propietario debe confirmar, no un requisito legal citado.
- No recopilar datos adicionales (controles de edad más estrictos, sensores del dispositivo) solo para justificar la recogida de telemetría conductual, según el rechazo del hallazgo 11 al razonamiento de «recoger más para cumplir».
- Cualquier uso adaptativo de señales conductuales debe poder explicarse a un progenitor en lenguaje sencillo — «ajustamos el ritmo del problema según la rapidez y confianza con la que respondes, no observando cómo tecleas» — ya que la transparencia de la AADC (hallazgo 12) abarca cómo se explica el sistema, no solo qué se recoge.
- Publicar la lista exacta de características derivadas recogidas en el aviso de privacidad dirigido a los padres, y considerar cualquier adición como sujeta a una nueva revisión de privacidad — la minimización como condición, no como una elección única.
Open questions for the project owner
- ¿Debería Math Challenge comprometerse a no conservar nunca la temporización cruda por pulsación (tiempo de permanencia/vuelo), ni siquiera de forma transitoria en un servidor, calculando todos los agregados únicamente en el dispositivo — cerrando por completo la cuestión de la dinámica de pulsaciones/biometría?
- ¿Qué ventana de retención es aceptable para los registros de interacción a nivel de sesión antes de reducirlos a agregados por competencia? El rango de 30–90 días en la Implicación 10 es una propuesta, no un requisito legal citado.
- ¿Tendrá Math Challenge usuarios del Reino Unido/UE en el corto plazo, haciendo que la AADC/GDPR/DSA sean directamente vinculantes en lugar de una buena práctica a emular globalmente?
- ¿Debería la detección de patrones de juego (Implicaciones 5‑6) incluirse en v1, considerando que incluso los detectores validados por Baker et al. no se trasladan a diferentes tipos de interfaz de problemas sin reentrenamiento?
- ¿Debería el encuadre «revisa su propio trabajo» del cambio de respuesta (Implicación 4) ser visible para el niño como estímulo, o quedar puramente interno al puntuado — lo que modifica tanto la experiencia de usuario como el análisis de transparencia de la AADC?
Fuentes
- Kruger, J., Wirtz, D., & Miller, D. T. (2005). Counterfactual Thinking and the First Instinct Fallacy. Journal of Personality and Social Psychology, 88(5), 725–735
- Baker, R.S., Corbett, A.T., Koedinger, K.R., Wagner, A.Z. (2004). Off-Task Behavior in the Cognitive Tutor Classroom: When Students "Game the System." ACM CHI 2004, 383–390
- Baker, R.S., Corbett, A.T., Koedinger, K.R., Roll, I. (2005). Detecting When Students Game the System, Across Tutor Subjects and Classroom Cohorts
- Michaelides, M.P., Ivanova, M.G., Avraam, D. (2024). The impact of filtering out rapid-guessing examinees on PISA 2015 country rankings. Psychological Test and Assessment Modeling, 66, 50–62
- NCES / The Nation's Report Card — NAEP Process Data
- EU Digital Services Act, Article 28 — Online protection of minors
- GDPR Article 4(14) and Article 9 — biometric data / special category definitions
- Sprintlaw, "Children's Code: Age-Appropriate Design for UK Made Simple."
- A&O Shearman, "ICO updates guidance on using children's information."
- Wikipedia — Keystroke dynamics
- EU AI Act Article 3(34) biometric data definition, contrasted with GDPR Art. 4(14)/Art. 9, per source 7
- Beck, J.E. & Gong, Y. (2013). Wheel-Spinning: Students Who Fail to Master a Skill. AIED 2013
- Matsuda, N. et al. — "Towards Detecting Wheel-Spinning: Approach and Applications." ACM Learning at Scale 2015
- D'Mello, S. & Graesser, A. — "Dynamics of affective states during complex learning" (2012) / "The half-life of cognitive-affective states during complex learning" (2011)
Preguntas que este documento le deja abiertas al dueño
Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.
- Should Math Challenge commit to never persisting raw per-keystroke timing (dwell/flight time), even transiently on a server, computing all aggregates on-device only — foreclosing the keystroke-dynamics/biometric question entirely?
- What retention window is acceptable for session-level interaction logs before reduction to per-skill aggregates? The 30–90 day range in Implication 10 is a proposal, not a sourced legal requirement.
- Will Math Challenge have UK/EU users in the near term, making AADC/GDPR/DSA directly binding rather than best practice to emulate globally?
- Should gaming-pattern detection (Implications 5–6) ship in v1 at all, given that even Baker et al.'s validated detectors don't transfer across different problem-interface types without retraining?
- Should "checks own work" framing of answer-changing (Implication 4) be visible to the child as encouragement, or purely internal to scoring — this changes both UX and the AADC transparency analysis?
Uno de 51 documentos de investigación, 168.346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio