Math Challenge
Más

Datos conductuales/de proceso en sistemas de aprendizaje: qué significan la vacilación y el tiempo, y dónde traza la línea la ley de privacidad infantil

mc-30 · Publicado: · de Math Challenge Research · 3,270 palabras · 14 fuentes citadas

Resumen ejecutivo

La telemetría de proceso — cuánto tarda un niño en responder, si borra y reescribe, si cambia una respuesta antes de enviarla — es información real sobre el aprendizaje, no solo ruido. Tres hallazgos robustos: (1) cambiar una respuesta en un examen de opción múltiple ayuda más de lo que perjudica — 51% de los cambios van de incorrecto a correcto, solo 25% al revés, y 79% de quienes cambian alguna respuesta mejora su puntaje [1]; (2) el tiempo de respuesta muy corto ("rapid guessing") señala desconexión, no dominio, y PISA lo usa para filtrar respuestas inválidas mediante el "response time effort" de Wise & Kong [4][5]; (3) "gaming the system" (adivinar sistemáticamente, pedir ayuda hasta que el sistema resuelve) se detecta desde logs con buena precisión (A'=0.85–0.96), pero el propio trabajo de Baker et al. advierte que un detector usado para penalizar se vuelve blanco de manipulación [2][3].

La conclusión de diseño más importante es una prohibición: nunca uses la latencia bruta ni el conteo de borrados como penalización directa del puntaje. Un niño reflexivo que se autocorrige es indistinguible, en datos crudos, de uno inseguro que titubea — penalizar ese patrón castiga justo el comportamiento metacognitivo que se busca fomentar. Lo defendible es usar las señales para adaptar (dificultad, pistas, ritmo) y detectar patrones agregados de desconexión, nunca eventos individuales de borrado.

En privacidad: bajo GDPR, los datos biométricos solo son "categoría especial" (Art. 9) si se usan para identificación única [7]; la dinámica de tecleo encaja en la definición general de dato biométrico-conductual, pero si nunca se construye un perfil que identifique a un niño por su ritmo de tecleo, se evita esa categoría reforzada — aunque el AI Act de la UE, sin ese requisito de identificación, la trataría más ampliamente [11]. El Código de Diseño Apropiado para la Edad del Reino Unido (AADC) exige perfilado apagado por defecto y prohíbe "dark patterns" [8][9]. El Art. 28 de la DSA prohíbe publicidad por perfilado de menores, aclarando que esto no obliga a recolectar más datos para verificar edad [6]. Minimizar aquí significa: agregar en el dispositivo, guardar características derivadas, nunca la secuencia cruda de pulsaciones.

359 palabras

Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.

Estado de verificación

Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.

[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.

Cómo se produjo esta investigación

Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.

Hallazgos — Parte 1: Qué significan las señales (ciencia del aprendizaje)

1. Cambiar respuestas ayuda mucho más de lo que predice la creencia popular. El estudio de la “first instinct fallacy” de Kruger, Wirtz & Miller (JPSP, 2005) revisó más de 70 años de investigación previa y encontró que en ninguno de 33 estudios los examinados salieron perjudicados, en promedio, por cambiar respuestas — a pesar de que 55% de los instructores encuestados aconsejaba lo contrario. Su propio estudio de marcas de borrador en 1,561 exámenes encontró que 51% de los cambios fueron de incorrecto a correcto, 25% de correcto a incorrecto, 23% de incorrecto a incorrecto; de 1,231 estudiantes que cambiaron al menos una respuesta, 54% salieron netamente beneficiados, 19% netamente perjudicados, 27% ni una cosa ni la otra [1]. La creencia errada se remonta al arrepentimiento contrafáctico: abandonar una respuesta correcta produce un recuerdo “si tan solo” únicamente doloroso, que hace que los resultados malos, raros, se sientan comunes [1]. Un cambio de respuesta o un borrado no es, por sí mismo, evidencia de mala comprensión.

2. Las respuestas rápidas, con latencia casi nula, son la verdadera señal de alerta — de desconexión, no de trampa. El “response time effort” (RTE) de Wise & Kong mide la proporción de ítems respondidos por encima de un umbral de tiempo de comportamiento de solución. Un metaanálisis citado encontró el RTE fuertemente asociado con el desempeño, más que el esfuerzo autorreportado. Aplicado a PISA 2015, filtrar a quienes adivinan rápido elevó los puntajes medios por país pero apenas movió los rankings [4]. Los umbrales van desde un corte fijo (p. ej., 5 segundos) hasta normas específicas por ítem (p. ej., 15% del tiempo típico de solución) [4]. El uso correcto es un piso (“demasiado rápido para reflejar compromiso”), no una penalización graduada a lo largo de todo el rango de latencia.

3. “Gaming the system” es detectable, no monolítico, y los detectores terminan siendo manipulados a su vez. Baker, Corbett, Koedinger & Roll definen gaming como explotar las regularidades del sistema en lugar de pensar en el material — adivinar sistemáticamente, martillar la ayuda hasta que el sistema responde [2][3]. Su modelo distingue a los estudiantes GAMED-HURT de los estudiantes GAMED-NOT-HURT, que manipulan sin pérdida de aprendizaje. Las características que mejor separan: varias acciones rápidas seguidas, tasas de error altas en pasos de opción múltiple, respuestas numéricas rápidas, solicitudes de ayuda breves o errores en rápida sucesión [3]. El detector se transfirió entre cohortes de estudiantes (A’=0.76–0.92) pero mal entre interfaces de lecciones del tutor sin reentrenamiento — las firmas de gaming son específicas de la interfaz [3]. Los autores advierten: un detector estático y adivinable invita a los estudiantes a “learn how to game the gaming detector” [3]. Una advertencia directa contra una regla fija de puntaje tipo “comportamiento errático = trampa”.

4. “Wheel-spinning” describe a un estudiante atascado, no a uno que se porta mal. El artículo de Beck & Gong en AIED 2013 nombra un fenómeno de los tutores de aprendizaje por dominio: un estudiante trabajando en una habilidad mucho más tiempo del que el modelo espera que tome dominarla, sin alcanzarla — quemando tiempo y motivación sin ganancia. Trabajo posterior en ACM buscó la detección temprana para que un sistema pudiera intervenir antes de que el estudiante se rinda. El bajo desempeño sostenido a pesar de muchos intentos es una señal distinta de la vacilación momentánea, y pide un cambio de estrategia, no un puntaje más bajo.

5. La confusión, el aburrimiento y la frustración tienen patrones de transición característicos. El trabajo de dinámica afectiva de D’Mello & Graesser, ampliamente citado, encontró que el aburrimiento es el estado más “pegajoso” — difícil de abandonar una vez que se entra en él — mientras que la confusión es un pivote que se resuelve productivamente (hacia el recompromiso) o improductivamente (hacia la frustración, luego el aburrimiento) dependiendo de si el entorno lo andamia. Estos estados se infirieron de patrones de interacción (latencia, errores, búsqueda de ayuda), no de sensores. El objetivo accionable es interrumpir temprano la espiral de aburrimiento/frustración mediante ventanas agregadas cortas de dificultad, no banderas de evento único.

6. PISA y NAEP ya tratan los datos de proceso como un activo de investigación, con límites reales. El programa de datos de proceso de NAEP publica registros de interacción con marca de tiempo — tiempo en la tarea, conteos de navegación/revisita, uso de herramientas, secuencias de acciones — e invita a los investigadores a derivar sus propias variables conductuales en lugar de afirmar interpretaciones fijas [5], lo cual es en sí mismo una señal de lo poco resuelta que sigue estando la interpretación de los datos de proceso crudos. El programa de rapid-guessing/RTE de PISA (hallazgo 2) es el resultado aplicado más maduro de esta línea de trabajo.

7. La fluidez y la automaticidad aparecen como forma de la distribución, no como velocidad de un solo ensayo. La investigación en aritmética cognitiva trata la automaticidad como un desplazamiento de toda la distribución de tiempos de respuesta: rápida y de baja varianza (recuperación de memoria) frente a lenta y de alta varianza (estrategias de conteo/derivadas), con una cola derecha larga ocasional incluso en respondedores fluidos. La fluidez nunca debe puntuarse a partir de un solo ensayo: solo un patrón estable a lo largo de muchos ensayos distingue “aún no automático” de “un día lento”.

8. La dinámica de tecleo es madura — construida para autenticación, no para puntuar en el aula. El campo estandariza el dwell time (duración de la tecla presionada) y el flight time (intervalo entre soltar y la siguiente pulsación), más el tiempo de dígrafos y los patrones de corrección de errores, usados para autenticación continua con umbrales de confianza en lugar de pasa/no pasa [10]. El dominio existe para identificar quién está tecleando; el interés de Math Challenge está más cerca de cómo teclea un niño ya conocido — de menor riesgo, pero toma prestado el vocabulario exacto de características que un regulador usará para preguntar “¿es esto un dato biométrico?”

Hallazgos — Parte 2: Dónde traza la línea la ley de privacidad

9. Bajo GDPR, los datos biométricos solo son reforzados (“categoría especial”, Art. 9) cuando se usan para identificación única. El Art. 4(14) define los datos biométricos como datos personales resultantes del tratamiento técnico de características físicas, fisiológicas o conductuales que permiten la identificación única; el disparador del Art. 9 requiere ese propósito de identificación específicamente [7][11]. La dinámica de tecleo encaja en la mitad conductual de la definición. El hecho determinante es el propósito: registrar latencias/conteos de borrado para adaptar la dificultad no es, solo por ese uso, un tratamiento de categoría especial — pero tomar la huella de qué niño está tecleando a partir del ritmo cruzaría la línea de inmediato. El Art. 3(34) del AI Act de la UE elimina el requisito de identificación, así que sus reglas más amplias por niveles de riesgo pueden aplicar independientemente de la intención [11] — una segunda razón, independiente, para evitar cualquier perfil de ritmo de tecleo por niño.

10. Ningún caso confirmado de BIPA aborda la dinámica de tecleo directamente. La BIPA de Illinois nombra huellas dactilares, escaneos de retina/iris, huellas de voz y geometría de mano/rostro como sus ejemplos centrales; su intensa historia de litigios colectivos se ha centrado en esas modalidades. Esta es una cuestión legal abierta, no jurisprudencia establecida — señalarla al asesor legal en lugar de asumir en cualquier dirección.

11. El Artículo 28 de la DSA prohíbe la publicidad dirigida por perfilado de menores, y por separado rechaza el “recolectar más para cumplir”. El Art. 28(2) prohíbe anuncios basados en el perfilado de usuarios que se sabe son menores; el Art. 28(1) exige “medidas apropiadas y proporcionadas” para la privacidad/seguridad; el Art. 28(3) establece que no hay obligación de procesar datos adicionales solo para evaluar si un usuario es menor [6]. Para un producto ya declarado para niños desde los 4 años, el perfilado publicitario es un no-tema, pero el principio de “no recolectar extra para probar la edad” se generaliza: no recolectes un tipo de dato solo para justificar otro.

12. El AADC del Reino Unido fija el estándar más concreto: perfilado apagado por defecto, minimización estricta, nada de dark patterns. Instruye a los servicios a “prevent profiling… unless strictly necessary, and switch it off by default,” “collect and keep only what’s absolutely needed,” y evitar “dark patterns… that encourage children to share more than they need to” [8]. La guía del ICO por separado desaconseja perfilar a los niños “wherever possible,” ya que los niños “may be more easily influenced than adults” [9]. Cualquier uso adaptativo/de puntaje de señales conductuales debe ser una excepción estrecha y divulgada a un perfilado apagado por defecto.

13. La minimización de datos para telemetría tiene una forma establecida: agregar en el dispositivo, guardar características derivadas, descartar los flujos crudos. Calcular un conjunto pequeño de características derivadas y no reversibles en el dispositivo — tiempo hasta la primera pulsación, ediciones antes de enviar, respuesta-cambiada (bool), z-score de tiempo de respuesta contra la línea base del propio niño — y transmitir solo esas. El propio programa de datos de proceso de NAEP publica variables derivadas de secuencias de acciones, no la señal cruda del dispositivo de entrada — un precedente de datos de proceso responsables en el estado del arte de la industria de la evaluación [5].

Tabla de catálogo de señales

SeñalQué indicaCómo se calculaRiesgo de privacidad¿Cruda o solo derivada?
Latencia total de respuestaFluidez, solo en agregado (hallazgo 7)Marca de tiempo de render vs. envíoBajoDerivada: z-score contra la línea base del propio niño
Tiempo hasta la primera pulsaciónLatencia de recuperación vs. “todavía leyendo”Marca de tiempo de render vs. primera entradaBajoSolo duración derivada
Bandera de adivinanza rápidaDesconexión, según el RTE de PISA (hallazgo 2)Latencia vs. piso calibrado por ítem [4]BajoBooleano derivado
Respuesta cambiada antes de enviar (conteo)Usualmente autocorrección, neto positivo (hallazgo 1)Conteo de ediciones de la respuesta finalBajoConteo derivado, no el contenido de la edición
Conteo de borrados/retrocesosDébil por sí solo; confunde revisión con ansiedadConteo de eventos de borradoMedio si se empareja con tiempos por teclaSolo conteo derivado — sin tiempos por tecla
Tiempos completos de tecleo (dwell/flight por tecla)El conjunto de características de dinámica de tecleo (hallazgo 8)Marcas de tiempo de presión/liberación por teclaAlto — aplica la definición de biométrico-conductual [11]Nunca guardar crudo; calcular agregados, descartar
Solicitudes de ayuda/pistas en rápida sucesiónPosible gaming por abuso de ayuda (hallazgo 3), solo agregadoConteo + intervalo por sesión/semanaBajoTasa agregada derivada
Intentos repetidos sin dominioPosible wheel-spinning (hallazgo 4) — señal de intervenciónIntentos vs. expectativa del modeloBajoConteo derivado
Forma de la distribución de TR, muchos ensayos del mismo tipo de hechoSeñal de fluidez verdadera (hallazgo 7), nunca de un solo ensayoMedia + varianza por familia de hechosBajoResumen derivado de la distribución
Secuencias rápidas de bajo esfuerzo entre ítemsPatrón agregado de gaming (hallazgo 3)Ventana móvil sobre los últimos N ítemsBajo–medio si se retiene muchoPuntaje móvil derivado, retención corta
Patrón de navegación/revisitaSeñal de compromiso, según NAEP (hallazgo 6)Conteo de eventos de navegaciónBajoConteo derivado

Implicaciones de diseño

  1. Nunca puntuar la latencia ni el conteo de borrados directamente como penalización. Los hallazgos 1 y 7 muestran que las respuestas lentas, corregidas o editadas son con frecuencia el mejor comportamiento cognitivo — restar puntos por “tardó mucho” o “cambió la respuesta” es pedagógicamente al revés y está contradicho por más de 70 años de investigación en evaluación.
  2. El único uso defendible de un piso duro de latencia es un filtro de desconexión, no una penalización graduada. Siguiendo el modelo RTE de PISA (hallazgo 2), marcar “demasiado rápido para haberse comprometido” como un piso binario calibrado por tipo de problema — no una escala móvil que siga penalizando a medida que la velocidad baja hacia lo normal.
  3. Calcular la fluidez a partir de muchos ensayos de la misma familia de hechos, nunca de un solo ensayo. La automaticidad es (media baja Y varianza baja) a lo largo de exposiciones repetidas (hallazgo 7); una sola respuesta lenta pero correcta nunca debe bajar un puntaje de fluidez, solo retenerlo a la espera de más datos.
  4. Tratar “respuesta cambiada antes de enviar” como neutral-a-positiva, nunca como señal de alerta. Registrarla solo como conteo (hallazgo 1); si entra al puntaje en absoluto, debe acreditar el automonitoreo, no quitar puntos.
  5. Reservar la detección estilo gaming para agregados entre sesiones, nunca banderas de evento único, y nunca exponer los umbrales exactos en la interfaz. La propia advertencia de Baker et al. (hallazgo 3) es que un detector visible y estático termina siendo aprendido para evadirlo; si se construye, debe disparar una intervención en modo pista, no una penalización de puntaje, y sus umbrales deben revisitarse periódicamente.
  6. Mantener “atascado” (wheel-spinning), “desconectado” (patrón de gaming) y “dominado” (fluido-y-rápido) como tres estados separados con tres respuestas separadas, no un puntaje conductual compuesto: atascado → cambiar estrategia/escalar; desconectado → ajustar incentivos, no solo penalizar; fluido → avanzar la dificultad.
  7. Registrar al nivel de características derivadas calculadas en el dispositivo, nunca flujos crudos de interacción. Según el hallazgo 13, el dwell/flight-time-por-pulsación nunca debe salir del dispositivo ni persistir más allá del cálculo agregado único; los datos sincronizados se limitan a conteos, booleanos y resúmenes distribucionales.
  8. Nunca construir un modelo que identifique qué niño está frente al teclado a partir del ritmo de tecleo, ni siquiera internamente. Según el hallazgo 9, esta es la línea brillante que convierte una cuestión biométrico-conductual ambigua en una inequívoca del Art. 9 del GDPR — y no es una característica que el producto necesite, ya que el niño ya está autenticado por cuenta.
  9. Apagar por defecto todo puntaje/perfilado derivado de lo conductual, con excepciones estrechas y divulgadas, reflejando la norma del AADC de perfilado-apagado-por-defecto (hallazgo 12) — cumplir el régimen aplicable más estricto a nivel global en lugar de cercar geográficamente las protecciones.
  10. Fijar un período corto de retención para los logs de tiempos de sesión casi crudos, separado del modelo de dominio/fluidez de larga vida — p. ej., 30–90 días para calcular estadísticas móviles, y luego conservar solo el puntaje enrollado por habilidad. Este rango es una propuesta para que el dueño confirme, no un requisito legal citado.
  11. No recolectar datos adicionales (verificaciones de edad más estrictas, sensores del dispositivo) solo para justificar recolectar telemetría conductual, según el rechazo del hallazgo 11 al razonamiento de “recolectar más para cumplir”.
  12. Cualquier uso adaptativo de señales conductuales debe ser explicable a un padre en lenguaje sencillo — “ajustamos el ritmo de los problemas según qué tan rápido y con cuánta confianza respondes, no observando cómo tecleas” — ya que la transparencia del AADC (hallazgo 12) cubre cómo se explica el sistema, no solo lo que recolecta.
  13. Publicar la lista exacta de características derivadas recolectadas en el aviso de privacidad dirigido a los padres, y tratar cualquier adición como si requiriera una revisión de privacidad nueva — la minimización como puerta, no como una elección de una sola vez.

Preguntas abiertas para el dueño del proyecto

  1. ¿Debe Math Challenge comprometerse a nunca persistir los tiempos crudos por pulsación (dwell/flight time), ni siquiera transitoriamente en un servidor, calculando todos los agregados solo en el dispositivo — cerrando por completo la cuestión de dinámica de tecleo/biometría?
  2. ¿Qué ventana de retención es aceptable para los logs de interacción a nivel de sesión antes de reducirlos a agregados por habilidad? El rango de 30–90 días de la Implicación 10 es una propuesta, no un requisito legal con fuente.
  3. ¿Tendrá Math Challenge usuarios en el Reino Unido/UE en el corto plazo, haciendo que AADC/GDPR/DSA sean directamente vinculantes en lugar de mejores prácticas a emular globalmente?
  4. ¿Debe la detección de patrones de gaming (Implicaciones 5–6) siquiera salir en v1, dado que ni siquiera los detectores validados de Baker et al. se transfieren entre distintos tipos de interfaz de problemas sin reentrenamiento?
  5. ¿Debe el encuadre de “revisa su propio trabajo” del cambio de respuestas (Implicación 4) ser visible para el niño como estímulo, o puramente interno al puntaje — esto cambia tanto la UX como el análisis de transparencia del AADC?

Fuentes

  1. Kruger, J., Wirtz, D., & Miller, D. T. (2005). Counterfactual Thinking and the First Instinct Fallacy. Journal of Personality and Social Psychology, 88(5), 725–735
  2. Baker, R.S., Corbett, A.T., Koedinger, K.R., Wagner, A.Z. (2004). Off-Task Behavior in the Cognitive Tutor Classroom: When Students "Game the System." ACM CHI 2004, 383–390
  3. Baker, R.S., Corbett, A.T., Koedinger, K.R., Roll, I. (2005). Detecting When Students Game the System, Across Tutor Subjects and Classroom Cohorts
  4. Michaelides, M.P., Ivanova, M.G., Avraam, D. (2024). The impact of filtering out rapid-guessing examinees on PISA 2015 country rankings. Psychological Test and Assessment Modeling, 66, 50–62
  5. NCES / The Nation's Report Card — NAEP Process Data
  6. EU Digital Services Act, Article 28 — Online protection of minors
  7. GDPR Article 4(14) and Article 9 — biometric data / special category definitions
  8. Sprintlaw, "Children's Code: Age-Appropriate Design for UK Made Simple."
  9. A&O Shearman, "ICO updates guidance on using children's information."
  10. Wikipedia — Keystroke dynamics
  11. EU AI Act Article 3(34) biometric data definition, contrasted with GDPR Art. 4(14)/Art. 9, per source 7
  12. Beck, J.E. & Gong, Y. (2013). Wheel-Spinning: Students Who Fail to Master a Skill. AIED 2013
  13. Matsuda, N. et al. — "Towards Detecting Wheel-Spinning: Approach and Applications." ACM Learning at Scale 2015
  14. D'Mello, S. & Graesser, A. — "Dynamics of affective states during complex learning" (2012) / "The half-life of cognitive-affective states during complex learning" (2011)

Preguntas que este documento le deja abiertas al dueño

Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.

Uno de 51 documentos de investigación, 168,346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio