Math Challenge
Más

Tablas de clasificación y diseño de competición: efectos psicológicos, sistemas de puntuación y comparación justa entre dificultades

mc-18 · Publicado: · de Math Challenge Research · 3328 palabras · 17 fuentes citadas

Resumen ejecutivo

450 palabras

Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.

Estado de verificación

Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.

[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.

Cómo se produjo esta investigación

Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.

Resultados

1. Tablas de clasificación en educación: a quién motivan y a quién desmotivan

La revisión sistemática de 2023 «The use of leaderboards in gamified educational settings» plantea el hallazgo central como dependiente de la posición, no uniforme: la respuesta del alumno depende en gran medida de dónde se sitúe en la tabla [2]. Un estudio de 2025 sobre retroalimentación basada en tablas de clasificación aboga por «formas más estandarizadas de examinar los efectos potenciales», porque la investigación anterior mezcló resultados positivos y nulos sin separar a los mejores, intermedios y peor clasificados [2]. El estudio de Christy y Fox (2014) encontró que una manipulación de comparación social (una tabla de clasificación ordenada) tuvo un efecto más fuerte sobre el rendimiento en matemáticas que la amenaza de estereotipo, y algunos participantes que obtuvieron peores resultados bajo presión comparativa aun así reportaron una mayor identificación académica — los efectos conductuales y de motivación sentida pueden divergir [1]. Un meta‑análisis más amplio de 41 estudios de gamificación (5.071 participantes) halló un gran efecto agregado (g = 0,822) pero no pudo aislar efectos específicos de las tablas de clasificación sobre los participantes de menor rendimiento — una media positiva no implica que todas las posiciones se beneficien por igual [3]. La conclusión de diseño: las tablas de clasificación aumentan el compromiso en promedio, mientras concentran un riesgo real de daño en la parte inferior, invisible a menos que se mida por posición.

2. Teoría de la comparación social y niños

La teoría de Festinger (1954) sostiene que las personas evalúan sus habilidades comparándose con los demás, sobre todo cuando falta una referencia objetiva [4]. La comparación ascendente (con alguien mejor) puede motivar a personas con alta autoestima, pero desmoralizar a quienes ya dudan de sí mismas; la comparación descendente protege el estado de ánimo sin producir ganancia de aprendizaje [4]. Los niños, en general, poseen una autoestima menos estable que los adultos, y una tabla de clasificación permanente y siempre orientada hacia arriba — donde el niño medio siempre ve a otros por delante y nunca se le muestra un contexto tranquilizador — favorece estructuralmente la comparación ascendente que la teoría señala como desmoralizadora para individuos con baja confianza.

3. Teoría de la autodeterminación: la competición como controladora vs. informativa

La teoría de la autodeterminación (Deci y Ryan) organiza la motivación en torno a la autonomía, la competencia y la relación, en un espectro que va de lo controlado a lo autónomo [5]. El efecto de la competición depende de si se percibe como retroalimentación informativa sobre la propia competencia creciente, o como presión controladora para superar a los demás. Una tabla de clasificación a la que un niño no puede renunciar, visible para sus compañeros y que vincula la identidad al rango, se sitúa más cerca de lo controlado; la misma señal de habilidad entregada de forma privada y enmarcada como «has mejorado» se acerca más a lo informativo. Por eso la opcionalidad importa tanto como el propio cálculo del ranking [5].

4. Alternativas cooperativas: la evidencia

El meta‑análisis de Johnson y Johnson (1981) (122 estudios, 286 hallazgos) y una ampliación posterior (148 estudios sobre adolescentes tempranos) encontraron que las estructuras de objetivo cooperativo superan a las competitivas e individualistas en rendimiento, porque los entornos cooperativos generan apoyo entre pares que los competitivos no ofrecen [6]. Esto respalda directamente mecánicas de equipo/total de clase (XP combinada, una «liga familiar» total) como complemento al ranking individual: los objetivos cooperativos reclutan un canal motivacional que la competición individual no puede.

5. Sistemas de puntuación: Elo, Glicko-2, TrueSkill, OpenSkill

Elo: E_A = 1/(1+10^((R_B−R_A)/400)), R_A' = R_A + K·(S_A−E_A). No contempla confianza — una puntuación tras 3 partidas se trata igual que una tras 300 — y se sabe que tiende a derivar/inflarse a largo plazo (la población de ajedrez con más de 2.700 jugadores pasó de 1 jugador en 1979 a 44 en 2012) [7].

Glicko-2 añade Desviación de Rating (RD), que cuantifica la confianza (se reduce con el juego y aumenta con la inactividad), y volatilidad (σ), que cuantifica la consistencia de los resultados [8]. Los jugadores nuevos comienzan con RD alta (implementación de referencia: 350) de modo que los resultados iniciales mueven la puntuación rápidamente; los jugadores consolidados con RD baja se mueven despacio. Un parámetro tau (τ) (~0,3–1,2) limita la velocidad de cambio de la propia volatilidad. Funciona sobre periodos de rating discretos [8].

TrueSkill (Microsoft Research) representa a cada jugador como una gaussiana (μ, σ), extendiendo la valoración bayesiana a equipos mediante la suma de habilidades individuales (potencia del emparejamiento de Xbox Live); no puede detectar trampas, no gestiona handicaps intencionales y no separa la contribución individual cuando los jugadores forman equipos de forma constante [9].

OpenSkill es una alternativa de código abierto, libre de patentes, que implementa aproximaciones bayesianas de Weng‑Lin (Bradley‑Terry, Plackett‑Luce, Thurstone‑Mosteller), dirigida al emparejamiento asimétrico de múltiples equipos [10].

Adecuación para una app de aprendizaje: Math Challenge es fundamentalmente un juego individual contra el contenido, más cercano al dominio original de Glicko-2 (individuos, juego irregular, necesidad de medida de confianza) que al dominio de equipos de TrueSkill/OpenSkill. Glicko-2 encaja mejor; la maquinaria de suma de equipos resuelve un problema (competición por equipos) que actualmente no se necesita, con una complejidad añadida real.

6. Comparación justa entre niveles de dificultad muy diferentes

Sumar ingenuamente puntos brutos premia a quien responde más rápido a los problemas más fáciles — exactamente lo que plataformas de programación competitiva como Codeforces intentan evitar: «la velocidad en resolver problemas más fáciles suele ser decisiva», se señala como una distorsión conocida del puntuación, corregida en la práctica valorando el rendimiento relativo a oponentes de rating conocido en lugar de un valor fijo por problema [11].

El principio generalizable es la Teoría de Respuesta al Ítem (IRT): en lugar de contar respuestas correctas crudas, IRT estima conjuntamente la habilidad de una persona (θ, rasgo latente, estandarizado a media 0, DE 1) y la dificultad (b) y discriminación (a) de cada ítem, mediante un modelo logístico p(θ) = c + (1−c)/(1+e^(−a(θ−b))) [11]. Dos personas que respondieron ítems completamente diferentes, con dificultades distintas, quedan situadas en la misma escala de habilidad — precisamente el problema del «niño de 6 años vs. doctorado» que necesita resolver el tablero global. IRT también sustenta los tests adaptativos, donde cada ítem se elige para ser lo más informativo posible según la estimación actual de habilidad del examinado [11].

Un precedente no digital es el World Handicap System del golf: Course Handicap = (Handicap Index × Slope Rating)/113 + (Course Rating − Par), donde el Slope Rating (55–155) captura cuánto más difícil es un campo para un golfista bogey que para uno scratch — normalizando simultáneamente la habilidad del jugador y la dificultad de la tarea, la misma forma de problema que comparar la puntuación de suma de un niño con la de un adulto en topología [12].

7. Antiinflación y reinicios de temporada

Los sistemas de la familia Elo tienden a derivar a medida que la población crece; los sistemas reales contrarrestan esto con recalibraciones periódicas y anclando la mediana poblacional (Lichess informa que su mediana se mantiene cerca de 1.500 sin deriva significativa a largo plazo) [8]. El RD de Glicko-2 ofrece una herramienta antiinflación complementaria de forma gratuita: una puntuación no ejercitada crece automáticamente en incertidumbre, de modo que una puntuación antigua no puede mantenerse silenciosamente inflada — cada reingreso a la competición vuelve a probar el número.

8. Sandbagging y smurfing

El sandbagging (bajar deliberadamente el rendimiento para enfrentarse a oponentes más fáciles) y el smurfing (un jugador hábil con una cuenta nueva y de rating bajo) son modos de falla bien documentados del emparejamiento por habilidad en general. El sandbagging suele detectarse por una variación de resultados inusualmente alta respecto al historial; el smurfing es inherente a asignar a cuentas nuevas ratings bajos/neutros con alta incertidumbre, ya que una cuenta hábil gana rápidamente antes de que su RD colapse y su rating verdadero se ajuste. Ninguno se resuelve solo con la fórmula — los sistemas reales combinan una rápida convergencia de RD/σ con detección de anomalías fuera del propio rating.

9. How named products handle child competition

10. Named criticism worth taking seriously

La crítica académica publicada sobre la gamificación competitiva en el aprendizaje infantil es más escasa de lo que sugiere la cobertura mediática: la mayoría de los estudios rigurosos encuentran efectos reales pero heterogéneos — grandes ganancias agregadas junto a efectos poco claros o negativos concentrados en posiciones de rango específicas — y no una historia de “siempre bueno/malo”, llamando repetidamente a medir los efectos por subgrupo en lugar de por la media de toda la clase [1][2][3].

Design implications for Math Challenge

  1. Adoptar Glicko-2, no Elo ni TrueSkill, como algoritmo central de puntuación. Registrar (rating μ, RD, volatility σ) por jugador por tramo de curso/asignatura. Parámetros iniciales según la referencia de Glicko-2: rating 1.500, RD 350, σ ≈ 0,06, τ en el rango 0,3–0,5 (favorecer el extremo bajo —resistir oscilaciones volátiles más que un servidor de ajedrez) [8]. Utilizar periodos de puntuación cortos (p. ej., diarios), dado el gran número de “partidos” pequeños (problemas) en lugar de torneos de varios días [8].
  2. No puntuar cara a cara; puntuar contra la dificultad del ítem, estilo IRT. Modelar cada problema con su propia dificultad/discriminación estimada conjuntamente [11]. Una respuesta correcta a un ítem difícil es una señal mucho mayor que a uno fácil —la solución directa al “quien resuelve los problemas más fáciles más rápido gana”, ya que los totales de puntos brutos nunca entran en la comparación.
  3. Normalizar el tablero global sobre una estimación de capacidad (θ), nunca sobre puntos o velocidad brutos. El θ de un niño de 6 años en sumas y el θ de un adulto en matemáticas avanzadas comparten la misma escala porque ambos se estiman a partir de respuestas a ítems calibrados por separado —el mismo principio que el “Course Handicap” del golf [12]. Clasificar el tablero global por θ (o una transformación acotada del mismo), no por XP o número de ejercicios resueltos.
  4. Mantener tableros por tramo de curso y el tablero global, pero clasificar el tablero global con la misma escala normalizada de θ. Los tableros por tramo pueden mostrar métricos más simples y apropiados para la edad (estrellas, rachas); la clasificación basada en θ se reserva para la capa que pretende ser verdaderamente comparable entre edades.
  5. Promoción/degradación de liga: mantener el tamaño de grupo de Duolingo de ~30 personas; hacer la degradación suave. Promocionar la banda superior (p. ej., el 15-20 % superior) semanalmente; degradar solo la banda muy inferior (p. ej., el 10 % inferior), y nunca degradar a quien haya estado activo menos de N días esa semana —la inactividad debe congelar, no castigar, abordando directamente el hallazgo de “el fondo se desengancha” [1][2].
  6. Proteger estructuralmente al 20 % inferior, no solo mediante copia. Dado que el fondo de cualquier grupo experimenta comparaciones ascendentes constantes [4], ofrecer a la banda inferior una señal privada y no comparativa (“has mejorado X % esta semana” respecto a tu propio historial) en lugar de solo el rango público —reencuadrando la retroalimentación de comparativa a informativa [5].
  7. Nunca mostrar por defecto el número literal de posición último a un niño. El daño empírico se concentra en el extremo inferior [1][2]; mostrar bandas “mitad superior / no mitad superior” en lugar del rango exacto para los tramos más jóvenes, reservando el rango numérico exacto para el tablero global (opt‑in) y los tramos de curso superiores.
  8. Hacer el tablero opcional y reversible. Los usuarios (o un padre/docente) deben poder excluirse del tablero global público mientras siguen usando el modo de ligas/aula, o viceversa, siguiendo el precedente de Duolingo y el principio de autonomía de la SDT [5][13].
  9. Añadir una capa cooperativa junto a la clasificación individual: totales de clase/familia. Según la evidencia de Johnson & Johnson [6], añadir una métrica de total de clase o de equipo (respuestas correctas combinadas, días de racha combinados) para el modo aula que tenga éxito o fracaso conjunto, reclutando el estímulo entre pares como segundo canal motivacional.
  10. Proteger contra sandbagging/smurfing estructuralmente, no por confianza. Las cuentas nuevas reciben RD/σ altos, de modo que las victorias tempranas de un smurf se autocorrigen en unas cuantas sesiones [8]. Señalar cuentas con varianza de resultados anómalamente alta para revisión en lugar de impedir el sandbagging solo con reglas.
  11. Reiniciar la clasificación de la temporada, pero mantener θ/RD/σ persistentes entre temporadas. Las clasificaciones semanales públicas deben reiniciarse cada ciclo; la estimación privada de capacidad debe persistir y simplemente recuperar incertidumbre durante los intervalos —el mismo mecanismo antiinflación que usan los sistemas reales, y evita castigar a un niño que regresa tras una pausa escolar.
  12. No dejar que las mecánicas de juego/recompensa superen al contenido matemático. La crítica documentada a Prodigy se centra en que el progreso del juego y la monetización diluyen el tiempo de práctica matemática [14][15][16]; limitar la fracción del tiempo de sesión dedicada a bucles de juego no matemáticos, y mapear cada evento de obtención de puntos/XP a un problema de matemáticas realmente respondido.
  13. Informar de los efectos del tablero por posición de rango en la propia analítica de Math Challenge. Dado que la queja central de la literatura es que la mayoría de los estudios solo reportan un efecto promedio [1][2][3], instrumentar el producto para rastrear retención/compromiso por separado para usuarios de los tramos superior, medio e inferior dentro de cada liga —la única forma de detectar temprano el patrón de “el fondo se desengancha”.
  14. Para el modo aula, permitir al docente elegir la intensidad competitiva por aula. Ofrecer a los docentes un conmutador por aula entre modo individual clasificado, modo cooperativo por equipos o modo de práctica con clasificación oculta —operacionalizando los hallazgos de la SDT y del aprendizaje cooperativo como un control real en lugar de una política global fija [5][6].

Open questions for the project owner

  1. ¿Debe el tablero global clasificar por θ bruto, o por una transformación acotada/normalizada (p. ej., percentil dentro de la cohorte emparejada por curso) —θ bruto es más “honesto”, el percentil más legible para un niño sin necesidad de comprender un número de rating?
  2. ¿Qué cadencia de periodo de puntuación —diario o por sesión— se ajusta a la frecuencia de juego esperada de Math Challenge? Esto afina la decadencia del RD de Glicko-2.
  3. ¿Debe la degradación suspenderse totalmente para el tramo de curso más joven, o la degradación suave (10 % inferior, solo activos) es suficiente para todas las edades?
  4. ¿El conmutador de intensidad competitiva del docente por aula debe ser una configuración única o ajustable a mitad de semana, y cambiarlo ¿reinicia la clasificación de esa semana?
  5. ¿Existe interés en construir “mejorado respecto a tu propio historial” como métrica de primera clase para la banda inferior desde el lanzamiento, o es un alcance para una iteración posterior?
  6. ¿Debe la dificultad de los nuevos ítems estar sembrada por currículo (heurística de nivel de curso) con refinamiento IRT en línea desde el primer día, o lanzar solo con currículo y añadir calibración IRT una vez que exista suficiente datos de respuesta?

Fuentes

  1. Christy, K. R., & Fox, J. (2014). "Leaderboards in a virtual classroom: A test of stereotype threat and social comparison explanations for women's math performance." Computers & Education, 78
  2. "The use of leaderboards in gamified educational settings: A systematic review" (2023)
  3. Meta-analysis of gamification effects on student learning outcomes (41 studies, 5,071 participants)
  4. Festinger, L. (1954). Social comparison theory — overview and later research (upward/downward comparison)
  5. Self-Determination Theory (Deci & Ryan) — official theory site
  6. Johnson, D. W., Maruyama, G., Johnson, R., & Nelson, D. (1981). "Effects of Cooperative, Competitive, and Individualistic Goal Structures on Achievement: A Meta-Analysis."
  7. Elo rating system — formula, K-factor, known inflation issues
  8. Glickman, M. E. "Example of the Glicko-2 system" (official specification)
  9. TrueSkill Ranking System (Microsoft Research project page)
  10. OpenSkill documentation (Weng-Lin Bayesian rating models, open-source TrueSkill alternative)
  11. Item Response Theory — ability parameter, item difficulty/discrimination, logistic model
  12. World Handicap System (golf) — Handicap Index, Course Rating, Slope Rating normalization
  13. "How Duolingo Leaderboards and Leagues Work" (Duolingo blog); group-size/design-rationale detail via case study
  14. Fairplay for Kids — "Prodigy's Losing Equation" (FTC complaint coverage)
  15. NBC News — "Child protection nonprofit alleges manipulative upselling" re: Prodigy
  16. National Education Policy Center — newsletter review of Prodigy-commissioned Johns Hopkins study
  17. Financial Times — coverage of the Prodigy FTC complaint by 20+ advocacy organizations

Preguntas que este documento le deja abiertas al dueño

Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.

Uno de 51 documentos de investigación, 168.346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio