Tablas de clasificación y diseño de competición: efectos psicológicos, sistemas de puntuación y comparación justa entre dificultades
Resumen ejecutivo
- Las tablas de clasificación en educación tienen efectos mixtos y dependientes de la posición: motivan a quienes están cerca de la cima, pero desmotivan de forma constante a quienes quedan en el último puesto — la revisión sistemática de 2023 sobre tablas de clasificación en entornos gamificados documenta este patrón «de arriba a abajo» y pide medir el efecto por posición, no solo la media de la clase [1][2].
- La teoría de la comparación social de Festinger (1954) explica el mecanismo: comparar «hacia arriba» puede motivar o deprimir según la autoestima previa; comparar «hacia abajo» protege el ánimo pero no enseña nada. Una tabla de clasificación sin diseño cuidadoso maximiza la comparación hacia arriba para la mayor parte del grupo [4].
- Christy y Fox (2014), en un aula virtual, encontraron que el componente de comparación social (el ranking) pesó más que la amenaza del estereotipo en el rendimiento matemático de las mujeres — el ranking en sí cambia el resultado, no solo el contenido [1].
- La teoría de la autodeterminación (Deci y Ryan) predice que la competencia percibida como controladora desplaza la motivación intrínseca; por eso es importante que participar en el ranking sea opcional [5].
- El meta‑análisis de Johnson y Johnson (1981, 122+ estudios) muestra que las estructuras cooperativas superan de forma constante a las competitivas e individualistas tanto en logro como en relaciones entre pares [6].
- Glicko‑2 (con desviación de calificación (RD) y volatilidad σ) resulta más apropiado que el Elo simple para un juego con sesiones irregulares como Math Challenge; TrueSkill/OpenSkill resuelven un problema de equipos que este proyecto aún no tiene [7][8][9][10].
- Para comparar a un niño de 6 años que suma con un adulto en temáticas avanzadas, la solución adecuada es una escala de habilidad (θ) estimada independientemente de los ítems respondidos — el enfoque de la Teoría de Respuesta al Ítem (TRI), y lo que Codeforces aproxima al valorar el rendimiento relativo al rival, no el valor nominal del problema [11].
- El sistema de ligas de Duolingo (grupos semanales de ~30 con ascenso/descenso) es la referencia más cercana al diseño ya decidido para Math Challenge; el tamaño reducido del grupo es intencional: mantiene una posición alcanzable para cualquiera esa semana [13].
- El «sandbagging» (bajar el rendimiento a propósito) y el «smurfing» (cuentas nuevas para jugar por debajo del nivel real) son fallas conocidas de cualquier emparejamiento por habilidad; se mitigan con RD/volatilidad alta en cuentas nuevas, no con normas manuales.
- Prodigy Math ha recibido críticas documentadas (queja ante la FTC de 20+ organizaciones, cobertura de NBC News y Financial Times) por mecánicas de juego que diluyen el contenido matemático real — advertencia directa contra dejar que la capa de juego devore el aprendizaje [14][15][16].
Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.
Estado de verificación
Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.
[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.
Cómo se produjo esta investigación
Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.
Esto es investigación, no asesoría legal, médica ni financiera. Nada aquí reclama un resultado de aprendizaje de Math Challenge; ese estudio todavía no existe.
Resultados
1. Tablas de clasificación en educación: a quién motivan y a quién desmotivan
La revisión sistemática de 2023 «The use of leaderboards in gamified educational settings» plantea el hallazgo central como dependiente de la posición, no uniforme: la respuesta del alumno depende en gran medida de dónde se sitúe en la tabla [2]. Un estudio de 2025 sobre retroalimentación basada en tablas de clasificación aboga por «formas más estandarizadas de examinar los efectos potenciales», porque la investigación anterior mezcló resultados positivos y nulos sin separar a los mejores, intermedios y peor clasificados [2]. El estudio de Christy y Fox (2014) encontró que una manipulación de comparación social (una tabla de clasificación ordenada) tuvo un efecto más fuerte sobre el rendimiento en matemáticas que la amenaza de estereotipo, y algunos participantes que obtuvieron peores resultados bajo presión comparativa aun así reportaron una mayor identificación académica — los efectos conductuales y de motivación sentida pueden divergir [1]. Un meta‑análisis más amplio de 41 estudios de gamificación (5.071 participantes) halló un gran efecto agregado (g = 0,822) pero no pudo aislar efectos específicos de las tablas de clasificación sobre los participantes de menor rendimiento — una media positiva no implica que todas las posiciones se beneficien por igual [3]. La conclusión de diseño: las tablas de clasificación aumentan el compromiso en promedio, mientras concentran un riesgo real de daño en la parte inferior, invisible a menos que se mida por posición.
2. Teoría de la comparación social y niños
La teoría de Festinger (1954) sostiene que las personas evalúan sus habilidades comparándose con los demás, sobre todo cuando falta una referencia objetiva [4]. La comparación ascendente (con alguien mejor) puede motivar a personas con alta autoestima, pero desmoralizar a quienes ya dudan de sí mismas; la comparación descendente protege el estado de ánimo sin producir ganancia de aprendizaje [4]. Los niños, en general, poseen una autoestima menos estable que los adultos, y una tabla de clasificación permanente y siempre orientada hacia arriba — donde el niño medio siempre ve a otros por delante y nunca se le muestra un contexto tranquilizador — favorece estructuralmente la comparación ascendente que la teoría señala como desmoralizadora para individuos con baja confianza.
3. Teoría de la autodeterminación: la competición como controladora vs. informativa
La teoría de la autodeterminación (Deci y Ryan) organiza la motivación en torno a la autonomía, la competencia y la relación, en un espectro que va de lo controlado a lo autónomo [5]. El efecto de la competición depende de si se percibe como retroalimentación informativa sobre la propia competencia creciente, o como presión controladora para superar a los demás. Una tabla de clasificación a la que un niño no puede renunciar, visible para sus compañeros y que vincula la identidad al rango, se sitúa más cerca de lo controlado; la misma señal de habilidad entregada de forma privada y enmarcada como «has mejorado» se acerca más a lo informativo. Por eso la opcionalidad importa tanto como el propio cálculo del ranking [5].
4. Alternativas cooperativas: la evidencia
El meta‑análisis de Johnson y Johnson (1981) (122 estudios, 286 hallazgos) y una ampliación posterior (148 estudios sobre adolescentes tempranos) encontraron que las estructuras de objetivo cooperativo superan a las competitivas e individualistas en rendimiento, porque los entornos cooperativos generan apoyo entre pares que los competitivos no ofrecen [6]. Esto respalda directamente mecánicas de equipo/total de clase (XP combinada, una «liga familiar» total) como complemento al ranking individual: los objetivos cooperativos reclutan un canal motivacional que la competición individual no puede.
5. Sistemas de puntuación: Elo, Glicko-2, TrueSkill, OpenSkill
Elo: E_A = 1/(1+10^((R_B−R_A)/400)), R_A' = R_A + K·(S_A−E_A). No contempla confianza — una puntuación tras 3 partidas se trata igual que una tras 300 — y se sabe que tiende a derivar/inflarse a largo plazo (la población de ajedrez con más de 2.700 jugadores pasó de 1 jugador en 1979 a 44 en 2012) [7].
Glicko-2 añade Desviación de Rating (RD), que cuantifica la confianza (se reduce con el juego y aumenta con la inactividad), y volatilidad (σ), que cuantifica la consistencia de los resultados [8]. Los jugadores nuevos comienzan con RD alta (implementación de referencia: 350) de modo que los resultados iniciales mueven la puntuación rápidamente; los jugadores consolidados con RD baja se mueven despacio. Un parámetro tau (τ) (~0,3–1,2) limita la velocidad de cambio de la propia volatilidad. Funciona sobre periodos de rating discretos [8].
TrueSkill (Microsoft Research) representa a cada jugador como una gaussiana (μ, σ), extendiendo la valoración bayesiana a equipos mediante la suma de habilidades individuales (potencia del emparejamiento de Xbox Live); no puede detectar trampas, no gestiona handicaps intencionales y no separa la contribución individual cuando los jugadores forman equipos de forma constante [9].
OpenSkill es una alternativa de código abierto, libre de patentes, que implementa aproximaciones bayesianas de Weng‑Lin (Bradley‑Terry, Plackett‑Luce, Thurstone‑Mosteller), dirigida al emparejamiento asimétrico de múltiples equipos [10].
Adecuación para una app de aprendizaje: Math Challenge es fundamentalmente un juego individual contra el contenido, más cercano al dominio original de Glicko-2 (individuos, juego irregular, necesidad de medida de confianza) que al dominio de equipos de TrueSkill/OpenSkill. Glicko-2 encaja mejor; la maquinaria de suma de equipos resuelve un problema (competición por equipos) que actualmente no se necesita, con una complejidad añadida real.
6. Comparación justa entre niveles de dificultad muy diferentes
Sumar ingenuamente puntos brutos premia a quien responde más rápido a los problemas más fáciles — exactamente lo que plataformas de programación competitiva como Codeforces intentan evitar: «la velocidad en resolver problemas más fáciles suele ser decisiva», se señala como una distorsión conocida del puntuación, corregida en la práctica valorando el rendimiento relativo a oponentes de rating conocido en lugar de un valor fijo por problema [11].
El principio generalizable es la Teoría de Respuesta al Ítem (IRT): en lugar de contar respuestas correctas crudas, IRT estima conjuntamente la habilidad de una persona (θ, rasgo latente, estandarizado a media 0, DE 1) y la dificultad (b) y discriminación (a) de cada ítem, mediante un modelo logístico p(θ) = c + (1−c)/(1+e^(−a(θ−b))) [11]. Dos personas que respondieron ítems completamente diferentes, con dificultades distintas, quedan situadas en la misma escala de habilidad — precisamente el problema del «niño de 6 años vs. doctorado» que necesita resolver el tablero global. IRT también sustenta los tests adaptativos, donde cada ítem se elige para ser lo más informativo posible según la estimación actual de habilidad del examinado [11].
Un precedente no digital es el World Handicap System del golf: Course Handicap = (Handicap Index × Slope Rating)/113 + (Course Rating − Par), donde el Slope Rating (55–155) captura cuánto más difícil es un campo para un golfista bogey que para uno scratch — normalizando simultáneamente la habilidad del jugador y la dificultad de la tarea, la misma forma de problema que comparar la puntuación de suma de un niño con la de un adulto en topología [12].
7. Antiinflación y reinicios de temporada
Los sistemas de la familia Elo tienden a derivar a medida que la población crece; los sistemas reales contrarrestan esto con recalibraciones periódicas y anclando la mediana poblacional (Lichess informa que su mediana se mantiene cerca de 1.500 sin deriva significativa a largo plazo) [8]. El RD de Glicko-2 ofrece una herramienta antiinflación complementaria de forma gratuita: una puntuación no ejercitada crece automáticamente en incertidumbre, de modo que una puntuación antigua no puede mantenerse silenciosamente inflada — cada reingreso a la competición vuelve a probar el número.
8. Sandbagging y smurfing
El sandbagging (bajar deliberadamente el rendimiento para enfrentarse a oponentes más fáciles) y el smurfing (un jugador hábil con una cuenta nueva y de rating bajo) son modos de falla bien documentados del emparejamiento por habilidad en general. El sandbagging suele detectarse por una variación de resultados inusualmente alta respecto al historial; el smurfing es inherente a asignar a cuentas nuevas ratings bajos/neutros con alta incertidumbre, ya que una cuenta hábil gana rápidamente antes de que su RD colapse y su rating verdadero se ajuste. Ninguno se resuelve solo con la fórmula — los sistemas reales combinan una rápida convergencia de RD/σ con detección de anomalías fuera del propio rating.
9. How named products handle child competition
- Duolingo: ligas semanales de ~30 alumnos agrupados por nivel de actividad y zona horaria, clasificados por XP, promoción de los mejores y degradación de los peor clasificados, un torneo de eliminación de nivel superior y la posibilidad de excluirse totalmente del tablero de clasificación [13].
- Khan Academy: puntos de energía y un sistema de insignias de cinco niveles para habilidades/vídeos/desafíos; existen tableros para varios métricos, pero el encuadre enfatiza los puntos e insignias como reconocimiento del esfuerzo y del dominio.
- Zearn: explícitamente basado en el dominio y no competitivo — las lecciones se desbloquean mediante una comprobación de dominio “Torre de Poder” en lugar de superar a los compañeros, sin tablero de clasificación en su documentación de diseño; la justificación declarada es la equidad y el ritmo individualizado.
- Prodigy Math: progreso del juego y moneda dentro del juego superpuestos al contenido de matemáticas; recibió una denuncia ante la FTC de más de 20 organizaciones defensoras de menores (cobertura de Financial Times y NBC News) que alegan prácticas de marketing manipulador, engañoso y de venta adicional dirigidas a niños, y una revisión del NEPC que concluye que un estudio comisionado por Prodigy y realizado por Johns Hopkins “no respalda” las afirmaciones de la empresa sobre resultados de aprendizaje [14][15][16].
- Mathletics / Live Mathletics (3P Learning): organiza grandes competiciones con límite de tiempo (“World Maths Day”) y un modo “Live Mathletics” cara a cara en tiempo real; los detalles mecánicos no fueron accesibles de forma independiente y deben considerarse como no confirmados.
10. Named criticism worth taking seriously
La crítica académica publicada sobre la gamificación competitiva en el aprendizaje infantil es más escasa de lo que sugiere la cobertura mediática: la mayoría de los estudios rigurosos encuentran efectos reales pero heterogéneos — grandes ganancias agregadas junto a efectos poco claros o negativos concentrados en posiciones de rango específicas — y no una historia de “siempre bueno/malo”, llamando repetidamente a medir los efectos por subgrupo en lugar de por la media de toda la clase [1][2][3].
Design implications for Math Challenge
- Adoptar Glicko-2, no Elo ni TrueSkill, como algoritmo central de puntuación. Registrar
(rating μ, RD, volatility σ)por jugador por tramo de curso/asignatura. Parámetros iniciales según la referencia de Glicko-2: rating 1.500, RD 350, σ ≈ 0,06, τ en el rango 0,3–0,5 (favorecer el extremo bajo —resistir oscilaciones volátiles más que un servidor de ajedrez) [8]. Utilizar periodos de puntuación cortos (p. ej., diarios), dado el gran número de “partidos” pequeños (problemas) en lugar de torneos de varios días [8]. - No puntuar cara a cara; puntuar contra la dificultad del ítem, estilo IRT. Modelar cada problema con su propia dificultad/discriminación estimada conjuntamente [11]. Una respuesta correcta a un ítem difícil es una señal mucho mayor que a uno fácil —la solución directa al “quien resuelve los problemas más fáciles más rápido gana”, ya que los totales de puntos brutos nunca entran en la comparación.
- Normalizar el tablero global sobre una estimación de capacidad (θ), nunca sobre puntos o velocidad brutos. El θ de un niño de 6 años en sumas y el θ de un adulto en matemáticas avanzadas comparten la misma escala porque ambos se estiman a partir de respuestas a ítems calibrados por separado —el mismo principio que el “Course Handicap” del golf [12]. Clasificar el tablero global por θ (o una transformación acotada del mismo), no por XP o número de ejercicios resueltos.
- Mantener tableros por tramo de curso y el tablero global, pero clasificar el tablero global con la misma escala normalizada de θ. Los tableros por tramo pueden mostrar métricos más simples y apropiados para la edad (estrellas, rachas); la clasificación basada en θ se reserva para la capa que pretende ser verdaderamente comparable entre edades.
- Promoción/degradación de liga: mantener el tamaño de grupo de Duolingo de ~30 personas; hacer la degradación suave. Promocionar la banda superior (p. ej., el 15-20 % superior) semanalmente; degradar solo la banda muy inferior (p. ej., el 10 % inferior), y nunca degradar a quien haya estado activo menos de N días esa semana —la inactividad debe congelar, no castigar, abordando directamente el hallazgo de “el fondo se desengancha” [1][2].
- Proteger estructuralmente al 20 % inferior, no solo mediante copia. Dado que el fondo de cualquier grupo experimenta comparaciones ascendentes constantes [4], ofrecer a la banda inferior una señal privada y no comparativa (“has mejorado X % esta semana” respecto a tu propio historial) en lugar de solo el rango público —reencuadrando la retroalimentación de comparativa a informativa [5].
- Nunca mostrar por defecto el número literal de posición último a un niño. El daño empírico se concentra en el extremo inferior [1][2]; mostrar bandas “mitad superior / no mitad superior” en lugar del rango exacto para los tramos más jóvenes, reservando el rango numérico exacto para el tablero global (opt‑in) y los tramos de curso superiores.
- Hacer el tablero opcional y reversible. Los usuarios (o un padre/docente) deben poder excluirse del tablero global público mientras siguen usando el modo de ligas/aula, o viceversa, siguiendo el precedente de Duolingo y el principio de autonomía de la SDT [5][13].
- Añadir una capa cooperativa junto a la clasificación individual: totales de clase/familia. Según la evidencia de Johnson & Johnson [6], añadir una métrica de total de clase o de equipo (respuestas correctas combinadas, días de racha combinados) para el modo aula que tenga éxito o fracaso conjunto, reclutando el estímulo entre pares como segundo canal motivacional.
- Proteger contra sandbagging/smurfing estructuralmente, no por confianza. Las cuentas nuevas reciben RD/σ altos, de modo que las victorias tempranas de un smurf se autocorrigen en unas cuantas sesiones [8]. Señalar cuentas con varianza de resultados anómalamente alta para revisión en lugar de impedir el sandbagging solo con reglas.
- Reiniciar la clasificación de la temporada, pero mantener θ/RD/σ persistentes entre temporadas. Las clasificaciones semanales públicas deben reiniciarse cada ciclo; la estimación privada de capacidad debe persistir y simplemente recuperar incertidumbre durante los intervalos —el mismo mecanismo antiinflación que usan los sistemas reales, y evita castigar a un niño que regresa tras una pausa escolar.
- No dejar que las mecánicas de juego/recompensa superen al contenido matemático. La crítica documentada a Prodigy se centra en que el progreso del juego y la monetización diluyen el tiempo de práctica matemática [14][15][16]; limitar la fracción del tiempo de sesión dedicada a bucles de juego no matemáticos, y mapear cada evento de obtención de puntos/XP a un problema de matemáticas realmente respondido.
- Informar de los efectos del tablero por posición de rango en la propia analítica de Math Challenge. Dado que la queja central de la literatura es que la mayoría de los estudios solo reportan un efecto promedio [1][2][3], instrumentar el producto para rastrear retención/compromiso por separado para usuarios de los tramos superior, medio e inferior dentro de cada liga —la única forma de detectar temprano el patrón de “el fondo se desengancha”.
- Para el modo aula, permitir al docente elegir la intensidad competitiva por aula. Ofrecer a los docentes un conmutador por aula entre modo individual clasificado, modo cooperativo por equipos o modo de práctica con clasificación oculta —operacionalizando los hallazgos de la SDT y del aprendizaje cooperativo como un control real en lugar de una política global fija [5][6].
Open questions for the project owner
- ¿Debe el tablero global clasificar por θ bruto, o por una transformación acotada/normalizada (p. ej., percentil dentro de la cohorte emparejada por curso) —θ bruto es más “honesto”, el percentil más legible para un niño sin necesidad de comprender un número de rating?
- ¿Qué cadencia de periodo de puntuación —diario o por sesión— se ajusta a la frecuencia de juego esperada de Math Challenge? Esto afina la decadencia del RD de Glicko-2.
- ¿Debe la degradación suspenderse totalmente para el tramo de curso más joven, o la degradación suave (10 % inferior, solo activos) es suficiente para todas las edades?
- ¿El conmutador de intensidad competitiva del docente por aula debe ser una configuración única o ajustable a mitad de semana, y cambiarlo ¿reinicia la clasificación de esa semana?
- ¿Existe interés en construir “mejorado respecto a tu propio historial” como métrica de primera clase para la banda inferior desde el lanzamiento, o es un alcance para una iteración posterior?
- ¿Debe la dificultad de los nuevos ítems estar sembrada por currículo (heurística de nivel de curso) con refinamiento IRT en línea desde el primer día, o lanzar solo con currículo y añadir calibración IRT una vez que exista suficiente datos de respuesta?
Fuentes
- Christy, K. R., & Fox, J. (2014). "Leaderboards in a virtual classroom: A test of stereotype threat and social comparison explanations for women's math performance." Computers & Education, 78
- "The use of leaderboards in gamified educational settings: A systematic review" (2023)
- Meta-analysis of gamification effects on student learning outcomes (41 studies, 5,071 participants)
- Festinger, L. (1954). Social comparison theory — overview and later research (upward/downward comparison)
- Self-Determination Theory (Deci & Ryan) — official theory site
- Johnson, D. W., Maruyama, G., Johnson, R., & Nelson, D. (1981). "Effects of Cooperative, Competitive, and Individualistic Goal Structures on Achievement: A Meta-Analysis."
- Elo rating system — formula, K-factor, known inflation issues
- Glickman, M. E. "Example of the Glicko-2 system" (official specification)
- TrueSkill Ranking System (Microsoft Research project page)
- OpenSkill documentation (Weng-Lin Bayesian rating models, open-source TrueSkill alternative)
- Item Response Theory — ability parameter, item difficulty/discrimination, logistic model
- World Handicap System (golf) — Handicap Index, Course Rating, Slope Rating normalization
- "How Duolingo Leaderboards and Leagues Work" (Duolingo blog); group-size/design-rationale detail via case study
- Fairplay for Kids — "Prodigy's Losing Equation" (FTC complaint coverage)
- NBC News — "Child protection nonprofit alleges manipulative upselling" re: Prodigy
- National Education Policy Center — newsletter review of Prodigy-commissioned Johns Hopkins study
- Financial Times — coverage of the Prodigy FTC complaint by 20+ advocacy organizations
Preguntas que este documento le deja abiertas al dueño
Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.
- Should the global board rank by raw θ, or by a bounded/normalized transform (e.g., percentile within grade-matched cohort) — raw θ is more "honest," percentile more legible to a child without requiring them to understand a rating number?
- What rating-period cadence — daily or per-session — fits Math Challenge's expected play frequency? This tunes Glicko-2's RD decay.
- Should demotion ever be fully suspended for the youngest grade band, or is soft demotion (bottom 10%, active-only) sufficient across all ages?
- Should the teacher's per-room competitive-intensity toggle be a one-time room setting or adjustable mid-week, and does changing it reset that week's standings?
- Is there appetite to build "improved over your own history" as a first-class metric for the bottom band at launch, or is that scope for a later iteration?
- Should new-item difficulty be curriculum-seeded (grade-level heuristic) with online IRT refinement from day one, or launch curriculum-only and add IRT calibration once enough response data exists?
Uno de 51 documentos de investigación, 168.346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio