Math Challenge
Más

Leaderboards y diseño de competencia: efectos psicológicos, sistemas de calificación y comparación justa entre dificultades distintas

mc-18 · Publicado: · de Math Challenge Research · 3,328 palabras · 17 fuentes citadas

Resumen ejecutivo

435 palabras

Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.

Estado de verificación

Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.

[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.

Cómo se produjo esta investigación

Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.

Hallazgos

1. Leaderboards en educación: a quién motivan, a quién desmotivan

La revisión sistemática de 2023 “The use of leaderboards in gamified educational settings” plantea el hallazgo central como dependiente de la posición, no uniforme: la respuesta de un estudiante depende fuertemente de dónde queda en el tablero [2]. Un estudio de 2025 sobre retroalimentación basada en leaderboards aboga por “more standardized ways of examining potential effects,” porque la investigación previa mezclaba resultados positivos y nulos en lugar de separar a quienes rinden arriba, en medio y abajo [2]. El estudio de Christy y Fox (2014) encontró que una manipulación de comparación social (un leaderboard clasificado) tuvo un efecto más fuerte sobre el desempeño matemático que la amenaza del estereotipo, y algunos participantes que rindieron peor bajo la presión de la comparación aun así reportaron una identificación académica mayor — los efectos conductuales y los de motivación sentida pueden divergir [1]. Una meta-análisis más amplia de 41 estudios de gamificación (5,071 participantes) encontró un gran efecto agregado (g = 0.822) pero no pudo aislar los efectos específicos del leaderboard sobre quienes rinden abajo — un promedio positivo no significa que todas las posiciones del ranking se beneficien por igual [3]. La conclusión de diseño: los leaderboards ayudan al engagement en promedio mientras concentran el riesgo real de daño en el fondo, invisible a menos que se mida por posición.

2. La teoría de la comparación social y los niños

La teoría de Festinger (1954) sostiene que las personas evalúan sus habilidades comparándose con otros, especialmente a falta de una vara de medir objetiva [4]. La comparación hacia arriba (con alguien mejor) puede motivar a personas con alta autoestima pero desmoralizar a quienes ya dudan de sí mismas; la comparación hacia abajo protege el ánimo sin producir ganancia de aprendizaje [4]. Los niños en general tienen una autoestima menos estable que los adultos, y un leaderboard permanente, siempre orientado hacia arriba — donde el niño mediano siempre ve gente por delante y nunca se le muestra un contexto tranquilizador — favorece estructuralmente la comparación hacia arriba que la teoría señala como desmoralizante para individuos de menor confianza.

3. Teoría de la autodeterminación: la competencia como controladora vs. informativa

La teoría de la autodeterminación (Deci y Ryan) organiza la motivación en torno a la autonomía, la competencia y la vinculación, en un espectro que va de lo controlado a lo autónomo [5]. El efecto de la competencia depende de si se experimenta como retroalimentación informativa sobre la propia competencia creciente, o como presión controladora para vencer a otros. Un leaderboard del que un niño no puede salirse, visible para sus pares, que ata la identidad al rango, está más cerca de lo controlador; la misma señal de habilidad entregada en privado y enmarcada como “mejoraste” está más cerca de lo informativo. Por eso la opcionalidad importa tanto como el cálculo del ranking mismo [5].

4. Alternativas cooperativas: la evidencia

La meta-análisis de Johnson y Johnson de 1981 (122 estudios, 286 hallazgos) y una extensión posterior (148 estudios en adolescentes tempranos) encontraron ambas que las estructuras de metas cooperativas superan a las competitivas e individualistas en logro, porque los entornos cooperativos generan apoyo entre pares que los competitivos no generan [6]. Esto respalda directamente las mecánicas de equipo/total de clase (XP combinado de la clase, un total de “liga familiar”) como complemento del ranking individual — las metas cooperativas reclutan un canal motivacional que la competencia individual no puede.

5. Sistemas de calificación: Elo, Glicko-2, TrueSkill, OpenSkill

Elo: E_A = 1/(1+10^((R_B−R_A)/400)), R_A' = R_A + K·(S_A−E_A). Sin concepto de confianza — una calificación de 3 partidas se trata igual que una de 300 — y se sabe que deriva/se infla en horizontes largos (la población de ajedrez de 2700+ creció de 1 jugador en 1979 a 44 en 2012) [7].

Glicko-2 añade la Desviación de Calificación (RD), que cuantifica la confianza (se reduce con el juego, crece con la inactividad), y la volatilidad (σ), que cuantifica la consistencia de los resultados [8]. Los jugadores nuevos empiezan con RD alta (implementación de referencia: 350) para que los primeros resultados muevan las calificaciones rápido; los jugadores establecidos con RD baja se mueven lento. Un parámetro tau (τ) (~0.3–1.2) limita qué tan rápido cambia la volatilidad misma. Opera sobre períodos de calificación discretos [8].

TrueSkill (Microsoft Research) representa a cada jugador como una gaussiana (μ, σ), extendiendo la calificación bayesiana a equipos sumando las habilidades individuales (impulsa el emparejamiento de Xbox Live); no puede detectar trampas, no puede manejar handicaps intencionales y no puede separar la contribución individual cuando los jugadores se juntan consistentemente en equipo [9].

OpenSkill es una alternativa de código abierto y libre de patentes que implementa las aproximaciones bayesianas de Weng-Lin (Bradley-Terry, Plackett-Luce, Thurstone-Mosteller), orientada al emparejamiento asimétrico de múltiples equipos [10].

Ajuste para una aplicación de aprendizaje: Math Challenge es fundamentalmente un jugador contra el contenido, más cercano al dominio original de Glicko-2 (individuos, juego irregular, necesidad de una medida de confianza) que al dominio de equipos de TrueSkill/OpenSkill. Glicko-2 encaja mejor; la maquinaria de suma de equipos resuelve un problema (competencia por equipos) que hoy no se necesita, a un costo real de complejidad añadida.

6. Comparación justa entre niveles de dificultad muy distintos

Sumar ingenuamente puntos crudos premia a quien responde más problemas fáciles más rápido — exactamente contra lo que se protegen las plataformas de programación competitiva como Codeforces: “the speed in solving easier problems is often decisive” está señalado como una distorsión de puntuación conocida, corregida en la práctica calificando el rendimiento relativo a rivales de calificación conocida en lugar de un valor fijo de puntos por problema [11].

El principio generalizable es la Teoría de Respuesta al Ítem (TRI): en lugar de conteos crudos de aciertos, la TRI estima conjuntamente la habilidad de una persona (θ, un rasgo latente, estandarizado a media 0, DE 1) y la dificultad (b) y discriminación (a) de cada ítem, mediante un modelo logístico p(θ) = c + (1−c)/(1+e^(−a(θ−b))) [11]. Dos personas que respondieron ítems completamente distintos, de distinta dificultad, caen en la misma escala de habilidad — precisamente el problema del “niño de 6 años vs. doctorado” que el tablero global necesita resolver. La TRI también subyace a las pruebas adaptativas, donde cada ítem se elige para ser máximamente informativo en la estimación de habilidad actual del evaluado [11].

Un precedente no digital es el World Handicap System del golf: Course Handicap = (Handicap Index × Slope Rating)/113 + (Course Rating − Par), donde el Slope Rating (55–155) captura cuánto más difícil es un campo para un golfista bogey que para uno scratch — normalizando la habilidad del jugador y la dificultad de la tarea simultáneamente, la misma forma de problema que comparar el puntaje de sumas de un niño con el puntaje de topología de un adulto [12].

7. Antiinflación y reinicios de temporada

Los sistemas de la familia Elo derivan a medida que las poblaciones crecen; los sistemas reales lo contrarrestan con recalibración periódica y anclando la mediana de la población (Lichess reporta que su mediana se mantiene cerca de 1500 sin deriva significativa de largo plazo) [8]. La RD de Glicko-2 da una herramienta antiinflación complementaria gratis: una calificación sin ejercitar se vuelve automáticamente más incierta, de modo que un puntaje viejo no puede costearse en silencio a un valor inflado — cada reingreso a la competencia vuelve a poner a prueba el número.

8. Sandbagging y smurfing

El sandbagging (rendir deliberadamente por debajo para enfrentar rivales más fáciles) y el smurfing (un jugador hábil en una cuenta nueva de baja calificación) son modos de falla bien documentados del emparejamiento por habilidad en general. El sandbagging típicamente se detecta por una varianza de resultados inusualmente alta respecto al historial; el smurfing es inherente a dar a las cuentas nuevas calificaciones bajas/neutrales con alta incertidumbre, ya que una cuenta nueva hábil gana rápido antes de que su RD colapse y la calificación verdadera la alcance. Ninguno se resuelve solo con la fórmula — los sistemas reales combinan convergencia rápida de RD/σ con detección de anomalías fuera de la calificación misma.

9. Cómo manejan la competencia infantil los productos nombrados

10. Crítica nombrada que vale la pena tomar en serio

La crítica académica publicada de la gamificación competitiva en el aprendizaje infantil es más escasa de lo que sugiere la cobertura de la industria: la mayoría de los estudios rigurosos encuentran efectos reales pero heterogéneos — grandes ganancias agregadas junto a efectos poco claros o negativos concentrados en posiciones específicas del ranking — no una historia de “siempre bueno/malo”, y piden repetidamente medir los efectos por subgrupo en lugar del promedio de toda la clase [1][2][3].

Implicaciones de diseño para Math Challenge

  1. Adoptar Glicko-2, no Elo ni TrueSkill, como algoritmo central de calificación. Registrar (rating μ, RD, volatility σ) por jugador por banda de grado/materia. Parámetros iniciales según la referencia de Glicko-2: calificación 1500, RD 350, σ ≈ 0.06, τ en el rango 0.3–0.5 (favorecer el extremo bajo — resistir los vaivenes volátiles más de lo que lo haría un servidor de ajedrez) [8]. Usar períodos de calificación cortos (p. ej., diarios), dado que hay muchas “partidas” pequeñas (problemas) en lugar de torneos de varios días [8].
  2. No calificar cara a cara; calificar contra la dificultad del ítem, al estilo TRI. Modelar cada problema con su propia dificultad/discriminación estimada conjuntamente [11]. Un acierto en un ítem difícil es una señal mucho mayor que uno en un ítem fácil — la solución directa a “gana quien hace los problemas más fáciles más rápido”, ya que los totales de puntos crudos nunca entran en la comparación.
  3. Normalizar el tablero global sobre una estimación de habilidad (θ), nunca sobre puntos crudos ni velocidad. El θ de sumas de un niño de 6 años y el θ de matemáticas avanzadas de un adulto viven en la misma escala porque ambos se estiman a partir de respuestas a ítems calibrados por separado — el mismo principio que el Course Handicap del golf [12]. Clasificar el tablero global por θ (o una transformación acotada de él), no por XP ni por conteo de resueltos.
  4. Mantener los tableros por banda de grado y el tablero global, pero clasificar el tablero global en la misma escala θ normalizada. Los tableros por banda de grado pueden mostrar métricas más simples y apropiadas para la edad (estrellas, rachas); el ranking basado en θ se reserva para la capa que pretende ser genuinamente comparable entre edades.
  5. Ascenso/descenso de liga: mantener el tamaño de grupo de ~30 personas de Duolingo; hacer el descenso suave. Ascender semanalmente a la banda superior (p. ej., el 15-20% superior); descender solo a la banda del fondo (p. ej., el 10% inferior), y nunca descender a nadie activo menos de N días esa semana — la inactividad debe congelar, no castigar, apuntando directamente al hallazgo de “el fondo se desengancha” [1][2].
  6. Proteger estructuralmente al 20% inferior, no solo con el texto. Como el fondo de cualquier grupo experimenta comparación hacia arriba constante [4], dar a la banda inferior una señal privada y no comparativa (“mejoraste X% esta semana” contra su propio historial) en lugar de solo el rango público — reencuadrando la retroalimentación de comparativa a informativa [5].
  7. Nunca mostrar por defecto a un niño el número literal del último lugar. El daño empírico se concentra en el último lugar [1][2]; mostrar bandas de “mitad superior / no mitad superior” en lugar del rango exacto para los niveles más jóvenes, reservando el rango numérico exacto para el tablero global (opcional) y las bandas de grado mayores.
  8. Hacer el leaderboard opcional y reversible. Los usuarios (o un padre/maestro) deben poder salirse del tablero global público mientras siguen usando las ligas/el modo salón de clases, o viceversa, según el propio precedente de Duolingo y el principio de autonomía de la TAD [5][13].
  9. Añadir una capa cooperativa junto al ranking individual: totales de clase/familia. Según la evidencia de Johnson y Johnson [6], añadir una métrica de total de clase o de equipo (aciertos combinados, días de racha combinados) para el modo salón de clases que triunfa o fracasa en conjunto, reclutando el aliento entre pares como segundo canal motivacional.
  10. Protegerse del sandbagging/smurfing estructuralmente, no por confianza. Las cuentas nuevas reciben RD/σ altas para que las victorias tempranas de un smurf se autocorrijan en un puñado de sesiones [8]. Marcar para revisión las cuentas con varianza de resultados anómalamente alta en lugar de prevenir el sandbagging solo con reglas.
  11. Reiniciar las clasificaciones de temporada, pero mantener θ/RD/σ persistentes entre temporadas. Las clasificaciones públicas de la liga semanal deben reiniciarse cada ciclo; la estimación privada de habilidad debe persistir y simplemente recuperar incertidumbre durante los huecos — el mismo mecanismo antiinflación que usan los sistemas reales, y evita castigar a un niño que regresa tras un receso del año escolar.
  12. No dejar que las mecánicas de juego/recompensa superen al contenido matemático. La crítica documentada de Prodigy concierne específicamente a mecánicas de progreso de juego/monetización que diluyen el tiempo de práctica matemática [14][15][16]; limitar la fracción del tiempo de sesión en el ciclo de juego no matemático, y mapear cada evento que otorga puntos/XP a un problema matemático realmente respondido.
  13. Reportar los efectos del leaderboard por posición de rango en las analíticas propias de Math Challenge. Como la queja central de la literatura es que la mayoría de los estudios solo reportan un efecto promediado [1][2][3], instrumentar el producto para seguir retención/engagement por separado para usuarios de banda superior, media e inferior dentro de cada liga — la única forma de detectar temprano el patrón de “el fondo se desengancha”.
  14. En el modo salón de clases, dejar que el maestro elija la intensidad competitiva por salón. Dar a los maestros un interruptor por salón entre modo clasificado individual, modo cooperativo por equipos o modo de práctica con ranking oculto — operacionalizando los hallazgos de la TAD/aprendizaje cooperativo como un control real en lugar de una política global fija [5][6].

Preguntas abiertas para el dueño del proyecto

  1. ¿El tablero global debería clasificar por θ crudo, o por una transformación acotada/normalizada (p. ej., percentil dentro de la cohorte de mismo grado) — el θ crudo es más “honesto”, el percentil más legible para un niño sin exigirle entender un número de calificación?
  2. ¿Qué cadencia de período de calificación — diaria o por sesión — encaja con la frecuencia de juego esperada de Math Challenge? Esto ajusta el decaimiento de la RD de Glicko-2.
  3. ¿El descenso debería suspenderse por completo alguna vez para la banda de grado más joven, o el descenso suave (10% inferior, solo activos) es suficiente en todas las edades?
  4. ¿El interruptor de intensidad competitiva por salón del maestro debería ser un ajuste único del salón o ajustable a media semana, y cambiarlo reinicia las clasificaciones de esa semana?
  5. ¿Hay disposición a construir “mejorado respecto a tu propio historial” como métrica de primera clase para la banda inferior desde el lanzamiento, o eso queda para una iteración posterior?
  6. ¿La dificultad de los ítems nuevos debería sembrarse desde el currículo (heurística por nivel de grado) con refinamiento TRI en línea desde el día uno, o lanzar solo con currículo y añadir la calibración TRI cuando haya suficientes datos de respuesta?

Fuentes

  1. Christy, K. R., & Fox, J. (2014). "Leaderboards in a virtual classroom: A test of stereotype threat and social comparison explanations for women's math performance." Computers & Education, 78
  2. "The use of leaderboards in gamified educational settings: A systematic review" (2023)
  3. Meta-analysis of gamification effects on student learning outcomes (41 studies, 5,071 participants)
  4. Festinger, L. (1954). Social comparison theory — overview and later research (upward/downward comparison)
  5. Self-Determination Theory (Deci & Ryan) — official theory site
  6. Johnson, D. W., Maruyama, G., Johnson, R., & Nelson, D. (1981). "Effects of Cooperative, Competitive, and Individualistic Goal Structures on Achievement: A Meta-Analysis."
  7. Elo rating system — formula, K-factor, known inflation issues
  8. Glickman, M. E. "Example of the Glicko-2 system" (official specification)
  9. TrueSkill Ranking System (Microsoft Research project page)
  10. OpenSkill documentation (Weng-Lin Bayesian rating models, open-source TrueSkill alternative)
  11. Item Response Theory — ability parameter, item difficulty/discrimination, logistic model
  12. World Handicap System (golf) — Handicap Index, Course Rating, Slope Rating normalization
  13. "How Duolingo Leaderboards and Leagues Work" (Duolingo blog); group-size/design-rationale detail via case study
  14. Fairplay for Kids — "Prodigy's Losing Equation" (FTC complaint coverage)
  15. NBC News — "Child protection nonprofit alleges manipulative upselling" re: Prodigy
  16. National Education Policy Center — newsletter review of Prodigy-commissioned Johns Hopkins study
  17. Financial Times — coverage of the Prodigy FTC complaint by 20+ advocacy organizations

Preguntas que este documento le deja abiertas al dueño

Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.

Uno de 51 documentos de investigación, 168,346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio