Math Challenge
Más

Sistema de gamificación de Duolingo y la investigación detrás de los mecanismos de compromiso

mc-16 · Publicado: · de Math Challenge Research · 3209 palabras · 17 fuentes citadas

Resumen ejecutivo

390 palabras

Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.

Estado de verificación

Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.

[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.

Cómo se produjo esta investigación

Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.

Findings

Streaks and streak freezes

El contador de rachas consecutivas de días es descrito por el propio equipo de Duolingo, según fuentes secundarias, como «la palanca más importante del producto para impulsar los usuarios activos diarios» [2]. El mecanismo citado es la aversión a la pérdida, que crece con la longitud de la racha: una racha de 1.000 días se defiende con mayor dureza que una de 5 días [2][9]. Fuentes secundarias informan de aproximadamente 9 M de usuarios con rachas de más de un año, sin verificación independiente aquí [2].

Streak Freeze, un consumible que protege un día perdido, suaviza una mecánica de todo o nada [9][1]. Las cifras reportadas — reducción del churn del 21 % para usuarios en riesgo; micro‑pruebas que muestran aproximadamente +1 % DAU /+3 % D14 al enfatizar la racha tras la lección, +4 % D14 con un «amuleto de fin de semana» y +14 % D14 al aceptar apuestas de racha — no pudieron rastrearse a un documento primario de Duolingo; aparecen en varios blogs de analítica de producto que describen pruebas internas, pero el post original no se encontró ni confirmó, por lo que se trata de datos plausibles pero no verificados [1][15]. «Friend Streaks» extiende la misma lógica de aversión a la pérdida a una racha compartida entre dos personas [2].

XP, gems, and lingots

El XP es la unidad base por ejercicio que determina la posición semanal en la liga; no parece limitar el acceso al contenido [15]. Las gemas (antes llamadas lingotes) son una moneda secundaria obtenida en lecciones, hitos y misiones, que se gastan en cosméticos y en reparar rachas [2]. Las recompensas se asignan de forma aleatoria, y el «Daily Chest» retrasa la entrega completa de la recompensa aproximadamente 9‑10 horas después de cada ciclo de 24 horas — una estructura variable y retrasada asociada a un retorno habitual más fuerte que las recompensas fijas e inmediatas [2].

Hearts / energy and the monetization controversy

Los corazones limitan los errores antes de bloquear la práctica gratuita hasta que se regeneran o se compran [5]. Esta es la mecánica más criticada de forma constante: las fuentes describen a Duolingo restringiendo el aprendizaje gratuito específicamente para impulsar las suscripciones Super/Max, con «prácticamente todo» en la aplicación enlazado a la versión premium [5]. Esto contrasta con el compromiso público original de Duolingo de no mostrar anuncios, suscripciones ni compras dentro de la app; hoy ofrece los tres [5]. El propio cofundador y CEO Luis von Ahn, en una entrevista para la Harvard Digital Initiative, contrapone que Duolingo es como «una máquina elíptica»: lo que importa es que el usuario haga algo de forma constante, no que el resultado sea perfecto — una confesión directa de que el objetivo de diseño explícito es el compromiso, no la rigurosidad del aprendizaje [9]. Mezcla de monetización (no verificada): ~75 % de los ingresos provienen de suscripciones, ~9 % de anuncios [2].

Leagues / Leaderboards

Duolingo gestiona una escalera semanal por niveles — Bronce, Rubí, Esmeralda, Perla, Zafiro y una liga superior Diamante, que según la mayoría de descripciones públicas no tiene un límite inferior de degradación, funcionando como una escalera sin fin [2][3]. Los cohortes agrupan a usuarios con XP reciente similar; los mejores se promocionan semanalmente y los peor clasificados se degradan. Fuentes secundarias que resumen lo que parecen ser informes internos previos al lanzamiento afirman que las ligas aumentaron tanto los inicios de sesión como la finalización de lecciones antes de su despliegue amplio [3]; no se localizó ningún documento fuente verificable con cifras concretas, por lo que se trata de una tendencia, no de una estadística confirmada. El mecanismo citado es la comparación social más la aversión a la pérdida: la zona de degradación funciona como su propia cuenta atrás, independiente de la racha [2][3].

Daily quests and timed events

Las Misiones Diarias (objetivos del mismo día) y las Misiones Mensuales (recompensas con insignias) se ejecutan junto a las capas de racha y liga, ofreciendo múltiples motivos independientes para volver cada día [2]. Duolingo también organiza eventos breves con ventanas de 2‑3 horas, como una «Happy Hour» los sábados, «Desafíos de Incremento de XP» y celebraciones sociales [2]. El patrón constante: lecciones de 3‑5 minutos divididas en 8‑10 micro‑ejercicios de 10‑20 segundos, superpuestos a varios temporizadores de recompensa (misión, racha, semana de liga, evento) de modo que al menos un reloj suele estar próximo a expirar [2].

Push notifications and the “passive‑aggressive owl”

Este es el apartado con la documentación primaria más sólida. Un post del blog de ingeniería de Duolingo describe un algoritmo de bandido multi‑brazo que selecciona qué notificación enviar a un usuario que está decayendo [6][8]. La empresa afirma haber analizado aproximadamente 200 millones de recordatorios de práctica durante 34 días, generando decenas de millones de nuevos registros semanales, mediante una canalización AWS Kinesis Firehose/Spark [6]. La personalización se realiza a nivel de segmento — por ejemplo, «Hora de [idioma]» funciona bien para aprendices de chino pero suele fallar para los de inglés — y el bandido atenúa las variantes mostradas recientemente para combatir la fatiga en lugar de converger en un único mensaje «óptimo» [6]. Duolingo reporta que el enfoque ayudó a «decenas de miles» de nuevos aprendices que habían abandonado a volver en semanas, sin revelar el porcentaje de incremento [6].

Un análisis secundario describe cinco «ganchos motivacionales» rotativos (continuidad, competición, pertenencia, finalización, recompensa) y dos clases de notificaciones: impulsos «de rutina» enviados durante la ventana de hábito detectada del usuario (no en un reloj fijo), y impulsos «de salvado» reservados para momentos de pérdida inminente, supuestamente limitados a dos por día (no confirmado) [4]. El principio declarado — «el comportamiento desencadena el ciclo, no el reloj» — refleja un cambio respecto a los horarios de recordatorio elegidos por el usuario, que según los datos tuvieron un rendimiento inferior [4]. El meme del «búho pasivo‑agresivo» es descrito por los analistas como una decisión deliberada basada en datos: mensajes que rompen el patrón y cargan emocionalmente superan mediblemente a los recordatorios genéricos en algunos segmentos [4][8].

Duolingo Max and AI features

Anunciado en marzo de 2023, Duolingo Max incorpora Roleplay impulsado por GPT‑4 (práctica de conversación con IA, que genera XP) y Explain My Answer (desgloses gramaticales), además de una función relacionada de Video Call con un personaje que conserva la memoria [7]. El anuncio oficial no publica cifras de retención, duración de sesión ni churn [7]. Afirmaciones como «sesiones 2× más largas» o «mejora de retención del 20‑30 %» aparecen en resúmenes de búsqueda pero no pudieron rastrearse a una divulgación verificable de Duolingo — se consideran no confirmadas. El estudio de caso de OpenAI enfatiza la velocidad de desarrollo (un prototipo funcional en aproximadamente un día), no métricas de resultados de usuario [7].

Duolingo’s A/B testing culture

Duolingo se describe de forma constante, tanto por la propia empresa como por analistas, como ejecutando numerosos tests A/B concurrentes en casi todas las superficies — visuales de racha, redacción de notificaciones, precios de congelación, incorporación, diseño de insignias [1][2]. Una fuente secundaria atribuye resultados específicos a esta cultura: un tratamiento de punto rojo que supuestamente aporta +1,6 % DAU; una notificación con mascota que genera +5 % DAU; una rediseño de insignia que produce +116 % referidos; y una renovación del onboarding que eleva +20 % la retención al día siguiente [1]. Como se indica arriba, estos números provienen de un blog secundario que describe publicaciones propias de Duolingo, y el original no pudo localizarse de forma independiente — se incluyen por su amplia difusión, pero sin verificación primaria.

Company‑level metrics (press/analyst‑relayed, not independently verified here)

Fuentes secundarias informan: > 100 M MAU, ~ 37 M DAU, ~ 50 % de crecimiento interanual de DAU, crecimiento de la base de usuarios 4× desde 2020; el churn en los principales mercados habría caído del 47 % (2020) al 28 % (2024‑2026); el DAU habría duplicado de ~ 16 M (2021) a más de 30 M (2023); los ingresos del cuarto trimestre de 2023 habrían aumentado un 45 % interanual [2][10]. Los intentos de acceder a la página de relaciones con inversores de Duolingo y a un PDF de carta a accionistas fallaron (403/tiempo de espera) en esta sesión, por lo que ninguna de estas cifras fue contrastada con un documento primario — se recomienda volver a verificar contra una carta a accionistas real antes de utilizarlas en material externo.

Academic literature: meta-analyses and the novelty effect

Sailer & Homner (2020), Educational Psychology Review 32(1), 77‑112, encontró efectos significativos de pequeña a moderada magnitud de la gamificación en resultados cognitivos (g=0,49), motivacionales (g=0,36) y conductuales (g=0,25) [11]. El encuadre de ficción/narrativa del juego y la combinación de competición con colaboración (no solo competición) fueron moderadores significativos del efecto conductual — la competición pura en una tabla de clasificación es un diseño más débil que uno que combina ambos [11]. Conclusión: la gamificación «tal como se operacionaliza actualmente» es eficaz, pero los factores de diseño que impulsan el éxito siguen sin resolverse, especialmente a nivel cognitivo [11].

Hamari, Koivisto & Sarsa (2014) (HICSS), la revisión fundamental de puntos/badges/leaderboards (PBL), examinó aproximadamente dos docenas de estudios empíricos y halló efectos mayormente positivos pero altamente dependientes del contexto — los contextos educativos difieren de los comerciales, moderados por la motivación previa de los usuarios [12][13]. Señala explícitamente el efecto de novedad: los primeros aumentos de implicación se deben en parte a la novedad más que a la mecánica, y decaen con el tiempo — una amenaza grave para interpretar estudios breves como duraderos [12][13].

Una meta‑análisis de 2023 (Educational Technology Research and Development) encontró que la gamificación aumenta de forma fiable la motivación intrínseca y la autonomía/relación percibidas, pero tiene un impacto medido mínimo en la competencia — lo que refleja la tensión de Duolingo entre un alto compromiso y resultados de aprendizaje no probados [14]. Un meta‑análisis PMC separado sobre el cambio conductual en educación halló de forma similar efectos positivos pero heterogéneos, que varían según la calidad de la implementación [16]. Una crítica más amplia (Sebastian Deterding, Jon Radoff, a través de una síntesis secundaria) describe el riesgo de la «pointsificación» — puntos/badges sin un diseño subyacente de calidad de juego — que produce logros artificiales y conductas de manipulación del sistema [13].

Mechanic inventory table

MecánicaQué haceEvidencia del efectoRiesgo con niños
Contador de rachaCuenta de días consecutivos completadosPalanca principal de usuarios activos diarios según los propios autores [2]; aumentos específicos no verificados [1]Alto: diseño basado en aversión a la pérdida/culpa; ansiedad, uso compulsivo, «dolor de racha»
Congelación de rachaProtección de 1 día pagada o ganadaReducción de abandono reportada; % no verificado [1][9]Medio: suaviza el diseño punitivo pero monetiza la ansiedad que generó
Rachas de amigosRacha compartida de 2 personasAmplía la aversión a la pérdida a nivel social [2]Medio: presión de pares; culpa por la racha rota de un amigo
XPPunto por ejercicio, impulsa la posición en la ligaFundamental; no se encontró un tamaño de efecto aisladoBajo-medio: puede recompensar volumen más que corrección
Gemas / LingotesMoneda secundariaApoya el diseño de hábito de recompensa variable/retrasada [2]Medio: moneda cercana al dinero real dirigida en parte a niños
Corazones / EnergíaSistema de vidas; bloquea la práctica hasta que se recargue o compreSin evidencia de eficacia; principal palanca de conversión reportada [5]Alto: limita el aprendizaje gratuito para impulsar la compra; el niño siente el bloqueo, no el pagador
Ligas / Escalera de diamantesCohorte semanal clasificada, promoción/demociónAumentos de sesiones/completados reportados antes del lanzamiento; no verificado [3]Medio-alto: la comparación y la presión de democión pueden desanimar a los de bajo rendimiento [11]
Misiones diarias/mensualesConjuntos de objetivos independientesSin tamaño de efecto aislado; añade un «reloj» superpuesto [2]Bajo-medio: obligación diaria extra acumulada sobre racha+liga
Eventos cronometrados / Hora felizVentanas cortas de XP extraNo medido de forma independienteBajo: escasez/FOMO, apuestas menores que la racha/corazones
Notificaciones push (bandido)Personalizadas, activadas por comportamiento, a veces con tono de culpaEvidencia primaria más fuerte: ~200 M recordatorios, 34 días, decaimiento por fatiga [6]Alto: los mensajes de re‑engagement basados en culpa/vergüenza son más problemáticos cuando se dirigen a niños
Duolingo Max (IA)Interpretación de roles/explicación con GPT‑4Sin cifras de retención publicadas; afirmaciones no verificadas [7]Bajo-medio: principalmente un nivel de contenido con pago
Cultura de pruebas A/BPruebas continuas de casi todas las superficiesBien documentado como práctica; resultados individuales en gran parte no verificados [1][2]N/D (proceso) — implica experimentación conductual constante sobre niños si no se modifica

Design implications for Math Challenge

  1. Racha como mecánica principal de retorno, estado de fallo suavizado: mantener un contador visible, pero atenuarlo en lugar de ponerlo a cero tras un día perdido (reiniciar solo después de dos), ya que el propio Freeze de Duolingo existe porque el modelo puro de todo o nada resultó demasiado severo [1][9].
  2. Una mecánica de protección de racha gratuita e ilimitada para niños — no un artículo escaso y comprable. El alivio de ansiedad monetizado es el ancestro directo de la controversia de los corazones y el patrón de mayor riesgo a importar [1][5].
  3. Sin bloqueo al estilo de corazones en la práctica principal. Permitir que los errores cuesten una recompensa extra, no el acceso — un niño nunca debe ser detenido de aprender por un recurso agotado.
  4. Economía de dos monedas: una puntuación de XP «esfuerzo» que impulsa el progreso en ligas/misiones, y una señal de dominio por habilidad separada (según el hallazgo de Khan Academy de mc-14) que las tablas de clasificación NO deben usar, de modo que el volumen no supere a la precisión.
  5. Escalera de liga semanal, de Bronce hasta un nivel superior sin límite, cohortes de ~15‑30 usuarios con actividad similar, ~20‑25 % promovidos/demotados, con una restricción estricta por franja de edad/curso para que un niño de 6 años nunca compita contra uno de 12 años.
  6. Misión diaria + una misión semanal/mensual, ambas visibles junto a la racha — el préstamo 1:1 más barato y menos controvertido de Duolingo [2].
  7. Fórmula de XP: 10 × nivel_dificultad (1‑5) por respuesta correcta, +50 % de bonificación por primer intento (desalienta adivinar), +20 plano por bonificación de finalización de sesión para que cualquier sesión terminada se perciba como progreso.
  8. Temporización de notificaciones activada por comportamiento (ventana de hábito aprendido, no reloj fijo) — la idea más reutilizable y éticamente limpia de la fuente primaria de Duolingo [6] — pero sustituir el tono de culpa/vergüenza por un encuadre motivador o de curiosidad para un producto infantil [6][8].
  9. Límite de notificaciones conservador y controlado por los padres (p. ej., una al día, desactivado por defecto bajo una edad establecida) en lugar de las dos al día reportadas por Duolingo, ya que un padre — no el niño — debe gestionar la frecuencia de los push.
  10. Mantener revelaciones de recompensas aleatorias pero limitadas (un cofre breve abierto justo después de una sesión); la recompensa variable es una psicología sólida, pero omitir el retraso de ~9‑10 horas de Duolingo para que nunca se convierta en su propio disparador de retorno artificial.
  11. Encaje narrativo más competición con colaboración, según los moderadores más fuertes de Sailer & Homner [11]: envolver XP/ligas/misiones en una historia ligera (basada en la mascota Larry, mc-37) y combinar las ligas con una misión cooperativa compartida de clase/familia, no solo competición.
  12. Presupuestar el efecto de novedad: volver a medir el compromiso a los 60/90 días, no solo la primera semana, dado el aviso explícito de Hamari et al. de que el entusiasmo inicial por la gamificación decae [12][13].
  13. No promocionar un tutor IA solo por satisfacción/duración de sesión — evaluar primero contra el movimiento de dominio, replicando tanto los resultados no probados de Duolingo Max como el resultado nulo de Khanmigo (mc-14).
  14. Tratar «adictivo» como una restricción delimitada, no como un objetivo sin límites. El propio CEO de Duolingo presenta el producto como un compromiso sobre el resultado por diseño [9]; para edades de 4 años a adultos con los padres como guardianes, la búsqueda sin límites del compromiso conlleva el mismo riesgo de crítica que Duolingo recibe ahora, aplicado a niños más pequeños.

Open questions for the project owner

  1. ¿Debería Math Challenge adoptar un ADR en docs/wiki/decisions.md (según AGENTS.md §13b) comprometiéndose a nunca bloquear la práctica gratuita de un niño tras una compra, independientemente de futuros planes de suscripción?
  2. ¿Debería la severidad de la interrupción de la racha variar según la franja de edad (más suave para edades de 4‑7) o mantenerse una única regla para todas las edades?
  3. ¿Deben las notificaciones push estar desactivadas por defecto en perfiles gestionados por niños, y activarse solo mediante una cuenta de padre/tutor?
  4. ¿Está la escalera de liga semanal dentro del alcance para el lanzamiento, o debe esperarse hasta que la base de usuarios activos por franja de edad/curso sea lo suficientemente grande para cohortes de emparejamiento significativas?
  5. ¿Debería Math Challenge comprometerse a una re‑medición de los métricos de compromiso a los 60/90 días desde el día uno, dado que la literatura advierte de forma constante que los resultados tempranos sobreestiman el efecto duradero?

Fuentes

  1. Econsultancy — "Six A/B tests used by Duolingo to tap into habit-forming behaviour"
  2. Deconstructor of Fun — "Duolingo: How the $15B App uses Gaming Principles to Supercharge DAU Growth"
  3. StriveCloud — "Duolingo gamification explained"
  4. Deconstructor of Fun — "Duolingo Push Notifications: Inside One of Mobile's Most-Copied Playbooks"
  5. RevenueCat Sub Club — "How Cem Kansu helped Duolingo scale monetization without breaking freemium"
  6. Duolingo Blog (official, primary source) — "Hi, it's Duo — the AI behind the meme"
  7. Duolingo Blog (official, primary source) — "Introducing Duolingo Max, a learning experience powered by GPT-4"
  8. Vicki (Substack) — "Duo, the Push, and the Bandits"
  9. Harvard Digital Initiative (Platform Digit) — "Learning New Lessons at Duolingo"
  10. justanotherpm — "The Psychology Behind Duolingo's Streak Feature"
  11. Sailer, M. & Homner, L. (2020). "The Gamification of Learning: A Meta-Analysis." Educational Psychology Review, 32(1), 77-112
  12. Hamari, J., Koivisto, J., & Sarsa, H. (2014). "Does Gamification Work? A Literature Review of Empirical Studies on Gamification." Proceedings of HICSS 2014 — synthesized via Wikipedia's "Gamification" article
  13. Wikipedia — "Gamification" (synthesis of Hamari, Sailer et al., Deterding, and Radoff critiques)
  14. Springer, Educational Technology Research and Development (2023) — "Gamification enhances student intrinsic motivation, perceptions of autonomy and relatedness, but minimal impact on competency: a meta-analysis and systematic review"
  15. StriveCloud — "Duolingo Gamification: 5 Tactics for User Retention"
  16. PMC — "Effects of Gamification on Behavioral Change in Education: A Meta-Analysis"
  17. OpenAI — "Duolingo" case study

Preguntas que este documento le deja abiertas al dueño

Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.

Uno de 51 documentos de investigación, 168.346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio