Math Challenge
Más

La amenaza del solucionador: asistencia matemática IA en 2026 y qué lo frena realmente

mc-31 · Publicado: · de Math Challenge Research · 3219 palabras · 14 fuentes citadas

Resumen ejecutivo

Cualquier tarea reducible a «un número final, enviado como texto o foto» ya está resuelta por la tecnología disponible: los solucionadores de consumo (Photomath, Symbolab, Mathway, Microsoft Math Solver, Gauth, Wolfram|Alpha) devuelven una respuesta con pasos en segundos para casi todo el currículo de primaria a cálculo universitario [4][5][6], y los asistentes generales (GPT, Gemini, Claude) ya superaron la matemática de competencia — AIME se considera «saturado» porque los mejores modelos rondan el máximo posible [12] — y, en julio de 2025, un sistema de Google DeepMind alcanzó nivel de medalla de oro en la Olimpiada Internacional de Matemáticas operando de extremo a extremo en lenguaje natural, sin traducir el problema a un lenguaje formal como en 2024 [2][3]. La foto de la pantalla rompe casi cualquier defensa dentro de la aplicación: nunca toca el DOM, el teclado ni la API, así que ninguna medida anti‑copia o límite de tiempo del cliente puede verla. El uso estudiantil ya es mayoría y crece rápido: el 88 % de universitarios del Reino Unido usó IA generativa para evaluaciones en 2025, frente al 53 % en 2024 [1]; en EE. UU. el uso de ChatGPT para tareas escolares entre adolescentes se duplicó de 13 % a 26 % en un año, aunque las matemáticas siguen siendo el uso que los propios adolescentes consideran menos aceptable (29 % a favor, 28 % en contra) [10]. Los detectores de texto de IA no son salida: son evadibles con paráfrasis simple y penalizan de forma desproporcionada a quien escribe en un segundo idioma [7][8] — no deben usarse como puerta punitiva en una aplicación bilingüe. La defensa que sí funciona no es técnica sino de diseño de evaluación: pedir el proceso en vez de la respuesta, pedir detectar el error en una solución ajena, exigir una pregunta de seguimiento adaptativa con números distintos, y usar tareas de manipulación interactiva cuya respuesta es un estado de UI, no texto copiable.

323 palabras

Este documento fue traducido del original en inglés por Claude (Anthropic) y verificado automáticamente contra la fuente: cada número, URL, marcador de cita y marca [unverified] coincide con el original. La prosa todavía no ha sido revisada por un hablante nativo humano.

Estado de verificación

Este documento no lleva ninguna marca [unverified]. Cada afirmación está atada a una fuente numerada de abajo.

[unverified] quiere decir que la afirmación está en la investigación pero no se confirmó contra una fuente primaria en la sesión que la produjo. Se publica en vez de borrarse, porque un corpus que esconde sus huecos no es verificable.

Cómo se produjo esta investigación

Los 47 documentos se hicieron el 2026-07-31 por agentes independientes, cada uno con instrucción explícita de no inventar citas y de marcar como [unverified] lo que no pudiera confirmar contra una fuente primaria. La cuota de búsqueda web de la sesión se agotó a media investigación y los agentes posteriores trabajaron por descarga directa contra fuentes primarias. Varios sitios (ftc.gov, ico.org.uk) bloquean la descarga automatizada, y por eso ciertas afirmaciones legales están marcadas a propósito.

Findings

1. Consumer math solvers: capability and reach

Photomath combina un sistema de álgebra computacional con OCR (ampliado al reconocimiento de escritura a mano desde 2016) para escanear un problema impreso o manuscrito — incluidos los problemas de texto — y producir una solución paso a paso en segundos, abarcando “de primaria a universidad” matemáticas: aritmética, álgebra, geometría, trigonometría, estadística y cálculo [4][5]. La escala es grande: a fecha de 2021, más de 220 millones de descargas y aproximadamente 2,2 mil millones de problemas resueltos al mes [4]. Symbolab anuncia explícitamente la aceptación de “páginas escritas y capturas de pantalla” junto a notación tipada y consultas en lenguaje natural, cubriendo preálgebra hasta cálculo, trigonometría, física y estadística, presentando la salida como paso a paso en lugar de solo la respuesta [6]. La fortaleza de Wolfram|Alpha es el cálculo simbólico/de forma cerrada con entrada libre — muy fuerte en álgebra canónica, cálculo y resolución de ecuaciones, históricamente más débil en problemas que requieren análisis semántico de un problema de texto ambiguo. Las aplicaciones centradas en la cámara, como Gauth (y Microsoft Math Solver, que añade reconocimiento de escritura a mano y trazado de gráficos a una cadena similar OCR‑más‑solucionador), siguen el mismo patrón: cámara dentro, respuesta escalonada fuera en segundos, varias con un chat de tutor humano o IA superpuesto para cualquier cosa que el solucionador automático no analice con claridad. El hilo conductor es que estas herramientas son más fuertes precisamente donde los problemas de escuela y de aplicaciones de práctica son más débiles por necesidad de diseño: problemas únicos, bien planteados, de forma cerrada con una única respuesta final correcta.

2. General AI assistants: from AIME to IMO gold

Los LLM de frontera han superado el nivel de matemáticas de competición que antes constituía un techo significativo. El AIME (un examen olímpico de clasificación en EE. UU.) ahora figura en al menos un rastreador de benchmarks como un benchmark “archivado” o saturado porque “el rendimiento en este benchmark se ha saturado” y los proveedores han dejado de ejecutar nuevas versiones contra él, con una puntuación máxima del 98,12 % registrada para Gemini 3.1 Pro Preview y una nota de que nueve de los diez modelos mejor clasificados en la tabla de líderes son modelos de razonamiento [12]. La generación de pruebas en lenguaje natural de nivel de competición, la frontera más dura, también ha caído más de lo esperado. En 2024, AlphaProof y AlphaGeometry 2 de DeepMind alcanzaron 28/42 puntos (estándar de medalla de plata) en la IMO, pero solo después de que los problemas se tradujeran manualmente al lenguaje formal Lean, y el problema más difícil requirió hasta tres días de cálculo [3]. Un año después, en julio de 2025, una versión avanzada de Gemini con “Deep Think” alcanzó 35/42 (estándar de medalla de oro), resolviendo cinco de seis problemas a la perfección, de extremo a extremo en lenguaje natural — sin paso de formalización — dentro del mismo límite de 4,5 h por sesión que enfrentan los competidores humanos [2]. La propia revisión de la IMO confirmó que las soluciones presentadas eran “completas y correctas” pero indicó que “su revisión no se extiende a validar nuestro sistema, procesos o modelo subyacente” [2] — se trata de artefactos calificados, no de sistemas auditados, y el resultado siguió implicando una curación sustancial humana de datos de entrenamiento y pistas generales de resolución de problemas [2]. OpenAI informó por separado resultados comparables a nivel de medalla de oro para un modelo experimental en el mismo periodo, aunque no se ejecutó a través del mismo proceso oficial de coordinación de la IMO; trate esa afirmación como consistentemente direccional con el resultado verificado de DeepMind más que como una puntuación auditada de forma independiente. Donde los modelos generales aún fallan es en la verdadera frontera de investigación: Epoch AI’s FrontierMath extrae problemas de matemáticos profesionales de teoría de números, análisis real, geometría algebraica y teoría de categorías que requieren a los expertos varias horas cada uno, con una franja “Tier 4” superior que lleva varios días de esfuerzo experto — diseñada para mantener a prueba los sistemas de frontera a medida que los benchmarks más fáciles se saturan [11]. Eso está muy por encima de lo que una aplicación de práctica K‑12/universidad asignaría, pero es relevante para la ambición de Math Challenge de alcanzar contenido a nivel de doctorado: en algún punto entre “conjunto de problemas duros” y “problema de investigación abierto”, los solucionadores dejan de ser fiables, y ese límite vale la pena conocer con precisión antes de diseñar contenido de nivel superior.

3. Multimodal screenshot-to-answer: why cameras defeat in-app defenses

El mecanismo que hace que la mayor parte del diseño anti‑trampa dentro de la aplicación sea irrelevante es sencillo: una fotografía de una pantalla es un canal fuera de banda. Nunca entra en el DOM de la app, nunca dispara un evento de teclado o pegado, nunca toca sus peticiones de red, y es invisible para cualquier defensa a nivel de JavaScript (desactivar copiar/pegar, ofuscar el código fuente, difuminar al cambiar de pestaña, marcas de agua, incluso la mayor parte de la supervisión en el navegador). La foto abandona el dispositivo a través de la cámara y una segunda aplicación o dispositivo — una superficie que la app de práctica no puede instrumentar en absoluto. Cada solucionador para consumidores mencionado se construye exactamente alrededor de este flujo de trabajo — cámara dentro, respuesta escalonada fuera, en segundos [4][5][6]. La novedad para 2026 es que ya no se necesita un paso discreto de “foto, esperar al OCR”: los asistentes multimodales en tiempo real (compartir pantalla o modos continuos de cámara/visión a través de GPT, Gemini y productos comparables) permiten a un estudiante compartir la pantalla en tiempo real y obtener una respuesta hablada de forma conversacional, incluida la narración de qué hacer a continuación — leyendo un problema desde una pantalla en movimiento o parcialmente oculta, en medio de la interacción. Ninguna defensa puramente del lado del cliente o basada únicamente en el tiempo es duradera por sí sola; las dos respuestas que no dependen de “¿puede el estudiante extraer una foto?” son (a) exigir un artefacto entregado que no sea una cadena reproducible única — un proceso, un estado de manipulación de UI, un diálogo — y (b) hacer que un viaje externo adicional cueste más, en conjunto, que los puntos que otorga, mediante re‑preguntas adaptativas (§6 y las Implicaciones de Diseño más abajo).

4. How widespread AI use already is among students

Esto no es un comportamiento marginal. La encuesta de HEPI de diciembre de 2024 a 1.041 estudiantes universitarios a tiempo completo del Reino Unido (realizada por Savanta) encontró que el 92 % había usado alguna herramienta de IA y el 88 % había usado IA generativa específicamente para evaluaciones, un fuerte aumento respecto al 53 % del año anterior; el ahorro de tiempo (51 %) y la mejora percibida de la calidad (50 %) fueron las motivaciones declaradas, mientras que el temor a acusaciones de trampa (53 %) y el riesgo de alucinaciones (51 %) fueron los principales disuasivos — no la falta de capacidad o de conocimiento [1]. El informe de Pew Research de enero de 2025 (Ipsos, sept‑oct 2024, n=1.391 adolescentes estadounidenses de 13 a 17 años) encontró que el 26 % había usado ChatGPT para tareas escolares, el doble del 13 % registrado en 2023 — y el propio juicio de los adolescentes sobre la aceptabilidad varía mucho según la tarea: el 54 % lo considera aceptable para investigar un tema, pero solo el 29 % para resolver problemas de matemáticas (el 28 % lo considera inaceptable), y el 18 % para redactar ensayos [10]. Esa asimetría es importante aquí: las matemáticas son la materia sobre la que los estudiantes están más divididos, una verdadera apertura para un producto cuya superficie puntuada/clasificada pueda afirmar con credibilidad que resiste el uso casual de solucionadores. El uso entre personas que ya disponen de acceso a IA se inclina hacia la búsqueda directa de respuestas: el análisis de Anthropic de aproximadamente 575.000 conversaciones académicas con Claude.ai encontró que Informática y STEM estaban sobrerrepresentados respecto a la matrícula (solo Informática representó el 36,8 % de las conversaciones frente al 5,4 % de los títulos universitarios en EE. UU.), y cerca de la mitad (~ 47 %) de las conversaciones fueron “Directas” — buscando una respuesta o contenido terminado con el mínimo intercambio [9]. La distribución de tareas se inclinó hacia trabajos de orden superior (Creación 39,8 %, Análisis 30,2 %) y alejada de la memorización (Recordar 1,8 %) [9], coherente con un patrón de “dejo que la herramienta razone, yo tomo la salida” por defecto — precisamente el comportamiento que una app de práctica necesita volver poco gratificante.

5. El fracaso de los detectores de texto IA y lo que implica

Dos líneas de investigación publicada socavan la idea de que un detector pueda bloquear la trampa de forma fiable. Primero, los detectores son demostrablemente sesgados: los estudios de detectores GPT encuentran que «clasifican sistemáticamente como generados por IA muestras de escritura en inglés no nativas, mientras que las muestras nativas se identifican con precisión», y las mismas estrategias simples de prompting que reducen este sesgo también permiten a un usuario evadir la detección por completo — la misma palanca corta en ambos sentidos [7]. Segundo, los detectores son frágiles ante la evasión adversaria en general: la investigación que probó la detección contra textos de ChatGPT y Claude halló que la paráfrasis, el espaciado aleatorio y las perturbaciones adversarias «pueden disminuir significativamente la efectividad de la detección», concluyendo que los métodos actuales carecen de robustez incluso frente a evasiones poco sofisticadas [8]. La implicación aquí es directa: cualquier campo «explica tu razonamiento» no puede usar de forma segura un detector IA como una puerta automática de aprobado/reprobado — hacerlo sería trivially evadible y arriesgaría marcar desproporcionadamente trabajos genuinos de autores cuya lengua materna es el español o de cualquier otro escritor no nativo en un producto cuyas propias exigencias imponen una UX bilingüe. La detección, cuando se emplea, debe ser una señal suave que alimente la revisión humana, nunca un bloqueo automatizado.

6. Respuestas de diseño que realmente resisten el contacto con un solver

El hilo conductor de toda mitigación que se mantiene es el mismo: dejar de puntuar un único artefacto final reproducible y comenzar a puntuar algo que un solver no pueda entregar de un solo golpe — un proceso con pasos intermedios graduados, un juicio sobre el trabajo de otro, un seguimiento adaptativo en directo o un estado de UI manipulado. Nada de esto hace que un estudiante determinado sea a prueba de solver; eleva los viajes de ida y vuelta, el trabajo de traducción y el coste temporal por punto obtenido — la única palanca que una PWA de autoservicio controla realmente. La tabla y las Implicaciones de diseño a continuación convierten esto en un catálogo de construcción concreto.

Qué sobrevive a un solver

Formato del ítem¿Qué tan fácil es que un solver lo venza?Gradabilidad
Respuesta final simple («resolver para x»)Trivial — segundos, éxito casi total [4][5][6]Totalmente auto‑evaluable; formato más débil
Problema verbal de un solo pasoFácil para LLM multimodales; los solucionadores solo OCR son más débiles pero se están acercandoAuto‑evaluable con un analizador
Problema verbal multietapa, con sub‑cantidades nombradasSigue siendo vencible, pero requiere transcribir todo el problemaAuto‑evaluable por paso; fricción, no inmunidad
«Muestra tu trabajo» / proceso completoEl solver genera un proceso completo para copiar literalmenteRequiere evaluación humana/IA; el texto copiado no es detectable de forma fiable [7][8]
«Detecta el error en esta solución»Más difícil — el solver debe evaluar un argumento, no solo producirloAuto‑evaluable (qué línea, qué error)
Estimación / solo orden de magnitudDébil por sí sola — una respuesta exacta del solver satisface trivialmente una comprobación de rangoFácil de auto‑evaluar; combinar con justificación
Manipulación interactiva (arrastrar punto, construir gráfico, equilibrar ecuación)El solver puede describir el objetivo, pero la ejecución de la acción UI sigue necesitando al estudianteEvaluado sobre el estado final de la UI, no sobre una cadena
Respuesta múltiple / seleccionar todo, distractores basados en conceptos erróneosModerado — la resolución forzada obtiene el conjunto, pero los distractores dirigidos debilitan el atajoTotalmente auto‑evaluable
Seguimiento adaptativo (nuevos números, mismo método)Fuerte — detecta «respondido una vez» vs. «puede repetirse»; vencido solo reconsultando cada vezAuto‑evaluable, totalmente controlado por la aplicación
Diálogo socrático con el tutor integradoFuerte frente a capturas estáticas; se degrada si el texto del solver se pegaRequiere su propio evaluador — misma carrera armamentista, un nivel más arriba
Defensa oral en directo / comprobación sincrónicaMuy fuerteRequiere personal/infraestructura en vivo; poco adecuado para una PWA de autoservicio
Prueba original/de nivel de investigaciónResiste a los solvers y a los LLM generales en la verdadera frontera [11][2][3]No evaluable a escala; solo revisión experta

Implicaciones de diseño

  1. Formato de pista/desafío por defecto: mostrar una solución trabajada con un paso incorrecto, preguntar qué línea y por qué — evaluar un argumento supera producir uno.
  2. Sustituir el cuadro de respuesta única por un proceso estructurado de varios campos (cada operación más su resultado intermedio), evaluado por paso, de modo que una respuesta final copiada sin los pasos coincidentes falle automáticamente.
  3. Re‑pregunta adaptativa obligatoria: seguir una respuesta correcta inmediatamente con un problema isomorfo (mismo método, nuevos números); «correcto una vez, erróneo en la variante» es una señal real, sobre todo en modos de clasificación/tablas de líderes.
  4. Ítems de respuesta múltiple/seleccionar todo con distractores construidos a partir de conceptos erróneos documentados y específicos del tema, no de «números cercanos», de modo que la resolución forzada sea un atajo más débil para obtener el conjunto completo correcto.
  5. Encerrar preguntas de valor exacto tras un paso de estimación (puntuar un rango o respuesta de orden de magnitud antes de revelar la pregunta precisa), recompensando la intuición numérica que un solver no necesita.
  6. Manipulables interactivos — arrastrar un punto en una recta numérica, colocar puntos para construir un gráfico, mover términos para equilibrar una ecuación — evaluados sobre el estado resultante de la UI, no sobre un número tecleado: el único formato que un solver no puede devolver como cadena copiable, aun cuando pueda describir la respuesta.
  7. Chat de tutor socrático integrado como vía principal de búsqueda de pistas, de modo que pedir ayuda produzca un diálogo graduado en lugar de una cadena extraíble de captura de pantalla; puntuar parcialmente por la coherencia y especificidad de las réplicas propias del estudiante.
  8. Un breve campo «explica con tus propias palabras» antes de aceptar una respuesta; usar cualquier señal de texto IA solo como una marca suave para revisión humana, nunca como bloqueo automatizado, dada la parcialidad del detector contra escritores no nativos y la evadibilidad mediante paráfrasis [7][8].
  9. Presupuestos de tiempo en modo clasificado lo suficientemente cortos como para que un viaje externo completo (fotografía, OCR/solución, copia de vuelta) cueste más que resolver directamente; el modo de práctica sin límite de tiempo permanece como la superficie de bajo fricción y no competitiva.
  10. Aleatorizar parámetros numéricos del lado del servidor por estudiante/intento, de modo que una captura de pantalla, una clave de respuestas compartida o un resultado web en caché no se transfiera a otro estudiante con el mismo ítem.
  11. Ponderar la puntuación hacia la consistencia a lo largo de muchos ítems pequeños (rachas, portafolios) en lugar de ítems de alto valor único, reduciendo la recompensa de resolver cualquier ítem mediante ayuda externa.
  12. Auto‑valoración de confianza (1‑5) junto a cada respuesta; una confianza alta descalibrada con razonamiento discordante es una señal útil y no punitiva.
  13. Dividir la historia de integridad por modo: la práctica no hace ninguna afirmación de resistencia al solver; el modo clasificado/con tabla de líderes concentra seguimientos adaptativos, evaluación de procesos y temporizadores cortos, ya que esa es la superficie cuya integridad importa a otros usuarios.
  14. Encauzar ítems de tipo «produce una prueba novedosa» adyacentes a doctorado a revisión humana o entre pares asíncrona, en lugar de auto‑evaluación — el único formato que aún resiste tanto a los solvers consumidores como a los modelos de frontera [11][2][3], y el único formato que nadie puede auto‑evaluar a escala.

Lo que no podemos impedir, dicho claramente: cualquier tarea totalmente especificable como texto plano o una única imagen con una respuesta final verificable, presentada sin un proceso o seguimiento requerido, será resuelta en segundos por herramientas ya en amplio uso estudiantil — porque la foto o el canal de visión en directo nunca toca la aplicación. Los asistentes multimodales en directo erosionan aún más las defensas basadas en presión de tiempo, ya que un estudiante puede obtener orientación hablada mientras la pantalla permanece visible en lugar de realizar un viaje externo con captura estática. Ninguna puerta basada en detector es segura para usar de forma punitiva. Nada de esto se puede arreglar mediante ingeniería; solo puede hacerse menos gratificante (no la superficie puntuable) o más costoso por punto (diseño adaptativo). Una afirmación contraria es marketing, no hecho.

Preguntas abiertas para el propietario del proyecto

  1. ¿Deberían los modos clasificados/tablas de clasificación imponer un límite de tiempo estricto por ítem más corto que el tiempo típico de ida y vuelta de foto‑y‑resolución, y qué tipo de adaptación existe para los estudiantes que realmente necesitan más tiempo?
  2. ¿Qué proporción de la hoja de ruta se destina a un tutor socrático interno (coste propio de LLM, moderación, latencia) frente a un diseño de ítems adaptativos y evaluación de procesos sin ningún componente generativo?
  3. ¿Debería el producto emplear alguna vez señales de similitud de texto IA en un contexto bilingüe EN/ES, teniendo en cuenta el sesgo documentado de los detectores contra escritores no nativos, o esa clase de comprobación está excluida por la política?
  4. Para contenidos a nivel de doctorado, ¿está dentro del alcance la revisión manual/por pares de pruebas abiertas, o la capa superior se mantiene limitada a formatos auto‑gradables (crítica de pruebas, detección de errores) aunque ello limite el grado de “PhD” que pueden alcanzar?
  5. ¿Debería el modo de práctica permitir explícitamente el uso de herramientas externas como una decisión de diseño declarada, replanteando la narrativa de integridad en torno al modo clasificado y la maestría a lo largo del tiempo, en lugar de insinuar que las respuestas de práctica son resistentes a la resolución cuando estructuralmente no pueden serlo?

Fuentes

  1. HEPI, "Student Generative AI Survey 2025"
  2. Google DeepMind, "Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the International Mathematical Olympiad"
  3. Google DeepMind, "AI solves IMO problems at silver medal level"
  4. Wikipedia, "Photomath"
  5. Photomath, official product site
  6. Symbolab, official product site
  7. Liang et al., "GPT detectors are biased against non-native English writers," arXiv:2304.02819
  8. "MGTBench: Benchmarking Machine-Generated Text Detection," arXiv:2303.14822
  9. Anthropic, "Anthropic Education Report: How University Students Use Claude"
  10. Pew Research Center, "About a quarter of U.S. teens have used ChatGPT for schoolwork — double the share in 2023"
  11. Epoch AI, "FrontierMath" benchmark page
  12. Vals AI, AIME benchmark leaderboard
  13. Wolfram|Alpha, official "About" page
  14. Microsoft Education, product overview (Math Solver context)

Preguntas que este documento le deja abiertas al dueño

Están sin responder a propósito. Se listan, no se resuelven — convertirlas en preguntas frecuentes obligaría a inventar respuestas que el documento no tiene.

Uno de 51 documentos de investigación, 168.346 palabras en total, contadas en el build sobre los archivos mismos. Leer este documento en el repositorio