La IA aprende a demostrar teoremas: 48% en FrontierMath Tier 4, un nuevo récord que cambia las reglas

Google DeepMind presenta AI Co-Mathematician: el primer sistema de IA que supera el 48% en FrontierMath Tier 4, el benchmark de matemáticas más difícil del mundo. Qué significa para la investigación y para la seguridad.

Este artículo sintetiza información publicada originalmente por epoch.ai. Para el contexto completo, las declaraciones originales y los detalles que no hemos incluido, consulta la fuente indicada.

Resumen: FrontierMath es un benchmark de cientos de problemas matemáticos originales extremadamente difíciles, elaborados y verificados por matemáticos expertos. Las preguntas cubren la mayoría de las ramas principales de las matemáticas modernas.

El contexto

FrontierMath es un benchmark de cientos de problemas matemáticos originales y excepcionalmente desafiantes, elaborados y verificados por matemáticos expertos. Las preguntas cubren la mayoría de las ramas principales de las matemáticas modernas: desde problemas computacionalmente intensivos en teoría de números y análisis real, hasta cuestiones abstractas en geometría algebraica y teoría de categorías. Resolver un problema típico requiere varias horas de esfuerzo por parte de un investigador especializado en la rama correspondiente, y los problemas del extremo superior, varios días.

El dataset completo de FrontierMath contiene 350 problemas. Se divide en un conjunto base de 300 problemas, llamados Tiers 1-3, y un conjunto de expansión de 50 problemas excepcionalmente difíciles, llamado Tier 4. Se han hecho públicos 10 problemas de Tiers 1-3 bajo el nombre frontiermath-2025-02-28-public. Los 290 problemas restantes forman frontiermath-2025-02-28-private. De forma similar, se han hecho públicos 2 problemas de Tier 4 como frontiermath-tier-4-2025-07-01-public, mientras que los 48 problemas restantes forman frontiermath-tier-4-2025-07-01-private. Salvo mención explícita, todas las cifras de este hub corresponden a evaluaciones sobre los conjuntos privados.

FrontierMath fue desarrollado con financiación de OpenAI, que tiene acceso exclusivo a un subconjunto del benchmark. Para FrontierMath se recomienda usar el log viewer sobre las preguntas públicas como mejor forma de entender la configuración de evaluación, por ejemplo, haciendo clic aquí para o4-mini-2025-04-16 con alto esfuerzo de razonamiento.

Qué ha pasado

Para cada pregunta de FrontierMath, el modelo debe enviar una función Python answer() que devuelva la respuesta. La respuesta es un objeto Python, a menudo (aunque no siempre) un entero o un objeto sympy. La implementación permite al modelo razonar y ejecutar código Python.

Esta implementación difiere del código usado para ejecutar las evaluaciones preliminares en el paper. Tampoco es la metodología usada por OpenAI en sus propias evaluaciones de FrontierMath, como para los modelos o3 y o3-mini: no participamos en la ejecución de esas evaluaciones. La diferencia entre nuestros resultados y los de OpenAI podría deberse a que OpenAI evalúa con un scaffold interno más potente, usando más compute en test-time, o porque esos resultados se ejecutaron sobre un subconjunto distinto de FrontierMath (los 180 problemas de frontiermath-2024-11-26 frente a los 290 de frontiermath-2025-02-28-private).

El 23 de enero de 2026 identificamos problemas con dos preguntas de Tier 4 que afectaban a puntuaciones previas. En un caso el problema era de nuestro grader, así que pudimos re-evaluar soluciones dadas por modelos en runs anteriores. Los modelos que acertaron este problema fueron: GPT-5.2 Pro, GPT-5.2 (xhigh), GPT-5.2 (high), GPT-5.2 (medium) y GPT-5 Pro. En el otro caso el problema estaba en el enunciado. Re-ejecutamos todos los modelos que habían superado el 10% en Tier 4 sobre este único problema. Solo GPT-5.2 Pro y GPT-5.2 (high) acertaron el problema corregido. Ajustamos las puntuaciones de todos estos modelos en consecuencia.

Detalles

El 13 de noviembre de 2025 aumentamos diez veces el presupuesto de tokens asignado a los modelos. Esto se hizo en respuesta a la observación de que los modelos excedían cada vez más el límite del presupuesto de tokens. Con este cambio, incrementamos el número de versión del benchmark a 1.1.0. Re-ejecutamos una selección de modelos recientes de alto rendimiento con esta nueva versión del benchmark.

Ejecutamos este modelo en Fireworks por motivos de seguridad de datos. Encontramos que, al correr en benchmarks públicos, el modelo se comportaba igual de bien en Fireworks que cuando estaba hospedado por el desarrollador (es decir, usando la API de DeepSeek). Sin embargo, encontramos que Fireworks tenía una tasa de error de API muy alta. Por ello, tomamos una muestra aleatoria de 100 problemas de FrontierMath Tiers 1-3 y reintentamos hasta que se completaron. Esto explica el mayor error estándar asociado a la puntuación de este modelo.

Encontramos un número inusual de errores de API al intentar hacer benchmark de estos modelos en un plazo razonable tras su lanzamiento. En los casos en los que una muestra no se completó por un error de API, reintentamos al menos 10 veces. Si todos los reintentos fallaron, marcamos la muestra como incorrecta. Una versión anterior de este sitio incluía gemini-2.5-pro en esta tabla, pero una re-ejecución posterior (debido al cambio de versión 1.1.0 documentado arriba) no encontró problemas, así que eliminamos esa entrada.

Fuente original

Lee el artículo completo en epoch.ai.