OpenAI ha lanzado esta semana o4-mini, una versión optimizada de su modelo de razonamiento o4 que promete cambiar la ecuación precio-rendimiento en la IA de razonamiento avanzado. Según los benchmarks publicados por la compañía, o4-mini supera a o3 en matemáticas competitivas (AIME) y programación (Codeforces) mientras cuesta entre 8 y 10 veces menos por token.
Qué es un modelo de razonamiento y por qué importa
Los modelos de razonamiento de OpenAI (la serie o1, o3, o4) son diferentes a GPT-5: antes de responder, “piensan” durante varios segundos o minutos, resolviendo el problema paso a paso internamente. Esto los hace mucho más potentes para matemáticas, código complejo y problemas de lógica, aunque también más lentos y costosos.
o4-mini mantiene esa capacidad de razonamiento profundo pero en un modelo más ligero, diseñado para casos donde la velocidad y el coste importan.
Los números concretos
| Benchmark | o3 | o4-mini | Mejora |
|---|---|---|---|
| AIME 2025 | 88,9% | 93,4% | +4,5pp |
| Codeforces | 2.130 ELO | 2.194 ELO | +64 puntos |
| GPQA Diamond | 77,3% | 81,4% | +4,1pp |
El coste por millón de tokens de entrada baja de $15 (o3) a $1,10 (o4-mini).
Disponibilidad
o4-mini ya está disponible en ChatGPT Plus y Pro, en la API de OpenAI y en Copilot de Microsoft. Los usuarios del plan gratuito tendrán acceso limitado.
Para desarrolladores, el precio de $1,10 por millón de tokens de entrada convierte a o4-mini en la opción más económica para aplicaciones que requieren razonamiento avanzado, desbancando a modelos como Gemini Flash Thinking.
Implicaciones para el sector
La llegada de o4-mini hace que el razonamiento avanzado deje de ser un lujo de grandes empresas. Startups y desarrolladores independientes pueden ahora construir aplicaciones con capacidad de resolución de problemas matemáticos y de código al nivel de los mejores expertos humanos, por costes antes impensables.
La competencia en este espacio se intensifica: Google tiene Gemini 3.6 Flash Thinking, Anthropic trabaja en versiones extendidas de Claude Fable 5, y DeepSeek ha demostrado que el razonamiento eficiente es posible desde fuera de Silicon Valley.