Meta ha publicado esta semana los resultados completos de Llama 4 Maverick, su modelo de código abierto de última generación, y los números han sorprendido a la industria: por primera vez, un modelo de código abierto supera a GPT-5 en varios benchmarks de referencia.

Los resultados concretos

Según los datos publicados por Meta, Llama 4 Maverick supera a GPT-5 en:

  • HumanEval (generación de código): 94,2% frente al 91,8% de GPT-5
  • MATH (razonamiento matemático): 88,7% frente al 87,1%
  • GPQA Diamond (ciencias): 72,4% frente al 71,9%

En comprensión lectora y razonamiento general, GPT-5 sigue por delante, pero la brecha se ha reducido significativamente.

¿Qué significa “código abierto” en este contexto?

Llama 4 Maverick tiene los pesos del modelo disponibles públicamente, lo que permite a empresas y desarrolladores descargarlo y ejecutarlo en su propia infraestructura. Sin embargo, la licencia de Meta impone restricciones para servicios con más de 700 millones de usuarios activos mensuales.

El impacto en el sector

Este hito tiene implicaciones importantes para toda la industria:

Para empresas: Tener acceso a un modelo de calidad GPT-5 sin pagar por API abre la puerta a implementaciones privadas sin costes por token. Para empresas con grandes volúmenes de llamadas a la API, el ahorro puede ser millonario.

Para la competencia: OpenAI y Anthropic llevan tiempo argumentando que la calidad de sus modelos propietarios justifica el coste. Llama 4 Maverick complica ese argumento.

Para Mistral y otros: Los modelos europeos de código abierto también sienten la presión de Meta, que tiene recursos de infraestructura incomparablemente mayores.

La reacción del mercado

Las acciones de empresas de infraestructura de IA, como CoreWeave y Lambda Labs, subieron ligeramente al conocerse la noticia: más uso de código abierto implica más necesidad de computación propia, no menos.

Qué sigue para Llama 4

Meta ha anunciado que Llama 4 Behemoth, la versión más grande de la familia (con más de 400 mil millones de parámetros), llegará antes de final de año. Las estimaciones preliminares sugieren que podría superar a Claude Fable 5 en varios benchmarks de razonamiento avanzado.

Para los usuarios finales, el efecto más inmediato es que plataformas como Perplexity, Groq y Together AI ya están ofreciendo acceso a Llama 4 Maverick a precios significativamente más bajos que los modelos de OpenAI o Anthropic.