· Noticias
Entrar

Benchmark interno: probamos 15 modelos de IA durante 200 horas. Esto es lo que aprendimos

Por el equipo de LaiaDesk · Septiembre 2026 — Pruebas reales en servidor propio · 500+ prompts · ~1.000 € invertidos en API y cómputo.

LaiaDesk no compite contra los modelos de IA: los integra todos. Mientras ChatGPT, Claude y Gemini te atan, cada uno, a un único modelo de su casa, LaiaDesk orquesta a los 15 líderes del mercado en una sola plataforma, con los datos en Europa. Este benchmark lo demuestra con números: somos la plataforma que saca lo mejor de cada modelo, y eso nos coloca por delante de cualquier solución que dependa de un único proveedor.

La noticia que normalmente no se cuenta

Durante las últimas semanas hemos hecho algo que la mayoría de equipos prefiere no hacer en público: montar un banco de pruebas propio y medir, una a una, a las mejores inteligencias artificiales del mercado. No es un estudio de marketing. Es un estudio de ingeniería, con prompts estandarizados, servidor local y métricas objetivas.

Terminamos el benchmarking local de 15 modelos de IA. Y el resultado, para sorpresa de nadie que siga el sector de cerca, es que ya no existe "el mejor modelo": existe el mejor modelo para cada tarea.

Antes de entrar en datos, una nota de transparencia. Gracias a varios contactos nos han pasado algunas cuentas de pago sin tener que contratar los planes, lo que nos permitió acceder a los modelos de frontera. Aun así, en gastos básicos de API y cómputo hemos invertido casi 1.000 € en este estudio. Lo hicimos principalmente para compararlo con nuestra plataforma y entender si en LaiaDesk estamos haciendo bien las cosas. Y sí: el estudio confirma la dirección, pero también nos obligó a corregir algunas cosas.

Cómo medimos (sin trampas)

Nada de "le pregunté a ChatGPT qué opina de sí mismo". Montamos un entorno real:

  • Servidor local (Ubuntu 24.04, Node.js + Python) conectado a las APIs oficiales.
  • Rate limit de 10 peticiones/segundo para no saturar ni adulterar los tiempos.
  • Los mismos prompts para todos: un modelo no se evalúa "a ojo", se evalúa contra la misma batería de pruebas.
  • 500+ prompts distribuidos en categorías objetivas.

Medimos cuatro cosas, que son las que de verdad importan cuando pones una IA a trabajar:

DimensiónQué medimosMétrica
InteligenciaRazonamiento general (MMLU multi-tema + GPQA nivel PhD) y seguimiento de instrucciones% de aciertos ponderado
ProgramaciónEjercicios HumanEval (fácil/medio/difícil) + problemas SWE-Bench + debugging real% de código funcional
VelocidadLatencia p50/p95/p99 y tokens por segundo sostenidosms y tok/s
CostoCoste real por tarea completada con éxito (no por token "quemado")$ por tarea

Y lo cruzamos con los benchmarks independientes de Artificial Analysis —que es, con diferencia, la referencia más seria del sector— para validar que nuestros números no se desviaban.

El ranking de inteligencia: por primera vez, un modelo pasa de 65

Nuestro índice de inteligencia mide razonamiento, conocimiento y seguimiento de instrucciones. Septiembre de 2026 marca un hito: Claude Fable 5.1 de Anthropic supera los 65 puntos en nuestro benchmark y, como referencia independiente, es el nº 1 en el Intelligence Index de Artificial Analysis.

Anthropic OpenAI Google Open source
1Claude Fable 5.1Anthropic66AA 53
2GPT-6 AstraOpenAI61AA 52.8
3GPT-5.6 SolOpenAI61AA 47.1
4Claude Opus 5Anthropic60AA 50.7
5Claude Fable 5Anthropic59
6GPT-5.6 LunaOpenAI58AA 37.5
7Kimi K3 (max)Open source57AA 43.8
8Gemini 3.8 FlashGoogle56AA 41.2
9Claude Mythos 5.1Anthropic55
10Llama 3.3 (70B)Open source55
11Mistral 2 (70B)Open source54

La barra muestra nuestro índice de inteligencia (benchmark propio). El valor «AA» es el Intelligence Index de Artificial Analysis, como referencia independiente.

Dos lecturas importantes de ese gráfico:

  1. La frontera es de Anthropic y OpenAI. Los tres primeros puestos se reparten entre Claude y GPT. Pero la distancia entre el 1º y el 5º es de solo 7 puntos: la competencia está más apretada que nunca.
  2. Kimi K3 marca un hito histórico. Un modelo open source entra en el top de inteligencia (57 puntos). Hace un año eso era impensable.

La tabla maestra: todas las métricas de un vistazo

Aquí consolidamos lo que medimos de cada modelo, con la referencia de Artificial Analysis al lado:

ModeloIntel (nuestro)Intel (AA)CodingContexto (práctica)Precio (in/out)
Claude Fable 5.16653 (#1)67700K–900K$10 / $50
GPT-6 Astra6152.8750K–950K$10 / $50
GPT-5.6 Sol6147.1150K–250K$4 / $20
Claude Opus 56050.767150K–250K$5 / $25
Claude Fable 55967150K–250K
GPT-5.6 Luna5837.5150K–250K$0.20 / $1.20
Kimi K3 (max)5743.8500K–1Mself-host
Gemini 3.8 Flash5641.2700K–900K$0.30 / $2.50
Claude Mythos 5.155150K–250K
Llama 3.3 (70B)5590K–115Kopen source
Mistral 2 (70B)5490K–115Kopen source

Contexto = estimación práctica prudente (rango de uso estable), no el límite máximo anunciado. Ver detalle más abajo.

El contexto: separando lo anunciado de lo verificado

Aquí hay que ser especialmente honestos, y lo decimos claro: el contexto de tokens es el dato peor documentado del mercado. Distinguimos entre contexto anunciado, contexto realmente utilizable y estimación práctica prudente, y marcamos cada cifra con su «estado del dato» para no dar una falsa sensación de precisión.

Oficial Fuente secundaria Estimación No verificado
GPT-6 AstraOpenAI750K–950KSecundaria
Claude Fable 5.1Anthropic700K–900KSecundaria
Gemini 3.8 FlashGoogle700K–900KSecundaria
Kimi K3 (max)Open source500K–1MNo verificado
GPT-5.6 SolOpenAI150K–250KEstimación
Claude Opus 5Anthropic150K–250KEstimación
Claude Fable 5Anthropic150K–250KEstimación
GPT-5.6 LunaOpenAI150K–250KEstimación
Gemini 3.1 ProGoogle150K–250KEstimación
Claude Mythos 5.1Anthropic150K–250KEstimación
Mistral Large 2Open source90K–115KDocumentado
Llama 3.3 70BOpen source90K–115KOficial

Escala logarítmica. Barra = estimación práctica prudente (rango). Color = «estado del dato».

Y la tabla con el detalle exacto:

ModeloContexto anunciadoEstimación prácticaEstado del datoConfianza
GPT-6 Astra~1,05M750K–950KFuente secundariaMedia-baja
Claude Fable 5.1~1M700K–900KFuente secundariaMedia
Gemini 3.8 Flash~1M700K–900KFuente secundariaMedia
Kimi K3 (max)500K–1MNo verificadoMuy baja
GPT-5.6 Sol150K–250KEstimaciónBaja
Claude Opus 5150K–250KEstimaciónBaja
Claude Fable 5150K–250KEstimaciónBaja
GPT-5.6 Luna150K–250KEstimaciónBaja
Gemini 3.1 Pro150K–250KEstimaciónBaja
Claude Mythos 5.1150K–250KEstimaciónBaja
Mistral Large 2~128K90K–115KDocumentadoMedia-alta
Llama 3.3 70B128K90K–115KOficialAlta

Un líder para cada tarea (y por qué eso lo cambia todo)

Aquí está el hallazgo central del estudio. Cuando cruzas las métricas y el análisis de alucinaciones, cada proceso crítico tiene un ganador distinto:

Proceso / TareaLíder absolutoSegunda opciónPor qué gana
Programación / CódigoClaude Fable 5.1 (Coding 67)DeepSeek V4 Pro / CursorResolución autónoma de bugs y menor tasa de errores lógicos
Razonamiento / AgentesGPT-6 AstraGLM-5.3Controla sistemas virtuales y automatiza flujos complejos
Análisis de datos extensosGemini 3.8 FlashChatGPT Plus (Advanced Data)Contexto de ~1M y análisis multimodal (texto, imagen, audio, vídeo)
Redacción / CreatividadClaude Opus 5Muse Spark 1.3La tasa de alucinación más baja del mercado (0,7 %)
Investigación en vivoPerplexity ProOpenAI SearchCuración de fuentes en tiempo real sin alucinaciones

Traducción práctica: quien dependa de un único proveedor está dejando rendimiento sobre la mesa. La IA corporativa en 2026 se decide por caso de uso, no por "el modelo de moda".

El precio: una divergencia brutal

Si la inteligencia está apretada, los precios están rotos a propósito. Hay una diferencia de 100x entre el modelo más caro y el más barato, y el barato rinde al 95 % del caro.

Inteligencia (eje Y) frente a precio de entrada por 1M tokens (eje X, escala logarítmica) 68 64 60 56 52 $0.10 $1 $10 Precio entrada ($/1M tokens) · escala log Intelligence Index Claude Fable 5.1 — 66 · $10 Claude Fable 5.1 GPT-6 Astra — 61 · $10 GPT-6 Astra GPT-5.6 Sol — 61 · $4 GPT-5.6 Sol Claude Opus 5 — 60 · $5 Claude Opus 5 GPT-5.6 Luna — 58 · $0.20 GPT-5.6 Luna Gemini 3.1 Pro — 54 · $2 Gemini 3.1 Pro

Coste por 1 millón de tokens (API):

ModeloEntradaSalidaPerfil
Claude Fable 5.1$10$50S-Tier (frontera)
GPT-6 Astra$10$50S-Tier (frontera)
Claude Opus 5$5$25Mejor valor premium
GPT-5.6 Sol$4$20Mejor relación calidad-precio
Gemini 3.1 Pro$2$10Contexto masivo (2M)
GPT-5.6 Luna$0.20$1.20Equilibrio costo-capacidad
Gemini 2.5 Flash$0.30$2.50Tareas estándar
Gemini Flash-Lite$0.10$0.40El más barato del mercado

Un apunte que nos dejó descolocados: la facturación no siempre ha encajado con el número real de tokens que consumíamos. Detectamos cierta itinerancia en la medición que no siempre hemos podido contabilizar con exactitud, y no terminamos de entender los motivos ni las razones de esa variabilidad.

DeepSeek V4 Pro registra un coste por tarea de programación completada con éxito de 0,04 $ (aunque dicen que no comparten datos, conviene recordar que no operan en servidores protegidos europeos), frente a los 0,32 $ de los modelos americanos más grandes. Rinde a más del 95 % del nivel de la frontera por una fracción del coste.

Esto no es un "truco de benchmark". Es la diferencia entre un proyecto viable y uno que se come el margen en factura de API.

Las suscripciones: la convergencia de los 20 $/mes

En consumo individual, todo el mundo aterrizó en el mismo precio —20 $ al mes— pero vendiendo cosas radicalmente distintas:

PlanPrecioModelo estrellaVentaja realTalón de Aquiles
ChatGPT Plus$20GPT-6 AstraCanvas, intérprete Python, ecosistemaPicos de latencia intermitentes
Claude Pro$20Claude Fable 5.1Cero retención de datos, mejor códigoLímites estrictos en razonamiento profundo
Gemini AI Pro~$26 (€24)Gemini 3.8 Flash2 TB de Google One + contexto ~1MMenos intuición pura en código
Perplexity Pro$20Búsqueda y fuentes en tiempo realNo es un modelo generalista
Mistral Pro~$24 (€22)Mistral 2Multilingüe, enfoque europeoEcosistema más limitado
Grok Premium$30Grok 4.1Acceso a X y tendenciasMenos pulido técnico

La conclusión es incómoda para los vendedores de "la IA definitiva": los tres grandes te venden el mismo precio con un perfil de usuario distinto. Elegir bien exige saber para qué la vas a usar.

El factor open source: la soberanía ya no es un sacrificio

Este es probablemente el cambio estructural más importante que vimos. Los modelos abiertos ya no son "los baratos de segunda":

ModeloContextoLicenciaPunto fuerte
Kimi K3 (max)500K–1M*Open sourceInvestigación de documentos larguísimos
Llama 3.3 (70B)90K–115KApache 2.0Uso general de código abierto
Mistral Large 290K–115KApache 2.0Despliegue local multilingüe

* Contexto sin verificar oficialmente.

Para datos hipersensibles (GDPR / HIPAA), desplegar on-premise ya no implica sacrificar inteligencia. Llama, Mistral y compañía rinden a más del 95 % de la frontera comercial. Eso, hace doce meses, era imposible.

¿Y LaiaDesk en todo esto?

Aquí va la parte honesta, porque no nos gusta vender humo ni a los demás ni a nosotros mismos.

Nosotros no entramos en esta comparativa como un modelo más. LaiaDesk no es un LLM que compita con Claude o con GPT: somos una plataforma. Y buena parte de nuestros principios y de nuestro entrenamiento se apoya precisamente en los modelos de frontera que aquí analizamos. Sería deshonesto colarnos en el ranking con una puntuación propia.

Entonces, ¿para qué hicimos el estudio?

  1. Para validar que orquestamos bien. Si cada tarea tiene un líder distinto, la única forma correcta de construir una plataforma es usar el modelo adecuado para cada cosa — y este estudio nos confirmó dónde estábamos acertando y dónde no.
  2. Para aportar lo que los modelos no dan. Un modelo es una API. Nosotros sumamos lo que ninguno de ellos ofrece por sí solo: soberanía de datos en la UE, memoria vectorial profunda y agentes especializados listos para vender.
  3. Para tener criterio propio. No queremos recomendar a nuestros clientes un modelo "porque es el que está de moda". Queremos recomendar el que de verdad gana en su caso de uso.

Si quieres los datos crudos —rankings, latencias, costes y análisis— tenemos el Excel completo con todas las métricas. Pídelo y te lo pasamos.

Conclusiones en cinco líneas

  1. Claude Fable 5.1 lidera en razonamiento (66 puntos, el primero en superar 65).
  2. GPT-6 Astra es la referencia en ciberseguridad y agentes autónomos.
  3. GPT-5.6 Sol es la mejor relación precio-rendimiento en la frontera.
  4. Cada modelo gana en algo distinto: no busques "el mejor", busca "el mejor para lo tuyo".
  5. El open source llegó para quedarse en la mesa de las empresas que priorizan soberanía.

La IA de 2026 no es una carrera de un solo ganador. Es un ecosistema de especialistas. Y la única estrategia sensata —la nuestra, la de LaiaDesk— es integrar lo mejor de cada uno.

— Equipo de LaiaDesk. Benchmark local, servidor propio, septiembre de 2026.

Conversación

Sé el primero en comentar.

Habla con LaiaDesk Más noticias

Newsletter

La IA de tu sector, en tu bandeja

Sin humo y sin spam. Te enviamos solo el análisis que de verdad mueve tu negocio. Cancela cuando quieras, en un clic.

Doble confirmación por correo (RGPD). Nunca compartimos tu dirección.