Benchmark interno: probamos 15 modelos de IA durante 200 horas. Esto es lo que aprendimos
Por el equipo de LaiaDesk · Septiembre 2026 — Pruebas reales en servidor propio · 500+ prompts · ~1.000 € invertidos en API y cómputo.
LaiaDesk no compite contra los modelos de IA: los integra todos. Mientras ChatGPT, Claude y Gemini te atan, cada uno, a un único modelo de su casa, LaiaDesk orquesta a los 15 líderes del mercado en una sola plataforma, con los datos en Europa. Este benchmark lo demuestra con números: somos la plataforma que saca lo mejor de cada modelo, y eso nos coloca por delante de cualquier solución que dependa de un único proveedor.
La noticia que normalmente no se cuenta
Durante las últimas semanas hemos hecho algo que la mayoría de equipos prefiere no hacer en público: montar un banco de pruebas propio y medir, una a una, a las mejores inteligencias artificiales del mercado. No es un estudio de marketing. Es un estudio de ingeniería, con prompts estandarizados, servidor local y métricas objetivas.
Terminamos el benchmarking local de 15 modelos de IA. Y el resultado, para sorpresa de nadie que siga el sector de cerca, es que ya no existe "el mejor modelo": existe el mejor modelo para cada tarea.
Antes de entrar en datos, una nota de transparencia. Gracias a varios contactos nos han pasado algunas cuentas de pago sin tener que contratar los planes, lo que nos permitió acceder a los modelos de frontera. Aun así, en gastos básicos de API y cómputo hemos invertido casi 1.000 € en este estudio. Lo hicimos principalmente para compararlo con nuestra plataforma y entender si en LaiaDesk estamos haciendo bien las cosas. Y sí: el estudio confirma la dirección, pero también nos obligó a corregir algunas cosas.
Cómo medimos (sin trampas)
Nada de "le pregunté a ChatGPT qué opina de sí mismo". Montamos un entorno real:
- Servidor local (Ubuntu 24.04, Node.js + Python) conectado a las APIs oficiales.
- Rate limit de 10 peticiones/segundo para no saturar ni adulterar los tiempos.
- Los mismos prompts para todos: un modelo no se evalúa "a ojo", se evalúa contra la misma batería de pruebas.
- 500+ prompts distribuidos en categorías objetivas.
Medimos cuatro cosas, que son las que de verdad importan cuando pones una IA a trabajar:
| Dimensión | Qué medimos | Métrica |
|---|---|---|
| Inteligencia | Razonamiento general (MMLU multi-tema + GPQA nivel PhD) y seguimiento de instrucciones | % de aciertos ponderado |
| Programación | Ejercicios HumanEval (fácil/medio/difícil) + problemas SWE-Bench + debugging real | % de código funcional |
| Velocidad | Latencia p50/p95/p99 y tokens por segundo sostenidos | ms y tok/s |
| Costo | Coste real por tarea completada con éxito (no por token "quemado") | $ por tarea |
Y lo cruzamos con los benchmarks independientes de Artificial Analysis —que es, con diferencia, la referencia más seria del sector— para validar que nuestros números no se desviaban.
El ranking de inteligencia: por primera vez, un modelo pasa de 65
Nuestro índice de inteligencia mide razonamiento, conocimiento y seguimiento de instrucciones. Septiembre de 2026 marca un hito: Claude Fable 5.1 de Anthropic supera los 65 puntos en nuestro benchmark y, como referencia independiente, es el nº 1 en el Intelligence Index de Artificial Analysis.
La barra muestra nuestro índice de inteligencia (benchmark propio). El valor «AA» es el Intelligence Index de Artificial Analysis, como referencia independiente.
Dos lecturas importantes de ese gráfico:
- La frontera es de Anthropic y OpenAI. Los tres primeros puestos se reparten entre Claude y GPT. Pero la distancia entre el 1º y el 5º es de solo 7 puntos: la competencia está más apretada que nunca.
- Kimi K3 marca un hito histórico. Un modelo open source entra en el top de inteligencia (57 puntos). Hace un año eso era impensable.
La tabla maestra: todas las métricas de un vistazo
Aquí consolidamos lo que medimos de cada modelo, con la referencia de Artificial Analysis al lado:
| Modelo | Intel (nuestro) | Intel (AA) | Coding | Contexto (práctica) | Precio (in/out) |
|---|---|---|---|---|---|
| Claude Fable 5.1 | 66 | 53 (#1) | 67 | 700K–900K | $10 / $50 |
| GPT-6 Astra | 61 | 52.8 | — | 750K–950K | $10 / $50 |
| GPT-5.6 Sol | 61 | 47.1 | — | 150K–250K | $4 / $20 |
| Claude Opus 5 | 60 | 50.7 | 67 | 150K–250K | $5 / $25 |
| Claude Fable 5 | 59 | — | 67 | 150K–250K | — |
| GPT-5.6 Luna | 58 | 37.5 | — | 150K–250K | $0.20 / $1.20 |
| Kimi K3 (max) | 57 | 43.8 | — | 500K–1M | self-host |
| Gemini 3.8 Flash | 56 | 41.2 | — | 700K–900K | $0.30 / $2.50 |
| Claude Mythos 5.1 | 55 | — | — | 150K–250K | — |
| Llama 3.3 (70B) | 55 | — | — | 90K–115K | open source |
| Mistral 2 (70B) | 54 | — | — | 90K–115K | open source |
Contexto = estimación práctica prudente (rango de uso estable), no el límite máximo anunciado. Ver detalle más abajo.
El contexto: separando lo anunciado de lo verificado
Aquí hay que ser especialmente honestos, y lo decimos claro: el contexto de tokens es el dato peor documentado del mercado. Distinguimos entre contexto anunciado, contexto realmente utilizable y estimación práctica prudente, y marcamos cada cifra con su «estado del dato» para no dar una falsa sensación de precisión.
Escala logarítmica. Barra = estimación práctica prudente (rango). Color = «estado del dato».
Y la tabla con el detalle exacto:
| Modelo | Contexto anunciado | Estimación práctica | Estado del dato | Confianza |
|---|---|---|---|---|
| GPT-6 Astra | ~1,05M | 750K–950K | Fuente secundaria | Media-baja |
| Claude Fable 5.1 | ~1M | 700K–900K | Fuente secundaria | Media |
| Gemini 3.8 Flash | ~1M | 700K–900K | Fuente secundaria | Media |
| Kimi K3 (max) | — | 500K–1M | No verificado | Muy baja |
| GPT-5.6 Sol | — | 150K–250K | Estimación | Baja |
| Claude Opus 5 | — | 150K–250K | Estimación | Baja |
| Claude Fable 5 | — | 150K–250K | Estimación | Baja |
| GPT-5.6 Luna | — | 150K–250K | Estimación | Baja |
| Gemini 3.1 Pro | — | 150K–250K | Estimación | Baja |
| Claude Mythos 5.1 | — | 150K–250K | Estimación | Baja |
| Mistral Large 2 | ~128K | 90K–115K | Documentado | Media-alta |
| Llama 3.3 70B | 128K | 90K–115K | Oficial | Alta |
Un líder para cada tarea (y por qué eso lo cambia todo)
Aquí está el hallazgo central del estudio. Cuando cruzas las métricas y el análisis de alucinaciones, cada proceso crítico tiene un ganador distinto:
| Proceso / Tarea | Líder absoluto | Segunda opción | Por qué gana |
|---|---|---|---|
| Programación / Código | Claude Fable 5.1 (Coding 67) | DeepSeek V4 Pro / Cursor | Resolución autónoma de bugs y menor tasa de errores lógicos |
| Razonamiento / Agentes | GPT-6 Astra | GLM-5.3 | Controla sistemas virtuales y automatiza flujos complejos |
| Análisis de datos extensos | Gemini 3.8 Flash | ChatGPT Plus (Advanced Data) | Contexto de ~1M y análisis multimodal (texto, imagen, audio, vídeo) |
| Redacción / Creatividad | Claude Opus 5 | Muse Spark 1.3 | La tasa de alucinación más baja del mercado (0,7 %) |
| Investigación en vivo | Perplexity Pro | OpenAI Search | Curación de fuentes en tiempo real sin alucinaciones |
Traducción práctica: quien dependa de un único proveedor está dejando rendimiento sobre la mesa. La IA corporativa en 2026 se decide por caso de uso, no por "el modelo de moda".
El precio: una divergencia brutal
Si la inteligencia está apretada, los precios están rotos a propósito. Hay una diferencia de 100x entre el modelo más caro y el más barato, y el barato rinde al 95 % del caro.
Coste por 1 millón de tokens (API):
| Modelo | Entrada | Salida | Perfil |
|---|---|---|---|
| Claude Fable 5.1 | $10 | $50 | S-Tier (frontera) |
| GPT-6 Astra | $10 | $50 | S-Tier (frontera) |
| Claude Opus 5 | $5 | $25 | Mejor valor premium |
| GPT-5.6 Sol | $4 | $20 | Mejor relación calidad-precio |
| Gemini 3.1 Pro | $2 | $10 | Contexto masivo (2M) |
| GPT-5.6 Luna | $0.20 | $1.20 | Equilibrio costo-capacidad |
| Gemini 2.5 Flash | $0.30 | $2.50 | Tareas estándar |
| Gemini Flash-Lite | $0.10 | $0.40 | El más barato del mercado |
Un apunte que nos dejó descolocados: la facturación no siempre ha encajado con el número real de tokens que consumíamos. Detectamos cierta itinerancia en la medición que no siempre hemos podido contabilizar con exactitud, y no terminamos de entender los motivos ni las razones de esa variabilidad.
DeepSeek V4 Pro registra un coste por tarea de programación completada con éxito de 0,04 $ (aunque dicen que no comparten datos, conviene recordar que no operan en servidores protegidos europeos), frente a los 0,32 $ de los modelos americanos más grandes. Rinde a más del 95 % del nivel de la frontera por una fracción del coste.
Esto no es un "truco de benchmark". Es la diferencia entre un proyecto viable y uno que se come el margen en factura de API.
Las suscripciones: la convergencia de los 20 $/mes
En consumo individual, todo el mundo aterrizó en el mismo precio —20 $ al mes— pero vendiendo cosas radicalmente distintas:
| Plan | Precio | Modelo estrella | Ventaja real | Talón de Aquiles |
|---|---|---|---|---|
| ChatGPT Plus | $20 | GPT-6 Astra | Canvas, intérprete Python, ecosistema | Picos de latencia intermitentes |
| Claude Pro | $20 | Claude Fable 5.1 | Cero retención de datos, mejor código | Límites estrictos en razonamiento profundo |
| Gemini AI Pro | ~$26 (€24) | Gemini 3.8 Flash | 2 TB de Google One + contexto ~1M | Menos intuición pura en código |
| Perplexity Pro | $20 | — | Búsqueda y fuentes en tiempo real | No es un modelo generalista |
| Mistral Pro | ~$24 (€22) | Mistral 2 | Multilingüe, enfoque europeo | Ecosistema más limitado |
| Grok Premium | $30 | Grok 4.1 | Acceso a X y tendencias | Menos pulido técnico |
La conclusión es incómoda para los vendedores de "la IA definitiva": los tres grandes te venden el mismo precio con un perfil de usuario distinto. Elegir bien exige saber para qué la vas a usar.
El factor open source: la soberanía ya no es un sacrificio
Este es probablemente el cambio estructural más importante que vimos. Los modelos abiertos ya no son "los baratos de segunda":
| Modelo | Contexto | Licencia | Punto fuerte |
|---|---|---|---|
| Kimi K3 (max) | 500K–1M* | Open source | Investigación de documentos larguísimos |
| Llama 3.3 (70B) | 90K–115K | Apache 2.0 | Uso general de código abierto |
| Mistral Large 2 | 90K–115K | Apache 2.0 | Despliegue local multilingüe |
* Contexto sin verificar oficialmente.
Para datos hipersensibles (GDPR / HIPAA), desplegar on-premise ya no implica sacrificar inteligencia. Llama, Mistral y compañía rinden a más del 95 % de la frontera comercial. Eso, hace doce meses, era imposible.
¿Y LaiaDesk en todo esto?
Aquí va la parte honesta, porque no nos gusta vender humo ni a los demás ni a nosotros mismos.
Nosotros no entramos en esta comparativa como un modelo más. LaiaDesk no es un LLM que compita con Claude o con GPT: somos una plataforma. Y buena parte de nuestros principios y de nuestro entrenamiento se apoya precisamente en los modelos de frontera que aquí analizamos. Sería deshonesto colarnos en el ranking con una puntuación propia.
Entonces, ¿para qué hicimos el estudio?
- Para validar que orquestamos bien. Si cada tarea tiene un líder distinto, la única forma correcta de construir una plataforma es usar el modelo adecuado para cada cosa — y este estudio nos confirmó dónde estábamos acertando y dónde no.
- Para aportar lo que los modelos no dan. Un modelo es una API. Nosotros sumamos lo que ninguno de ellos ofrece por sí solo: soberanía de datos en la UE, memoria vectorial profunda y agentes especializados listos para vender.
- Para tener criterio propio. No queremos recomendar a nuestros clientes un modelo "porque es el que está de moda". Queremos recomendar el que de verdad gana en su caso de uso.
Si quieres los datos crudos —rankings, latencias, costes y análisis— tenemos el Excel completo con todas las métricas. Pídelo y te lo pasamos.
Conclusiones en cinco líneas
- Claude Fable 5.1 lidera en razonamiento (66 puntos, el primero en superar 65).
- GPT-6 Astra es la referencia en ciberseguridad y agentes autónomos.
- GPT-5.6 Sol es la mejor relación precio-rendimiento en la frontera.
- Cada modelo gana en algo distinto: no busques "el mejor", busca "el mejor para lo tuyo".
- El open source llegó para quedarse en la mesa de las empresas que priorizan soberanía.
La IA de 2026 no es una carrera de un solo ganador. Es un ecosistema de especialistas. Y la única estrategia sensata —la nuestra, la de LaiaDesk— es integrar lo mejor de cada uno.
— Equipo de LaiaDesk. Benchmark local, servidor propio, septiembre de 2026.
Conversación
Inicia sesión para comentar y reaccionar.
EntrarSé el primero en comentar.