Que una IA lidere un ranking no significa que sea la mejor para ti, según un estudio
Un agente de IA decide solo qué pasos dar para cumplir un encargo. Un estudio aún sin revisar por expertos (casi 30.000 pruebas con 54 modelos) concluye que su puesto en un ranking depende en buena parte del software que lo rodea. Y una prueba casera dice lo que el ranking no.

Imagina que contratas a un empleado y le dices: déjame cobrada la factura de este cliente. No le explicas cómo. Él decide si llama, si escribe, si mira la hoja de cálculo. Eso es un agente de IA: un sistema en el que un modelo de lenguaje decide por su cuenta qué pasos dar y qué herramientas usar para cumplir un encargo.
Un estudio del 30 de septiembre de 2026, que aún no ha revisado ningún experto, muestra que el puesto de un modelo en una clasificación de agentes depende en buena parte de lo que lo rodea, y no solo del modelo.
El taller que no se ve
Los autores hablan de «andamiaje»: el software que rodea al modelo y le permite actuar. Guarda el estado de la tarea, pone las herramientas a su alcance y convierte lo que escribe el modelo en acciones reales. Es como un mecánico: el modelo es su cabeza y el andamiaje, el taller con sus herramientas. Lo que se evalúa es el conjunto.
Y ese taller también se vende. En su evento para desarrolladores del 29 de septiembre, OpenAI presentó el uso de ordenador en su Agents API, y es OpenAI quien gestiona la infraestructura. Quien lo contrata no compra solo un modelo.
Por qué los errores se acumulan
Un ejemplo de cuenta nuestra, simplificado. Si un agente acierta el 95 % de las veces en cada paso, y los pasos son independientes, una tarea de diez pasos sale bien en torno al 60 % de las veces. Es como un repartidor que casi nunca falla una entrega: con rutas de diez paradas, aun así, unas cuatro de cada diez tendrían algún fallo.
Otro estudio, aceptado en una conferencia en 2026, evaluó 15 modelos y concluye que las mejoras recientes en capacidad solo han traído mejoras pequeñas en fiabilidad.
Qué encontró el estudio de septiembre
Parte de nueve pruebas de una clasificación pública de agentes: casi 30.000 ejecuciones de 54 modelos con 13 andamiajes distintos. Es fácil saber qué combinación concreta de modelo y andamiaje puntúa más. Es bastante más difícil saber si un modelo es mejor que otro con independencia de cómo se le prepare. Según los autores, cambiar de andamiaje puede alterar qué modelo parece superior.
Otro resultado va contra el reflejo habitual: añadir más tareas parecidas no arregla el problema. Repartir el presupuesto entre pruebas distintas sí ayuda. Y los propios autores matizan que no analizan si los resultados se trasladan a usos reales.
Por qué importa
Cuando un proveedor presume de que su agente logra un porcentaje alto en una prueba pública, esa cifra mide una pareja concreta de modelo y andamiaje, en tareas concretas y quizá en una sola pasada. La conclusión más útil es práctica: antes de fiarte de una clasificación, averigua con qué taller se obtuvo y si el resultado se repite.
Qué hacer hoy
Antes de poner un agente a trabajar en tu negocio, una prueba casera de unos días enseña lo que las clasificaciones no cuentan.
- Elige una tarea con resultado verificable, como clasificar facturas o responder consultas frecuentes.
- Prepara 20 casos reales con la respuesta correcta anotada de antemano y pasa cada caso varias veces. Cuenta los aciertos y también cuántas veces cambia el resultado con la misma entrada.
- Decide por escrito qué acciones necesitan aprobación humana, como enviar un mensaje a un cliente o gastar dinero.
- Compara con un proceso fijo más sencillo. La propia guía de Anthropic recomienda empezar por lo más simple.
Fuentes
- Hardy, Azam, Reuel, Kochenderfer y Koyejo, Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard, arXiv, 30 de septiembre de 2026 (preprint): https://arxiv.org/abs/2610.00651
- Rabanser, Kapoor, Kirgis, Liu, Utpala y Narayanan, Towards a Science of AI Agent Reliability, arXiv, 18 de febrero de 2026, aceptado en ICML 2026: https://arxiv.org/abs/2602.16666
- Anthropic, Building Effective AI Agents, 19 de diciembre de 2024: https://www.anthropic.com/engineering/building-effective-agents
- InfoQ, OpenAI DevDay 2026 Recap for Developers, 2 de octubre de 2026: https://www.infoq.com/news/2026/10/openai-devday-2026/
Fuentes citadas
- arXiv (preprint)Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard (se abre en otra pestaña)
- arXiv (aceptado en ICML 2026)Towards a Science of AI Agent Reliability (se abre en otra pestaña)
- AnthropicBuilding Effective AI Agents (se abre en otra pestaña)
- InfoQOpenAI DevDay 2026 Recap for Developers (se abre en otra pestaña)



