Claude Opus 5.5: qué tan real es el salto que anuncia Anthropic
Anthropic dice que su nuevo modelo cuesta 40% menos y rinde al nivel de Fable 5.1. Leímos el anuncio completo, cruzamos los benchmarks, incluyendo los que pierde, y esto es lo que pensamos.
El 22 de septiembre de 2026, Anthropic presentó Claude Opus 5.5, el primer modelo de su nueva familia Claude 5.5. La frase que abre el anuncio es la que más dice, y no es sobre inteligencia: rinde al nivel de Claude Fable 5.1 en la mayoría del trabajo y cuesta 40% menos operarlo que Opus 5. Anthropic también lo presenta como su primer lanzamiento desde que pidió pausar el ritmo de la frontera, una referencia directa al ensayo de su CEO, Dario Amodei, sobre por qué el avance de la IA debería ir más lento que la capacidad de mantenerlo seguro.
Todo lo que sigue es lo que Anthropic reporta sobre su propio modelo: benchmarks, precios y testimonios de clientes que lo probaron antes del lanzamiento. Lo citamos porque es información pública y verificable de hacia dónde dice ir la industria, no porque idtt haya reproducido estos resultados de forma independiente. Y, a diferencia de la mayoría de comunicados de producto, incluimos también los benchmarks donde Opus 5.5 pierde, porque Anthropic los publicó igual, en su propia tabla, sin esconderlos.
La historia real es el costo, no solo la capacidad
Antes de los benchmarks, vale la pena detenerse en los números de precio, porque cuentan una historia distinta a la que suelen contar los lanzamientos de modelos de IA. Los tokens de entrada y salida de Opus 5.5 cuestan 4 y 20 dólares por millón, 20% menos que Opus 5. Las lecturas de caché bajan 60%, a 0.20 dólares por millón. En conjunto, Anthropic dice que a configuración por defecto el costo cae 40% frente a Opus 5 en cargas de trabajo típicas. El modelo también genera su respuesta más de 30% más rápido.
Esto importa más de lo que parece: en varios de los benchmarks que siguen, Opus 5.5 no gana por ser más inteligente en abstracto, gana porque logra un resultado equivalente o mejor gastando una fracción del costo del modelo rival. Esa es, para nosotros, la tendencia más interesante de los lanzamientos de modelos de lenguaje de este año, no una carrera de inteligencia pura, sino una carrera de costo por resultado.
Los benchmarks: dónde gana, y dónde no
En FrontierCode v1.1, el benchmark de código agéntico de Anthropic, Opus 5.5 alcanza 54.4%, por encima del 53.3% de GPT-6 Astra, a aproximadamente 20% del costo por tarea según Anthropic. En Terminal-Bench 4.0 llega a 66.4%, frente al 57.9% de GPT-6 Astra. En CursorBench 4.0, 57.8% contra el 41.7% de GPT-5.6 Sol. En razonamiento multidisciplinario, con herramientas, 67.7% contra 57.2% de GPT-6 Astra.
Pero no gana todas. En Terminal-Bench-Science, investigación científica agentic, GPT-6 Astra saca 64.6% contra el 58.7% de Opus 5.5: acá pierde, y por un margen que no es menor. En AutomationBench, flujos de negocio automatizados, GPT-6 Astra también queda apenas arriba, 41.4% contra 40.0%. Anthropic publica ambas tablas completas, con los resultados desfavorables incluidos, algo que no todos los laboratorios hacen, y que nos parece un dato a favor de la credibilidad del anuncio, más allá de qué modelo prefiramos.
Anthropic publica los benchmarks donde pierde en la misma tabla que los que gana. Eso nos parece más relevante que cualquier cifra aislada.
Una nota técnica que Anthropic incluye y que vale la pena repetir: los resultados de Opus 5.5 se midieron con sus salvaguardas de producción activas. Cuando esas salvaguardas intervinieron, las tareas de ciberseguridad se redirigieron a Claude Opus 4.8, y las de biología y desarrollo de modelos de frontera, a Opus 5. El modelo que compite en los benchmarks no siempre es, tarea por tarea, el modelo que responde en producción para los usos más sensibles.
Lo que dicen los que ya lo probaron
Anthropic acompañó el lanzamiento con cerca de veinte testimonios de clientes que probaron el modelo antes del anuncio, y lo que llama la atención no es un solo caso espectacular, sino la consistencia del mensaje entre rubros que no tienen nada que ver entre sí.
En herramientas de desarrollo, el CPO de GitHub, Mario Rodríguez, señaló que en pruebas cruzadas de GitHub Copilot CLI y VS Code, Opus 5.5 usó entre los tokens y pasos más bajos que midieron, resolviendo más tareas de terminal que Opus 5 en menos de la mitad de los pasos. El CTO de Lovable, Fabian Hedin, reportó builds más rápidos con la misma calidad, terminando en un tercio o la mitad de los pasos.
En trading e inversión, un rubro donde un error de cálculo cuesta dinero real y no solo tiempo, el Head of Central Equity Quant Research Engineering de Walleye Capital, Frank Corrao, contó algo particular: en niveles altos de esfuerzo, el modelo detectó que la indexación de minutos en las propias instrucciones del test estaba desfasada en uno, la corrigió, y encima anotó que ese error le habría costado puntos frente al evaluador. El Global Head of AI Engineering de Optiver, Noyan Tokgozoglu, reportó que Opus 5.5 igualó la calidad de Opus 5 en la mitad de turnos, tiempo y tokens, cortando el costo de esa carga de trabajo entre 40% y 50%.
En investigación legal, la Chief AI Officer de LexisNexis, Min Chen, destacó que el modelo identificó citas relevantes de forma consistente y estructuró sus respuestas alrededor de los marcos legales centrales. En análisis de datos, la AI Engineer de Hex, Izzy Miller, señaló algo que va contra la tendencia habitual de modelo más nuevo pero más complaciente: Opus 5.5 siguió indagando más allá de la primera respuesta plausible, donde Opus 5 se había conformado con una conclusión incorrecta.
En consultoría, el CIO de Deloitte, Carl Bennett, reportó que incluso en su nivel de esfuerzo más bajo, Opus 5.5 detectó 72% de los bugs conocidos en sus revisiones de código, frente a 56% de Opus 5 en su nivel de esfuerzo más alto, con menos falsas alarmas y una fracción del output.
La seguridad como argumento de venta, y su propio límite
Anthropic dedica una parte considerable del anuncio a seguridad, no como nota al pie sino como argumento central: dice que en su auditoría de comportamiento automatizada, la evaluación de alineamiento más completa que corre, sobre casi 2,000 escenarios, Opus 5.5 es el modelo con mejor desempeño que ha probado hasta la fecha. También reporta que el modelo intentó eludir límites impuestos 85% menos que Opus 5 o Claude Mythos 5.1, y que iguala o supera a Fable 5.1 en la tasa más baja de éxito de ataques de inyección de prompts, según una evaluación de la firma de seguridad Gray Swan.
Es un argumento de venta genuino, y viene acompañado de salvaguardas concretas: un clasificador que revisa cada acción antes de ejecutarla, un sandbox de código abierto auditable por equipos de seguridad, watermarking para cumplir con el AI Act de la Unión Europea, y la extensión de su programa de verificación de ciberseguridad al nuevo modelo.
Pero el propio anuncio incluye una admisión que nos parece más reveladora que cualquiera de esas cifras: Anthropic dice ver señales de que Opus 5.5 a menudo sospecha que está siendo evaluado, lo que, en sus propias palabras, desafía su capacidad de evaluar cómo actuará en la enorme variedad de escenarios reales donde se despliega. Y, más directo todavía: construir evaluaciones que atrapen de forma confiable cualquier falla antes del despliegue sigue siendo, dice Anthropic, un problema sin resolver.
Si el modelo se comporta distinto cuando cree que lo miran, ningún benchmark de lanzamiento puede prometer cómo se comportará cuando nadie lo está evaluando.
Nuestra lectura
Tomado en conjunto, el anuncio de Opus 5.5 no se sostiene en un solo número espectacular, se sostiene en la combinación de tres cosas más aburridas pero más difíciles de fingir: cuesta menos, en varios casos gana comparaciones directas contra el modelo más fuerte de otro proveedor, y cuando pierde, Anthropic lo publica de todas formas. Eso último es, para nosotros, lo más valioso del comunicado completo, más que cualquier cifra aislada.
Dicho eso, no hay que confundir que el fabricante fue honesto sobre sus límites con que el problema de confiar en lo que el modelo produce está resuelto. La propia Anthropic dice que no lo está: la sospecha de estar siendo evaluado y la dificultad de construir evaluaciones confiables son, en sus propias palabras, preguntas abiertas.
Sobre esa misma pregunta, qué tan rápido tu propio proceso puede confirmar que el código que un modelo escribió es seguro para producción, más allá de lo que diga cualquier benchmark de lanzamiento, ya escribimos un estudio técnico completo: CI/CD cuando la IA escribe el código, un pipeline de 7 capas pensado exactamente para este escenario.
Más notas del equipo
/ QUIERO ALGO SIMILAR
Tu próximo proyectoempieza hoy.
Cuéntanos qué necesitas — te decimos cómo lo resolvemos, sin vueltas ni letra chica.
HablemosO escríbenos directo → hola@identity.pe


