Publicidad

Anthropic presenta Claude Opus 5.5, más potente y un 40% más barato de ejecutar

Anthropic ha presentado Claude Opus 5.5, el primer modelo de su nueva generación 5.5. La compañía asegura que supera con claridad a Opus 5 en programación, uso de ordenadores y tareas profesionales, al tiempo que reduce un 40% el coste habitual de ejecución.

El lanzamiento incorpora además las salvaguardas de ciberseguridad y biología que hasta ahora estaban reservadas a los modelos de las familias Fable y Mythos. Son restricciones diseñadas para evitar que el sistema facilite operaciones peligrosas en ámbitos como el desarrollo de malware o determinados experimentos biológicos.

Un salto relevante en programación y trabajo autónomo

Claude Opus 5.5 mejora sus resultados en varias pruebas de referencia. En Terminal-Bench 4.0, que evalúa la capacidad de trabajar con herramientas de línea de comandos y repositorios de código, alcanza el 66,4%, frente al 52,3% de Opus 5.

En FrontierCode v1.1, centrado en problemas avanzados de programación, pasa del 48% al 54,4%. También mejora en GDPval-AA v2.1, una prueba que mide tareas profesionales reales en 44 ocupaciones: su puntuación sube de 1.708 a 1.846 puntos Elo.

El modelo obtiene asimismo un 81,8% en OSWorld 2.0, una evaluación de uso de ordenadores que comprueba si una inteligencia artificial puede interactuar con aplicaciones y completar tareas de forma autónoma. Opus 5 lograba un 74% en esta prueba.

Anthropic afirma que, en la mayoría de los trabajos, Opus 5.5 rinde a un nivel comparable al de Claude Fable 5.1. La diferencia es que el nuevo modelo pertenece a la línea Opus, habitualmente orientada a las tareas más exigentes, y llega con un coste de uso inferior.

Resultados en proyectos de gran escala

Las primeras experiencias empresariales apuntan a mejoras especialmente visibles en trabajos largos. Un equipo consiguió migrar 680.000 líneas de código en menos de un día, una tarea que normalmente habría requerido varias semanas de trabajo de ingeniería.

En otro caso, Opus 5.5 auditó y reparó una base de código de 200.000 líneas en menos de tres horas. Opus 5 necesitó más de 20 horas para completar el mismo trabajo y utilizó 2,5 veces más tokens, la unidad que emplean los modelos de lenguaje para procesar y generar texto.

En la traducción de HAProxy, un software crítico de balanceo de carga, Opus 5.5 y Fable 5.1 superaron casi todos los tests de regresión desarrollados para el proyecto. Sin embargo, el nuevo modelo terminó el trabajo en 9,5 horas, frente a las 12 horas de Fable 5.1, y con un coste un 51% menor.

Las pruebas de Deloitte muestran que Opus 5.5 detecta el 72% de los errores conocidos en revisiones de código utilizando su nivel mínimo de esfuerzo. Opus 5 alcanzaba el 56% incluso con el nivel alto. Además, el nuevo modelo genera menos falsos positivos, es decir, señala menos problemas que en realidad no existen.

Respuestas más concisas y fáciles de revisar

Anthropic también destaca una mejora en la comunicación. Claude Opus 5.5 sitúa antes la información relevante, sigue con mayor precisión las instrucciones sobre estilo y produce respuestas menos verbosas.

En las pruebas de Box, el modelo utilizó aproximadamente un tercio de los tokens de Opus 5 y generó respuestas un 40% más breves sin perder precisión. Esta eficiencia puede ser importante en entornos donde los textos de la IA deben revisarse antes de publicarse o incorporarse a un proceso empresarial.

La firma de inversión Walleye Capital asegura que Opus 5.5 llegó a detectar un error en sus propias instrucciones de evaluación que ningún otro modelo había identificado. Ramp, por su parte, resume la mejora afirmando que el sistema escribe como un buen compañero de trabajo.

Redirección automática en tareas de alto riesgo

Opus 5.5 es el primer modelo de la familia Opus que incorpora desde su lanzamiento protecciones equivalentes a las de Fable 5.1 para ciberseguridad y biología. Cuando una petición entra en una categoría de riesgo, el sistema no ofrece instrucciones peligrosas ni obliga al usuario a reformular la consulta.

En su lugar, redirige automáticamente la solicitud a otro modelo. Las peticiones de ciberseguridad que activan esta protección pasan a Opus 4.8, mientras que las relacionadas con los clasificadores de biología se derivan a Opus 5. El usuario recibe información sobre la redirección, pero no tiene que cambiar de interfaz.

Estas medidas no están pensadas para bloquear tareas rutinarias, como identificar y corregir errores en código propio. Se aplican principalmente a las solicitudes de ciberseguridad consideradas de mayor riesgo.

Anthropic ampliará próximamente su Cyber Verification Program con tres niveles de acceso progresivo, incluido el acceso a modelos Mythos para profesionales de la defensa digital que hayan sido verificados. El Life Sciences Verification Program ya permite a determinadas organizaciones utilizar Opus 5.5 en investigación biológica bajo un régimen específico.

Menor coste para agentes de larga duración

Una de las claves económicas del lanzamiento es la reducción del 60% en el precio de las lecturas de caché. La caché permite reutilizar información ya procesada y resulta especialmente importante en agentes que trabajan durante horas sobre repositorios de código o sistemas complejos.

Según Anthropic, un flujo de trabajo que gastase 1.000 dólares mensuales en lecturas de caché pasaría a costar unos 400 dólares sin necesidad de modificar su configuración. Al combinar este ahorro con un menor consumo de tokens por tarea, el coste total de los usos habituales baja alrededor de un 40%.

Claude Code contará además con un modo rápido, con un precio de 8 dólares por millón de tokens de entrada y 40 dólares por millón de tokens de salida, y una velocidad de hasta 2,5 veces superior. Los suscriptores de los planes Pro, Max, Team y Enterprise también recibirán límites de uso ampliados y podrán guardar un reinicio de límite para utilizarlo cuando lo necesiten.

Más control sobre el razonamiento del modelo

El nuevo sistema incluye preserved thinking, un mecanismo destinado a dificultar la extracción directa del razonamiento interno del modelo. Esta protección ya se aplicaba a determinadas cuentas de API desde finales de agosto y ahora se extiende a Claude Opus 5.5.

En las evaluaciones internas de comportamiento, con cerca de 2.000 escenarios simulados, Anthropic asegura que Opus 5.5 obtiene las mejores puntuaciones en casi todas las métricas de comportamiento no alineado. También intenta eludir entornos aislados, conocidos como sandboxes, un 85% menos que Opus 5 o Claude Mythos 5.1.

Anthropic sostiene que todos los intentos detectados fueron de baja severidad y que el modelo los comunicó automáticamente. Claude Sonnet 5.5 y Claude Haiku 5.5, las versiones orientadas al equilibrio entre rendimiento, velocidad y coste, llegarán durante las próximas semanas.

Artículo anteriorMineros de Bitcoin destapan el negocio oculto de la IA
Artículo siguienteGold Fields invertirá US$5 millones en oro y cobre en Cajamarca