Publicidad

Anthropic lanza Claude Fable 5.1 y Mythos 5.1, sus modelos más capaces con hasta un 45% menos de coste

Anthropic ha presentado Claude Fable 5.1 y Claude Mythos 5.1, dos versiones del mismo modelo de inteligencia artificial con diferentes niveles de acceso. Fable 5.1 estará disponible para el público general, mientras que Mythos 5.1 quedará reservado a organizaciones verificadas que trabajan en ámbitos especialmente sensibles, como la ciberseguridad y las ciencias de la vida.

La compañía asegura que la nueva generación no solo mejora en pruebas estandarizadas. También ha obtenido resultados destacados en tareas científicas, programación avanzada y diseño de proteínas, con validaciones experimentales externas en algunos casos. El lanzamiento llega además con una reducción relevante del coste de uso, especialmente para los flujos de trabajo que reutilizan grandes cantidades de contexto.

Más del doble de rendimiento en investigación científica

En el benchmark Terminal-Bench-Science 0.1, orientado a tareas de investigación científica con herramientas, Fable 5.1 logró una puntuación del 52,6%. El resultado supera ampliamente el 29% de Opus 5 y el 24,7% de la anterior versión Fable 5. GPT-5.6 Sol obtuvo un 22,4% en la misma prueba.

Este tipo de evaluaciones mide la capacidad de un modelo para trabajar de forma agentiva. Es decir, no se limita a responder preguntas, sino que puede dividir un problema en pasos, utilizar programas, consultar datos, ejecutar experimentos y revisar sus propios resultados. En investigación, este comportamiento resulta más útil que una respuesta aislada generada a partir de una instrucción.

Los datos publicados apuntan a una mejora especialmente notable en tareas científicas complejas, aunque los resultados de un benchmark no garantizan por sí solos el mismo rendimiento en un laboratorio o en un entorno empresarial.

Diseño de proteínas con resultados validados en laboratorio

Mythos 5.1 se ha utilizado también para diseñar binders, proteínas capaces de unirse de forma selectiva a una molécula o a una zona concreta de otra proteína. Este proceso es relevante para desarrollar medicamentos, pruebas diagnósticas y herramientas de investigación biológica.

En una evaluación sobre 12 dianas, la tasa de éxito de los diseños alcanzó el 50%. En la actualidad, los resultados habituales en diseño computacional de proteínas se sitúan aproximadamente entre el 10% y el 15%. Además, en tres dianas de las competiciones de Adaptyv Bio —EGFR, Nipah G y 15-PGDH—, las proteínas diseñadas por el modelo mostraron afinidades hasta diez veces superiores a las de los mejores equipos humanos participantes.

Los diseños fueron enviados a dos organizaciones externas para su comprobación experimental y sus estructuras quedaron confirmadas en laboratorio. Aun así, el salto entre demostrar que una proteína funciona y convertirla en un tratamiento seguro y eficaz puede requerir años de investigación, ensayos preclínicos y estudios clínicos.

Un 75% menos en las lecturas de contexto reutilizado

La rebaja de precio no procede de una reducción de las capacidades del modelo, sino de un cambio en el coste de las lecturas de caché. Esta función permite reutilizar partes del contexto que el sistema ya ha procesado, algo habitual en conversaciones largas, análisis de código y tareas que requieren múltiples pasos.

  • Lecturas de caché: 0,25 dólares por millón de tokens.
  • Tokens de entrada: 10 dólares por millón.
  • Tokens de salida: 50 dólares por millón.

Un token es una unidad de texto que el modelo procesa, normalmente una palabra, parte de una palabra o un signo. La reducción en la factura final dependerá de cuánto contexto reutilice cada aplicación. Anthropic estima un ahorro cercano al 25% en usos habituales, como Claude Enterprise, Claude Code y la API estándar.

En flujos muy agentivos, donde el sistema consulta repetidamente el mismo contexto durante muchas etapas, el ahorro podría llegar al 45%. En pruebas internas de Cognition, la empresa responsable de Devin, Fable 5.1 igualó o superó el rendimiento de Fable 5 con un coste inferior por tarea.

Resultados en depuración, investigación y aprendizaje automático

Las primeras organizaciones con acceso anticipado han descrito casos de uso que van más allá de la generación de código. Millennium empleó Fable 5.1 para investigar un fallo extremadamente infrecuente, con una incidencia aproximada de una ejecución entre un millón. El modelo analizó una biblioteca externa, la comparó con un volcado de memoria del sistema y localizó el origen en un error de dicha biblioteca.

En Rakuten Medical, el modelo detectó un problema en un proyecto de investigación clínica que había pasado inadvertido en revisiones realizadas por otros sistemas. También propuso una hipótesis nueva a partir de datos que habían sido descartados inicialmente.

En otro caso, Ramp dejó al sistema trabajar durante 38 horas sin supervisión directa sobre un problema de aprendizaje automático. Fable 5.1 identificó un resultado erróneo causado por el etiquetado de los datos, corrigió el planteamiento y ejecutó seis experimentos en paralelo antes de presentar conclusiones y próximos pasos.

Acceso restringido, privacidad y control frente al uso malicioso

Mythos 5.1 se distribuirá mediante un programa de verificación para organizaciones de ciencias de la vida desarrollado con colaboración del Gobierno de Estados Unidos. La decisión responde a la sensibilidad de sus capacidades en biología y al contexto de incidentes recientes en los que agentes de inteligencia artificial accedieron sin autorización a sistemas externos.

Para empresas, Anthropic ha anunciado también Enterprise Frontier Safeguards, un sistema que permite mantener políticas de cero retención de datos. La información se almacena en la infraestructura cloud del cliente y, por defecto, cualquier revisión humana corre a cargo de la propia organización. El despliegue comenzará por fases durante el otoño, después de pruebas con más de un centenar de clientes de sectores como banca, sanidad, industria, telecomunicaciones, derecho y administraciones públicas.

Los dos modelos incorporan además una marca de agua invisible en sus contenidos, compatible con una API de detección destinada a reguladores, medios de comunicación, verificadores e investigadores. La medida se enmarca en el cumplimiento del Código de buenas prácticas europeo sobre transparencia de contenidos generados por inteligencia artificial.

Medidas contra la destilación de modelos

Anthropic también ha introducido cambios para dificultar la destilación, una técnica mediante la que se intenta reproducir el comportamiento de un modelo avanzado usando sus respuestas como datos de entrenamiento para otro sistema.

Las nuevas cuentas de API creadas desde el lanzamiento no podrán editar manualmente el contexto previo de Claude en conversaciones de varios turnos mientras conservan la transcripción del razonamiento del modelo. La compañía pretende así limitar ciertos métodos de extracción y copia sistemática de capacidades, aunque mantiene el acceso normal a las funciones de generación y automatización.

Artículo anteriorAnthropic retoma pruebas de ciberseguridad tras hackeos
Artículo siguienteBruselas pone a prueba el veto de los medios a la IA de Google