El gobierno de Estados Unidos ha levantado las restricciones impuestas sobre los modelos Claude Fable 5 y Mythos 5 de Anthropic, permitiendo así que la desarrolladora reactive el acceso a ambos modelos para todos los usuarios y usuarias.
El lanzamiento de ambas IAs, realizado el pasado 9 de junio, causó gran revuelo por ser consideradas dos de los modelos más avanzados del mercado.
Pero el entusiasmo duró apenas tres días, ya que el 12 de junio el gobierno estadounidense emitió una directiva de control de exportaciones alegando motivos de seguridad nacional que obligaba a Anthropic a bloquear el acceso a Claude Fable 5 y Mythos 5 a cualquier ciudadano extranjero, estuviera dentro o fuera de Estados Unidos. Sin embargo, como la compañía no tenía forma de segmentar los accesos por nacionalidad en tiempo real, decidió retirar los modelos en todo el mundo.
“La directiva de control de exportaciones del 12 de junio se emitió después de que el gobierno tuviera conocimiento de un informe en el que investigadores de Amazon habían descubierto un método para eludir las medidas de seguridad de Fable 5: provocar que el modelo identificara varias vulnerabilidades de software. En un caso, el modelo generó código que demostraba cómo explotar la vulnerabilidad en cuestión. Durante las últimas dos semanas, hemos colaborado estrechamente con el gobierno y otros socios, incluyendo Amazon, para revisar el informe y las pruebas“, ha explicado Anthropic en su comunicado.
Las pruebas ejecutadas pro Anthropic revelaron que modelos competidores y anteriores (como GPT-5.5, Kimi K2.7 o Claude Opus 4.8) replicaban exactamente el mismo comportamiento defensivo de bajo riesgo. Así mismo, en colaboración con el gobierno de Estados Unidos, desarrollaron un clasificador de seguridad mejorado capaz de detectar y bloquear el comportamiento descrito en el informe.
“El nuevo clasificador bloquea la técnica específica descrita en el informe de Amazon en más del 99 % de los casos. En una fracción muy pequeña de casos, el modelo podría proporcionar información insuficiente para ayudar a un ciberatacante. No se espera que las medidas de seguridad del modelo bloqueen todas las capacidades de ciberdefensa rutinarias de bajo riesgo, sino solo aquellas potencialmente dañinas. Investigadores del Centro de Estándares e Innovación de IA (CAISI) del Departamento de Comercio de EE. UU. han probado tanto nuestras medidas de seguridad anteriores como las nuevas y coinciden en que son extraordinariamente sólidas“, ha asegurado la desarrolladora.
Finalmente, el pasado 30 de junio, Anthropic anunciaba el restablecimiento de Claude Fable 5 y Mythos 5 después de que el gobierno de Estados Unidos levantase los controles de exportación. De este modo, el 1 de julio, Claude Fable 5 volvió a estar disponible a través de la plataforma Claude, Claude.ai, Claude Code y Claude Cowork. Mientras que Mythos se activó para un grupo de organizaciones estadounidenses.
Con el lanzamiento de la nueva generación de modelos, Anthropic reforzó su estrategia de seguridad, evidenciando una notable diferencia entre sus dos variantes. Mientras que Claude Mythos 5 demostró una eficacia sin precedentes para identificar y explotar vulnerabilidades de software (superando incluso a expertos humanos muy experimentados y convirtiéndose en un objetivo especialmente atractivo para el cibercrimen), Claude Fable 5 fue diseñado para no ofrecer capacidades ofensivas únicas gracias a la implementación de las medidas de seguridad más estrictas aplicadas hasta la fecha por la compañía.
Para proteger a Fable 5, Anthropic duplicó el número de investigadores e ingenieros dedicados específicamente a este problema y aplicó un enfoque de «defensa en profundidad». Esta estrategia combina el entrenamiento del modelo para rechazar solicitudes peligrosas, el análisis retrospectivo de patrones de uso indebido y, de forma destacada, el empleo de clasificadores automatizados. Estos sistemas de IA secundarios detectan cuándo una interacción puede implicar una tarea de ciberseguridad potencialmente dañina y bloquean la respuesta cuando corresponde.
Conscientes de que ningún sistema es infalible frente a técnicas de jailbreak (manipulación deliberada), los desarrolladores aplicaron un estricto «margen de seguridad». Esto significa que los clasificadores se configuraron de forma especialmente conservadora, bloqueando por precaución numerosas solicitudes que probablemente sean inofensivas. Aunque este criterio incrementa los falsos positivos y puede resultar frustrante para los usuarios, reduce el riesgo de que el modelo responda a solicitudes potencialmente peligrosas.
Bajo este esquema, Anthropic asume que la inmunidad absoluta frente a las vulnerabilidades no existe y clasifica las brechas detectadas según su gravedad: desde vulnerabilidades menores que solo permiten acceder al margen de seguridad, hasta jailbreaks específicos y los jailbreaks universales, considerados la categoría más preocupante por su capacidad para desbloquear una amplia variedad de comportamientos dañinos.
Según la compañía, hasta la fecha no se ha identificado ningún jailbreak universal en Fable 5. En conjunto, este sistema de capas de protección no pretende eliminar por completo el riesgo, sino hacer que los intentos de vulneración sean lo suficientemente costosos y complejos como para dificultar su explotación y añadir mecanismos adicionales de mitigación incluso cuando un ataque logra superar alguna de las barreras.
Foto: generada con ChatGPT Images 2.0
Your email address will not be published. Required fields are marked *
Δ