En los últimos meses hemos asistido a una proliferación de IAs de razonamiento, capaces de dividir las tareas en pasos y ejecutar un proceso de pensamiento que culmina en respuestas más refinadas. La última de estas herramientas es Claude 3.7 Sonnet, el modelo más avanzado de la desarrolladora Anthropic. Sin embargo, esta IA presenta una particularidad: se trata de un modelo de razonamiento híbrido.
Esto significa que, a diferencia de otras IAs de razonamiento, Claude 3.7 Sonnet permite a la persona usuaria activar o no estas capacidades de pensamiento avanzado. De este modo, cuando quieras que la IA de una respuesta rápida y sencilla solo tendrás que solicitárselo, y lo mismo cuando necesites reflexiones profundas para tareas complejas. «Creemos que el razonamiento debería ser una capacidad integrada de los modelos de vanguardia en lugar de un modelo completamente separado», explican desde Anthropic.
Además de esta novedad, Anthropic también ha presentado Claude Code, una herramienta de codificación de agentes que se encuentra en fase preliminar. Con Claude Code, los desarrolladores y desarrolladoras pueden delegar tareas complejas de ingeniería a Claude directamente desde su terminal.
Introducing Claude 3.7 Sonnet: our most intelligent model to date. It’s a hybrid reasoning model, producing near-instant responses or extended, step-by-step thinking. One model, two ways to think. We’re also releasing an agentic coding tool: Claude Code. pic.twitter.com/jt7qQmFWuC — Anthropic (@AnthropicAI) February 24, 2025
Introducing Claude 3.7 Sonnet: our most intelligent model to date. It’s a hybrid reasoning model, producing near-instant responses or extended, step-by-step thinking.
One model, two ways to think.
We’re also releasing an agentic coding tool: Claude Code. pic.twitter.com/jt7qQmFWuC
— Anthropic (@AnthropicAI) February 24, 2025
Claude 3.7 Sonnet se trata de la evolución de Claude 3.5 Sonnet (efectivamente, se han saltado el 3.6) y es la primera IA de razonamiento desarrollada por Anthropic. Además, presenta capacidades mejoradas en matemáticas, física, seguimiento de instrucciones o codificación, entre otras áreas.
Al tratarse de un modelo híbrido, integra tanto las capacidades de un LLM común como de una IA de razonamiento. El usuario o usuaria tan solo tendrá que desplegar el botón “Claude 3.7 Sonnet” ubicado en el propio cajón de texto de la IA y seleccionar la opción “Normal” o “Extended”, en función de si necesita que la herramienta use o no sus capacidades de razonamiento.
Esta característica la diferencia de otros modelos de razonamiento como o3 de OpenAI, que tan solo permiten ejecutar procesos de pensamiento complejos y por pasos para responder a las consultas. Lo cual implica que el usuario o usuaria tenga que seleccionar un modelo diferente según la complejidad de la tarea. De hecho, OpenAI informó recientemente de sus planes para eliminar el selector de modelos de ChatGPT y desarrollar una herramienta capaz de aplicar el modelo más adecuado en cada contexto, buscando simplificar y mejorar la experiencia de usuario.
Este también es el objetivo de Anthropic. El laboratorio de IA creado por ex empleados de OpenAI desea avanzar hacia un modelo capaz de decidir cuánto tiempo “pensar” o “razonar” una tarea, eliminando el paso intermedio que obliga a los usuarios y usuarias seleccionar el modo “Normal” o “Extended”.
En el propio panel de chat, Claude 3.7 Sonnet mostrará el proceso de razonamiento interno que realiza hasta llegar a la respuesta final y marcará el tiempo que ha tardado en llegar hasta su conclusión. Eso sí, desde Anthropic señalan que no siempre revelará todos sus “pensamientos”, ya que algunos pueden estar censurados por motivos de seguridad.
La desarrolladora ha optimizado los modos de pensamiento de esta inteligencia artificial para realizar tareas del mundo real que reflejen cómo las empresas usan esta tecnología para mejorar su productividad, como problemas de codificación o tareas de agencia.
Así mismo, Claude 3.7 Sonnet ha mejorado su capacidad para identificar solicitudes dañinas y diferenciarlas de las que no lo son. La versión 3.7 ha reducido en un 45% la tasa de rechazos innecesarios en comparación con su antecesora 3.5.
En lo que respecta al rendimiento de este nuevo modelo, en la prueba SWE-Bench (tareas de codificación) reveló una precisión del 62,3%, mientras que la IA o3-mini de OpenAI obtuvo un 49,3%. Y, en la prueba TAU-Bench, que mide la capacidad de un modelo de IA para interactuar con usuarios simulados y APIs externas, Claude 3.7 Sonnet logró un 81,2%, en comparación con o1 de OpenAI, que obtuvo un 73,5%.
Como detalle curioso, cabe mencionar que Anthropic no solo se sirvió de estas pruebas oficiales para testar su nueva IA, sino que también recurrió a otras vías como jugar al videojuego Pokemon Rojo de Game Boy.
Para ello, tal y como explican, «equipamos a Claude con memoria básica, entrada de píxeles en la pantalla y llamadas de función para pulsar botones y navegar por la pantalla, lo que le permitió jugar a Pokémon de forma continua más allá de sus límites de contexto habituales, manteniendo el juego a lo largo de decenas de miles de interacciones».
Claude 3.7 Sonnet logró vencer a tres líderes de gimnasio y ganar sus medallas. Este ha sido el mejor resultado obtenido por un modelo de la familia Claude Sonnet, cuya primera versión Claude 3.0 Sonnet ni siquiera consiguió salir de la casa en Pueblo Paleta.
«Pokémon es una forma divertida de apreciar las capacidades de Claude 3.7 Sonnet, pero esperamos que estas capacidades tengan un impacto en el mundo real mucho más allá de los juegos. La capacidad del modelo para mantener la concentración y lograr objetivos abiertos ayudará a los desarrolladores a crear una amplia gama de agentes de IA de última generación», apunta la desarrolladora.
Anthropic ha dado acceso a Claude 3.7 Sonnet a todos sus usuarios y usuarias, sin embargo no todos los planes dan acceso a su versión completa. La capacidad de razonamiento del modo “Extended” solo estará disponible para quienes tengan contratado un plan de pago (Pro, Team o Enterprise). Por su parte, el plan gratuito ofrecerá las capacidades mejoradas de Claude 3.7 Sonnet como modelo LLM, pero sin la función de razonamiento.
También es posible utilizar Claude 3.7 Sonnet y sus capacidades de razonamiento en Anthropic API, Amazon Bedrock y Vertex AI de Google Cloud.
Al usar este modelo a través de la API, «los usuarios también pueden controlar el presupuesto para pensar: pueden indicarle a Claude que piense por no más de N tokens, para cualquier valor de N hasta su límite de salida de 128K tokens. Esto les permite equilibrar la velocidad (y el costo) por la calidad de la respuesta».
La otra novedad presentada por Anthropic es Claude Code, su primer agente activo especializado en tareas de codificación. Este modelo puede «buscar y leer código, editar archivos, escribir y ejecutar pruebas, confirmar y enviar código a GitHub y usar herramientas de línea de comandos, manteniéndolo informado en cada paso».
Por el momento, Claude Code se encuentra en una vista previa de investigación limitada, pero sus capacidades ya han revelado grandes resultados. Desde la desarrolladora explican que este modelo logró completar tareas en una sola pasada que, normalmente, llevarían más de 45 minutos de trabajo manual.
Anthropic ha informado de que planea implementar mejoras continuas apoyándose en la experiencia de uso. Concretamente contemplan: «mejorar la confiabilidad de las llamadas a herramientas, agregar soporte para comandos de ejecución prolongada, mejorar la representación en la aplicación y expandir la propia comprensión de Claude sobre sus capacidades».
Ya es posible solicitar acceso a la versión preliminar de Claude Code apuntándote a su lista de espera.
Foto: Anthropic
No se han encontrado artículos relacionados.
Your email address will not be published. Required fields are marked *
Δ