Anthropic lanza Sonnet 4.7 priorizando confiabilidad
Una versión que apunta a la confiabilidad del agente, no a fuegos artificiales de benchmark.
Mariano De Vitto · Mayo 2026
Anthropic lanzó Claude Sonnet 4.7 esta semana. El encuadre fue deliberado. Mientras OpenAI llevó GPT-5.5 con demos de agentic worker y un mensaje de cadencia de release, Sonnet 4.7 fue al lado opuesto. El número titular fue confiabilidad de agentes: una caída medible en derailment durante cadenas largas de tool calls, menos tareas abandonadas y una respuesta más fina al feedback negativo en trabajo multi-paso.
Confiabilidad como tesis competitiva
La señal de benchmarks es consistente. Sonnet 4.6 ya lideraba el GDPval-AA Elo para tareas de trabajo del conocimiento. Sonnet 4.7 extiende esa ventaja y agrega métricas explícitas sobre lo que la comunidad de seguridad llama persistencia de tareas: cuando un agente encuentra un estado inesperado en la página, un muro de autenticación o una respuesta de API malformada, se recupera o se detiene. Los números de 4.7 son más altos que los de cualquier modelo público en persistencia bajo condiciones reales.
Por qué importa para marketing
Para los equipos de marketing, esta es la variable que realmente cuenta. La primera ola de herramientas agentic (los conectores AI de Meta, Salesforce Agentforce, HubSpot Breeze, Snapchat AI Sponsored Snaps) asume que el modelo subyacente puede ejecutar una tarea de punta a punta sin abandonar a la mitad. La economía de marketing agentic se cae cuando el agente tiene éxito el 60% de las veces. Empieza a funcionar cuando tiene éxito el 90%. La distancia entre demo y producción vive en esos números.
Leído junto al ritmo de seis semanas de OpenAI y Gemini 3.1 Ultra de Google, los laboratorios convergen en tres apuestas distintas. OpenAI corre por velocidad de iteración. Google corre por ventana de contexto y profundidad multimodal. Anthropic corre por la variable poco glamorosa que decide si los agentes llegan a producción. Para las organizaciones de marketing del lado de la marca, la pregunta de procurement se vuelve más interesante, no menos.
La calibración del rechazo
Hay una señal más silenciosa en las notas de release. Anthropic destacó una calibración mejorada del rechazo: el modelo declina menos solicitudes razonables sin dejar de rechazar las genuinamente inseguras. Esa es la variable que venía bloqueando la adopción enterprise en industrias reguladas (servicios financieros, salud, contenido publicitario dirigido a menores). Si 4.7 efectivamente acierta la calibración, los equipos legales de marca que eran escépticos sobre rollouts de agentes pueden reabrir la conversación.
La tarea práctica para este trimestre: volver a correr cualquier evaluación de agente hecha antes de marzo contra el último Sonnet. El trabajo que falló en febrero puede pasar ahora. Y al revés, los agentes en producción sobre Sonnet 4.5 pueden comportarse distinto a medida que el modelo subyacente se vuelve más prudente. Probá antes de promover.
La señal de esta semana: Sonnet 4.7 vende confiabilidad antes que velocidad. Esa es la variable que decide si los agentes llegan a producción en serio.
The Signal Brief · Mariano De Vitto — Head of Marketing, Barcelona