Claude Sonnet 5.5: el rápido de la familia, y cuándo usarlo en vez de Opus
Sonnet 5.5 es más rápido que Sonnet 5, escribe más claro y se come tu plan más lento. En Claude Code el modelo por defecto sigue siendo Opus 5.5, así que la pregunta de verdad es cuándo cambiarte. Aquí va eso, cómo hacerlo, qué dicen sus números y prompts para estrenarlo.
De qué va
En corto: para tareas bien definidas (un bug, un documento, un deck con plantilla, una hoja, un diseño) Sonnet 5.5 es la opción rápida, y en las pruebas del anuncio queda cerca de Opus 5.5. Para lo complejo y abierto, Anthropic misma dice que Opus sigue siendo claramente mejor.
Es el segundo modelo de la familia Claude 5.5, seis días después de Opus 5.5. Anthropic lo presenta como el complemento rápido y de menor costo de Opus: fuerte en tareas acotadas del día a día, en arreglar bugs y en armar documentos, presentaciones y hojas de cálculo pulidos, con buen ojo para el diseño. En Claude Code no viene por defecto en ningún plan; se elige con un comando. Los números del anuncio son buenos y esta página los pone con su letra chica.
Once secciones y nueve prompts para copiar. Si ya lo usas y quieres hablarle mejor, ve directo a Prompting para Sonnet 5.5.
Las once secciones
El Sonnet rápido de la familia 5.5
El complemento de Opus 5.5 para lo acotado, y la frase de Anthropic que conviene no perder.
Más rápido, más claro, más ligero
Menos pasos para lo mismo, menos vueltas y, en el chat, a veces más viñetas.
En Claude Code se elige
El default sigue siendo Opus 5.5. Cómo cambiar, la diferencia entre Enter y s, y lo que no se sabe.
Cuál usar para cada tarea
Una tabla por tipo de trabajo y la receta de Opus planea, Sonnet ejecuta.
Arranca en medio
Cinco niveles, cuál usar y cómo cambiarlo.
Código, documentos, diseño y pantallas
Bugs, decks con plantilla, interfaces pulidas, gráficas y hasta Pokémon Red.
Ocho pruebas y su letra chica
Pegado a Opus 5.5 en casi todas, y por qué en una prueba sacó menos en máximo que en extra-alto.
Por qué a veces cae a Sonnet 5
Qué pasa si tu tarea toca ciberseguridad o biología, y cómo volver.
Nueve prompts, uno por tarea
Un bug, un documento, un deck, una hoja, un diseño, opusplan y tres más.
Dónde queda y qué leer después
Fable, Opus, Sonnet y Haiku hoy, y las dos guías que siguen a esta.
Lo que no se sabe todavía
Números del día uno, lo que falta por superficie y las preguntas que más se repiten.
Ficha
Antes de empezar
- Nivel
- Principiante. No se escribe código: se copian prompts y, si usas Claude Code, un par de comandos de una línea.
- Qué necesitas
- Una cuenta de Claude. Para Claude Code, la versión 2.1.284 o posterior: con una más vieja no aparece.
- Qué NO necesitas
- Programar, una llave de API ni configurar nada raro. Todo pasa en claude.ai, las apps, Claude Code o Cowork.
- Cuánto toma
- Quince minutos de lectura. Probar los prompts de la sección 09 es otra media hora, y ahí se nota la velocidad.
- Qué te llevas
- Saber cuándo te conviene Sonnet 5.5 y cuándo Opus 5.5, cómo cambiar de uno a otro, qué hacer si cae a Sonnet 5 y nueve prompts para probarlo.
- Verificado
- 28 de septiembre de 2026, contra el anuncio oficial, la guía de prompting de Sonnet 5.5, su system prompt y la documentación de Claude Code.
01 · Qué es
El Sonnet rápido de la familia 5.5
Claude Sonnet 5.5 salió el 28 de septiembre de 2026, seis días después de Opus 5.5, y es el segundo modelo de la familia Claude 5.5. Anthropic lo presenta como el complemento más rápido y de menor costo de Opus 5.5. Donde Opus está hecho para trabajo complejo que pide criterio cuidadoso, Sonnet 5.5 es más fuerte en tareas del día a día bien acotadas, en arreglar bugs y en armar documentos, presentaciones y hojas de cálculo pulidos. El anuncio agrega que tiene buen ojo para el diseño.
Contra Sonnet 5 el salto es claro. Genera más de 30 % más rápido (es el Sonnet más rápido hasta hoy) y necesita mucho menos para terminar lo mismo, en parte porque junta varias acciones en un solo paso. Anthropic lo mide como hasta 30 % menos de costo por tarea. En un plan eso quiere decir que la misma tarea se come tu plan más lento.
Y una frase del anuncio que conviene tener a la mano: Opus 5.5 sigue siendo claramente más fuerte en trabajo complejo y abierto que pide criterio sostenido. Por eso esta guía dedica la sección 04 entera a decidir cuál usar.
De un vistazo
Sonnet 5.5 en ocho renglones
- Salió
- 28 de septiembre de 2026.
- Familia
- Es el segundo de Claude 5.5, después de Opus 5.5. Haiku 5.5 llega «en las próximas semanas», sin fecha.
- Fuerte en
- Tareas bien acotadas, bugs, documentos, presentaciones, hojas de cálculo y diseño.
- Velocidad
- Genera más de 30 % más rápido que Sonnet 5.
- Tu plan
- Necesita menos para la misma tarea, así que se come tu plan más lento que Sonnet 5.
- Claude Code
- No es el modelo por defecto en ningún plan: ahí sigue Opus 5.5. Se elige con /model sonnet.
- Esfuerzo
- Arranca en medio en Claude Code y en las apps. En Claude Code no hay botón para apagar el pensamiento; se regula con el esfuerzo.
- Sabe hasta
- Junio de 2026. Le cabe muchísimo texto en una sola conversación.
Lo que el anuncio no dice
No dice que Sonnet 5.5 sea igual de bueno que Opus 5.5. Dice que en varias pruebas, en su esfuerzo más alto, rinde parecido, y aclara que un benchmark mide solo una faceta de un modelo.
Tampoco dice que en claude.ai, en las apps o en Cowork sea el modelo que te sale elegido de entrada. Lo que se sabe y lo que no, superficie por superficie, está en la sección 03.
02 · Lo que notas
Más rápido, más claro y más ligero para tu plan
Antes de cualquier benchmark, esto es lo que notaron las empresas que lo probaron antes del lanzamiento. No hace falta configurar nada para verlo.
Velocidad
Llega antes y se deja dirigir
Genera más de 30 % más rápido que Sonnet 5. Un diseñador de Every lo describió así: rápido para programar, se deja corregir el rumbo enseguida cuando iteras, y aun así aguanta trabajar largo si hace falta. Zendesk lo midió en soporte: tickets resueltos 20 % más rápido.
Cómo escribe
Más claro, como Opus 5.5
Igual que Opus 5.5, escribe más claro que la generación anterior. Los primeros en probarlo lo encontraron mejor compañero de colaboración que Sonnet 5 y una conversación más natural.
Menos pasos
Junta acciones y termina con menos
En pruebas cara a cara agrupó más acciones por paso que Sonnet 5, así que termina en menos pasos. Lovable contó un tercio menos de acciones y cerca de la mitad de comandos en la terminal para cerrar la misma tarea. Para ti eso es tiempo y plan.
Menos vueltas
Menos iteraciones y menos búsquedas de más
Base44 armó 118 apps reales: quedaron al nivel de Opus 5 en 3.6 vueltas por app, contra 7.7 de Opus 5, y casi nunca se detuvo a medias a preguntarle algo al usuario. CodeRabbit dice que desapareció la costumbre de Sonnet 5 de buscar en la web de más.
Dos cosas que vas a ver, y dónde se ajustan
- En el chat de claude.ai y las apps puede darte más viñetas que Opus 5.5 cuando la respuesta tiene varias partes.
- En esfuerzo bajo puede reportar algo como terminado sin haberlo probado, y en bajo y medio, en tareas largas, es más probable que se frene a preguntar antes de acabar.
Por qué es más probable que salgan viñetas y cómo pedirle prosa está en el system prompt de Sonnet 5.5.
Las frases que evitan que se frene o que se salte las pruebas, listas para pegar, están en Prompting para Sonnet 5.5.
03 · En tu plan
En Claude Code no viene por defecto: se elige
En Claude Code, el modelo por defecto sigue siendo Opus 5.5 en Pro, Max, Team y Enterprise. Sonnet 5.5 no es el default en ningún plan: si lo quieres, lo eliges tú. El atajo «sonnet» ya apunta a Sonnet 5.5, siempre que tengas la versión 2.1.284 o posterior de Claude Code.
Actualiza Claude Code (en la terminal)
claude updateCámbiate a Sonnet 5.5 (dentro de Claude Code)
/model sonnetEscribir /model sonnet cambia el modelo y lo deja como tu default para las sesiones nuevas. Para volver a Opus 5.5, /model opus.
Enter o s: cuánto dura el cambio
Si escribes solo /model se abre el selector de modelos. Ahí la tecla con la que confirmas decide si el cambio es para hoy o para siempre:
- Enter cambia de modelo y lo guarda como tu default. Las sesiones nuevas arrancan en Sonnet 5.5.
- La tecla s cambia solo para esta sesión y deja tu default como estaba. Sirve para probarlo un rato sin mover nada.
Qué se sabe en cada superficie
Claude Code
- Lo que se sabe hoy
- Disponible desde la versión 2.1.284 con /model sonnet. El default sigue siendo Opus 5.5 en todos los planes de pago. Arranca en esfuerzo medio y puede tener a la vista muchísimo texto a la vez en todos los planes, incluido Pro.
- Lo que no se ha dicho
- Nada importante: es la superficie mejor documentada.
claude.ai y las apps
- Lo que se sabe hoy
- El system prompt de claude.ai y de las apps de iOS y Android ya tiene una versión para Sonnet 5.5, y ahí puedes cambiar de modelo a mitad de una conversación. El anuncio dice que en las apps el esfuerzo arranca en medio.
- Lo que no se ha dicho
- Si es el modelo que sale elegido de entrada, si está en el plan gratis y si cambian los límites de uso.
Cowork
- Lo que se sabe hoy
- Las fuentes oficiales del lanzamiento no nombran a Cowork para Sonnet 5.5.
- Lo que no se ha dicho
- Si aparece en el selector, si es el default y con qué esfuerzo arranca. Revisa el selector de modelo de tu sesión.
| Superficie | Lo que se sabe hoy | Lo que no se ha dicho |
|---|---|---|
| Claude Code | Disponible desde la versión 2.1.284 con /model sonnet. El default sigue siendo Opus 5.5 en todos los planes de pago. Arranca en esfuerzo medio y puede tener a la vista muchísimo texto a la vez en todos los planes, incluido Pro. | Nada importante: es la superficie mejor documentada. |
| claude.ai y las apps | El system prompt de claude.ai y de las apps de iOS y Android ya tiene una versión para Sonnet 5.5, y ahí puedes cambiar de modelo a mitad de una conversación. El anuncio dice que en las apps el esfuerzo arranca en medio. | Si es el modelo que sale elegido de entrada, si está en el plan gratis y si cambian los límites de uso. |
| Cowork | Las fuentes oficiales del lanzamiento no nombran a Cowork para Sonnet 5.5. | Si aparece en el selector, si es el default y con qué esfuerzo arranca. Revisa el selector de modelo de tu sesión. |
Cómo se traduce a tu plan
Contra Sonnet 5: Anthropic dice que necesita muchos menos pasos para el mismo trabajo y que cuesta hasta 30 % menos por tarea. En un plan, la misma tarea se come tu plan más lento.
Contra Opus 5.5, el ahorro se concentra en esfuerzo bajo y medio; cuándo conviene cada uno está en la sección 04.
Lo que nadie ha publicado es cuánto más te rinde el plan en la práctica, ni si con Sonnet 5.5 cambian los límites de uso.
04 · Sonnet u Opus
¿Sonnet 5.5 u Opus 5.5? Depende de la tarea
Anthropic reparte el trabajo así: Opus 5.5 para lo complejo que pide criterio cuidadoso, y Sonnet 5.5 para tareas del día a día bien acotadas, arreglar bugs y armar documentos, presentaciones y hojas pulidos, más el diseño. De ahí sale una regla corta que sirve casi siempre:
Si puedes describir la tarea y cómo se ve terminada en un par de líneas, Sonnet 5.5. Si parte de la tarea es decidir qué hay que hacer, Opus 5.5.
La tabla, por tipo de trabajo
Arreglar un bug concreto
- Usa
- Sonnet 5.5
- De dónde sale
- Es de lo primero que nombra Anthropic. Unity solo cuenta una tarea cuando el cambio funciona al abrir el proyecto, y la mayoría del trabajo de Sonnet 5.5 pasó esa revisión.
Un documento, una presentación o una hoja de cálculo pulidos
- Usa
- Sonnet 5.5
- De dónde sale
- En una prueba interna armó una revisión trimestral de 10 diapositivas con una plantilla; dos expertos dijeron que el primer borrador se podía mandar tal cual.
Pulir una interfaz o una pantalla
- Usa
- Sonnet 5.5
- De dónde sale
- El anuncio le reconoce buen ojo para el diseño, y los probadores dicen que le da acabado a las interfaces.
Iterar rápido en algo chico, con muchas vueltas cortas
- Usa
- Sonnet 5.5
- De dónde sale
- Anthropic dice que su velocidad lo hace buena opción para iterar rápido en tareas menos complejas.
Trabajo largo pero ya definido, como implementar un plan decidido
- Usa
- Sonnet 5.5
- De dónde sale
- Epic Games lo tuvo en tareas de varias horas sobre decenas de miles de líneas, con instrucciones menos detalladas de lo normal.
Mucho trabajo repetido: tickets, extraer datos, revisar documentos
- Usa
- Sonnet 5.5
- De dónde sale
- Balyasny corrió siete modelos en tareas de finanzas de alto volumen y Sonnet 5.5 dio la mejor relación entre calidad y costo.
Una tarea compleja y abierta, sin camino claro
- Usa
- Opus 5.5
- De dónde sale
- Anthropic y sus probadores externos coinciden: Opus 5.5 sigue siendo claramente más fuerte en trabajo complejo y abierto que pide criterio sostenido.
Decidir la arquitectura o el plan de algo grande
- Usa
- Opus 5.5
- De dónde sale
- La documentación de Claude Code reserva a Opus para razonamiento complejo y decisiones de arquitectura, y a Sonnet para ejecutar.
Algo grande que primero hay que planear y luego construir
- Usa
- Los dos: opusplan
- De dónde sale
- Opus planea, Sonnet ejecuta. La receta va justo abajo.
| Tu tarea | Usa | De dónde sale |
|---|---|---|
| Arreglar un bug concreto | Sonnet 5.5 | Es de lo primero que nombra Anthropic. Unity solo cuenta una tarea cuando el cambio funciona al abrir el proyecto, y la mayoría del trabajo de Sonnet 5.5 pasó esa revisión. |
| Un documento, una presentación o una hoja de cálculo pulidos | Sonnet 5.5 | En una prueba interna armó una revisión trimestral de 10 diapositivas con una plantilla; dos expertos dijeron que el primer borrador se podía mandar tal cual. |
| Pulir una interfaz o una pantalla | Sonnet 5.5 | El anuncio le reconoce buen ojo para el diseño, y los probadores dicen que le da acabado a las interfaces. |
| Iterar rápido en algo chico, con muchas vueltas cortas | Sonnet 5.5 | Anthropic dice que su velocidad lo hace buena opción para iterar rápido en tareas menos complejas. |
| Trabajo largo pero ya definido, como implementar un plan decidido | Sonnet 5.5 | Epic Games lo tuvo en tareas de varias horas sobre decenas de miles de líneas, con instrucciones menos detalladas de lo normal. |
| Mucho trabajo repetido: tickets, extraer datos, revisar documentos | Sonnet 5.5 | Balyasny corrió siete modelos en tareas de finanzas de alto volumen y Sonnet 5.5 dio la mejor relación entre calidad y costo. |
| Una tarea compleja y abierta, sin camino claro | Opus 5.5 | Anthropic y sus probadores externos coinciden: Opus 5.5 sigue siendo claramente más fuerte en trabajo complejo y abierto que pide criterio sostenido. |
| Decidir la arquitectura o el plan de algo grande | Opus 5.5 | La documentación de Claude Code reserva a Opus para razonamiento complejo y decisiones de arquitectura, y a Sonnet para ejecutar. |
| Algo grande que primero hay que planear y luego construir | Los dos: opusplan | Opus planea, Sonnet ejecuta. La receta va justo abajo. |
Anthropic no publicó una tabla por tipo de tarea. Esta se arma con lo que el anuncio dice que hace mejor cada modelo y con los casos que cita. Tu trabajo manda: si una tarea «acotada» se le complica a Sonnet, súbela a Opus.
Sonnet no siempre es el que gasta menos
Según el anuncio, Sonnet 5.5 complementa mejor a Opus en esfuerzo bajo y medio, donde gasta menos por tarea. En los niveles altos puede rendir parecido a Opus, pero con un gasto parecido.
Si para que Sonnet te dé lo que quieres tienes que subirlo a extra-alto o máximo, ya no te está ahorrando mucho: prueba la misma tarea con Opus 5.5.
La receta: Opus planea, Sonnet ejecuta
Claude Code tiene un modo que hace el reparto solo. Se llama opusplan: mientras estás en modo plan usa Opus, y cuando apruebas el plan y empieza a ejecutar, cambia a Sonnet. Hoy eso quiere decir que Opus 5.5 decide qué hacer y Sonnet 5.5 lo construye.
Actívalo dentro de Claude Code
/model opusplan- Actívalo con el comando de arriba. Igual que con cualquier modelo, queda como tu default hasta que elijas otro.
- Entra al modo plan y descríbele lo que quieres construir. Esa parte la piensa Opus 5.5.
- Revisa el plan. Cuando lo apruebas, la ejecución corre en Sonnet 5.5, más rápido y gastando menos de tu plan.
- Si a media ejecución algo se complica y hace falta volver a decidir, regresa al modo plan: vuelve a pensar Opus.
«Cuando Claude Opus 5.5 pone la arquitectura y el marco general de un juego, me sentiría seguro dejando que Sonnet 5.5 lo implemente.» — Kevin Ngo, Creator
05 · El esfuerzo
Arranca en medio, y ahí ya rinde
En Claude Code y en las apps de Claude, Sonnet 5.5 arranca en esfuerzo medio. No es un recorte: en varias pruebas del anuncio, en bajo o en medio ya supera el mejor resultado de Sonnet 5, gastando alrededor de una décima parte por tarea. Hay cinco niveles: bajo, medio, alto, extra-alto y máximo.
Dos cosas que cambian de hábito. Primero, los niveles están recalibrados: «alto» en Sonnet 5.5 no piensa lo mismo que «alto» en Sonnet 5, así que no arrastres el nivel que usabas. Segundo, en Claude Code el pensamiento de Sonnet 5.5 no se puede apagar; lo que controlas es cuánto piensa, y eso es el esfuerzo.
Abre el control de esfuerzo en Claude Code
/effort- Con Enter lo guardas como el nivel de ese modelo desde ahora. Claude Code guarda un nivel por modelo.
- Con la tecla s lo aplicas solo a esta sesión.
- Si lo eliges con /effort, el nivel máximo aplica solo a la sesión actual.
Qué nivel para qué
Bajo
- Úsalo para
- Chat rápido y cambios chicos que vas a revisar tú.
Medio
- Úsalo para
- El día a día: código bien definido, documentos, casi todo.
Alto
- Úsalo para
- Lo más difícil o más largo, o un bug donde importan los casos raros.
Extra-alto
- Úsalo para
- Solo donde comprobaste que la calidad sube. Las respuestas se alargan mucho.
Máximo
- Úsalo para
- Lo mismo que extra-alto, solo si mediste que mejora.
| Nivel | Úsalo para |
|---|---|
| Bajo | Chat rápido y cambios chicos que vas a revisar tú. |
| Medio | El día a día: código bien definido, documentos, casi todo. |
| Alto | Lo más difícil o más largo, o un bug donde importan los casos raros. |
| Extra-alto | Solo donde comprobaste que la calidad sube. Las respuestas se alargan mucho. |
| Máximo | Lo mismo que extra-alto, solo si mediste que mejora. |
Las frases de Anthropic para que no se frene en bajo y medio, para que pruebe de verdad sus cambios y para que no dispare revisiones de más en los niveles altos están en Prompting para Sonnet 5.5.
Y cómo se mueve la perilla en cada superficie, paso a paso, tiene su propia guía: los niveles de esfuerzo, explicados.
06 · Dónde brilla
Código del día a día, documentos, diseño y pantallas
En lo que tú haces, son seis tipos de trabajo, cada uno con un caso del lanzamiento que lo respalda.
Código
Entiende rápido un proyecto y arregla lo que le pides
Los probadores notaron lo rápido que entiende un código que no conoce. En la prueba de código en terminal pasó de 10.3 % con Sonnet 5 a 70.6 %. Epic Games lo tuvo en tareas de varias horas sobre decenas de miles de líneas, con respuestas ágiles y sin tener que darle instrucciones tan detalladas.
Trabajo de conocimiento
Revisa los datos contra la fuente
En la prueba de trabajo real de 44 ocupaciones quedó a dos puntos de Opus 5.5 y unos 400 arriba de Sonnet 5. Box dice que vuelve a revisar los datos en los documentos fuente y atrapó errores que Sonnet 5 no vio.
Presentaciones
Decks con tu plantilla que casi no hay que editar
Los probadores dicen que sigue plantillas de diapositivas y arma presentaciones que piden muy poca edición. En la prueba interna le dieron los materiales trimestrales de una empresa pública, las transcripciones de su llamada y una plantilla: el primer borrador de 10 diapositivas salió listo para mandar, según dos expertos.
Diseño
Le da acabado a las interfaces
El anuncio le reconoce buen ojo para el diseño, y los probadores notaron que pule las interfaces de usuario.
Gráficas y pantallas
Lee gráficas y usa la computadora casi como Opus
Leyendo gráficas sin herramientas pasó de 15.6 % con Sonnet 5 a 61.6 %, cerca del 64.4 % de Opus 5.5. En uso de computadora sacó 80.1 %, contra 81.8 % de Opus 5.5.
Largo aliento
El primer Sonnet que termina Pokémon Red
Es el primer Sonnet que le gana a Pokémon Red trabajando solo con capturas de pantalla. Suena a juego, pero mide dos cosas que te sirven: aguantar una tarea muy larga sin perder el hilo y entender lo que ve en una imagen.
Lo que dicen otros que lo probaron
- Slack: sin cambiar ninguno de sus prompts, le fue mejor que a Sonnet 5 en casi todas sus pruebas internas, en menos pasos.
- CodeRabbit: va a mover ya sus revisiones de código simples y moderadas a Sonnet 5.5, y más en las próximas semanas.
- Unity: solo cuenta una tarea si el cambio funciona de verdad al abrir el proyecto. La mayoría del trabajo de Sonnet 5.5 pasó esa revisión.
- Zendesk: con cientos de casos reales de soporte tomó menos decisiones equivocadas y resolvió los tickets 20 % más rápido.
07 · Los números
Ocho pruebas, con su letra chica
Esta es la tabla del anuncio, sin redondear. Léela con la advertencia del propio Anthropic: un benchmark mide solo una faceta de un modelo, y en sus pruebas y en las de probadores externos Opus 5.5 sigue siendo claramente más fuerte en trabajo complejo y abierto. Que Sonnet quede pegado en una fila no lo vuelve igual de bueno que Opus.
Terminal-Bench 4.0
- Qué mide
- Código con agentes, en terminal
- Sonnet 5.5
- 70.6 %
- Sonnet 5
- 10.3 %
- Opus 5.5
- 66.4 %
- GPT-6 Sol
- —
FrontierCode 1.1
- Qué mide
- Si su código se aceptaría sin retoques
- Sonnet 5.5
- 46.2 % (máximo) · 52.1 % (extra-alto)
- Sonnet 5
- 42.4 %
- Opus 5.5
- 54.4 %
- GPT-6 Sol
- 49.3 %
CursorBench 4.0
- Qué mide
- Código en sesiones reales de Cursor
- Sonnet 5.5
- 55.5 %
- Sonnet 5
- 34.1 %
- Opus 5.5
- 57.8 %
- GPT-6 Sol
- —
GDPval-AA v2.1
- Qué mide
- Trabajo real de 44 ocupaciones (Elo)
- Sonnet 5.5
- 1844
- Sonnet 5
- 1449
- Opus 5.5
- 1846
- GPT-6 Sol
- 1487
AA-Briefcase v1.1
- Qué mide
- Trabajo de conocimiento largo (Elo)
- Sonnet 5.5
- 1811
- Sonnet 5
- 1359
- Opus 5.5
- 1822
- GPT-6 Sol
- 1483
Humanity's Last Exam
- Qué mide
- Razonamiento, con herramientas
- Sonnet 5.5
- 64.5 %
- Sonnet 5
- 54.9 %
- Opus 5.5
- 67.7 %
- GPT-6 Sol
- —
OSWorld 2.1
- Qué mide
- Uso de computadora (parcial)
- Sonnet 5.5
- 80.1 %
- Sonnet 5
- 57.0 %
- Opus 5.5
- 81.8 %
- GPT-6 Sol
- —
Chartography
- Qué mide
- Lectura de gráficas, sin herramientas
- Sonnet 5.5
- 61.6 %
- Sonnet 5
- 15.6 %
- Opus 5.5
- 64.4 %
- GPT-6 Sol
- 53.6 %
| Prueba | Qué mide | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | Código con agentes, en terminal | 70.6 % | 10.3 % | 66.4 % | — |
| FrontierCode 1.1 | Si su código se aceptaría sin retoques | 46.2 % (máximo) · 52.1 % (extra-alto) | 42.4 % | 54.4 % | 49.3 % |
| CursorBench 4.0 | Código en sesiones reales de Cursor | 55.5 % | 34.1 % | 57.8 % | — |
| GDPval-AA v2.1 | Trabajo real de 44 ocupaciones (Elo) | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1 | Trabajo de conocimiento largo (Elo) | 1811 | 1359 | 1822 | 1483 |
| Humanity's Last Exam | Razonamiento, con herramientas | 64.5 % | 54.9 % | 67.7 % | — |
| OSWorld 2.1 | Uso de computadora (parcial) | 80.1 % | 57.0 % | 81.8 % | — |
| Chartography | Lectura de gráficas, sin herramientas | 61.6 % | 15.6 % | 64.4 % | 53.6 % |
Un guion quiere decir que el anuncio no trae cifra para ese modelo en esa prueba. GDPval-AA y AA-Briefcase dan un puntaje tipo ajedrez (Elo), no un porcentaje.
La fila donde Sonnet le gana a Opus, y por qué no es tan simple
En Terminal-Bench 4.0 Sonnet 5.5 saca 70.6 % y Opus 5.5 66.4 %. Ojo: la cifra de Opus es en extra-alto, que es su mejor resultado en esa prueba.
En todas las demás filas Opus 5.5 queda arriba, aunque en varias por muy poco: dos puntos en la prueba de 44 ocupaciones, menos de dos en uso de computadora.
Cómo leer la tabla
- Las publicó Anthropic el día del lanzamiento. Algunas las corrieron terceros (Artificial Analysis en las de trabajo de conocimiento), pero todas sobre versiones previas o en sus propias condiciones de prueba.
- FrontierCode castiga los cambios fuera de lo pedido. En máximo, Sonnet 5.5 corrió más seguido la revisión de código de Claude Code, que reparte el trabajo entre muchos subagentes revisores (copias de Claude que lanza para revisar lo que hizo); en dos casos eso terminó en un tiempo agotado o en ediciones de más. Por eso saca menos en máximo (46.2 %) que en extra-alto (52.1 %).
- En Terminal-Bench y CursorBench no hay cifra de GPT-6 Sol porque no se reportó. En las gráficas de costo del anuncio, OpenAI aparece ahí con GPT-5.6 Sol.
- OpenAI arregló hace poco un error que afectaba cómo GPT-6 Sol entiende imágenes, y algunas cifras externas de GPT-6 Sol podrían no estar actualizadas.
- Artificial Analysis corrió GDPval-AA y AA-Briefcase sobre una versión previa de Sonnet 5.5 que tenía un error, ya arreglado. Anthropic cree que el efecto, si lo hubo, es chico y en contra de Sonnet.
Lo que pasa en bajo y medio, los niveles que vas a usar
La tabla muestra el mejor resultado de cada modelo, pero lo interesante está abajo:
- En Terminal-Bench 4.0, en medio (el nivel con el que arranca en las apps) supera por mucho el mejor resultado de Sonnet 5, gastando menos de una décima parte por tarea.
- En CursorBench 4.0, incluso en bajo supera el mejor resultado de Sonnet 5.
- En AA-Briefcase, en medio supera el mejor resultado de Sonnet 5 gastando cerca de una novena parte.
08 · Seguridad
Por qué a veces cae a Sonnet 5
Estos son los resultados de seguridad que publicó Anthropic, y después lo que cambian en tu trabajo diario.
Comportamiento
Mejora o iguala a Sonnet 5
En una auditoría automática de unos 1,850 escenarios mejora o iguala a Sonnet 5 en la mayoría de las medidas de alineación, resistencia al mal uso y honestidad. Opus 5.5 sigue un poco mejor en el total, y no encontraron señales de que Sonnet 5.5 persiga metas contrarias a las tuyas.
Contención
El que menos tantea los límites
En las pruebas que miden si un modelo intenta salirse del entorno donde lo encierran, queda cerca de Opus 5.5, el mejor de todos. Y es el modelo de Anthropic que menos intenta tantear los límites de su contenedor.
Ciberseguridad
El primer Sonnet con salvaguardas de ciber
Sus capacidades de ciberseguridad son comparables a las de Opus 5, así que sale con salvaguardas parecidas a las de Opus 5.5. Apuntan a un grupo chico de pedidos de alto riesgo; el desarrollo de software normal no se afecta.
Destilación
No deja extraer su razonamiento
Es el primer Sonnet con filtros que impiden sacarle su razonamiento interno a escala para entrenar otro modelo. Además, su pensamiento queda atado a la cuenta que lo generó.
Qué pasa si tu tarea toca ciberseguridad o biología
Las tareas de ciberseguridad de mayor riesgo caen a Sonnet 5 de forma visible. En Claude Code, cuando un filtro automático marca un mensaje como ciberseguridad, lo vuelve a correr en Sonnet 5 y te deja un aviso en la conversación. No es una marca en tu cuenta.
- Después del cambio, la sesión sigue en Sonnet 5. Para volver a Sonnet 5.5, escribe /model y elígelo.
- Puede pasar desde el primer mensaje, porque ese primer envío lleva el contexto de tu proyecto (tu CLAUDE.md, el estado de tus archivos), y eso también pasa por el filtro.
- Si prefieres decidir tú cada vez, abre /config y apaga «Switch models when a message is flagged». Cuando algo se marque, te dará dos opciones: pasar al modelo de respaldo o editar el mensaje y reintentar.
- Biología es distinto: Sonnet 5.5 no tiene modelo de respaldo para eso. Un mensaje que se marque como biología termina en negativa desde la primera vez.
Con Opus 5.5 el desvío es otro: biología se va a Opus 5 y ciberseguridad a Opus 4.8. Está explicado en la sección de seguridad de la guía de Opus 5.5.
Lo que sigue funcionando igual
- Encontrar y arreglar bugs en tu propio código es parte normal del desarrollo y sigue igual.
- En biología, las salvaguardas son las mismas que tenía Sonnet 5. La mayoría de la investigación, la educación y el trabajo clínico no se afecta, aunque algunas preguntas de microbiología y virología pueden marcarse por error.
- Para quienes hacen trabajo legítimo en esas áreas hay programas de verificación: uno de ciencias de la vida para organizaciones, y uno ampliado para defensores de ciberseguridad que Anthropic dice que llega «pronto».
Si cambias de cuenta a media sesión
El pensamiento de Sonnet 5.5 queda atado a la cuenta que lo generó. Anthropic dice que la mayoría no lo va a notar; la excepción es mover conversaciones entre cuentas, incluido cambiar de cuenta a media sesión en Claude Code: para ese caso publicó un artículo en su documentación que explica qué cambia. Si trabajas con dos cuentas, léelo antes.
Hay una negativa que sí puede tocarte: si tu prompt le pide que escriba su razonamiento interno dentro de la respuesta, puede negarse. Qué pedirle en su lugar, y las otras categorías que pueden terminar en negativa, está en Prompting para Sonnet 5.5.
09 · Para estrenarlo
Nueve prompts, uno por tarea
Cada prompt es una tarea del tipo en que Sonnet 5.5 es fuerte, para que veas la diferencia de velocidad con tus propias cosas. Cambia lo que está entre corchetes y pega el resto tal cual. Ninguno le pide que escriba su razonamiento: lo que le pides es el resultado, la evidencia y lo que no pudo comprobar.
Arreglar un bug concreto
En Claude Code, dentro de la carpeta del proyecto y con /model sonnet. Si es un bug con casos raros, sube el esfuerzo a alto.
Tengo este problema: [DESCRIBE QUÉ PASA, por ejemplo: al guardar el formulario de contacto la página se queda en blanco]. Pasa cuando [LOS PASOS PARA QUE OCURRA]. Debería pasar esto otro: [LO QUE ESPERABAS]. 1. Encuentra la causa antes de tocar nada y dímela en dos líneas. 2. Arréglala con el cambio más chico que resuelva el problema. 3. Comprueba que el arreglo funciona corriendo lo que haga falta. Si no puedes comprobarlo, dime por qué. 4. No cambies nada que no tenga que ver con este problema. Al final: qué causaba el error, qué cambiaste y cómo lo compruebo yo.
De notas sueltas a un documento pulido
En claude.ai, o en Cowork si tu sesión te deja elegir Sonnet 5.5. Pega tus notas debajo del prompt o adjúntalas como archivo.
Te paso mis notas sueltas sobre [TEMA]. Conviértelas en [UN DOCUMENTO / UN MEMO / UNA PROPUESTA] de [EXTENSIÓN] para [QUIÉN LO VA A LEER]. - Lo más importante va en el primer párrafo. - Usa títulos solo si el documento pasa de una página. - Respeta mis cifras y mis nombres tal cual. Si falta un dato, márcalo como [PENDIENTE] en vez de inventarlo. - Tono: [POR EJEMPLO: directo y cálido, sin jerga]. Al final, una lista corta de lo que tuve que suponer.
Una presentación con tu plantilla
En claude.ai con la creación de archivos activada, o en Cowork si tu sesión te deja elegir Sonnet 5.5. Es el tipo de tarea de la prueba interna de 10 diapositivas.
Te adjunto mi plantilla de presentación y [LOS MATERIALES: un reporte, notas de una reunión, cifras del trimestre]. Arma una presentación de [NÚMERO] diapositivas para [QUIÉN LA VA A VER] sobre [TEMA]. - Usa la plantilla tal cual: sus colores, tipografías y acomodos. - Una idea por diapositiva, con un título que diga la conclusión, no el tema. - Cada cifra sale de los materiales. Si una no está, no la pongas. - Pon tus notas de orador debajo de cada diapositiva. Al terminar, dime qué diapositiva te costó más y por qué.
Ordenar y resumir una hoja de cálculo
En claude.ai con la creación de archivos activada, o en Cowork si tu sesión te deja elegir Sonnet 5.5, con la hoja adjunta.
Te adjunto [LA HOJA DE CÁLCULO / EL CSV] con [QUÉ DATOS: ventas por mes, gastos del equipo, inventario]. 1. Revísala primero: dime si hay filas duplicadas, celdas vacías o cifras que no cuadran. 2. Arma una hoja nueva con [LO QUE NECESITAS: un resumen por mes, una tabla dinámica, un presupuesto contra lo real]. 3. Deja las fórmulas visibles, no solo los resultados. 4. Agrega una gráfica que muestre [LA COMPARACIÓN QUE TE IMPORTA]. Explícame en tres líneas qué encontraste en los datos.
Pulir una pantalla que se ve improvisada
En claude.ai (Artifacts) con la captura adjunta, o en Claude Code dentro del proyecto. Aprovecha el ojo para el diseño que le reconoce el anuncio.
Te paso una captura de [UNA PANTALLA DE MI APP / MI PÁGINA]. Funciona, pero se ve improvisada. Rediséñala para que se vea profesional y pulida, sin cambiar lo que hace. - Mejora jerarquía, espacios, alineación y contraste. - Que se lea bien en un celular de 375 px de ancho. - Nada de degradados morados ni botones con forma de píldora. - Mantén mis textos; si alguno se puede decir más corto, propónmelo aparte. Entrégala como [UN ARTIFACT EN HTML / CAMBIOS EN MI PROYECTO] y dime las tres decisiones de diseño que más pesaron.
Opus planea, Sonnet construye
En Claude Code, después de /model opusplan y en modo plan. El plan lo piensa Opus 5.5; cuando lo apruebas, lo construye Sonnet 5.5.
Quiero construir [QUÉ: por ejemplo, una sección de reservas para mi página con calendario y correo de confirmación]. Antes de escribir código, arma un plan: 1. Qué partes tiene y en qué orden conviene hacerlas. 2. Qué decisiones hay que tomar y cuál recomiendas en cada una. 3. Qué riesgos ves y cómo sabremos que cada parte funciona. Espera a que apruebe el plan. Cuando lo apruebe, constrúyelo parte por parte y comprueba cada una antes de seguir.
Revisar cada dato contra sus fuentes
En claude.ai, o en Cowork si tu sesión te deja elegir Sonnet 5.5, con el texto y sus documentos fuente adjuntos. Es lo que Box destacó: vuelve a revisar los datos en la fuente.
Te paso [EL REPORTE / LA PRESENTACIÓN / EL CORREO] que voy a mandar, y los documentos de donde salieron los datos. Revisa cada cifra, fecha y nombre del texto contra los documentos fuente: - Si coincide, no me digas nada. - Si no coincide, dame la cifra del texto, la de la fuente y dónde está cada una. - Si algo del texto no aparece en ninguna fuente, márcalo como «sin respaldo». No corrijas el estilo: solo los datos.
Iterar rápido en algo chico
En claude.ai, con esfuerzo bajo o medio. Aquí se nota la velocidad: muchas vueltas cortas en pocos minutos.
Necesito [UN NOMBRE PARA MI NEGOCIO / UN TITULAR / EL TEXTO DE UN BOTÓN] para [CONTEXTO]. Dame cinco opciones muy distintas entre sí, cada una con una línea de por qué funciona. Yo te voy a decir cuál me gusta y qué le cambiaría. Con eso, dame otras cinco que vayan en esa dirección. Respuestas cortas: nada de introducciones ni despedidas.
Clasificar un montón de mensajes
En claude.ai, o en Cowork si tu sesión te deja elegir Sonnet 5.5. Trabajo repetido de volumen, donde Sonnet 5.5 rinde y se come tu plan más lento.
Te pego [NÚMERO] [CORREOS / MENSAJES DE CLIENTES / TICKETS] abajo, separados por «---». Para cada uno dame una fila de tabla con: - De quién es y de qué trata, en una línea. - Categoría: [TUS CATEGORÍAS, por ejemplo: queja, pregunta, pedido, otro]. - Urgencia: alta, media o baja, y por qué en tres palabras. - Siguiente paso sugerido. Si alguno no encaja en ninguna categoría, márcalo como «revisar yo». [PEGA AQUÍ LOS MENSAJES]
¿Se frena a preguntar, se salta las pruebas o te arma una presentación cuando solo querías ideas? Las frases exactas de Anthropic para cada caso, con dónde pegarlas, están en Prompting para Sonnet 5.5.
Y para diseño sin el look genérico de IA, sigue con el kit de diseño con Claude.
10 · La familia y lo que sigue
Dónde queda Sonnet 5.5, y qué leer después
Los modelos públicos más recientes, según el propio system prompt de Sonnet 5.5, son cuatro. Así se reparten el trabajo hoy.
Fable 5.1
- Para qué
- Lo más capaz de Claude Code, para tareas que no caben en una sentada, sesiones autónomas largas y problemas ambiguos.
- Cómo lo eliges en Claude Code
- /model fable. Según tu plan, su uso puede cobrarse con créditos aparte; el selector lo avisa con «Requires usage credits».
Opus 5.5
- Para qué
- Lo complejo y abierto, las decisiones de arquitectura y el trabajo que pide criterio sostenido.
- Cómo lo eliges en Claude Code
- Viene por defecto en Pro, Max, Team y Enterprise. Si cambiaste, /model opus.
Sonnet 5.5
- Para qué
- Lo bien acotado: bugs, documentos, presentaciones, hojas de cálculo, diseño e iterar rápido.
- Cómo lo eliges en Claude Code
- /model sonnet (versión 2.1.284 o posterior), o /model opusplan para combinarlo con Opus.
Haiku 4.5
- Para qué
- El más chico de la lista vigente, mientras llega Haiku 5.5.
- Cómo lo eliges en Claude Code
- /model haiku.
| Modelo | Para qué | Cómo lo eliges en Claude Code |
|---|---|---|
| Fable 5.1 | Lo más capaz de Claude Code, para tareas que no caben en una sentada, sesiones autónomas largas y problemas ambiguos. | /model fable. Según tu plan, su uso puede cobrarse con créditos aparte; el selector lo avisa con «Requires usage credits». |
| Opus 5.5 | Lo complejo y abierto, las decisiones de arquitectura y el trabajo que pide criterio sostenido. | Viene por defecto en Pro, Max, Team y Enterprise. Si cambiaste, /model opus. |
| Sonnet 5.5 | Lo bien acotado: bugs, documentos, presentaciones, hojas de cálculo, diseño e iterar rápido. | /model sonnet (versión 2.1.284 o posterior), o /model opusplan para combinarlo con Opus. |
| Haiku 4.5 | El más chico de la lista vigente, mientras llega Haiku 5.5. | /model haiku. |
Lo demás que conviene saber
- Haiku 5.5, pensado para mucho volumen y bajo costo, se suma a la familia «en las próximas semanas». No hay fecha.
- Por encima de Opus está el nivel Mythos. Fable 5.1 comparte modelo base con Mythos 5.1, con salvaguardas extra, y es el que puedes elegir en Claude Code.
- Sonnet 5 sigue existiendo: es a donde Claude Code manda lo que se marca como ciberseguridad (sección 08).
Si todavía trabajas con Sonnet 5, o quieres ver de dónde viene este modelo, la guía de la generación anterior es la guía de Sonnet 5.
Ya sabes qué es. Ahora, cómo hablarle
Esta guía es la puerta de entrada. Con Sonnet 5.5 salieron dos documentos oficiales que cambian cómo le escribes, y cada uno tiene su propia guía en la bóveda. Léelas en este orden.
Prompting para Sonnet 5.5
La guía oficial de Anthropic para escribirle a este modelo, pasada a claude.ai, Claude Code y Cowork. Es donde está lo que cambia con cada nivel de esfuerzo y las frases que lo corrigen.
- La frase que evita que se frene a preguntar en tareas largas.
- Cómo pedirle que pruebe de verdad un cambio antes de darlo por terminado.
- Qué hacer cuando mete pruebas y archivos que no pediste.
- Las frases originales para copiar, con dónde se pega cada una.
El system prompt de Sonnet 5.5
Lo que Anthropic le dice a Claude en cada chat de claude.ai y las apps, antes de que tú escribas nada. Explica por qué contesta como contesta, y en qué se aparta del de Opus 5.5.
- El texto completo en inglés, para descargar o copiar.
- Por qué es más probable que te dé viñetas que Opus 5.5, y cómo pedirle prosa.
- Qué trae el de Opus 5.5 que el de Sonnet 5.5 no.
- Cómo usar su misma estructura para tus instrucciones de Proyecto.
El mismo trío, para Opus 5.5
11 · Lo honesto
Lo que todavía no se sabe
Todo lo de esta página viene de Anthropic y salió el mismo día del lanzamiento. Vale la pena tener presente lo que falta antes de mover todo tu trabajo a un modelo nuevo.
- Los números los publicó Anthropic el día del lanzamiento; algunos los corrieron terceros, pero sobre versiones previas. Y Anthropic mismo advierte que un benchmark mide solo una faceta.
- Fuera de Claude Code no hay dato público de cuál es el modelo que sale elegido de entrada, ni de si Sonnet 5.5 está en el plan gratis.
- No se sabe cuánto más te rinde el plan en la práctica. Que cueste menos por tarea no se traduce en un porcentaje de uso publicado, y nadie ha dicho si cambian los límites.
- Para Cowork, las fuentes oficiales del lanzamiento no dicen nada específico de Sonnet 5.5.
- Anthropic reconoce que ninguna batería de pruebas atrapa todas las fallas y que Sonnet 5.5 puede tener tendencias que no encontraron. Por eso combina su trabajo de alineación con salvaguardas.
- La tabla de la sección 04 no es oficial: se arma con el posicionamiento del anuncio y sus casos. Tu propio trabajo es la mejor prueba.
Preguntas frecuentes
›¿Sonnet 5.5 reemplaza a Opus 5.5?
No. Anthropic lo presenta como su complemento: más rápido y de menor costo para tareas bien acotadas, bugs, documentos, presentaciones, hojas y diseño. Para trabajo complejo y abierto que pide criterio sostenido, Opus 5.5 sigue siendo claramente más fuerte.
›¿Está en el plan gratis?
No se sabe. Ninguna fuente oficial del lanzamiento lo dice. Lo confirmado es que en Claude Code se puede elegir con /model sonnet, y que ahí el modelo por defecto sigue siendo Opus 5.5 en Pro, Max, Team y Enterprise.
›¿Por qué Claude Code sigue arrancando en Opus 5.5?
La documentación no da la razón; solo dice que el modelo por defecto es Opus 5.5 en todos los planes de pago. Si la mayor parte de tu trabajo es acotado, cámbiate con /model sonnet, o usa /model opusplan para que Opus planee y Sonnet ejecute.
›¿Qué pasa con Sonnet 5?
Sigue existiendo. En Claude Code es a donde se manda lo que se marca como ciberseguridad cuando usas Sonnet 5.5. Si todavía trabajas con él, la guía de Sonnet 5 de la bóveda es la de la generación anterior.
›¿Cuándo sale Haiku 5.5?
«En las próximas semanas», según el anuncio. No hay fecha.
›¿Tengo que reescribir mis prompts de Sonnet 5?
No hace falta para empezar: Slack lo probó sin cambiar ninguno de sus prompts y le fue mejor que a Sonnet 5 en casi todo. Lo que sí conviene revisar es el nivel de esfuerzo, porque están recalibrados, y algunas frases que ahora estorban. Eso está en Prompting para Sonnet 5.5.
›¿Puedo apagar el pensamiento para que conteste más rápido?
En Claude Code, no: con Sonnet 5.5 el pensamiento no se apaga. Si quieres respuestas más rápidas, baja el esfuerzo con /effort. Pedírselo en el prompt no lo reduce de forma confiable.
›Mi Claude Code no muestra Sonnet 5.5. ¿Qué hago?
Necesitas la versión 2.1.284 o posterior. Corre claude update en la terminal, vuelve a abrir Claude Code y elige el modelo con /model sonnet.
›¿Hasta cuándo sabe cosas?
Su conocimiento confiable llega hasta junio de 2026. Para cualquier cosa más reciente, activa la búsqueda web en claude.ai.
Guía de la bóveda
Esta guía es una de las gratuitas de la bóveda.
Si te llevas una sola cosa
Sonnet 5.5 es el modelo para lo que ya está definido. Si puedes decir en dos líneas qué quieres y cómo se ve terminado, dáselo a Sonnet en esfuerzo medio y vas a ver la diferencia de velocidad. Si la tarea es decidir qué hacer, deja a Opus. Y cuando son las dos cosas, /model opusplan hace el reparto por ti.
Dónde sigue cada tema
Los niveles de esfuerzo, explicados
Aquí va lo propio de Sonnet 5.5. Allá está cómo se mueve la perilla en cada superficie, paso a paso.
El kit de diseño con Claude
Si vas a aprovechar su ojo para el diseño, empieza aquí: cómo pedir interfaces que no se vean hechas por IA.
La guía de Sonnet 5
La de la generación anterior: si todavía trabajas con Sonnet 5 o quieres ver de dónde viene este modelo.
Lo nuevo sale primero en Instagram
Ahí aviso cuando entra una guía nueva a la bóveda y cuando algo de esto cambia.
@soyenriquerocha
Cuándo se verificó esto
Cada dato de esta página se contrastó el 28 de septiembre de 2026, el día del lanzamiento, contra el anuncio oficial de Anthropic, su guía de prompting para Sonnet 5.5, el system prompt publicado y la documentación de modelos de Claude Code. Un modelo recién salido cambia rápido: defaults, versiones y disponibilidad se mueven. Si algo no cuadra con lo que ves en tu cuenta, lo que manda es tu cuenta.