Anthropic ha lanzado Claude Sonnet 5.5, una versión más económica y rápida de su modelo de lenguaje grande, y la compañía está haciendo una audaz afirmación: Sonnet 5.5 es el primer modelo Sonnet en derrotar a Pokémon Red utilizando solo capturas de pantalla. El anuncio ha llamado la atención en línea, donde la gente está sopesando si el rendimiento del modelo justifica el costo.
Sonnet 5.5 Comparado con Sonnet 5
Opus 5.5 se posiciona como la opción premium, mientras que Sonnet 5.5 se ofrece como una opción más económica y rápida en comparación con ella. Opus 5.5 está diseñado para manejar proyectos exigentes que requieren una deliberación cuidadosa, mientras que Sonnet 5.5 se destaca en trabajos rutinarios, corrección de errores y la producción de documentos, presentaciones y hojas de cálculo pulidas. La habilidad destacada del nuevo modelo reside en su agudo ojo para el diseño.
Sonnet 5.5 mantiene el mismo precio que Sonnet 5, con $2 por millón de tokens de entrada, $10 por millón de tokens de salida y $0.20 por millón de tokens para lecturas de caché. El modelo generalmente requiere muchos menos tokens para ofrecer los mismos resultados, según Anthropic, que dice que una tarea puede costar hasta un 30% menos que su predecesor.
Métricas de rendimiento
En Terminal-Bench 4.0, una evaluación de codificación agentiva, Sonnet 5.5 obtiene 70.6%, en comparación con el 10.3% de Sonnet 5. En GDPval-AA, una prueba de trabajo en el mundo real en 44 ocupaciones y nueve industrias importantes, Sonnet 5.5 obtiene casi el mismo puntaje que Opus 5.5 y unos 400 puntos por encima de Sonnet 5.
En FrontierCode, un punto de referencia para la generación de código, Sonnet 5.5 a Alto esfuerzo cuesta aproximadamente una quinceava parte del costo por tarea, mientras que aún obtiene 10 puntos más que Sonnet 5 en la misma configuración. En CursorBench, donde los modelos se prueban en tareas de codificación reales de sesiones reales de Cursor, Sonnet 5.5 se acerca a Opus 5.5, estando a unos dos puntos de su mejor puntaje.
Seguridad y Alineación
Las capacidades de ciberseguridad de Sonnet 5.5 son comparables a las de Opus 5, por lo que se lanza con salvaguardias y fallbacks cibernéticos como los que Anthropic ha desarrollado para sus modelos más capaces. Sus salvaguardias de biología siguen siendo las mismas que las de Sonnet 5.
Según la empresa, Sonnet 5.5 marca el primer modelo Sonnet en incluir estas protecciones. Las dos salvaguardias se aplican únicamente a un conjunto limitado de solicitudes de alto riesgo; el desarrollo de software de rutina y la mayoría del trabajo en ciencias de la vida permanecen sin cambios.
Sonnet 5.5 es el primer modelo Sonnet en derrotar a Pokémon Red utilizando solo capturas de pantalla.
Lo que observaron los testers iniciales
Según las pruebas propias de Anthropic, Sonnet 5.5 se ejecuta a un menor costo que Sonnet 5. Los usuarios iniciales observaron que Sonnet 5.5 comprende rápidamente una base de código y agrupa las llamadas a herramientas con mayor frecuencia que Sonnet 5, lo que reduce el número de pasos y disminuye los gastos.
El equipo informó que se sentía como un compañero de conversación más natural, y notaron su habilidad en el diseño, diciendo que añade pulido a las interfaces de usuario y sigue las plantillas de diapositivas para producir presentaciones que necesitan poca edición después. Durante una prueba interna, la empresa le proporcionó los materiales y transcripciones de las ganancias trimestrales de una empresa pública junto con una plantilla de diapositivas, y luego solicitó una revisión operativa de 10 diapositivas. Dos expertos juzgaron que su borrador inicial estaba listo para enviar tal como está.
La aseveración sobre Pokémon Red
Lo que distingue este anuncio es que asocia una cifra concreta a cómo Opus 5.5 se compara con Sonnet 5.5. La afirmación sobre Pokémon Red se presenta como una declaración audaz, incluso si no ha sido confirmada de forma independiente.
La empresa admite sus propias limitaciones. Afirma claramente que Opus 5.5 todavía se desempeña mejor en tareas que exigen juicio sostenido y trabajo abierto.
Los números
- Terminal-Bench: Sonnet 5.5 obtiene una puntuación del 70.6%, en comparación con el 10.3% de Sonnet 5.
- GDPval-AA: Sonnet 5.5 casi al mismo nivel que Opus 5.5, unos 400 puntos por encima de Sonnet 5.
- FrontierCode: +10 puntos comparado con Sonnet 5 en esfuerzos altos, a aproximadamente una quinceava parte del costo por tarea.
- Precios: $2 por millón de tokens de entrada, $10 por millón de tokens de salida, $0.20 por millón de tokens para lecturas de caché.
El Intercambio
El compromiso es simple: Sonnet 5.5 cuesta menos por tarea porque requiere menos tokens para completar el mismo trabajo. También produce resultados más rápidamente que Sonnet 5, una aseveración hecha por Anthropic que lo posiciona como el modelo Sonnet más rápido hasta la fecha.
A niveles de esfuerzo más bajos, Sonnet 5.5 cuesta menos por tarea y tiene un rendimiento comparable a Opus 5.5. A niveles más altos, puede tener un rendimiento comparable a un costo similar.
La Conclusión
Los números propios de Anthropic muestran que Sonnet 5.5 mejora a Sonnet 5. Se ejecuta más rápido, cuesta menos y maneja mejor el trabajo de diseño.
Queda por verse si la victoria de la captura de pantalla de Pokémon Red se mantiene. El modelo sí ofrece una vía más económica para tareas ordinarias, aunque tampoco abandona por completo la calidad.
Las notas en sí mismas sirven como un recordatorio de cuán lejos ha avanzado el campo. La aseveración de que un modelo puede vencer a Pokémon Red a partir de capturas de pantalla se presenta como una declaración particular y audaz.
Material fuente: “Claude Sonnet 5.5”, Anthropic.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

