Anthropic tiene un nuevo modelo en el mercado, y viene con una puntuación que suena impresionante, un precio que suena elevado y un nombre que pide ser leído dos veces. Claude Opus 5.5 (Razonamiento Adaptativo, Máximo Esfuerzo, Recuperación Predeterminada) es lo último en la línea de modelos de razonamiento de Anthropic, lanzado el 22 de septiembre de 2026, y ahora tiene su primera evaluación adecuada. El veredicto es simple: es inteligente, es locuaz y cuesta más que la mayoría de sus rivales.
El modelo tiene una puntuación de 58 en el Índice de Inteligencia de Análisis Artificial, lo que lo sitúa muy por encima del promedio entre modelos comparables, donde la mediana se sitúa en 25. Generó 260 millones de tokens durante la evaluación, lo cual es mucho más locuaz que la mediana de 88 millones. Cuesta $4 por 1 millón de tokens de entrada y $20 por 1 millón de tokens de salida, lo que lo sitúa muy por encima de la mediana de $2 para entrada y $10 para salida.
El Índice de Inteligencia Detrás de la Puntuación
El Índice de Inteligencia de Análisis Artificial es el punto de referencia aquí, y viene con su propio problema de título. «Índice de Inteligencia de Análisis Artificial» es un tautología envuelta en un nombre de doble cañón, que es ya sea un golpe de genio de marca o un tropiezo del lenguaje. De cualquier manera, el número importa más que la etiqueta. La puntuación de 58 del modelo lo sitúa muy por encima de una mediana de 25, lo cual es un margen real sobre sus compañeros.
El índice no dice cómo mide la inteligencia. Esa es una brecha real en la información, y es una que vale la pena tener en cuenta en lugar de cerrarla con una suposición. Lo que el índice sí mide, según el informe de artificialanalysis.ai, es el rendimiento en capacidades e industrias específicas. Los componentes de la prueba son:
- Trabajo de agente con conocimiento
- Tareas de trabajo del mundo real para agentes
- Flujos de trabajo de SaaS para agentes
- Codificación y uso de terminal para agentes
- Razonamiento de documentos profesionales
- Razonamiento físico
- Análisis cuantitativo en hojas de cálculo y documentos
- Análisis de la causa raíz del incidente de Kubernetes )
- Razonamiento médico de contexto largo )
Esa es una amplia gama de habilidades. )
El modelo también tiene una puntuación en AA-Briefcase v1.1, que el informe describe como un «AA-Briefcase Elo», aunque no explica lo que eso significa en términos de cómo se desempeñó allí. AA-Omniscience y AA-Omniscience Index también forman parte del conjunto de comparación, y el informe no dice qué prueban más allá de nombrarlos. )
Precio y Uso de Tokens )
El precio de Claude Opus 5.5 es el dato que hará reflexionar a cualquiera que quiera ejecutarlo. A $4 por 1 millón de tokens de entrada y $20 por 1 millón de tokens de salida, está muy por encima de la mediana de $2 y $10. Para una tasa combinada de 7:2:1 de aciertos en caché/entrada/salida, el precio efectivo equivale a $2.94 por 1 millón de tokens. El informe señala que los precios pueden variar según el proveedor, lo que significa que el costo real podría cambiar dependiendo de dónde esté comprando acceso un usuario. )
Los números de tokens merecen ser tenidos en cuenta. El modelo obtuvo una puntuación de 58 en el Índice de Inteligencia y generó 260 millones de tokens de salida, lo que está en el extremo superior de lo que producen otros modelos de razonamiento de su nivel de precios. La mediana fue de 88 millones. Ese nivel de salida no es derrochador en abstracto: podría ser una señal de exhaustividad. Pero es un golpe considerable para la billetera, ya que los tokens de salida cuestan $20 por millón. )
La ventana de contexto es de 1 millón de tokens, lo que determina cuántos texto e historial de conversación puede procesar el modelo en una sola solicitud. Esa ventana es estándar para un modelo de este tamaño, y no es el punto de comparación aquí: el punto es la inteligencia que el modelo ofrece dentro de esa ventana. )
Lo que Claude Opus 5.5 Realmente Hace )
Anthropic describe el modelo como un modelo de razonamiento que utiliza el pensamiento extendido o el razonamiento de cadena de pensamiento para resolver problemas complejos antes de proporcionar una respuesta. Admite texto e entrada de imágenes, y puede procesar ambos en una sola solicitud. El modelo puede analizar, describir y responder preguntas sobre imágenes, aunque el informe no proporciona un ejemplo de cómo se ve eso en la práctica. También puede generar texto de salida. )
El modelo es propietario — Anthropic no ha revelado el tamaño del modelo ni el número de parámetros. No es de pesos abiertos, lo que significa que su arquitectura y datos de entrenamiento no están disponibles para su inspección por parte de investigadores externos. Esa es una restricción importante para cualquiera que quiera probar sus límites o comparar su comportamiento con el de sus rivales.
Cómo Se Compara Con Otros Modelos
El informe compara Claude Opus 5.5 contra varios grupos de modelos, y los patrones son consistentes en todos ellos. Claude Opus 5.5 es caro según la medida del informe, y habla mucho más que sus rivales.
El informe agrupa modelos en varias categorías para la comparación:
- Modelos que no razonan, comparados únicamente con otros modelos que no razonan
- Modelos que razonan, comparados tanto entre modelos que razonan como modelos que no razonan
- Modelos de pesos abiertos, comparados únicamente con otros modelos de pesos abiertos del mismo tamaño, desglosados por número de parámetros (pequeño: ≤4B, mediano: 4B–40B, medio: 40B–150B, grande: >150B)
- Modelos propietarios, comparados entre modelos propietarios y modelos de pesos abiertos del mismo rango de precios, usando una proporción de entrada/salida combinada de 3:1
Claude Opus 5.5 se incluye en la comparación de modelos que razonan, y su precio se mide en relación con la categoría de $0.15–$1 por 1 millón de tokens. El informe no indica dónde se ubica el modelo en la comparación más amplia de modelos propietarios, que utiliza una proporción de precios combinada diferente.
El Negocio de Ser Caro
Los propios números del informe cuentan una historia clara sobre dónde se ubica Claude Opus 5.5. Es más inteligente que sus rivales según el Índice de Inteligencia. Habla más que sus rivales. Y cuesta más que la mayoría de ellos. Esa es una combinación útil si el problema en cuestión vale la pena el dinero, pero es una señal de advertencia si la pregunta podría ser respondida por un modelo más barato.
El precio combinado de $2.94 por 1 millón de tokens, según la API de Anthropic, es el número al que hay que prestar atención. Es superior a la mediana en todos los casos, y se aplica a cualquier carga de trabajo que mezcle los costos de entrada y salida. El informe señala que los precios pueden variar según el proveedor, por lo que el número podría cambiar dependiendo de dónde un usuario compre acceso. Esa es una consideración real para cualquiera que esté construyendo un flujo de trabajo alrededor del modelo.
Lo que esto significa para los usuarios )
La conclusión es simple. Claude Opus 5.5 es un modelo para personas que necesitan respuestas que provengan del razonamiento a través de un problema, no solo de la obtención de un hecho conocido. Es un modelo para usuarios que desean la respuesta más detallada y exhaustiva posible, y que están dispuestos a pagar por ella. La puntuación del modelo de 58 en el Índice de Inteligencia sugiere que cumple con esa promesa, pero el costo de 260 millones de tokens de salida es una carga real para cualquier flujo de trabajo que lo ejecute a escala.
El modelo está disponible a través de 5 proveedores de API, lo que les da a los usuarios cierta flexibilidad para buscar el mejor precio. La propia API de Anthropic es la fuente de las cifras de precios, y el informe compara proveedores para usuarios que desean probar los números entre sí. Ese es un servicio útil, pero no cambia las matemáticas subyacentes.
Claude Opus 5.5 es un modelo que obtiene una buena puntuación, habla mucho y cuesta más que la mayoría de sus rivales. Si el problema vale la pena resolverlo y el presupuesto no es una preocupación, es un modelo a considerar. Si el problema puede resolverse con un modelo más barato, es un modelo a evitar. El informe ha hecho el trabajo de medir la inteligencia; la decisión sobre qué compromiso hacer es del usuario.
Material fuente: “Análisis de Inteligencia, Rendimiento y Precio de Claude Opus 5.5 (Max),” artificialanalysis.ai.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

