Die neueste Version des Gesprächs-KI-Assistenten von Anthropic, Claude Opus 5.5, kommt nun mit einem neuen Leitfaden. Er ist für Entwickler gedacht, die das Modell in ihre eigenen Systeme integrieren möchten, und behandelt eine Vielzahl von Themen, darunter Anstrengungskalibrierung und Multi-Agent-Workflows.
Dieser Leitfaden trägt den Titel „Prompting Claude Opus 5.5“ und konzentriert sich auf den Vergleich, wie sich Claude Opus 5 im Vergleich zur neuen Version verhält. Er geht davon aus, dass Leser bereits die Funktionsweise der älteren Version kennen, weshalb er die Grundlagen überspringt und direkt zu den Aktualisierungen übergeht.
Anstrengungs-Kalibrierung
Der wesentliche Unterschied liegt darin, wie viel Anstrengung aufgewendet wird. Claude Opus 5.5 produziert Tokens zu einer Rate, die über 30 Prozent schneller ist als sein Vorgänger, und er erledigt in der Regel dieselbe Aufgabe mit weniger Tokens. Infolgedessen funktionieren aktuelle Prompts im Allgemeinen weiterhin, ohne dass sie angepasst werden müssen, obwohl sich der zugrunde liegende Denkprozess verschoben hat.
Die Empfehlung von Anthropic ist, mit mittlerer Anstrengung zu beginnen, die auf Claude Opus 5.5 standardmäßig eingestellt ist. Die frühere Edition hatte stattdessen standardmäßig hohe Anstrengung eingestellt, sodass die beiden Einstellungen nicht austauschbar sind. Die Anleitung empfiehlt, Tests über mehrere Stufen durchzuführen, parallel zu Ihren eigenen Bewertungen, anstatt einfach die Einstellung beizubehalten, die Sie auf Claude Opus 5 verwendet haben.
Der Leitfaden weist darauf hin, dass die Namen der Anstrengungsstufen nicht die gleiche Menge an Denken über Modelle hinweg bedeuten. In Anthropics Tests entspricht Claude Opus 5.5 bei mittlerer Anstrengung oder übertrifft Claude Opus 5 bei hoher Anstrengung bei Programmier- und Wissensarbeitsbewertungen, und niedrige Anstrengung nähert sich ihm zu deutlich geringeren Kosten.
Denkverhalten
Claude Opus 5.5 denkt pro Runde mehr als sein Vorgänger, insbesondere bei xhoch und maximal. Das bedeutet, dass ein Prompt, der auf dem älteren Modell bei einer bestimmten Anstrengungseinstellung gut funktioniert hat, jetzt längere Runden und mehr Ausgabetoken erzeugen kann. Der Leitfaden bietet drei Lösungen:
- Setzen Sie max_tokens hoch genug ein, um genügend Platz für die Denk-Token des Modells und die Antwort zu lassen.
- Reservieren Sie xhoch und maximal für Arbeiten, bei denen Sie einen Qualitätsgewinn gemessen haben.
- Reduzieren Sie die Anstrengung zuerst, wenn Sie weniger Denken wünschen.
Das Nachdenken zählt zu den maximalen Tokens, selbst wenn der Inhalt des Denkprozesses nicht an Sie zurückgegeben wird, sodass ein für Claude Opus 5 mit deaktiviertem Nachdenken dimensioniertes Limit Antworten abschneiden kann. Für lange Zyklen, die agenturbezogene Programmierung erzeugen kann, hat ein max_tokens-Wert von 128.000 in Anthropics Tests gut funktioniert.
Schutzmaßnahmen und unbeaufsichtigte Läufe
Der Leitfaden beschreibt einen Stop-Grund von „Refusal“ als fallend unter Schutzmaßnahmen. Wenn Anfragen mit diesem Grund zurückkommen, signalisiert dies einen langen, agenturbetriebenen Zyklus, der still wirkt. Möglicherweise wünschen Sie Updates zu vorhersehbaren Zeitpunkten während dieser verlängerten Perioden.
Zu den im Leitfaden behandelten Themen gehören unbeaufsichtigte Agenten, die ihre Arbeit mitten in einer längeren Aufgabe beenden, nachdem sie über ihre Fortschritte berichtet haben. Diese Fälle werden als unbeaufsichtigte Agentenläufe bezeichnet. In jedem Fall stoppt der Agent vor Abschluss, während er sich noch mitten in seiner zugewiesenen Aufgabe befindet.
Multi-Agent-Harnesse
Der Leitfaden bietet Zeitsignale als Möglichkeit, ein Team von Agenten schneller fertigzustellen. Es beinhaltet die Koordinierung mehrerer Agenten, die an einer gemeinsamen Aufgabe arbeiten, wobei jeder einen Teil beisteuert.
Laut dem Leitfaden berichteten frühe Tester von einer stärkeren Code-Überprüfung, die mehr Fehler auffindet als bei Claude Opus 5, während gleichzeitig weniger Fehlalarme generiert wurden. Das Modell legt seine Änderungen in klaren, leicht verständlichen Begriffen dar.
Visuelle Eingaben
Anthropics Tests zeigten, dass das Modell dichte Diagramme genauer liest als Claude Opus 5, selbst bei seiner niedrigsten Anstrengungseinstellung. Dies geschah bei Verwendung nur eines kleinen Bruchteils der Ausgabetoken im Vergleich dazu, wie Claude Opus 5 bei seiner höchsten Einstellung arbeitet.
Bedeutung hängt oft mehr von der Anordnung als von den Wörtern allein ab: welche Boxen ein Pfeil in einem Flussdiagramm verbindet, was zwischen zwei Ausgaben eines Diagramms geändert wurde oder genau wann ein Meeting in einem Kalenderschnappschuss beginnt und endet.
Wissensarbeit und agenturbezogene Programmierung
Das Modell zeichnet sich besonders gut bei Aufgaben wie der Erstellung eines Finanzmodells und einer einseitigen Zusammenfassung für eine Transaktion oder der Lokalisierung und Korrektur von Fehlern in einem Bewertungs-Workbook aus. In einer echten Codebasis erzielt das Modell die besten Ergebnisse bei mehrstufigen Aufgaben. Es führt eine Änderung vollständig durch eine große Codebasis, bis seine Tests bestanden sind, und kann längere autonome Arbeiten länger durchführen als Claude Opus 5.
Das System handhabt langwierige Audits und Code-Migrationen über große Codebasen mithilfe von parallelen Subagenten, mit minimaler Beaufsichtigung. Laut der Anleitung entsprach oder übertraf es Claude Opus 5 bei diesen anspruchsvollen, aufwändigen Aufgaben, indem es sie in weniger Schritten und mit geringerem Token-Verbrauch abschloss.
Vorgeschichte: Text, Kontext und Frontend-Design
Innerhalb der Nachricht, die ein Benutzer eingefügt hat, befindet sich Text, der Anweisungen enthält, denen das Modell folgt. Dieser Text umfasst eine bestimmte Art der Kennzeichnung eingefügten Inhalts, die in der Anleitung beschrieben wird. Das Modell kann Anfragen verwalten, die sich über mehrere miteinander verbundene Apps erstrecken, obwohl es möglicherweise Details verpasst, die die ursprüngliche Anfrage nicht erwähnt hat.
Das Frontend-Aussehen ist generisch, und die Anleitung behandelt die Standardeinstellungen für das Frontend-Design.
Die wichtigsten Fakten
- Claude Opus 5.5 generiert Ausgabetoken mehr als 30 Prozent schneller als Claude Opus 5.
- Claude Opus 5.5 neigt dazu, dieselbe Aufgabe mit weniger Token abzuschließen.
- Mittlerer Aufwand ist der Standard bei Claude Opus 5.5.
- Niedriger Aufwand bei Claude Opus 5.5 entspricht hohem Aufwand bei Claude Opus 5 zu deutlich geringeren Kosten.
- Ein Wert von max_tokens von 128.000 hat sich in Anthropics Tests für lange agentenbasierte Codierabläufe bewährt.
- Anfragen können einen Stop-Grund von „Verweigerung“ zurückgeben.
- Das Modell liest dichte Diagramme genauer als Claude Opus 5, selbst bei seinem niedrigsten Aufwandsgrad.
Dieses Dokument beschreibt, wie sich die beiden Versionen unterschiedlich verhalten, erläutert mit praktischen Details über seine Seiten hinweg.
Quellenmaterial: „Prompting Claude Opus 5.5“, claude.com.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

