Wer die Rangliste von Artificial Analysis nur nach Punkten liest, sieht bei Claude Opus 5.5 die Hälfte der Rechnung.
Erst kostenlos reinschnuppern, dann entscheiden
Bevor du dich für eine Weiterbildung entscheidest, sieh dir kostenlos an, wie sie läuft, fünf Lektionen plus Live-Demo, ohne Verpflichtung. Passt es, ist der Digitalisierungsmanager bei bewilligtem Bildungsgutschein für dich kostenlos.
Kostenlos reinschnuppernDer Schnupperkurs ist gratis. Ob die Weiterbildung über den Bildungsgutschein gefördert wird, entscheidet die Agentur für Arbeit im Einzelfall.
58 Punkte bei höchster Aufwandsstufe
Artificial Analysis betreibt den Intelligence Index, der laut heise die Ergebnisse zehn verschiedener Tests zusammenfasst, etwa zum Programmieren und zu Wissensfragen. Die Auswertung zu Opus 5.5 trägt das Datum 22. September 2026, heise berichtete am 25. September 2026 darüber. Auf der Aufwandsstufe „max“ kommt das Modell auf 58 Punkte.
Laut Artificial Analysis ist das der höchste bisher gemessene Wert im Index.
Dahinter folgen laut heise GPT-6 Astra und Claude Fable 5.1 mit je 53 Punkten. Getestet wurden die Modelle laut heise jeweils in ihrer höchsten Leistungsstufe. Das ist bei der Lektüre wichtig, denn eine Rangliste, die jedes Modell mit voller Rechenleistung antreten lässt, misst, was im besten Fall möglich ist. Wie ein Modell auf einer sparsameren Stufe abschneidet, steht auf einem anderen Blatt.
Wo Opus 5.5 vorne liegt und wo es zurückfällt
Im Einzeltest Terminal-Bench 4.0, der Aufgaben an der Kommandozeile prüft, erreicht Opus 5.5 laut Artificial Analysis 59,6 Prozent. Damit liegt es gleichauf mit GPT-6 Astra und 11 Punkte über Opus 5. In drei anderen Tests, CritPt, AA-LCR und GDP.pdf, liegt es laut Artificial Analysis zurück.
Aufschlussreich sind die Aufwandsstufen. Opus 5.5 hat laut Artificial Analysis fünf davon: low, medium, high, xhigh und max. Vier dieser Stufen, von medium bis max, liegen laut der Auswertung auf der Grenze des besten Verhältnisses von Leistung zu Kosten pro Aufgabe. Anders gesagt: Nach dieser Messung ist keine dieser vier Stufen für ihren Preis eine schlechte Wahl, auch die mittleren nicht.
Mehr Text, gleiche Kosten pro Aufgabe
Die eigentliche Nachricht steckt in der Kostenseite der Auswertung. Opus 5.5 erzeugt bei maximalem Aufwand laut Artificial Analysis rund 119.000 Ausgabetokens pro Index-Aufgabe. Opus 5 kam auf rund 73.000, Fable 5.1 auf rund 78.000 und GPT-6 Astra auf rund 27.000. Gegenüber Opus 5 ist das laut Artificial Analysis das 1,6-Fache. Teurer pro Aufgabe wird das Modell dadurch nach dieser Messung trotzdem nicht, die Kosten liegen auf dem Niveau von Opus 5. Der Grund ist der gesunkene Tokenpreis: 4 US-Dollar je 1 Million Eingabetokens und 20 US-Dollar je 1 Million Ausgabetokens, vorher waren es 5 und 25 US-Dollar. Das sind Listenpreise des Anbieters für die Programmierschnittstelle, keine Abopreise. Ein niedrigerer Preis je Token und eine größere Menge an Token heben sich hier also ungefähr auf.
heise fasst den Vergleich mit Astra so zusammen: Die Token von Opus sind laut der Analyse deutlich günstiger als bei Astra, Astra benötigt aber viel weniger davon. Wer vor allem Leistung braucht, soll laut dieser Zusammenfassung Opus 5.5 ausprobieren, wer auf Kosten achten muss, sich Astra ansehen. Die Kosten bleiben nach Einschätzung von heise weiterhin hoch, und Opus 5.5 sei nicht für alle Aufgaben immer die beste Wahl.
Wie sich die neuen Listenpreise für Betriebe auswirken, haben wir im Artikel Claude Opus 5.5 und GPT-6 Sol: Was die neuen Preise für Betriebe bedeuten beschrieben.
Kürzere Sätze, längere Antworten
Eine zweite, davon getrennte Messung betrifft den Schreibstil. BleepingComputer berichtete am 26. September 2026 unter Berufung auf die Bewertungsplattform Arena über eine Auswertung von Antworten aus der Text-Arena aus August und September 2026. Die Originalauswertung liegt uns nicht vor, alle Zahlen in diesem Abschnitt stammen aus dem Bericht von BleepingComputer, der sich auf Arena beruft.
Demnach entwickelten sich 10 von 12 Schreibmerkmalen in eine Richtung, die Arena als besser einstuft. Lange Gedankenstriche kamen bei Opus 5 auf 15,2 je 1.000 Wörter, bei Opus 5.5 auf 0,8. Die Sätze wurden kürzer, im Schnitt von 12,14 auf 10,03 Wörter. Die Antworten dagegen wurden länger, im Schnitt von 453 auf 481 Wörter.
Diese Wortzahlen pro Chat-Antwort haben mit den Ausgabetokens pro Index-Aufgabe von Artificial Analysis nichts zu tun. Es sind zwei Messungen mit verschiedenen Aufgaben und verschiedenen Einheiten, die sich nicht gegeneinander verrechnen lassen.
Unsere Einschätzung
Der Preis pro Million Token steht in jeder Ankündigung. Für einen Betrieb zählt am Ende eine andere Zahl: was eine erledigte Aufgabe kostet.
Die Auswertung von Artificial Analysis zeigt, warum die beiden Zahlen auseinanderlaufen können. Ein Modell mit niedrigerem Tokenpreis kann mehr Text erzeugen und am Ende gleich viel kosten wie sein Vorgänger. Umgekehrt kann ein Modell mit teureren Token mithalten, wenn es mit wenigen auskommt; so beschreibt heise den Vergleich mit Astra. Dazu kommt, dass Benchmarks die Messungen eines Dienstleisters unter seinen eigenen Bedingungen sind, mit eigener Testsammlung und auf der höchsten Aufwandsstufe. Wie ein Modell bei den Aufgaben eines bestimmten Betriebs abschneidet, sagen sie nicht.
Aus unserer Sicht sollten Betriebe, die Modelle über die Schnittstelle nutzen, ihre eigenen zwei oder drei typischen Aufgaben durchlaufen lassen und die Kosten pro erledigter Aufgabe vergleichen, und zwar auf mehreren Aufwandsstufen. Möglicherweise reicht eine niedrigere Stufe.
Wer Texte für Kunden erzeugen lässt, sollte außerdem die Länge der Antworten im Blick behalten. Kürzere Sätze machen einen Text noch nicht kürzer.
Quellen
Die genannten Angaben stützen sich auf folgende öffentlich zugängliche Quellen (Stand der Recherche: 27. September 2026):
- Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index, along with a 20% price cut and larger cache hit discount
- heise online: Externe Benchmarks: Claude Opus 5.5 überholt Astra von OpenAI und Fable 5.1
- BleepingComputer: Claude Opus 5.5 uses 95% fewer em dashes, but its answers are getting longer
Häufige Fragen
Wie hat Claude Opus 5.5 im Intelligence Index von Artificial Analysis abgeschnitten?
Bei der höchsten Aufwandsstufe „max“ erreicht Claude Opus 5.5 im Intelligence Index 58 Punkte, laut Artificial Analysis der höchste bisher gemessene Wert. GPT-6 Astra und Claude Fable 5.1 kommen laut heise auf je 53 Punkte. Die Auswertung trägt das Datum 22. September 2026.
Wie viele Ausgabetokens braucht Opus 5.5 pro Aufgabe?
Laut Artificial Analysis erzeugt Opus 5.5 bei maximalem Aufwand rund 119.000 Ausgabetokens pro Index-Aufgabe. Opus 5 kam auf rund 73.000, Fable 5.1 auf rund 78.000 und GPT-6 Astra auf rund 27.000. Gegenüber Opus 5 ist das das 1,6-Fache.
Ist Opus 5.5 pro Aufgabe teurer als Opus 5?
Laut Artificial Analysis liegen die Kosten pro Aufgabe auf dem Niveau von Opus 5, weil der Tokenpreis gesunken ist. Die Listenpreise für die API betragen 4 US-Dollar je 1 Million Eingabetokens und 20 US-Dollar je 1 Million Ausgabetokens, vorher waren es 5 und 25 US-Dollar.
Was sollte ein Betrieb vor einem Modellwechsel prüfen?
Aus unserer Sicht zählen die Kosten pro erledigter Aufgabe mehr als der Preis pro Million Token. Wir würden zwei oder drei typische eigene Aufgaben auf mehreren Aufwandsstufen durchlaufen lassen und die Ergebnisse vergleichen, denn Benchmarks messen unter den Bedingungen des Dienstleisters. Möglicherweise reicht eine niedrigere Stufe.
Was kostet im Betrieb eine erledigte KI-Aufgabe, und hat das schon jemand gemessen?
Im kostenlosen KI-Schnupperkurs zeigen wir in fünf Lektionen, wie kleine und mittlere Firmen KI im Alltag einsetzen. Tiefer und praxisnah geht es im Vollkurs Digitalisierungsmanager, DEKRA-zertifiziert und förderfähig über den Bildungsgutschein.
Zuletzt aktualisiert: 27. September 2026. Stand der Recherche: 27. September 2026.