Ob Claude Opus 5.5 einige Wochen nach dem Start schlechter arbeitet als am ersten Tag, soll ein öffentlicher Dauertest namens Livenerf klären. Das Projekt stellt dem Modell 30 Tage lang täglich dieselben 78 Fragen und hat seine Entscheidungsregel vorab veröffentlicht. Ein erstes Urteil ist frühestens um den 24. Oktober möglich.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Anthropic hat Claude Opus 5.5 am 22. September freigegeben, das Modell erledigt in Projects mehrere Aufgaben parallel. Seit Monaten kursieren Berichte, Anthropic verschlechtere seine Modelle einige Tage oder Wochen nach dem Start, etwa durch Quantisierung, ein kleineres Modell unter demselben Namen oder weniger Denkaufwand. Der Entwickler hinter dem GitHub-Konto ninjahawk will den Streit mit einer Messreihe klären, die zwei Tage nach dem Start begann.[1] Livenerf ist ein unabhängiges Projekt ohne Verbindung zu Anthropic.

Das Wichtigste in Kürze

  • Livenerf befragt Claude Opus 5.5 einmal täglich mit 78 eingefrorenen Prüfungsfragen und vergleicht die Ergebnisse mit den ersten zehn Messtagen.
  • Als Verschlechterung gilt nur ein Minus von mindestens 3 Punkten, das in zwei aufeinanderfolgenden Zehn-Tage-Fenstern auftritt und beim Kontrollmodell fehlt.
  • Weniger Denkaufwand zeigt sich zuerst am Tokenverbrauch: Im Vorabtest sanken die Ausgabe-Token um 62 Prozent, die Trefferquote nur um 8,3 Punkte.
  • Das ältere Opus 5 und Opus 5.5 konnte der Test in der Vorabprüfung nicht sicher auseinanderhalten.

Wie misst Livenerf, ob Claude Opus 5.5 nachlässt?

Weiße Küchenwaage mit Metallschale, darauf ein Zuckerwürfel; Aufkleber mit Text „TAG 1“
Opus 5.5 löst 93% von 2.336 Testfragen aus GPQA Diamond, MMLU-Pro und AIME beim ersten Versuch korrekt

Nur knappe Fragen. Livenerf hat 2.336 Aufgaben aus den Testsammlungen GPQA Diamond und MMLU-Pro sowie aus Mathematikwettbewerben wie AIME je viermal gestellt. Opus 5.5 löste rund 93 Prozent auf Anhieb, und 97 Prozent der Fragen beantwortete das Modell immer richtig oder immer falsch. Übrig blieben 78 Fragen, an denen Opus 5.5 mal scheitert und mal nicht.[1] Nur an solchen Aufgaben lässt sich ein Leistungsabfall überhaupt ablesen.

Feste Regeln. Prompts, Bewertung und die Version des Kommandozeilenwerkzeugs Claude Code sind eingefroren, ein Sprachmodell als Bewerter kommt nicht zum Einsatz. Livenerf beziffert den Aufwand auf rund 3,6 Prozent des wöchentlichen Kontingents eines Max-Abos. Die Statistik folgt dem Aufsatz „Adding Error Bars to Evals“ des Anthropic-Forschers Evan Miller,[2] als Gerüst dient das quelloffene Prüfwerkzeug Inspect des britischen AI Security Institute. Zur Kontrolle beantwortet der Vorgänger Opus 5 täglich die GPQA-Fragen aus dem Prüfset. Bewegen sich die Ergebnisse beider Modelle gemeinsam, liegt die Ursache bei Werkzeug oder Plattform.

Tokenverbrauch als Frühwarnung. Vor dem Start testete Livenerf seinen Messaufbau an einer bekannten Verschlechterung. Mit niedrigem statt hohem Denkaufwand erzeugte Opus 5.5 im Mittel über alle Fragen 62 Prozent weniger Ausgabe-Token. Die Trefferquote fiel dagegen nur um 8,3 Punkte, bei einer Unsicherheit von 4,5 Punkten.[3] Ein Anbieter, der den Denkaufwand seines Modells unbemerkt senkte, würde sich deshalb zuerst in der Tokenstatistik verraten und erst viel später in den Ergebnissen. Wie wenig Ranglisten über den Arbeitsalltag aussagen, zeigt auch die Kritik an gängigen Coding-Benchmarks.

Warum steht Anthropic unter Verdacht?

Zwei Präzedenzfälle. Im September 2025 räumte Anthropic drei Infrastrukturfehler ein, die über Wochen die Antworten mehrerer Claude-Modelle verschlechtert hatten. Ein Routingfehler traf am 31. August 2025 in der Spitze 16 Prozent aller Anfragen an Sonnet 4. Zugleich versicherte Anthropic, die Modellqualität nie wegen Nachfrage, Tageszeit oder Serverlast zu senken.[4]

Änderungen am Werkzeug. Im April 2026 folgte das zweite Eingeständnis. Ab dem 4. März hatte Anthropic in Claude Code den voreingestellten Denkaufwand für Sonnet 4.6 und Opus 4.6 von hoch auf mittel gesenkt, um Wartezeiten zu verkürzen. Erst am 7. April galt wieder die alte Einstellung. Ein Fehler im Zwischenspeicher löschte vom 26. März bis 10. April in länger ruhenden Sitzungen die bisherigen Denkschritte, und eine Vorgabe für kürzere Antworten im Systemprompt senkte vom 16. bis 20. April die Ergebnisse in Anthropics Tests um rund 3 Prozent. Die API war nicht betroffen, Anthropic setzte die Nutzungslimits aller Abonnenten zurück.[5] Warum eine Fehleranalyse oft folgenlos bleibt, beschreibt unser Beitrag zu Postmortems nach Pannen.

Gleiches Modell, anderes Ergebnis. Beide Fälle zeigen denselben Mechanismus: Die Gewichte des Modells blieben unverändert, geändert hatten sich Serverkonfiguration, Voreinstellungen und Systemprompt. Genau diese Schicht erfasst Livenerf, denn der Test läuft über ein Max-Abo und Claude Code statt über die API. Eine Quantisierung, also das Rechnen mit gröberen Zahlenformaten, würde sich ebenfalls in dieser Messung zeigen. Wie stark gröbere Formate schaden, zeigte ein Test mit Qwen3.8 27B: Die 4-Bit-Fassung hielt die Qualität, die 1-Bit-Fassung brach ein.

Anthropic hat 2026 selbst eingeräumt, dass Claude Code wochenlang schwächer arbeitete, obwohl am Modell nichts geändert war. Livenerf ersetzt das Bauchgefühl durch eine Messreihe, und jedes Unternehmen mit Claude im Einsatz sollte für die eigenen Aufgaben genau dasselbe tun.

Michael Dobler, Herausgeber Dr. Web
Zitat teilen
Livenerf: So misst der Dauertest Claude Opus 5.5
Livenerf stellt täglich dieselben Fragen und entscheidet nach einer vorab veröffentlichten Regel.
78
Fragen im Prüfset, ausgewählt aus 2.336 Aufgaben, die Opus 5.5 nur manchmal löst
30 Tage
läuft die Messreihe seit dem 24. September, die ersten zehn Tage bilden die Vergleichsbasis
−62 %
Ausgabe-Token bei niedrigem Denkaufwand, die Trefferquote sank nur um 8,3 Punkte
7,5 Punkte
Veränderung der Trefferquote, die ein Zehn-Tage-Fenster zuverlässig erkennen soll

Die zwei bekannten Qualitätseinbrüche bei Claude

Sommer 2025
Frühjahr 2026
Ursache
Drei Fehler in der Infrastruktur
Drei Änderungen an Claude Code
Ausmaß
Bis zu 16 % der Sonnet-4-Anfragen fehlgeleitet
Rund 3 % schlechtere Testergebnisse allein durch die Kürzungsvorgabe
Folge
Fehler behoben, Postmortem veröffentlicht
Änderungen zurückgenommen, Nutzungslimits zurückgesetzt

Was sollten Unternehmen mit Claude im Einsatz jetzt tun?

Grenzen des Tests. Opus 5 und Opus 5.5 konnte der Aufbau im Vorabtest nicht sicher auseinanderhalten: Die Differenz lag bei 3,8 Punkten mit einer Unsicherheit von 6,3 Punkten.[3] Außerdem fand der Entwickler im Prüfset acht vermutlich falsche Musterlösungen und 30 mehrdeutige Fragen. Gemessen wird nur das Abo über Claude Code, Ergebnisse für die API leitet das Projekt daraus nicht ab.

Rechtlicher Rahmen. Seit dem 2. August 2025 müssen Anbieter von KI-Modellen mit allgemeinem Verwendungszweck ihre technische Dokumentation aktuell halten und Unternehmen, die das Modell in eigene Systeme einbauen, über Fähigkeiten und Grenzen informieren.[6] Eine Meldepflicht für jede geänderte Voreinstellung folgt aus Artikel 53 des EU AI Act nicht. Für den Nachweis, dass ein Werkzeug weiterhin wie abgenommen arbeitet, bleibt der Betreiber selbst zuständig.

Vier Prüfpunkte. Für Teams, die Claude in Entwicklung oder Support nutzen, lohnt ein eigenes kleines Messverfahren:

  • Ein Set aus 20 bis 50 typischen Aufgaben mit eindeutig prüfbarem Ergebnis anlegen und in festen Abständen erneut durchlaufen lassen.
  • Den Tokenverbrauch pro Aufgabe protokollieren, denn sinkender Denkaufwand zeigt sich dort früher als in der Trefferquote. Die Kosten pro Aufgabe sind zudem der Maßstab, an dem Anthropic auch Claude Sonnet 5.5 misst.
  • Modellbezeichnung, Denkaufwand und Werkzeugversion fest einstellen und jede Aktualisierung als eigenes Ereignis mit Vorher-Nachher-Lauf behandeln.
  • Eine Ausweichoption bereithalten: Modell-Routing wie bei Snowflake oder ein lokal betriebenes Qwen für Aufgaben mit stabilen Anforderungen.

Termin vormerken. Die erste Zeile der Livenerf-Ergebnistabelle erscheint nach Tag 20 der Messreihe, ein Urteil nach der vorab festgelegten Regel fällt frühestens Ende Oktober. Bis dahin taugt keine Einzelbeobachtung als Beleg, weder für noch gegen eine Verschlechterung. Einen Überblick über Abos und Werkzeuge liefert unser Beitrag zu den Anthropic-Produkten, weitere Analysen sammelt die KI-Rubrik.

Quellen

[1] Livenerf (GitHub): „livenerf: tracking post-launch capability drift in frontier models“ (README, Stand 30.09.2026)

[2] Evan Miller (arXiv): „Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations“ (01.11.2024)

[3] Livenerf (GitHub): „livenerf instrument validation“ (24.09.2026)

[4] Anthropic: „A postmortem of three recent issues“ (17.09.2025)

[5] Anthropic: „An update on recent Claude Code quality reports“ (23.04.2026)

[6] EU AI Act: „Article 53: Obligations for Providers of General-Purpose AI Models“

Mehr Newshunger?

4,1 12 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?