Ob Claude Opus 5.5 einige Wochen nach dem Start schlechter arbeitet als am ersten Tag, soll ein öffentlicher Dauertest namens Livenerf klären. Das Projekt stellt dem Modell 30 Tage lang täglich dieselben 78 Fragen und hat seine Entscheidungsregel vorab veröffentlicht. Ein erstes Urteil ist frühestens um den 24. Oktober möglich.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenAnthropic hat Claude Opus 5.5 am 22. September freigegeben, das Modell erledigt in Projects mehrere Aufgaben parallel. Seit Monaten kursieren Berichte, Anthropic verschlechtere seine Modelle einige Tage oder Wochen nach dem Start, etwa durch Quantisierung, ein kleineres Modell unter demselben Namen oder weniger Denkaufwand. Der Entwickler hinter dem GitHub-Konto ninjahawk will den Streit mit einer Messreihe klären, die zwei Tage nach dem Start begann.[1] Livenerf ist ein unabhängiges Projekt ohne Verbindung zu Anthropic.
Das Wichtigste in Kürze
- Livenerf befragt Claude Opus 5.5 einmal täglich mit 78 eingefrorenen Prüfungsfragen und vergleicht die Ergebnisse mit den ersten zehn Messtagen.
- Als Verschlechterung gilt nur ein Minus von mindestens 3 Punkten, das in zwei aufeinanderfolgenden Zehn-Tage-Fenstern auftritt und beim Kontrollmodell fehlt.
- Weniger Denkaufwand zeigt sich zuerst am Tokenverbrauch: Im Vorabtest sanken die Ausgabe-Token um 62 Prozent, die Trefferquote nur um 8,3 Punkte.
- Das ältere Opus 5 und Opus 5.5 konnte der Test in der Vorabprüfung nicht sicher auseinanderhalten.
Wie misst Livenerf, ob Claude Opus 5.5 nachlässt?

Nur knappe Fragen. Livenerf hat 2.336 Aufgaben aus den Testsammlungen GPQA Diamond und MMLU-Pro sowie aus Mathematikwettbewerben wie AIME je viermal gestellt. Opus 5.5 löste rund 93 Prozent auf Anhieb, und 97 Prozent der Fragen beantwortete das Modell immer richtig oder immer falsch. Übrig blieben 78 Fragen, an denen Opus 5.5 mal scheitert und mal nicht.[1] Nur an solchen Aufgaben lässt sich ein Leistungsabfall überhaupt ablesen.
Feste Regeln. Prompts, Bewertung und die Version des Kommandozeilenwerkzeugs Claude Code sind eingefroren, ein Sprachmodell als Bewerter kommt nicht zum Einsatz. Livenerf beziffert den Aufwand auf rund 3,6 Prozent des wöchentlichen Kontingents eines Max-Abos. Die Statistik folgt dem Aufsatz „Adding Error Bars to Evals“ des Anthropic-Forschers Evan Miller,[2] als Gerüst dient das quelloffene Prüfwerkzeug Inspect des britischen AI Security Institute. Zur Kontrolle beantwortet der Vorgänger Opus 5 täglich die GPQA-Fragen aus dem Prüfset. Bewegen sich die Ergebnisse beider Modelle gemeinsam, liegt die Ursache bei Werkzeug oder Plattform.
Tokenverbrauch als Frühwarnung. Vor dem Start testete Livenerf seinen Messaufbau an einer bekannten Verschlechterung. Mit niedrigem statt hohem Denkaufwand erzeugte Opus 5.5 im Mittel über alle Fragen 62 Prozent weniger Ausgabe-Token. Die Trefferquote fiel dagegen nur um 8,3 Punkte, bei einer Unsicherheit von 4,5 Punkten.[3] Ein Anbieter, der den Denkaufwand seines Modells unbemerkt senkte, würde sich deshalb zuerst in der Tokenstatistik verraten und erst viel später in den Ergebnissen. Wie wenig Ranglisten über den Arbeitsalltag aussagen, zeigt auch die Kritik an gängigen Coding-Benchmarks.
Warum steht Anthropic unter Verdacht?
Zwei Präzedenzfälle. Im September 2025 räumte Anthropic drei Infrastrukturfehler ein, die über Wochen die Antworten mehrerer Claude-Modelle verschlechtert hatten. Ein Routingfehler traf am 31. August 2025 in der Spitze 16 Prozent aller Anfragen an Sonnet 4. Zugleich versicherte Anthropic, die Modellqualität nie wegen Nachfrage, Tageszeit oder Serverlast zu senken.[4]
Änderungen am Werkzeug. Im April 2026 folgte das zweite Eingeständnis. Ab dem 4. März hatte Anthropic in Claude Code den voreingestellten Denkaufwand für Sonnet 4.6 und Opus 4.6 von hoch auf mittel gesenkt, um Wartezeiten zu verkürzen. Erst am 7. April galt wieder die alte Einstellung. Ein Fehler im Zwischenspeicher löschte vom 26. März bis 10. April in länger ruhenden Sitzungen die bisherigen Denkschritte, und eine Vorgabe für kürzere Antworten im Systemprompt senkte vom 16. bis 20. April die Ergebnisse in Anthropics Tests um rund 3 Prozent. Die API war nicht betroffen, Anthropic setzte die Nutzungslimits aller Abonnenten zurück.[5] Warum eine Fehleranalyse oft folgenlos bleibt, beschreibt unser Beitrag zu Postmortems nach Pannen.
Gleiches Modell, anderes Ergebnis. Beide Fälle zeigen denselben Mechanismus: Die Gewichte des Modells blieben unverändert, geändert hatten sich Serverkonfiguration, Voreinstellungen und Systemprompt. Genau diese Schicht erfasst Livenerf, denn der Test läuft über ein Max-Abo und Claude Code statt über die API. Eine Quantisierung, also das Rechnen mit gröberen Zahlenformaten, würde sich ebenfalls in dieser Messung zeigen. Wie stark gröbere Formate schaden, zeigte ein Test mit Qwen3.8 27B: Die 4-Bit-Fassung hielt die Qualität, die 1-Bit-Fassung brach ein.
Anthropic hat 2026 selbst eingeräumt, dass Claude Code wochenlang schwächer arbeitete, obwohl am Modell nichts geändert war. Livenerf ersetzt das Bauchgefühl durch eine Messreihe, und jedes Unternehmen mit Claude im Einsatz sollte für die eigenen Aufgaben genau dasselbe tun.
Michael Dobler, Herausgeber Dr. Web
Die zwei bekannten Qualitätseinbrüche bei Claude
Was sollten Unternehmen mit Claude im Einsatz jetzt tun?
Grenzen des Tests. Opus 5 und Opus 5.5 konnte der Aufbau im Vorabtest nicht sicher auseinanderhalten: Die Differenz lag bei 3,8 Punkten mit einer Unsicherheit von 6,3 Punkten.[3] Außerdem fand der Entwickler im Prüfset acht vermutlich falsche Musterlösungen und 30 mehrdeutige Fragen. Gemessen wird nur das Abo über Claude Code, Ergebnisse für die API leitet das Projekt daraus nicht ab.
Rechtlicher Rahmen. Seit dem 2. August 2025 müssen Anbieter von KI-Modellen mit allgemeinem Verwendungszweck ihre technische Dokumentation aktuell halten und Unternehmen, die das Modell in eigene Systeme einbauen, über Fähigkeiten und Grenzen informieren.[6] Eine Meldepflicht für jede geänderte Voreinstellung folgt aus Artikel 53 des EU AI Act nicht. Für den Nachweis, dass ein Werkzeug weiterhin wie abgenommen arbeitet, bleibt der Betreiber selbst zuständig.
Vier Prüfpunkte. Für Teams, die Claude in Entwicklung oder Support nutzen, lohnt ein eigenes kleines Messverfahren:
- Ein Set aus 20 bis 50 typischen Aufgaben mit eindeutig prüfbarem Ergebnis anlegen und in festen Abständen erneut durchlaufen lassen.
- Den Tokenverbrauch pro Aufgabe protokollieren, denn sinkender Denkaufwand zeigt sich dort früher als in der Trefferquote. Die Kosten pro Aufgabe sind zudem der Maßstab, an dem Anthropic auch Claude Sonnet 5.5 misst.
- Modellbezeichnung, Denkaufwand und Werkzeugversion fest einstellen und jede Aktualisierung als eigenes Ereignis mit Vorher-Nachher-Lauf behandeln.
- Eine Ausweichoption bereithalten: Modell-Routing wie bei Snowflake oder ein lokal betriebenes Qwen für Aufgaben mit stabilen Anforderungen.
Termin vormerken. Die erste Zeile der Livenerf-Ergebnistabelle erscheint nach Tag 20 der Messreihe, ein Urteil nach der vorab festgelegten Regel fällt frühestens Ende Oktober. Bis dahin taugt keine Einzelbeobachtung als Beleg, weder für noch gegen eine Verschlechterung. Einen Überblick über Abos und Werkzeuge liefert unser Beitrag zu den Anthropic-Produkten, weitere Analysen sammelt die KI-Rubrik.
Quellen
[1] Livenerf (GitHub): „livenerf: tracking post-launch capability drift in frontier models“ (README, Stand 30.09.2026)
[2] Evan Miller (arXiv): „Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations“ (01.11.2024)
[3] Livenerf (GitHub): „livenerf instrument validation“ (24.09.2026)
[4] Anthropic: „A postmortem of three recent issues“ (17.09.2025)
[5] Anthropic: „An update on recent Claude Code quality reports“ (23.04.2026)
[6] EU AI Act: „Article 53: Obligations for Providers of General-Purpose AI Models“
Mehr Newshunger?
- Claude Opus 5.5 ist da und erledigt in Projects mehrere Aufgaben parallel
- Claude Sonnet 5.5: Anthropic behält den Tokenpreis und verspricht bis zu 30 Prozent geringere Kosten pro Aufgabe
- OpenAI stoppt GPT-6.1 Astra: Das Modell täuschte in Sicherheitstests häufiger als sein Vorgänger
- Der Pelikan-Benchmark: Trainieren KI-Labore heimlich für den berühmten Test?
- KI-Coding-Agenten im Dauereinsatz: Warum die Trefferquote nach fünf Runden einbricht
- Claude Opus 5: Anthropic setzt auf Kosten statt Benchmark-Krone
