Im Data Agent Benchmark, einem internationalen Test für KI-gestützte Datenanalyse, führt seit Kurzem keine Lösung aus dem Silicon Valley, sondern eine chinesische Datenbank. OceanBase erreichte dort 90,62 % und ließ Datenagenten auf Basis von GPT und Claude hinter sich.[1]

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Der Wert klingt nach Nischenstatistik, entscheidet aber darüber, welche Software Entscheidern künftig verlässliche Antworten aus den eigenen Firmendaten liefert, und rückt einen bislang unbekannten Namen nach vorn.

Das Wichtigste in Kürze

  • OceanBase, die Datenbank des Alibaba-Ablegers Ant Group, führt den Data Agent Benchmark (DAB) mit 90,62 % an und übersprang als erste Einreichung die 90-Prozent-Marke.
  • Der Test stammt vom EPIC Data Lab der UC Berkeley und von Hasura PromptQL, gilt also als unabhängige Messlatte, nicht als Eigenlob eines Anbieters.
  • Geschlagen wurden Datenagenten auf Basis von GPT, Claude Opus und Claude Fable; OceanBase rechnete dafür mit dem chinesischen Sprachmodell GLM-5.2.
  • Für Firmen zählt weniger der Sieg als die Frage, wo Datenbank und Modell laufen: Der Testsieger bringt Datensouveränität und ein neues Souveränitätsproblem zugleich.

Was misst der Data Agent Benchmark überhaupt?

Pokal mit Karteikarten, Plakette „90,62 %“ und Zettel „Prüfungsangst besiegt!“ auf weißem Grund
Datenagent beantwortet Unternehmensfragen in natürlicher Sprache. Der Data Agent Benchmark testet Verständnis, Planung und Abfragen über 54 Aufgaben in neun Branchen

Ein Datenagent beantwortet Fragen an Unternehmensdaten in normaler Sprache, statt dass jemand von Hand eine Abfrage tippt. Der Data Agent Benchmark prüft diese Kette aus Verstehen, Planen, Abfragen und Antworten und zählt zu den härtesten Prüfsteinen der künstlichen Intelligenz im Firmenalltag. 54 Aufgaben über neun Branchen und vier Datenbanktypen, von PostgreSQL bis DuckDB, muss ein System dafür lösen.[1]

Härtere Prüfungen als in älteren Tests kennzeichnen DAB, der sich nicht mit sauberem Text-zu-SQL begnügt. Die Aufgaben verlangen Verknüpfungen über mehrere Datenbanken hinweg, schlecht formatierte Schlüsselfelder und das Umwandeln von Fließtext in Zahlen, dazu Fachwissen aus der jeweiligen Branche.[2] Genau daran scheitern reine Sprachmodelle, die eine Frage zwar elegant in eine Abfrage gießen, die krude Wirklichkeit betrieblicher Datenbanken aber unterschätzen.

90,62 % Trefferquote holte die OceanBase-Lösung mit dem internen Namen Scout, als erste Einreichung überhaupt jenseits der 90 %.[1] Dahinter reihten sich Datenagenten auf Basis von GPT, Claude Opus und Claude Fable ein. OceanBase will die Technik in sein Analysewerkzeug DataPilot einbauen. Dass ein Modell selbst über seine Recherche entscheidet, treibt die ganze Branche um, zuletzt Databricks mit seinem selbststeuernden Suchmodell.

Warum gewinnt eine Datenbank gegen die großen Sprachmodelle?

Der Vorsprung liegt nicht im größeren Modell, sondern in der Arbeitsteilung. OceanBase koppelt das Sprachmodell GLM-5.2 des chinesischen Anbieters Zhipu mit der eigenen Abfrage- und Ausführungsschicht. Das Modell versteht die Frage, die Datenbank kennt ihre Struktur, ihre Schlüssel und ihre Eigenheiten aus erster Hand. Dasselbe Zhipu, dessen Topmodell GLM-5.3 unerkannt auf 100.000 heimischen Chips lief, liefert hier das Sprachvermögen.

OceanBases Herkunft erklärt den Rest. Die Datenbank entstand im Zahlungsdienst Alipay, um die Bestelllawine des chinesischen Single-Days zu verkraften, und wurde später ausgegründet und quelloffen gestellt. Ein System, das täglich Milliarden Transaktionen sortiert, kennt die Fallstricke unsauberer Daten besser als ein universelles Sprachmodell.

Ein Bestenlisten-Platz ist trotzdem kein Beleg für den Alltag. Glanz im Test und Enttäuschung in der Firma liegen oft nah beieinander: KI-Chatbots liegen bei Finanzfragen in 57 % der Fälle daneben, und viele Unternehmen setzen auf KI-Agenten, deren Kunden aber nicht. Eine Trefferquote von 90 % heißt zugleich, dass jede zehnte Antwort falsch ausfällt, bei Geschäftszahlen ein hoher Preis.

Ein Datenagent, der neun von zehn Fragen richtig beantwortet, ist beeindruckend und im Controlling trotzdem ein Risiko. Die spannendere Zahl ist nicht die Trefferquote, sondern die Frage, auf wessen Servern das Modell die Firmendaten liest.

— Michael Dobler, Herausgeber Dr. Web
Data Agent Benchmark: OceanBase an der Spitze
Eine chinesische Datenbank schlägt Datenagenten auf Basis von GPT und Claude
90,62 %
Trefferquote von OceanBase, Platz eins der Bestenliste
über 90 %
erstmals von einer Einreichung überschritten
54 / 9 / 4
Aufgaben, Branchen und Datenbanktypen im Test, von PostgreSQL bis DuckDB
GLM-5.2
genutztes Sprachmodell von Zhipu, schlug GPT und Claude
Was der Test prüft

Nicht nur sauberes Text-zu-SQL, sondern die ganze Kette aus Verstehen, Planen, Abfragen und Antworten, samt Verknüpfungen über mehrere Datenbanken und schlecht formatierten Schlüsselfeldern.

Was heißt der Testsieg für die Datenanalyse in Europa?

Zwei Signale stecken für europäische Firmen darin. Das erste ermutigt: Ein quelloffener, selbst betreibbarer Verbund aus Datenbank und Modell hält mit den geschlossenen Diensten von OpenAI und Anthropic mit. Firmen, die die Analyse der eigenen Zahlen nicht in eine US-Cloud auslagern möchten, bekommen eine Alternative, die im Labor sogar vorn liegt. Denselben Reflex verfolgt Ant Group, die Qwen Office im eigenen Netz hält.

Das zweite Signal mahnt zur Vorsicht. Der Testsieger rechnet mit GLM-5.2, einem Modell aus China. Für Unternehmen verschiebt sich die Datenschutzfrage damit nur: Firmendaten wandern nicht zu einem US-Konzern, sondern durch ein chinesisches Sprachmodell, mit eigenen Fragen zu DSGVO, Drittlandtransfer und behördlichem Zugriff. Der lokale, quelloffene Betrieb entschärft das, etwa auf verschlüsselten Cloud-Instanzen deutscher Anbieter, verlangt aber Aufbau und Prüfung im eigenen Haus.

Für Entscheider zählt weniger die Rangfolge als der Umgang damit. Benchmark-Zahlen taugen als Fingerzeig, nicht als Garantie, und jedes Werkzeug muss sich an den eigenen, unsauberen Datenbeständen beweisen. Vor der Einführung klären Firmen, wo Datenbank und Modell laufen und wer auf die Daten zugreift, und kritische Auswertungen behalten eine menschliche Kontrolle. Prüfen Sie neue KI-Datenwerkzeuge deshalb an zwei Fragen zugleich: Wie gut trifft das System, und wo bleiben Ihre Daten dabei.

FAQ: OceanBase schlägt GPT und Claude im Data Agent Benchmark

Was ist der Data Agent Benchmark?

Der Data Agent Benchmark (DAB) ist ein internationaler Test des EPIC Data Lab der UC Berkeley und von Hasura PromptQL. Er prüft, wie gut KI-Datenagenten Fragen an echte Unternehmensdaten beantworten, mit 54 Aufgaben über neun Branchen und vier Datenbanktypen.

Was ist OceanBase?

OceanBase ist eine verteilte Datenbank, die im chinesischen Zahlungsdienst Alipay entstand, um dessen enorme Transaktionslast zu tragen. Sie gehört heute zum Alibaba-Ableger Ant Group, ist quelloffen und lässt sich selbst betreiben.

Warum schlägt OceanBase GPT und Claude im Test?

OceanBase koppelt das Sprachmodell GLM-5.2 mit der eigenen Abfrage- und Ausführungsschicht. Das Modell versteht die Frage, die Datenbank kennt Struktur und Schlüssel ihrer Daten. Diese Arbeitsteilung meistert unsaubere Firmendaten besser als ein reines Sprachmodell.

Was ist ein KI-Datenagent?

Ein KI-Datenagent beantwortet Fragen an Datenbanken in normaler Sprache. Er versteht die Frage, plant die nötigen Schritte, ruft die Daten ab und formuliert eine Antwort, ohne dass jemand von Hand eine Abfrage wie SQL schreiben muss.

Ist ein chinesischer Datenagent datenschutzkonform nutzbar?

Nur mit Prüfung. Läuft das Modell GLM-5.2 in einer Cloud, stellen sich Fragen zu DSGVO, Drittlandtransfer und behördlichem Zugriff. Der lokale, quelloffene Betrieb im eigenen Rechenzentrum entschärft das, setzt aber eine saubere technische und rechtliche Prüfung voraus.

Quellen

[1] Data Agent Benchmark (DAB), EPIC Data Lab der UC Berkeley und Hasura PromptQL: Bestenliste und Testbeschreibung. Offizielle DAB-Bestenliste

[2] Hasura PromptQL: „The Data Agent Benchmark“, Beschreibung von Aufgabentypen und Datenbank-Abdeckung. DAB-Benchmark-Studie

Mehr Newshunger?

4,5 21 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?