Alibabas Sicherheitsmodell XekRung steht an der Spitze der CyberGym-Rangliste der University of California in Berkeley. Mit 27 Milliarden Parametern löste das Modell 88,9 Prozent der Testaufgaben und lag damit vor Googles Gemini 3.8 Flash Cyber und OpenAIs GPT-5.5-Cyber. Für Sicherheitsteams in der DACH-Region zählt vor allem die Frage, ob XekRung je auf eigenen Servern läuft.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Den ersten Platz der Modellwertung belegt XekRung seit dem 13. September, bekannt machte ihn das chinesische Technikportal Kuai Keji am 28. September.[1] „Künstliche Intelligenz hat die Erkennungsrate in der Systemsicherheit und die Trefferquote bei Sicherheitslücken stark erhöht“, sagt Huang Longtao, Leiter des Security AGI Lab der Alibaba Group. Wie viel der Spitzenplatz aussagt, hängt allerdings an den Details des Tests.

Das Wichtigste in Kürze

  • XekRung-1.5-27B-Preview baut auf Alibabas offenem Modell Qwen3.8-27B auf und hebt dessen CyberGym-Wert von 54,5 auf 88,9 Prozent.
  • CyberGym prüft, ob ein Modell aus Lückenbeschreibung und ungepatchtem Code einen funktionierenden Angriffsnachweis baut.
  • In der Agentenwertung stützen sich die elf besten Einträge auf chinesische Modelle von DeepSeek, Zhipu und Alibaba.
  • Die Gewichte hat Alibaba nicht veröffentlicht, für die Prüfung von eigenem Quellcode kommt XekRung deshalb vorerst nicht infrage.

Was misst CyberGym eigentlich?

Eine große und eine kleine Lupe, die eine Goldmedaille mit einem blauen Band hält
Forscherteam um Dawn Song testet KI-Modelle mit 1.507 historischen Sicherheitslücken aus Open-Source-Projekten zur Bewertung ihrer Exploitfähigkeit

Bekannte Lücken bilden den Kern des Tests. Das Team um die Berkeley-Informatikerin Dawn Song sammelte 1.507 historische Schwachstellen aus 188 Open-Source-Projekten, aufgespürt von Googles Dauer-Fuzzing-Projekt OSS-Fuzz.[2] Das Modell erhält eine Beschreibung der Lücke und den Code vor dem Patch. Als gelöst gilt eine Aufgabe erst, sobald der eingereichte Proof of Concept die Lücke tatsächlich auslöst.

Das Kleingedruckte relativiert die Rangfolge. Die Teams werten ihre Läufe selbst aus. Die Berkeley-Forscher schreiben auf der Rangliste, kleine Abstände spiegelten nicht zwingend echte Leistungsunterschiede.[2] XekRung lief zudem in Alibabas eigener Testumgebung, mit bis zu acht Stunden und 3.000 Arbeitsschritten pro Aufgabe.[3] Zwischen Platz eins und Gemini 3.8 Flash Cyber liegen 2,6 Prozentpunkte. Dass KI-Labore gezielt auf bekannte Tests hin optimieren könnten, diskutiert die Branche seit Monaten, etwa am Beispiel des Pelikan-Benchmarks.

Wie holt Alibaba so viel aus 27 Milliarden Parametern?

Das Nachtraining macht den Unterschied. Das Basismodell Qwen3.8-27B kam im selben Test auf 54,5 Prozent, XekRung erreicht 34,4 Prozentpunkte mehr.[3] Alibaba trainierte das Modell zunächst mit anonymisierten Abläufen aus eigenen Angriffs- und Verteidigungseinsätzen, danach per Reinforcement Learning. Als Belohnung dienten überprüfbare Signale: ob der Code kompiliert und ob der Nachweis das Zielprogramm tatsächlich zum Absturz bringt. Gescheiterte Versuche baute das Team zu Lernpaaren aus Fehlerursache und Korrektur um. CyberGym-Aufgaben enthielten die Trainingsdaten nach Alibabas Angaben nicht.

Die Größe stellt Alibaba besonders heraus. XekRung komme mit einem Siebenundzwanzigstel bis einem Dreihundertsiebzigstel der Parameter von GPT-5.5-Cyber oder Claude Mythos aus.[1] Prüfen lässt sich dieser Vergleich nicht, weil OpenAI und Anthropic die Größe ihrer Modelle nicht offenlegen. Neu ist der Ansatz kleiner Spezialmodelle nicht: Cisco stellte im Juli mit Antares winzige offene Modelle vor, die Lücken im Quellcode lokalisieren. Das Basismodell von XekRung läuft sogar auf einer Heim-Grafikkarte.

Ein 27-Milliarden-Modell an der Spitze heißt: Die Lückensuche wird billig, für Verteidiger wie für Angreifer. Brauchbar wird XekRung für Firmen erst, sobald Alibaba die Gewichte freigibt.

— Michael Dobler, Herausgeber Dr. Web
XekRung im CyberGym-Test
Alibabas Sicherheitsmodell führt die Modellwertung der University of California in Berkeley an
88,9 %
der Testaufgaben löste XekRung mit einem funktionierenden Angriffsnachweis
27 Mrd.
Parameter: klein genug für den Betrieb auf einem einzelnen Server
+34,4 Pkt.
gegenüber dem Basismodell Qwen3.8-27B, das auf 54,5 % kam
1.507
bekannte Sicherheitslücken aus 188 Open-Source-Projekten umfasst der Test
Modellwertung CyberGym, Erfolgsquote in Prozent
XekRung-1.5-27B-Preview (Alibaba)88,9 %
Gemini 3.8 Flash Cyber (Google)86,3 %
GPT-5.5-Cyber (OpenAI)85,6 %
GLM-5.3 (Zhipu)84,5 %
DeepSeek-V4-Pro (DeepSeek)83,3 %
Claude Mythos Preview (Anthropic)83,1 %

Stand der Rangliste: 28. September 2026. Die Teams werten ihre Läufe selbst aus und reichen die Ergebnisse ein.

Warum dominieren chinesische Modelle die Agentenwertung?

In der Agentenwertung fällt der chinesische Vorsprung noch größer aus. Dort treten ganze Systeme mit Werkzeugen und laufenden Testumgebungen an, die besten erreichen über 99 Prozent.[2] Alle elf Spitzenreiter setzen auf Modelle von DeepSeek, Zhipu oder Alibaba, darunter Einträge von Huawei Cloud, den Sicherheitsanbietern Sangfor und NSFOCUS sowie dem Bezahldienst Alipay. Zhipu hatte mit GLM-5.3 im August bereits 84,5 Prozent in der Modellwertung gemeldet. Ein naheliegender Grund sind die offenen Gewichte: Sicherheitsfirmen trainieren frei verfügbare Modelle nach und betreiben sie auf eigener Hardware.

Was bedeutet das für Sicherheitsteams in der DACH-Region?

Der Zeitdruck wächst. Seit dem 11. September 2026 gelten die Meldepflichten des Cyber Resilience Act: Hersteller melden aktiv ausgenutzte Schwachstellen binnen 24 Stunden als Frühwarnung und binnen 72 Stunden ausführlich an die ENISA und das zuständige nationale CSIRT.[4] Modelle wie XekRung verkürzen die Zeit, bis aus einer Lückenbeschreibung ein funktionierender Angriff wird. Sicherheitsteams sollten ihre Patch-Prozesse und Meldewege deshalb jetzt auf diese Fristen ausrichten.

Der Quellcode gehört dabei nicht in fremde Hände. Alibaba kündigt zwar an, die Technik auf verschiedenen Wegen auch externen Nutzern anzubieten, nennt aber weder Form noch Termin.[1] Bei einem reinen Cloud-Dienst müssten Firmen ihren Code zur Analyse an einen chinesischen Anbieter schicken, für Geschäftsgeheimnisse ein schwer vertretbares Risiko. Bis zu einer Freigabe der Gewichte bleiben offene Modelle auf eigener Hardware die sicherste Wahl. Als Cloud-Alternative mit Zugang für EU-Kunden bietet OpenAI inzwischen GPT-5.5-Cyber an. Welche Schutzmaßnahmen kleine und mittlere Firmen ohnehin brauchen, fassen unsere Cybersecurity-Grundlagen zusammen.

Was ist XekRung?

XekRung ist ein KI-Modell des Security AGI Lab der Alibaba Group für die Suche nach Sicherheitslücken. Die Vorabversion XekRung-1.5-27B-Preview hat 27 Milliarden Parameter und baut auf dem offenen Alibaba-Modell Qwen3.8-27B auf.

Was misst der CyberGym-Test?

CyberGym stammt von Forschern der University of California in Berkeley. Ein Modell erhält die Beschreibung einer von 1.507 bekannten Lücken und den ungepatchten Code. Gelöst ist die Aufgabe, sobald der eingereichte Nachweis die Lücke tatsächlich auslöst.

Können Unternehmen XekRung selbst einsetzen?

Bisher nicht. Alibaba hat die Gewichte nicht veröffentlicht und nennt für ein Angebot an externe Nutzer weder Form noch Termin. Für die Prüfung von eigenem Quellcode bleiben offene Modelle auf eigener Hardware die sicherere Wahl.

Quellen

[1] Kuai Keji (快科技): „中国模型首登CyberGym榜首!阿里自研AI安全模型实现“小强”突破“

[2] UC Berkeley RDI: „CyberGym: Evaluating AI Agents‘ Real-World Cybersecurity Capabilities at Scale (Leaderboard)“

[3] Alibaba Security: „XeKRung Model on CyberGym“

[4] EUR-Lex: „Verordnung (EU) 2024/2847 (Cyber Resilience Act)“

Mehr Newshunger?

4,3 14 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?