Zhipu hat sein Modell GLM-5.3-Flash unter die MIT-Lizenz gestellt und ruft dafür 0,13 Euro je Million Eingabe-Token auf. Das offene Modell verarbeitet Text, Bild und Video nativ, fasst rund eine Million Token Kontext und kostet ein Zehntel des hauseigenen Spitzenmodells. Für europäische Teams verschiebt der Preis die Rechnung zwischen eigenem Server und fremder Cloud.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

GLM-5.3-Flash lief eine Woche lang anonym als „Ox Alpha“ auf den Entwickler-Plattformen OpenRouter und OpenCode, bevor Zhipu am 26. August die Identität bestätigte. Hinter dem Tarnnamen steckt ein Sprachmodell mit 320 Milliarden Parametern, von denen je Anfrage nur 18 Milliarden rechnen. Genau diese Bauweise erklärt den niedrigen Preis.

Das Wichtigste in Kürze

  • Zhipu stellt GLM-5.3-Flash unter die MIT-Lizenz, die Gewichte liegen offen auf Hugging Face.
  • Das Modell verarbeitet Text, Bild und Video nativ und fasst rund eine Million Token Kontext.
  • Der Preis liegt mit 0,13 Euro je Million Eingabe-Token bei einem Zehntel des Spitzenmodells GLM-5.3.
  • Der unabhängige Artificial-Analysis-Index bewertet die Leistung im Mittelfeld, nicht an der Spitze.

Warum ist GLM-5.3-Flash so günstig?

Geöffnetes Vorhängeschloss mit Anhänger (beschriftet 1/10) auf weißem Grund
GLM-5.3-Flash nutzt Mixture-of-Experts-Architektur: Von 320 Milliarden Parametern aktiviert das Modell nur 18 Milliarden pro Token, was Rechenkosten senkt

Die Antwort steckt in der Architektur. GLM-5.3-Flash ist ein Mixture-of-Experts-Modell und aktiviert von 320 Milliarden Parametern je Token nur 18 Milliarden, also acht von 288 Experten. Die Rechenkosten hängen an den aktiven Parametern, nicht an der Gesamtzahl, weshalb das Modell trotz seiner Größe billig im Betrieb bleibt.

Ein hybrides Aufmerksamkeitsverfahren aus linearer und dünn besetzter Attention senkt zusätzlich den Speicherbedarf beim langen Kontext. Zhipu ruft laut Preisliste 0,13 Euro je Million Eingabe-Token und 0,44 Euro je Million Ausgabe-Token auf, umgerechnet zum Kurs 0,87 am 27. August 2026.[1] Das Spitzenmodell GLM-5.3 kostet das Zehnfache.

Was heißt offen bei diesem KI-Modell?

Offen meint hier die Gewichte, nicht nur eine Schnittstelle. Zhipu veröffentlicht GLM-5.3-Flash unter der MIT-Lizenz auf Hugging Face, der freizügigsten Open-Source-Lizenz überhaupt, sodass Firmen das Modell herunterladen, anpassen und kommerziell einsetzen dürfen.[2]

Der Haken steckt in der Hardware. Der FP8-Datensatz umfasst rund 306 Gigabyte, ein produktiver Betrieb verlangt einen Knoten mit mindestens acht Hopper-GPUs. Damit bleibt der Eigenbetrieb größeren Häusern vorbehalten, während kleinere Teams weiter über die Programmierschnittstelle zugreifen. Dieselbe Öffnung zeigte zuletzt schon Alibaba, dessen Videomodell Wan 3.0 den offenen Weg geht.

GLM-5.3-Flash in Zahlen

Zhipus offenes KI-Modell im Überblick, alle Beträge in Euro (Kurs 0,87, Stichtag 27.08.2026)

0,13 €
je Million Eingabe-Token, rund ein Zehntel des Spitzenmodells GLM-5.3 (dort etwa 1,31 €)
320 / 18 Mrd.
Parameter gesamt, davon nur 18 Milliarden je Anfrage aktiv (Mixture of Experts)
1 Mio. Token
Kontextfenster, dazu native Verarbeitung von Text, Bild und Video
MIT-Lizenz
offene Gewichte auf Hugging Face, für den Eigenbetrieb rund 306 GB und mindestens acht Hopper-GPUs

Unabhängige Einordnung: Der Artificial-Analysis-Intelligence-Index bewertet GLM-5.3-Flash mit 57 Punkten im Mittelfeld. Auf Zhipus eigenem Coding-Benchmark stehen 29,0 Punkte gegen 29,5 für Claude Opus 4.8.

Ein offenes Modell zum Zehntel des Preises verschiebt nicht die Rangliste der Benchmarks, sondern die Kostenrechnung jeder KI-Abteilung. Die eigentliche Entscheidung lautet künftig eigener Server oder fremde Cloud, nicht mehr teuer oder billig.

— Markus Seyfferth, Chefredakteur Dr. Web

Was bedeutet das für europäische Anbieter?

Für deutschsprachige Entscheider zählt weniger der Benchmark als die Datenhoheit. Ein selbst gehostetes Modell verlässt das eigene Rechenzentrum nicht, was die DSGVO-Prüfung deutlich entspannt und den Weg zur lokalen KI im eigenen Haus ebnet. Zugleich steht Zhipu seit Januar 2025 auf der US-Entity-List. Die offene Programmierschnittstelle bindet Nutzer zudem an die Pflichten des EU AI Act für Anbieter allgemeiner KI-Modelle.

Bei der reinen Leistung ist Vorsicht angebracht. Zhipu vermeldet auf dem eigenen Coding-Benchmark 29,0 Punkte gegen 29,5 für Claude Opus 4.8, doch der unabhängige Artificial-Analysis-Index ordnet das Modell mit 57 Punkten ins Mittelfeld ein. Dieselbe Preislogik trieb schon DeepSeek in die Bücher und drückt inzwischen die Bewertung der chinesischen KI-Labore.

Vor dem nächsten Jahresvertrag für eine teure Frontier-API gehört GLM-5.3-Flash als Preisanker auf den Tisch, geprüft an den eigenen Anwendungsfällen gegen ein offenes Modell. Vertiefende Orientierung dazu liefert der Ratgeber zur generativen Suche.

FAQ: GLM-5.3-Flash von Zhipu

Ist GLM-5.3-Flash wirklich Open Source?

Ja, Zhipu veröffentlicht die Gewichte von GLM-5.3-Flash unter der MIT-Lizenz auf Hugging Face, der freizügigsten Open-Source-Lizenz. Unternehmen dürfen das Modell herunterladen, anpassen und kommerziell einsetzen. Offen sind hier die Gewichte selbst, nicht nur eine Programmierschnittstelle.

Kann ich GLM-5.3-Flash selbst hosten?

Technisch ja, der Aufwand ist aber hoch. Der FP8-Datensatz umfasst rund 306 Gigabyte, ein produktiver Betrieb verlangt einen Server mit mindestens acht GPUs der Hopper-Generation oder neuer. Für kleinere Teams bleibt der Zugriff über die Programmierschnittstelle meist praktikabler.

Ist GLM-5.3-Flash so stark wie Claude Opus 4.8?

Das lässt sich nicht bestätigen. Zhipu meldet auf dem eigenen Coding-Benchmark 29,0 Punkte gegen 29,5 für Claude Opus 4.8, doch diese Werte stammen vom Anbieter selbst. Der unabhängige Artificial-Analysis-Index ordnet GLM-5.3-Flash mit 57 Punkten ins Mittelfeld ein, nicht an die Spitze.

Was kostet GLM-5.3-Flash über die API?

Zhipu ruft laut Preisliste 0,13 Euro je Million Eingabe-Token und 0,44 Euro je Million Ausgabe-Token auf, umgerechnet zum Kurs 0,87 am 27. August 2026. Das ist rund ein Zehntel des Preises für das hauseigene Spitzenmodell GLM-5.3.

Quellen

[1] Z.ai (Zhipu): „GLM-5.3-Flash“

[2] Hugging Face: „zai-org/GLM-5.3-Flash“

Mehr Newshunger?

4,4 10 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?