Ant Group stellte am 30. September Ling-3.1-flash vor, ein Sprachmodell mit rund 560 Milliarden Parametern. Das Technikportal IT Home meldete den Start noch am selben Tag.[1] Die offenen Gewichte will der Konzern erst freigeben, sobald aus dem Gratistest ein Bezahldienst geworden ist.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenFür Unternehmen in der EU verändert Ling-3.1-flash die Rechnung beim Selbstbetrieb. Der Vorgänger passte noch auf eine einzelne Grafikkarte, die Gewichte des neuen Modells füllen einen Server mit acht Nvidia H100 fast allein.
Das Wichtigste in Kürze
- Ling-3.1-flash zählt rund 560 Milliarden Parameter, davon rechnen je Token etwa 25 Milliarden.
- Das Kontextfenster fasst bis zu eine Million Token, im zweiwöchigen Gratistest stehen 256.000 Token bereit.
- Offene Gewichte plant Ant erst nach dem Wechsel zum Bezahldienst, einen Termin nennt der Konzern nicht.
- Für den Betrieb im eigenen Rechenzentrum bleibt vorerst Ling-3.0-flash mit 124 Milliarden Parametern und MIT-Lizenz.
Was hat Ant Group angekündigt?

Ling-3.1-flash stammt aus Ants Modellfamilie Bailing und folgt dem Mixture-of-Experts-Prinzip: Pro Token rechnet das Modell nur mit einem Teil seines Netzes, hier mit rund 25 von 560 Milliarden Parametern. Optimiert hat das Team das Modell nach eigenen Angaben für Agenten, Suche, Büroarbeit und Softwareentwicklung, zusätzlich für Medizin, Finanzen und Materialforschung.[1] Die Finanzbranche bedient Ant bereits mit einem eigenen Modell, das Banken selbst betreiben können.
Die Freigabe koppelt Ant an den Bezahlstart. Zwei Wochen lang testen Nutzer das Modell kostenlos, wegen der Servicekosten allerdings mit höchstens 256.000 Token Kontext. Mit dem Wechsel zum Bezahldienst will Ant das volle Fenster von einer Million Token freischalten und das Modell gleichzeitig als Open Source veröffentlichen.[1] Herunterladbare Gewichte, eine Lizenz und eine Modellkarte fehlen bislang.
Welche Hardware braucht Ling-3.1-flash?
Über die Hardware entscheidet die Gesamtzahl der Parameter, nicht die Zahl der aktiven. Alle 560 Milliarden Gewichte müssen im Grafikspeicher liegen, auch wenn pro Token nur ein Bruchteil davon zum Einsatz kommt. Bei acht Bit je Parameter belegen die Gewichte rund 560 Gigabyte. Ein Server mit acht Nvidia H100 bietet 640 Gigabyte, für den Zwischenspeicher langer Kontexte bleibt da kaum Platz.
Beim Vorgänger fiel die Rechnung deutlich kleiner aus. Ling-3.0-flash kommt auf 124 Milliarden Parameter, davon 5,1 Milliarden aktiv, und steht seit Anfang August unter MIT-Lizenz auf Hugging Face.[2] In acht Bit passen die Gewichte auf eine einzelne Nvidia H200 mit 141 Gigabyte. Auf derselben Basis veröffentlichte Ant im September das multimodale Ling-3.0-flash-VL.
Ant gibt das Modell erst frei, nachdem die ersten Kunden dafür bezahlt haben. Bis dahin bleibt Ling-3.1-flash ein Mietdienst auf chinesischen Servern, an dem für viele deutsche Firmen die Erprobung schon endet.
Markus Seyfferth, Chefredakteur Dr. Web
Was bedeutet das für Unternehmen in der EU?
Ant folgt einem Muster chinesischer Anbieter. Alibaba versprach im Juli für Qwen 3.8 offene Gewichte ohne Termin, Meituan bietet LongCat-2.5-Preview bislang nur als Mietdienst an. Bei Ling-3.0-flash lieferte Ant die Gewichte dagegen unter MIT-Lizenz.
Bis zur Freigabe läuft jeder Test über Ants eigene Dienste. Personenbezogene Daten landen damit in China, einem Land ohne Angemessenheitsbeschluss der EU-Kommission. Wie schnell Aufsichtsbehörden eingreifen, zeigte Italiens Datenschutzbehörde Garante, die im Januar 2025 DeepSeek in Italien sperrte.
Testen Sie Ling-3.1-flash im Gratiszeitraum deshalb nur mit Daten ohne Personenbezug, etwa mit öffentlichen Handbüchern oder synthetischen Beispielen. Für Anwendungen mit Kunden- oder Personaldaten bleibt Ling-3.0-flash auf eigener Hardware die naheliegende Wahl, Hinweise zur Ausstattung liefert ein Praxisleitfaden für den lokalen Betrieb. Budget für das große Modell planen Sie am besten erst ein, sobald Ant Lizenz und Gewichte tatsächlich veröffentlicht hat.
Quellen
[1] IT Home: „Ant Bailing veröffentlicht Ling-3.1-flash: rund 560B Gesamtparameter, 25B aktive Parameter“ (chinesisch)
[2] inclusionAI (Ant Group): „Ling-3.0-flash“, Modellkarte auf Hugging Face
Mehr Newshunger?
- Ant Group öffnet sein erstes multimodales KI-Modell Ling-3.0-flash-VL
- Ant Group öffnet ein Finanz-KI-Modell, das Banken selbst betreiben können
- Ant Group baut das Betriebssystem für autonome KI-Agenten
- Qwen Office für den ganzen Konzern: Ant Group hält den KI-Büroagenten im eigenen Netz
- LongCat-2.5-Preview: Meituans KI-Modell versteht Bilder, die offenen Gewichte fehlen noch
- GLM-5.3-Flash: Zhipu veröffentlicht ein multimodales KI-Modell zum Zehntel des Preises
- Alle News und Ratgeber zur künstlichen Intelligenz
