Ant Group stellte am 30. September Ling-3.1-flash vor, ein Sprachmodell mit rund 560 Milliarden Parametern. Das Technikportal IT Home meldete den Start noch am selben Tag.[1] Die offenen Gewichte will der Konzern erst freigeben, sobald aus dem Gratistest ein Bezahldienst geworden ist.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Für Unternehmen in der EU verändert Ling-3.1-flash die Rechnung beim Selbstbetrieb. Der Vorgänger passte noch auf eine einzelne Grafikkarte, die Gewichte des neuen Modells füllen einen Server mit acht Nvidia H100 fast allein.

Das Wichtigste in Kürze

  • Ling-3.1-flash zählt rund 560 Milliarden Parameter, davon rechnen je Token etwa 25 Milliarden.
  • Das Kontextfenster fasst bis zu eine Million Token, im zweiwöchigen Gratistest stehen 256.000 Token bereit.
  • Offene Gewichte plant Ant erst nach dem Wechsel zum Bezahldienst, einen Termin nennt der Konzern nicht.
  • Für den Betrieb im eigenen Rechenzentrum bleibt vorerst Ling-3.0-flash mit 124 Milliarden Parametern und MIT-Lizenz.

Was hat Ant Group angekündigt?

Servergehäuse mit blauem Vorhängeschloss und beschriftetem Etikett auf weißem Hintergrund
Ling-3.1-flash von Ant nutzt Mixture-of-Experts: Pro Token nur 25 von 560 Milliarden Parametern aktiv. Optimiert für Agenten, Suche, Büroarbeit und Softwareentwicklung

Ling-3.1-flash stammt aus Ants Modellfamilie Bailing und folgt dem Mixture-of-Experts-Prinzip: Pro Token rechnet das Modell nur mit einem Teil seines Netzes, hier mit rund 25 von 560 Milliarden Parametern. Optimiert hat das Team das Modell nach eigenen Angaben für Agenten, Suche, Büroarbeit und Softwareentwicklung, zusätzlich für Medizin, Finanzen und Materialforschung.[1] Die Finanzbranche bedient Ant bereits mit einem eigenen Modell, das Banken selbst betreiben können.

Die Freigabe koppelt Ant an den Bezahlstart. Zwei Wochen lang testen Nutzer das Modell kostenlos, wegen der Servicekosten allerdings mit höchstens 256.000 Token Kontext. Mit dem Wechsel zum Bezahldienst will Ant das volle Fenster von einer Million Token freischalten und das Modell gleichzeitig als Open Source veröffentlichen.[1] Herunterladbare Gewichte, eine Lizenz und eine Modellkarte fehlen bislang.

Welche Hardware braucht Ling-3.1-flash?

Über die Hardware entscheidet die Gesamtzahl der Parameter, nicht die Zahl der aktiven. Alle 560 Milliarden Gewichte müssen im Grafikspeicher liegen, auch wenn pro Token nur ein Bruchteil davon zum Einsatz kommt. Bei acht Bit je Parameter belegen die Gewichte rund 560 Gigabyte. Ein Server mit acht Nvidia H100 bietet 640 Gigabyte, für den Zwischenspeicher langer Kontexte bleibt da kaum Platz.

Beim Vorgänger fiel die Rechnung deutlich kleiner aus. Ling-3.0-flash kommt auf 124 Milliarden Parameter, davon 5,1 Milliarden aktiv, und steht seit Anfang August unter MIT-Lizenz auf Hugging Face.[2] In acht Bit passen die Gewichte auf eine einzelne Nvidia H200 mit 141 Gigabyte. Auf derselben Basis veröffentlichte Ant im September das multimodale Ling-3.0-flash-VL.

Ant gibt das Modell erst frei, nachdem die ersten Kunden dafür bezahlt haben. Bis dahin bleibt Ling-3.1-flash ein Mietdienst auf chinesischen Servern, an dem für viele deutsche Firmen die Erprobung schon endet.

Markus Seyfferth, Chefredakteur Dr. Web
Zitat teilen
Ling-3.1-flash: groß angekündigt, noch nicht offen
Eckdaten des neuen Ant-Modells und der Speicherbedarf im Vergleich zum Vorgänger
560 Mrd.
Parameter zählt Ling-3.1-flash, rund 4,5-mal so viele wie Ling-3.0-flash
25 Mrd.
Parameter rechnen je Token, der Rest des Netzes ruht
1 Mio.
Token Kontext plant Ant, im Gratistest sind 256.000 freigeschaltet
2 Wochen
dauert der Gratistest, offene Gewichte folgen erst mit dem Bezahldienst

Passen die Gewichte auf Ihre Hardware?

Speicherbedarf der Gewichte bei acht Bit je Parameter, verglichen mit dem Grafikspeicher gängiger Nvidia-Konfigurationen
Ling-3.0-flash
124 GB
Eine Nvidia H200
141 GB
Ling-3.1-flash
560 GB
Server mit acht Nvidia H100
640 GB

Was bedeutet das für Unternehmen in der EU?

Ant folgt einem Muster chinesischer Anbieter. Alibaba versprach im Juli für Qwen 3.8 offene Gewichte ohne Termin, Meituan bietet LongCat-2.5-Preview bislang nur als Mietdienst an. Bei Ling-3.0-flash lieferte Ant die Gewichte dagegen unter MIT-Lizenz.

Bis zur Freigabe läuft jeder Test über Ants eigene Dienste. Personenbezogene Daten landen damit in China, einem Land ohne Angemessenheitsbeschluss der EU-Kommission. Wie schnell Aufsichtsbehörden eingreifen, zeigte Italiens Datenschutzbehörde Garante, die im Januar 2025 DeepSeek in Italien sperrte.

Testen Sie Ling-3.1-flash im Gratiszeitraum deshalb nur mit Daten ohne Personenbezug, etwa mit öffentlichen Handbüchern oder synthetischen Beispielen. Für Anwendungen mit Kunden- oder Personaldaten bleibt Ling-3.0-flash auf eigener Hardware die naheliegende Wahl, Hinweise zur Ausstattung liefert ein Praxisleitfaden für den lokalen Betrieb. Budget für das große Modell planen Sie am besten erst ein, sobald Ant Lizenz und Gewichte tatsächlich veröffentlicht hat.

Quellen

[1] IT Home: „Ant Bailing veröffentlicht Ling-3.1-flash: rund 560B Gesamtparameter, 25B aktive Parameter“ (chinesisch)

[2] inclusionAI (Ant Group): „Ling-3.0-flash“, Modellkarte auf Hugging Face

Mehr Newshunger?

4,6 23 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?