Mit Ember-1 bietet der US-Inferenzanbieter Fireworks AI eine sparsamere Fassung des chinesischen Sprachmodells Kimi K3 an. In den Tests von Fireworks braucht Ember-1 bei nahezu gleicher Qualität rund 40 % weniger Token und kostet pro Token so viel wie das Original.[1][2] Für Coding-Agenten sinkt so die Rechnung, die Gewichte des Ablegers hält Fireworks allerdings unter Verschluss.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Für die Frage nach 2 plus 3 verbrauchten Reasoning-Modelle im Schnitt 1.953 % mehr Token als herkömmliche Sprachmodelle, ergab eine Studie des Tencent AI Lab von Ende 2024.[4] In einem Beispiel erzeugte ein solches Modell 13 Lösungswege für die Grundschulaufgabe. Diesen Mehraufwand will Fireworks mit Ember-1 abbauen.

Das Wichtigste in Kürze

  • Ember-1 basiert auf Kimi K3 und spart in einem Kundentest von Fireworks 71 % der Reasoning-Token.
  • Pro Token kostet Ember-1 so viel wie Kimi K3: umgerechnet 2,61 € je Million Eingabe-Token und 13,05 € je Million Ausgabe-Token.
  • Die Gewichte veröffentlicht Fireworks nicht. Die Lizenz von Kimi K3 erlaubt solche geschlossenen Ableger.
  • Ember-1 läuft als Research Preview ausschließlich in der Cloud von Fireworks.

Warum werden Reasoning-Modelle so teuer?

Weiße Kunststoffkette mit hellblauem Verschluss und Preisschild: 40% kürzer
Kimi K3 rechnet interne Denkketten bis zu 90% der Token als teure Ausgabe-Token ab, die fünfmal mehr kosten als Eingabe-Token

Reasoning-Modelle schreiben vor jeder Antwort eine interne Denkkette. Beim offenen Modell Kimi K3 von Moonshot AI zählt Fireworks teils mehr als 90 % der erzeugten Token zu dieser Denkkette.[1] Abgerechnet werden diese Token als Ausgabe. Ausgabe-Token kosten bei Kimi K3 fünfmal so viel wie Eingabe-Token.

In Agenten-Schleifen wächst die Rechnung weiter. Der Agent schickt in jeder Runde die bisherigen Denkketten erneut ans Modell, der Kontext wächst dadurch nach der Rechnung von Fireworks ungefähr quadratisch mit der Zahl der Runden.[1] Dieser Effekt macht autonome KI-Agenten schnell teuer.

Was leistet Ember-1 in den Tests?

Fireworks trainierte Ember-1 in mehr als 50 Experimenten mit eigenen Daten auf kürzere Denkketten. Über sieben Benchmarks und den Produktivverkehr zweier Kunden hinweg wurden die Denkketten um 35 bis 50 % kürzer. Im A/B-Test eines Kunden sank der Token-Verbrauch pro Aufgabe um 39 %, die Punktzahl lag mit 0,753 knapp über den 0,751 des Originals.[1]

Ganz ohne Einbußen geht der Umbau nicht. Bei SWE-bench Verified erreicht Ember-1 92,2 % statt 93,2 % von Kimi K3 auf höchster Denkstufe, beim Agententest DeepSWE dagegen 75,2 % statt 66,4 %. Die Rangliste, in der Ember-1 das beste Verhältnis aus Kosten und Qualität erzielt, hat Fireworks erst in derselben Woche selbst eingeführt. Der Fall zeigt, warum der Preis pro Million Token wenig über die Kosten einer erledigten Aufgabe verrät.

Ember-1 gegen Kimi K3
Wie viel Fireworks bei den Denkketten spart und was die Tests zur Qualität zeigen
rund 40 %
weniger Token braucht Ember-1 im Schnitt der Tests von Fireworks
71,3 %
weniger Reasoning-Token im A/B-Test mit dem Produktivverkehr eines Kunden
über 90 %
der erzeugten Token entfallen bei Kimi K3 teils auf die interne Denkkette
13,05 €
kosten eine Million Ausgabe-Token bei beiden Modellen, umgerechnet aus 15 US-Dollar

Trefferquote in vier Benchmarks

SWE-bench Verified
Kimi K3
93,2 %
Ember-1
92,2 %
DeepSWE 1.1
Kimi K3
66,4 %
Ember-1
75,2 %
Terminal Bench 2.1
Kimi K3
80,9 %
Ember-1
82,0 %
SWE-Interact
Kimi K3
21,3 %
Ember-1
20,0 %

Kimi K3 jeweils auf der höchsten Denkstufe. Alle Werte stammen aus Messungen von Fireworks.

Was sollten Unternehmen vor dem Wechsel prüfen?

Die Kimi-K3-Lizenz erlaubt abgeleitete Modelle ausdrücklich und verlangt nicht, deren Gewichte offenzulegen.[3] Fireworks nutzt diesen Spielraum und bietet Ember-1 nur als Dienst an, zunächst als Research Preview. Solche Forschungsmodelle macht Fireworks zwei Wochen lang buchbar und entscheidet dann nach der Nachfrage über den Dauerbetrieb.[1] Kimi K3 selbst läuft auf eigener Hardware oder per Klick auf Amazon Bedrock. Ember-1 fehlen diese Ausweichwege.

Bei Coding-Agenten bestimmt die Länge der Denkkette die Rechnung, der Listenpreis pro Token sagt wenig. Ember-1 senkt die Kosten und bindet Unternehmen zugleich an einen einzigen Anbieter.

— Michael Dobler, Herausgeber Dr. Web

Hinzu kommt der Datenschutz: Prompts und Quellcode landen bei einem US-Anbieter. Europäische Firmen brauchen deshalb einen Auftragsverarbeitungsvertrag nach Art. 28 DSGVO und eine tragfähige Grundlage für die Übermittlung in die USA.

  • Lassen Sie Ember-1 zunächst parallel zu Kimi K3 laufen, denn der Rückgang bei SWE-bench zeigt, dass die Ersparnis nicht bei jeder Aufgabe ohne Qualitätsverlust gelingt.
  • Halten Sie einen Rückweg zu Kimi K3 oder einem anderen Modell bereit, falls Fireworks die Research Preview nicht verlängert.

Für Teams mit viel Agenten-Verkehr lohnt der Test schon jetzt, denn Ember-1 kostet pro Token nichts extra.

Quellen

[1] Fireworks AI: „Introducing Ember-1“, 23. September 2026

[2] Fireworks AI: „Ember-1 API & Playground“, Modellseite mit Preisen

[3] Moonshot AI auf Hugging Face: „Kimi K3 License“

[4] Xingyu Chen u. a., Tencent AI Lab: „Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs“, arXiv, 30. Dezember 2024

Mehr Newshunger?

4,6 20 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?