Kimi K3 erzeugt auf 16 Tensor-Chips von Google 709 Token pro Sekunde, auf 16 Nvidia GB200 dagegen nur 452. Das Tempo stammt aus einem handgeschriebenen Programm des US-Start-ups Inferact, nicht aus besserer Hardware. Für Firmen mit eigenen KI-Servern zählt deshalb der Code mehr als das Datenblatt.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Inferact veröffentlichte die Messung am 23. September, das chinesische KI-Portal QbitAI griff sie drei Tage später auf.[2] Hinter der Firma stehen die Entwickler der quelloffenen Inferenz-Software vLLM, darunter deren Initiator Woosuk Kwon. Getestet hat das Team das offene Sprachmodell des Pekinger Start-ups Moonshot AI, Moonshot selbst war an der Arbeit nicht beteiligt.[1]

Das Wichtigste in Kürze

  • Kimi K3 erreicht auf 16 Google-Chips vom Typ TPU v7 insgesamt 709 Token pro Sekunde, auf 16 Nvidia GB200 nur 452.
  • Den Vorsprung liefert ein sogenannter Megakernel, der alle 92 Schichten des Modells in einem einzigen Programm abarbeitet.
  • Für Nvidia nutzte Inferact die Standard-Konfiguration von vLLM, eine ebenso optimierte GPU-Version fehlt im Vergleich.
  • Der Code ist quelloffen, passt aber nur zu Kimi K3 und einer festen Anordnung von 16 Chips.

Woher kommen die 57 Prozent?

Zwei Chips nebeneinander: einer grau mit
TPU v7 und GB200 haben ähnliche Rechenleistung, doch bei Textgenerierung limitiert Speicherbandbreite die Performance stärker als Rechenkapazität

Die Rechenwerke erklären den Unterschied nicht. Auf dem Papier liegen TPU v7 und GB200 gleichauf, bei der Speicherbandbreite führt Nvidia sogar mit 8.000 zu 7.380 Gigabyte pro Sekunde.[1] Beim Erzeugen von Text bremst allerdings der Transport, nicht die Rechenleistung: Für jedes neue Token wandern die Gewichte des Modells aus dem Hauptspeicher in den schnellen Speicher auf dem Chip.

Die Pausen zwischen den Rechenschritten kosten Zeit. Üblich sind Hunderte kleine Programme pro Token, sogenannte Kernel, die nacheinander starten. Zwischen zwei Kerneln ruht der Speicherbus kurz. Inferact fasst alle 92 Schichten von Kimi K3 in einem einzigen Programm zusammen, geschrieben in Googles Chipsprache Pallas. Während Schicht 40 rechnet, lädt der Chip bereits die Gewichte für Schicht 41.

Der Chipspeicher erleichtert das auf der TPU. Jeder Rechenkern der TPU v7 verfügt über 64 Mebibyte Zwischenspeicher, den das Programm selbst verwaltet. Ein Rechenblock der GB200 hat dafür nur 256 Kilobyte, der Chip zählt 152 solcher Blöcke.[1] Einen Nebeneffekt hatte das Team nicht erwartet: Das Programm kompiliert in unter 90 Sekunden statt in mehr als 30 Minuten.

Warum dient ein chinesisches Modell als Messlatte?

Die Größe macht Kimi K3 zum Härtetest. Mit 2,8 Billionen Parametern belegt das Modell über 1,5 Terabyte Speicher, schon im August nutzte der Anbieter Wafer es für einen Kostenvergleich zwischen AMD und Nvidia. Solche Messungen setzen offene Gewichte voraus, bei den geschlossenen Modellen von OpenAI oder Anthropic sind sie für Außenstehende unmöglich.

Das Rateverfahren stammt ebenfalls aus China. Die Bestmarke erreicht Inferact nur mit spekulativem Decoding: Ein kleines Hilfsmodell sagt mehrere Token voraus, das große Modell prüft sie in einem Durchgang. Das zugrunde liegende Verfahren DSpark stellten Forscher von DeepSeek und der Peking-Universität im Sommer vor.[3] Ohne diese Hilfe schafft die TPU bei einer einzelnen Anfrage 249 Token pro Sekunde, die GB200 127.

Der Vergleich hat eine Schlagseite. Für Nvidia setzte Inferact die veröffentlichte Standard-Konfiguration von vLLM ein, keinen eigenen Megakernel.[1] Auf Grafikchips wirkt die Technik ebenso: Die Stanford-Gruppe Hazy Research nutzte schon im Mai 2025 mit einem Megakernel für ein kleines Llama-Modell 78 Prozent der Speicherbandbreite eines Nvidia H100, vLLM kam damals auf rund 50 Prozent.[4]

Die 57 Prozent belegen vor allem gute Handarbeit am Code. Vor dem Kauf teurer KI-Chips lohnt deshalb der Test mit dem eigenen Modell und der eigenen Software.

— Markus Seyfferth, Chefredakteur Dr. Web
Kimi K3: Googles TPU gegen Nvidias GB200
Gleiches Modell, gleiche Inferenz-Software vLLM, anderer Chip und handoptimierter Code
57 %
mehr Token pro Sekunde auf 16 TPU v7 als auf 16 GB200, mit spekulativem Decoding
7.380 zu 8.000
Gigabyte pro Sekunde Speicherbandbreite: Auf dem Datenblatt liegt Nvidia vorn
64 MiB
frei verwalteter Zwischenspeicher je TPU-Rechenkern, 256 KB je GB200-Rechenblock
90 Sek.
Kompilierzeit des Megakernels, zuvor dauerte das Übersetzen mehr als 30 Minuten
Erzeugte Token pro Sekunde
Kimi K3 mit spekulativem Decoding
16 × TPU v7 (Megakernel)709
16 × GB200 (vLLM-Standard)452
Kimi K3, eine einzelne Anfrage
16 × TPU v7 (Megakernel)249
16 × GB200 (vLLM-Standard)127
Qwen 3.8 27B mit spekulativem Decoding
4 × TPU v7 (Megakernel)1.515
4 × GB200 (vLLM-Standard)695

Balkenlänge relativ zum TPU-Wert je Vergleich. Für Nvidia nutzte Inferact die veröffentlichte Standard-Konfiguration ohne eigenen Megakernel.

Was folgt daraus für Unternehmen in der DACH-Region?

Die Chipwahl hängt am Modell. Inferacts Programm läuft nur mit Kimi K3 auf einer festen Anordnung von 16 TPUs, für jedes weitere Modell muss das Team neu optimieren.[1] Dieser Aufwand lohnt sich für Betreiber, die ein einzelnes Modell dauerhaft in großem Volumen ausliefern. Bei häufig wechselnden Modellen bleibt Nvidias Standard bequemer. Seit dem Frühjahr verkauft Google seine TPUs auch an fremde Rechenzentren.

Der Datenschutz spricht für den eigenen Betrieb. Über Moonshots Schnittstelle gehen Eingaben an einen chinesischen Anbieter. Für China fehlt ein Angemessenheitsbeschluss der EU-Kommission nach Artikel 45 DSGVO.[5] Läuft das offene Modell dagegen im eigenen Rechenzentrum oder bei einem Cloud-Anbieter mit EU-Standort, erhält Moonshot keine Nutzerdaten. Amazon bietet Kimi K3 bereits auf Bedrock an. IT-Verantwortliche vergleichen Angebote deshalb am besten nach Token pro Sekunde und Euro für das eigene Modell, nicht nach dem Datenblatt. Wie der Betrieb auf eigener Hardware gelingt, erklärt unser Ratgeber zu lokalen KI-Modellen.

Wie schnell läuft Kimi K3 auf Googles TPU?

Auf 16 Chips vom Typ TPU v7 Ironwood erzeugt Kimi K3 laut Inferact 709 Token pro Sekunde. 16 Nvidia GB200 kommen in der Standard-Konfiguration von vLLM auf 452 Token. Das entspricht einem Vorsprung von 57 Prozent, gemessen mit spekulativem Decoding.

Was ist ein Megakernel?

Ein Megakernel fasst alle Rechenschritte eines KI-Modells in einem einzigen Programm auf dem Chip zusammen. Dadurch entfallen die Pausen zwischen Hunderten Einzelprogrammen, und der Chip lädt die Gewichte der nächsten Schicht, während die aktuelle noch rechnet.

Ist Googles TPU grundsätzlich schneller als Nvidia?

Nein. Auf dem Datenblatt liegen TPU v7 und GB200 gleichauf, Nvidia hat sogar die höhere Speicherbandbreite. Der Vorsprung stammt aus Inferacts handoptimiertem Code, für Nvidia nutzte das Team die Standard-Konfiguration. Megakernel beschleunigen auch Grafikchips deutlich.

Quellen

[1] Inferact: „700 TPS on Kimi K3: A Case for TPU Megakernels“

[2] QbitAI (量子位) über Sina Finance: „谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架“

[3] arXiv: „DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation“

[4] Hazy Research (Stanford): „Look Ma, No Bubbles! Designing a Low-Latency Megakernel for Llama-1B“

[5] EUR-Lex: „Verordnung (EU) 2016/679 (Datenschutz-Grundverordnung)“

Mehr Newshunger?

4,3 16 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?