Eine der größten Banken Chinas hat fast 10.000 KI-Beschleuniger unter eine einzige Steuerung gestellt und ihre GPU-Auslastung von 35 auf über 60 Prozent gehoben. Die Kosten je Million Token sanken um mehr als 60 Prozent. Der Umbau lief nicht über neue Hardware, sondern über Software, die brachliegende Rechenzeit sichtbar macht.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenBei der China Merchants Bank stand mehr als die Hälfte der teuren KI-Beschleuniger die meiste Zeit still. Genau diese Lücke schließt die Bank jetzt mit einer gemeinsamen Steuerungsebene auf Kubernetes, ausgezeichnet auf der KubeCon in Shanghai. Für jedes Unternehmen, das eigene Modelle betreibt, steckt darin eine übertragbare Rechnung.
Das Wichtigste in Kürze
- Die China Merchants Bank teilt rund 10.000 heterogene Beschleunigerkarten zwischen Training, Feinabstimmung und Inferenz.
- Die durchschnittliche Auslastung stieg von 35 auf über 60 Prozent, die Inferenzkosten je Million Token sanken um mehr als 60 Prozent.
- Möglich macht das eine Kubernetes-Steuerungsebene aus Kueue, KEDA, HAMi und Fluid, nicht ein zusätzlicher Chipeinkauf.
- Die Cloud Native Computing Foundation kürte den Fall zum Sieger ihres End-User-Wettbewerbs auf der KubeCon China 2026.
Was hat die China Merchants Bank umgestellt?

Die Bank hat ihre verstreuten KI-Server zu einem einzigen Pool zusammengefasst und zentral verteilt. Training, Feinabstimmung und laufende Inferenz greifen jetzt auf denselben Bestand aus knapp 10.000 Beschleunigerkarten zu, statt jede Abteilung eigene Karten reservieren zu lassen.[1]
Das Gerüst dahinter ist Kubernetes. Kueue reiht Trainingsjobs in eine Warteschlange, KEDA und Prometheus skalieren die Online-Inferenz nach Last, HAMi zerlegt einzelne Karten fein zwischen Training und Inferenz, und Fluid beschleunigt den Zugriff auf Daten und Modelle.[2] Das eigene Framework Twinkle lässt fünf LoRA-Mandanten eine Basisinstanz teilen und senkt deren Kartenbedarf um 80 Prozent.
Warum lag die halbe Rechenleistung brach?
Fragmentierung ist der Grund. In vielen Rechenzentren gehört jede Karte einem Team, einem Modell oder einem Projekt, und außerhalb der Stoßzeiten läuft sie leer. Eine Auslastung von 35 Prozent heißt, dass fast zwei Drittel der Investition ungenutzt Strom ziehen.
Eine gemeinsame Steuerung dreht dieses Verhältnis um. Freie Fenster einer Inferenzkarte füllt die Plattform mit wartenden Trainingsjobs, und mehrere kleine Mandanten teilen sich eine Karte, statt je eine eigene zu belegen. Genau dort entsteht die zweite Zahl: Eine fast verdoppelte Auslastung verteilt dieselben Modelle auf weniger Silizium und drückt so die Kosten je Million Token.
Der teuerste Beschleuniger ist der, der wartet. Bevor Sie neue Karten kaufen, holen Sie die freie Zeit aus den vorhandenen.
— Markus Seyfferth, Chefredakteur Dr. Web
Was bedeutet das für Unternehmen im DACH-Raum?
Der Hebel liegt in der Organisation, nicht im Einkauf. In Europa treffen knappe Beschleuniger auf lange Lieferzeiten und hohe Strompreise, also zählt jede Leerstunde doppelt. Ob ein Betrieb eigene Karten braucht oder besser mietet, klärt unser Beitrag zur Frage nach dem eigenen KI-Rechenzentrum im Mittelstand.
Aus dem Fall der China Merchants Bank lassen sich drei Schritte ableiten:
- Messen Sie die echte Auslastung Ihrer Beschleuniger über eine ganze Woche, nicht im Spitzenmoment.
- Legen Sie Training und Inferenz auf einen gemeinsamen, planbaren Pool statt auf reservierte Einzelkarten.
- Rechnen Sie gegen, ob gemietete Inferenz günstiger liegt, etwa über Hetzners europäische Inferenz-API.
Der Umbau zeigt zugleich ein Muster: Chinas Anbieter setzen auf Effizienz, weil ihnen der Zugang zu Spitzenchips fehlt, sichtbar auch bei DeepSeeks Rechenzentrum mit heimischen Chips. Wie sich der Markt insgesamt sortiert, sammelt unsere Übersicht zur künstlichen Intelligenz.
Was die China Merchants Bank mit einer Kubernetes-Plattform aus ihrem Rechenpark herausholte.
Woraus die Steuerung besteht
Quellen
[1] Cloud Native Computing Foundation: „China Merchants Bank Wins CNCF End User Case Study Contest for Unifying AI Training and Inference on Kubernetes“
[2] InfoQ: „招商银行统一近万张AI加速卡:利用率从35%提至60%+、每百万Token推理成本降低60%“
Mehr Newshunger?
- KI-Inferenz zur Miete: IBM baut Together AI einen Cluster für 209 Millionen Euro
- Huawei umgeht den HBM-Engpass: schneller Speicher senkt die Kosten der KI-Inferenz
- Inferenzkosten für Kimi K3: AMDs MI355X liefert mehr Token je Euro als Nvidias B300
- Mesh LLM: Wie ein großes KI-Modell über mehrere eigene Rechner verteilt läuft
- Welche 15 Rechenzentren dominieren Deutschland? Die große Hitparade 2026