Fünf Leute reden gleichzeitig, doch die automatische Transkription liefert nur Wortsalat: An diesem Punkt scheitert KI-Spracherkennung bis heute. Xiaomi hat dafür jetzt ein eigenes Modell offengelegt, das aus einer kurzen Stimmprobe lernt und danach nur diese eine Person mitschreibt. Xiaomi-CocktailASR-1 ist quelloffen und zielt auf alle, die Gespräche zuverlässig protokollieren wollen.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenDas Wichtigste in Kürze
- Xiaomi hat mit Xiaomi-CocktailASR-1 ein quelloffenes Modell für die Spracherkennung in Gesprächen mit mehreren Sprechern veröffentlicht, verfügbar auf GitHub und Hugging Face unter der Lizenz CC BY 4.0.
- Eine kurze Referenzaufnahme dient als Stimmabdruck; das Modell transkribiert gezielt nur diese Person, ohne die Stimmen vorher zu trennen.
- Fehlt die Zielstimme im Mitschnitt, gibt das Modell leeren Text aus, statt fremde Sprecher zu erfinden; ein zuschaltbarer Denk-Modus legt die Zwischenschritte offen.
- Für Firmen im DACH-Raum zählt vor allem, dass sich offene Gewichte lokal und damit DSGVO-nah betreiben lassen, etwa für Protokolle aus Meetings und Callcentern.
Eine Stimme aus dem Stimmengewirr

Das sogenannte Cocktail-Party-Problem gilt in der Spracherkennung als hart: Sobald sich mehrere Stimmen überlagern, zerfällt die Erkennung. CocktailASR-1 geht die Sache anders an. Eine kurze Referenzaufnahme der Zielperson dient als Stimmabdruck. Das Modell transkribiert dann direkt nur deren Sprache, ohne die Stimmen vorher voneinander zu trennen.[1]
Gängige Erkenner wie Apples SpeechAnalyzer oder Whisper schreiben zunächst alles mit und ordnen die Sprecher erst danach zu. Diesen Trennschritt spart Xiaomis Ansatz. Das Modell arbeitet LLM-basiert und Ende-zu-Ende, verwandt mit den lokal laufenden Erkennern, die zuletzt in Mode kamen.
Was das Modell anders macht
Zwei Eigenschaften stechen heraus. Fehlt die Zielstimme im Mitschnitt, gibt CocktailASR-1 leeren Text aus, statt fremde Sprecher zu erfinden. Zusätzlich lässt sich ein Denk-Modus zuschalten, der die Zwischenschritte offenlegt. Bei einzelnen Sprechern bleibt die Genauigkeit nach Angaben von Xiaomi auf dem Niveau gängiger Modelle, in Mehrsprecher-Tests meldet der Technik-Report Spitzenwerte.
Beim Protokollieren scheitert die Technik selten am einzelnen Wort, sondern am Durcheinander vieler Stimmen. Genau dort setzt ein offenes Modell an, das eine Stimme herausschreibt und den Rest ignoriert.
— Michael Dobler, Herausgeber Dr. Web
Was Open Source aus China für Europa bedeutet?
CocktailASR-1 reiht sich in eine Serie offener Modelle aus China ein, von Alibabas Qwen bis DeepSeek. Für Firmen im DACH-Raum zählt vor allem der Betrieb: Offene Gewichte lassen sich lokal ausführen, sodass Sprachdaten das Haus nicht verlassen. Stimmen zählen nach DSGVO als personenbezogene Daten. Cloud-Diktate brachten zuletzt Ärger.
Vor dem Einsatz zählt die Lizenzfrage: CC BY 4.0 erlaubt auch die kommerzielle Nutzung mit Quellenangabe.[2] Für Meeting- oder Callcenter-Protokolle empfiehlt sich, das Modell zuerst an eigenen deutschen Aufnahmen zu prüfen, denn die veröffentlichten Ergebnisse stammen aus chinesisch- und englischsprachigen Tests.
Ein quelloffenes Modell, das im Stimmengewirr eine Zielstimme mitschreibt (September 2026)
Quellen
[1] Xiaomi: „Xiaomi-CocktailASR-1 Technical Report“ (arXiv 2609.11274)
[2] Xiaomi Research: Xiaomi-CocktailASR-1 auf GitHub
Was ist Xiaomi-CocktailASR-1?
Xiaomi-CocktailASR-1 ist ein quelloffenes KI-Modell zur Spracherkennung in Gesprächen mit mehreren Sprechern. Das Modell transkribiert gezielt eine einzelne Zielstimme und löst so das Cocktail-Party-Problem. Xiaomi hat es im September 2026 auf GitHub und Hugging Face unter der Lizenz CC BY 4.0 veröffentlicht.
Wie erkennt CocktailASR-1 nur eine Stimme?
Eine kurze Referenzaufnahme der Zielperson dient als Stimmabdruck. Das Modell transkribiert direkt nur diese Stimme, ohne die Sprecher vorher zu trennen. Fehlt die Zielstimme im Mitschnitt, gibt CocktailASR-1 leeren Text aus, statt fremde Sprecher zu erfinden.
Wofür können Unternehmen das Modell nutzen?
Naheliegend sind Protokolle aus Meetings, Interviews und Callcentern, in denen mehrere Personen durcheinanderreden. Weil die Gewichte offen sind, lässt sich das Modell lokal und damit DSGVO-nah betreiben. Vor dem Einsatz sollten Firmen es an eigenen deutschen Aufnahmen testen.
Was kostet Xiaomi-CocktailASR-1?
Das Modell ist quelloffen: Gewichte und Technik-Report stehen frei auf GitHub und Hugging Face. Die Lizenz CC BY 4.0 erlaubt auch die kommerzielle Nutzung mit Quellenangabe. Kosten entstehen nur für die eigene Rechen-Infrastruktur, nicht für das Modell selbst.
Mehr Newshunger?
- CosyVoice Studio: Alibaba bündelt 1.000 KI-Stimmen und den Stimmklon in einer App
- Granola: Der KI-Notizblock ohne Meeting-Bot und sein Rechtsproblem in Deutschland
- KI-Notiztool tl;dv: 181.874 Meetings in einer ungeschützten Datenbank
- Qwen3.8-Flash: Alibaba drückt die KI-Trainingskosten um 89 Prozent
- DeepSeek per API: Der günstige Preis liefert ein geschrumpftes Modell