Alibaba hat sein Videomodell Wan 3.0 freigeschaltet, das aus einem einzigen Prompt bis zu 30 Sekunden Film erzeugt. Neu ist der Dokument-Input: Aus einer PowerPoint oder einem PDF entsteht ein fertiger Clip. Ein 30-Sekunden-Video in 1080p kostet dabei rund 4,61 Euro.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenWan 3.0 ist seit dem 24. August 2026 offen verfügbar. Alibabas neues KI-Videomodell verarbeitet nicht mehr nur Text und Bilder.[1] Aus einer Tabelle, einem PDF oder einer PowerPoint-Datei baut das Modell jetzt einen Clip von bis zu 30 Sekunden. Für Marketing- und Content-Teams verschiebt der Dokument-Input die Grenze zwischen Foliensatz und fertigem Film.
Das Wichtigste in Kürze
- Wan 3.0 erzeugt seit dem 24. August 2026 Videos von bis zu 30 Sekunden am Stück, in 480p, 720p oder 1080p.
- Neu ist der Dokument-Input: DOC, XLS, PPT, PDF und Markdown werden zur Vorlage für einen Clip.
- Ein 30-Sekunden-Clip in 1080p kostet rund 4,61 Euro, bis zum 23. September 2026 mit 30 Prozent Rabatt.
- Der EU AI Act verlangt seit dem 2. August 2026 eine Kennzeichnung KI-generierter Videos.
Was macht Wan 3.0 anders?

Neu ist vor allem der Dokument-Input. Wan 3.0 nimmt DOC, XLS, PPT, PDF und Markdown entgegen und übersetzt deren Inhalt in Bewegtbild, zusätzlich zu den bekannten Wegen aus Text, Bild, Video und Ton. Die Ausgabe reicht von 480p über 720p bis 1080p, ein Clip läuft bis zu 30 Sekunden am Stück.
An der Qualität hat Alibaba an vier Stellen geschraubt: Anweisungsverständnis, Konsistenz über Szenenschnitte hinweg, Tonqualität und Videoschnitt. Damit rückt Wan neben die anderen chinesischen KI-Modelle im Videorennen, etwa Kuaishous Kling, das seinen Umsatz zuletzt verdreifachte.
Offene Wurzeln hat die Modellreihe schon länger. Wan 2.1 stellte Alibaba im Februar 2025 unter Apache-2.0-Lizenz frei, die kleinste Variante lief mit 8,2 GB Grafikspeicher auf einer Consumer-Karte.[2] Version 3.0 startet dagegen zuerst kostenpflichtig über die Cloud-Plattformen Bailian und Qianwen, offene Gewichte nennt Alibaba bislang nicht.
Was kostet ein KI-Video bei Alibaba?
Ein 30-Sekunden-Clip in 1080p kostet rund 4,61 Euro. Der Preis staffelt sich nach Auflösung: 0,30 Yuan je Sekunde in 480p, 0,60 Yuan in 720p und 1,20 Yuan in 1080p. Umgerechnet sind das bei 1080p rund 15 Cent je Sekunde (Kurs 0,128 Euro je Yuan, Stand 25. August 2026). Bis zum 23. September gewährt Alibaba 30 Prozent Rabatt.
Der aggressive Sekundenpreis passt ins Muster: Chinas Anbieter unterbieten sich seit Monaten. DeepSeek senkte den Preis für Bildanalyse zuletzt auf Bruchteile eines Cents, und jeder neue Sekundentarif drückt die Marge der ganzen Branche.
Der eigentliche Sprung steckt nicht in den 30 Sekunden, sondern im Dokument-Input: Eine hochgeladene Preisliste wird zum Rohstoff für ein Video. Genau deshalb entscheidet künftig die Datenschutzfrage darüber, ob ein Team Wan überhaupt einsetzen darf.
— Michael Dobler, Herausgeber Dr. Web
Was ein 30-Sekunden-Clip kostet
| Auflösung | Preis je Sekunde | 30-Sekunden-Clip |
|---|---|---|
| 480p | rund 0,04 € | rund 1,15 € |
| 720p | rund 0,08 € | rund 2,30 € |
| 1080p | rund 0,15 € | rund 4,61 € |
Umrechnung 0,128 Euro je Yuan, Stand 25. August 2026. Vom 24. August bis 23. September 2026 gewährt Alibaba 30 Prozent Rabatt.
Was bedeutet Wan 3.0 für Teams in der DACH-Region?
Zwei Pflichten treffen europäische Teams sofort: Kennzeichnung und Datenschutz. Seit dem 2. August 2026 verlangt der EU AI Act in Artikel 50, KI-generierte Videos als solche auszuweisen. Die Verantwortung liegt beim Team, das den Clip veröffentlicht, nicht bei Alibaba. Dieselbe Kennzeichnungslogik steht hinter den Leitplanken zwischen Hollywood und ByteDance.
Die zweite Hürde ist der Datenschutz. Der Dokument-Input verführt dazu, Angebote, Preislisten oder Kundenunterlagen hochzuladen, und diese Dateien wandern auf Server von Alibaba Cloud. Wo personenbezogene Daten drinstehen, greift die DSGVO mit Auftragsverarbeitung und Drittlandtransfer.
Vor dem Praxistest zählen deshalb zwei Fragen: Was landet in der Cloud? Und braucht der Clip ein Wasserzeichen? Für reine Marketing-Rohschnitte lohnt der Vergleich mit westlichen Diensten wie Sora oder Veo. Unser Vergleich von Adobe Firefly und CapCut zeigt, worauf Content-Teams achten müssen.
FAQ: Was kann Alibabas Wan 3.0?
Was ist Alibaba Wan 3.0?
Wan 3.0 ist das im August 2026 gestartete KI-Videomodell von Alibaba Cloud. Aus Text, Bild, Ton oder ganzen Dokumenten erzeugt es Clips von bis zu 30 Sekunden in 480p, 720p oder 1080p. Zugang gibt es kostenpflichtig über die Cloud-Plattformen Bailian und Qianwen.
Was kostet Wan 3.0?
In 1080p kostet eine Sekunde 1,20 Yuan, ein 30-Sekunden-Clip also rund 4,61 Euro (Kurs 0,128, Stand 25. August 2026). Günstiger sind 720p mit etwa 2,30 Euro und 480p mit rund 1,15 Euro je Clip. Bis zum 23. September 2026 gilt ein Rabatt von 30 Prozent.
Kann Wan 3.0 aus einem PDF ein Video machen?
Ja. Wan 3.0 akzeptiert DOC, XLS, PPT, PDF und Markdown als Eingabe und setzt deren Inhalt in ein Video um. Damit lässt sich etwa aus einem Foliensatz oder einer Preisliste direkt ein Clip erzeugen, ohne den Umweg über ein Skript.
Ist Wan 3.0 Open Source?
Die aktuelle Version 3.0 startet zunächst kostenpflichtig über die Alibaba-Cloud-Plattformen, offene Gewichte nennt Alibaba dafür bislang nicht. Frühere Generationen wie Wan 2.1 waren dagegen unter Apache-2.0-Lizenz frei verfügbar und liefen auf einer Consumer-Grafikkarte.
Muss ich mit Wan erstellte Videos in der EU kennzeichnen?
Ja. Seit dem 2. August 2026 verlangt Artikel 50 des EU AI Act, KI-generierte Videos klar als künstlich erzeugt zu kennzeichnen. Die Pflicht trifft denjenigen, der den Clip veröffentlicht, nicht den Modellanbieter.
Quellen
[1] Alibaba Cloud Model Studio: „wan3.0-video Modellinformationen“
[2] Alibaba Cloud: „Alibaba Unveils its Latest Open-Source Video Generation Model“
Mehr Newshunger?
- Seedance 2.5: ByteDance bringt 30-Sekunden-KI-Video in die Firmen-Produktion
- MiniMax H3: Chinas Videomodell erzeugt 2K-Clips mit nativem Ton
- iQIYI: KI-Filme senken die Kosten, nicht den Verlust
- MiniMax Design: Ein Agententeam übernimmt die kommerzielle Videoproduktion
- Flux 3: Ein Modell aus Freiburg erzeugt Video, Ton und Roboterbewegung