Werbeteams
Ein kompletter 30-Sekunden-Spot mit Video, Sprechertext und Musik aus einem Briefing, Take für Take verfeinert.
Schreib eine Zeile, lade ein Bild hoch oder gib mehrere Referenzen an. Du erhältst bis zu 30 Sekunden fertiges Video mit Dialog, Musik und lippensynchroner Sprache.
Production preview
Clips aus Alibabas offiziellen Launch-Demos: eine lange Plansequenz, Figurenperformance und filmische Größenordnung.
Ein kleiner Engel steigt in einer durchgehenden Aufnahme eine Wendeltreppe durch die Wolken hinauf — der lange, zusammenhängende Take, für den das Modell entwickelt wurde.

Eine stilisierte Figur plündert nachts den Kühlschrank. Ausdruck, Bewegung und Licht bleiben über die Szene hinweg konsistent.

Laternenbeleuchtete Ruinen, ein riesiger steinerner Buddha, ein Krieger — eine 30-Sekunden-Cinematic direkt aus dem Modell.


Wan 3.0 ist Alibabas einheitliches Videomodell: Text zu Video, Bild zu Video, referenzgesteuerte Generierung, Bearbeitung und Verlängerung in einem Modell. Ein Satz oder Startbild genügt für bis zu 30 Sekunden bei bis zu 1080p. Der Ton entsteht nativ: Dialog, Effekte und Hintergrundmusik werden gleichzeitig erzeugt; gesprochene Sätze bewegen die Lippen der Figur. Stand September 2026 führt es die Text-zu-Video-Rangliste mit Audio von Artificial Analysis mit Elo 1242 vor Gemini Omni Flash und MiniMax H3 Max an.
Wähle eine Länge in ganzen Sekunden, standardmäßig 5. Oder lass das Modell die passende Länge zur Handlung bestimmen.
Starte beim Ausprobieren mit 480p und generiere den Take zum Behalten bei 1080p. Jeder Clip läuft mit festen 30 FPS.
Dialog, Umgebungseffekte und Musik entstehen mit dem Bild. Gesprochene Sätze steuern die Lippenbewegungen.
16:9, 4:3, 1:1, 3:4 oder 9:16 — oder lass das Format automatisch anpassen.
Kombiniere Bilder, Clips, Audio und sogar PDF, Präsentation oder Webseite. Das Modell baut die Szene aus allen Referenzen auf.
Tausche Elemente aus, ändere den Stil oder den gesprochenen Satz einer Figur. Ergänze Zeit vor oder nach dem Clip, bis insgesamt 30 Sekunden.
Schreib, was passiert, oder lade Startbild, Endbild oder mehrere Referenzen hoch.
Wähle 2–30 Sekunden, 480p bis 1080p und ein Format von 16:9 bis 9:16. Die Länge kannst du auch automatisch bestimmen lassen.
Der Clip enthält Stimmen, Effekte und Musik. Behalte ihn, ändere einen Satz oder verlängere den Take.
Ein Durchgang übernimmt Aufgaben, für die bisher mehrere Tools nötig waren.
Ein kompletter 30-Sekunden-Spot mit Video, Sprechertext und Musik aus einem Briefing, Take für Take verfeinert.
Bild zu Video aus einer Hauptaufnahme: Das Produktfoto eröffnet die Szene, und das Modell setzt sie in Bewegung.
Mach aus PDF, Präsentation oder Webseite ein Erklärvideo mit Sprechertext, ohne vorher ein Storyboard zu erstellen.
Vertikale 9:16-Szenen mit lippensynchronem Dialog, der bereits hörbar ist — für deinen Feed.
Filmische Sequenzen mit konsistenten Figuren, Einstellung für Einstellung inszeniert und Szene für Szene verlängert.
Die Änderungen gegenüber der Wan 2.7-API-Reihe laut Alibabas Launch-Ankündigung.
| Diese WebsiteWan 3.0Die einheitliche GenerationGenerieren | Wan 2.7Vorherige API-Generation | |
|---|---|---|
| Längster einzelner Durchlauf | Bis zu 30 Sekunden | Auf 15 Sekunden begrenzt |
| Modellaufbau | Referenzen, Bearbeitung, Generierung und Verlängerung in einem Modell | Auf separate Modelle verteilt |
| Eingaben | Text und Bilder plus bis zu 20 Referenzdateien, einschließlich Dokumenten und Webseiten | Kleinere Auswahl an Eingaben |
Abos füllen dein Konto mit Credits. Für $19.90 erhältst du 1.000: 25 fünfsekündige Entwürfe oder 6 zehnsekündige Takes bei 720p.
Genieße für kurze Zeit 30% OFF!
2 bis 30 Sekunden in einem Durchgang, standardmäßig 5. Oder überlasse dem Modell die zur Handlung passende Länge. Auch bei Verlängerungen bleibt der Gesamtclip innerhalb von 30 Sekunden.
Ja. Dialog, Umgebungseffekte und Hintergrundmusik entstehen nativ im selben Durchgang. Die gesprochenen Sätze steuern die Lippenbewegungen der Figur.
Ja. Bild zu Video startet mit einem Bild. Oder lege erstes und letztes Bild fest und lass das Modell die Bewegung dazwischen ergänzen.
Ja. Dokumente wie PDF, Word, Excel und PowerPoint mit bis zu 100MB oder 50 Seiten sowie Webseitenlinks können direkt als Referenzen dienen, bei insgesamt bis zu 20 Materialien.
Nein. Die Ausgabe erfolgt in 480p, 720p oder 1080p bei festen 30 FPS. 1080p ist die Obergrenze. Der Generator startet bei 480p, damit Entwürfe günstig bleiben.
Nein. Es ist ein kostenpflichtiges gehostetes Modell. Abos beginnen bei $19.90 pro Monat für 1.000 Credits. Die Generierung wird pro Sekunde berechnet: ein fünfsekündiger 480p-Entwurf kostet 40 Credits, ein zehnsekündiger 720p-Take 150.
Nein. Diese Generation ist Alibabas gehostetes API-Modell. Alibaba hat die 3.0-Gewichte nicht veröffentlicht; herunterladbare Open-Source-Modelle reichen nur bis Wan 2.2. Die 3.0-Generation läuft daher über einen gehosteten Generator wie diesen.
Behalte den Take, schreibe einen Satz um, verlängere das Ende. Deine erste Szene beginnt mit einem Prompt.