Zeitlich begrenzt 30% OFF!Angebot sichern
Platz 1 bei Artificial Analysis: Text zu Video mit Audio — September 2026

Wan 3.0: eine ganze Szene inszenieren, samt Stimmen

Schreib eine Zeile, lade ein Bild hoch oder gib mehrere Referenzen an. Du erhältst bis zu 30 Sekunden fertiges Video mit Dialog, Musik und lippensynchroner Sprache.

Try Agent modeNEW

Describe your idea in a conversation and keep refining it.

Try Agent
HochladenErforderlich
Startbild
Endbild
  • Bilder: JPG, PNG oder WebP
Duration (seconds)5s
2s16s30s

Production preview

5s Living Oil Painting | 16:9 | Impressionist Post-Painterly Texture | Sea-Cliff Wind and Scattering Blossoms FIRST FRAME: strictly preserve the reference image's original composition, palette, and brushwork. Nothing is re-rendered as photoreal — the animation must look like an oil painting in motion, visible impasto strokes and palette-knife ridges holding their identity as they move. SUBJECT: young dark-haired woman in a sage-olive long-sleeved blouse with a patterned sash, head tilted down and to her right, eyes lowered, expression calm and inward. Both bare forearms lift toward a great bundle of white chrysanthemum blooms breaking apart in the air before her. Face structure, hair mass, sleeve folds, and skin tone stay consistent throughout.
Offizielle Beispiele

Einblick in die offiziellen Wan 3.0-Demos

Clips aus Alibabas offiziellen Launch-Demos: eine lange Plansequenz, Figurenperformance und filmische Größenordnung.

Eine lange Aufnahme ohne Schnitt

Ein kleiner Engel steigt in einer durchgehenden Aufnahme eine Wendeltreppe durch die Wolken hinauf — der lange, zusammenhängende Take, für den das Modell entwickelt wurde.

Langen Take generieren
Ein kleiner Engel steigt eine spiralförmige Marmortreppe durch Wolken hinauf — eine lange Wan 3.0-Plansequenz

Eine konsistente Figurenperformance

Eine stilisierte Figur plündert nachts den Kühlschrank. Ausdruck, Bewegung und Licht bleiben über die Szene hinweg konsistent.

Figur animieren
Wan 3.0 AI-Videodemo: Eine stilisierte Figur öffnet nachts einen Kühlschrank

Die Größe einer Spiel-Cinematic

Laternenbeleuchtete Ruinen, ein riesiger steinerner Buddha, ein Krieger — eine 30-Sekunden-Cinematic direkt aus dem Modell.

Filmische Szene inszenieren
Wan 3.0-Videodemo: Ein Krieger vor einem riesigen steinernen Buddha in laternenbeleuchteten Ruinen

Was ist Wan 3.0?

Wan 3.0 ist Alibabas einheitliches Videomodell: Text zu Video, Bild zu Video, referenzgesteuerte Generierung, Bearbeitung und Verlängerung in einem Modell. Ein Satz oder Startbild genügt für bis zu 30 Sekunden bei bis zu 1080p. Der Ton entsteht nativ: Dialog, Effekte und Hintergrundmusik werden gleichzeitig erzeugt; gesprochene Sätze bewegen die Lippen der Figur. Stand September 2026 führt es die Text-zu-Video-Rangliste mit Audio von Artificial Analysis mit Elo 1242 vor Gemini Omni Flash und MiniMax H3 Max an.

Einstellungen

Wan 3.0 bietet die Einstellungen für deine Szene

  • 2 bis 30 Sekunden in einem Durchgang

    Wähle eine Länge in ganzen Sekunden, standardmäßig 5. Oder lass das Modell die passende Länge zur Handlung bestimmen.

  • Bis zu 1080p bei 30 FPS

    Starte beim Ausprobieren mit 480p und generiere den Take zum Behalten bei 1080p. Jeder Clip läuft mit festen 30 FPS.

  • Ton ist nativ

    Dialog, Umgebungseffekte und Musik entstehen mit dem Bild. Gesprochene Sätze steuern die Lippenbewegungen.

  • Fünf Formate oder automatische Anpassung

    16:9, 4:3, 1:1, 3:4 oder 9:16 — oder lass das Format automatisch anpassen.

  • Bis zu 20 Referenzen

    Kombiniere Bilder, Clips, Audio und sogar PDF, Präsentation oder Webseite. Das Modell baut die Szene aus allen Referenzen auf.

  • Bearbeiten und verlängern

    Tausche Elemente aus, ändere den Stil oder den gesprochenen Satz einer Figur. Ergänze Zeit vor oder nach dem Clip, bis insgesamt 30 Sekunden.

Ablauf

So erstellst du ein KI-Video mit Wan 3.0

  1. 1

    Szene aufbauen

    Schreib, was passiert, oder lade Startbild, Endbild oder mehrere Referenzen hoch.

  2. 2

    Bildformat festlegen

    Wähle 2–30 Sekunden, 480p bis 1080p und ein Format von 16:9 bis 9:16. Die Länge kannst du auch automatisch bestimmen lassen.

  3. 3

    Mit Ton generieren

    Der Clip enthält Stimmen, Effekte und Musik. Behalte ihn, ändere einen Satz oder verlängere den Take.

Anwendungsfälle

Was Teams mit Wan 3.0 erstellen

Ein Durchgang übernimmt Aufgaben, für die bisher mehrere Tools nötig waren.

  • Werbeteams

    Ein kompletter 30-Sekunden-Spot mit Video, Sprechertext und Musik aus einem Briefing, Take für Take verfeinert.

  • Produktmarketing

    Bild zu Video aus einer Hauptaufnahme: Das Produktfoto eröffnet die Szene, und das Modell setzt sie in Bewegung.

  • Bildung und Erklärvideos

    Mach aus PDF, Präsentation oder Webseite ein Erklärvideo mit Sprechertext, ohne vorher ein Storyboard zu erstellen.

  • Social-Media-Creator

    Vertikale 9:16-Szenen mit lippensynchronem Dialog, der bereits hörbar ist — für deinen Feed.

  • Story- und Spieleteams

    Filmische Sequenzen mit konsistenten Figuren, Einstellung für Einstellung inszeniert und Szene für Szene verlängert.

Generationssprung

Wan 3.0 im Vergleich zur Vorgängergeneration

Die Änderungen gegenüber der Wan 2.7-API-Reihe laut Alibabas Launch-Ankündigung.

Diese WebsiteWan 3.0Die einheitliche GenerationGenerierenWan 2.7Vorherige API-Generation
Längster einzelner DurchlaufBis zu 30 SekundenAuf 15 Sekunden begrenzt
ModellaufbauReferenzen, Bearbeitung, Generierung und Verlängerung in einem ModellAuf separate Modelle verteilt
EingabenText und Bilder plus bis zu 20 Referenzdateien, einschließlich Dokumenten und WebseitenKleinere Auswahl an Eingaben
Preise

Wan 3.0: Preise in Credits

Abos füllen dein Konto mit Credits. Für $19.90 erhältst du 1.000: 25 fünfsekündige Entwürfe oder 6 zehnsekündige Takes bei 720p.

Zeitlich begrenztes Angebot30% OFF

Genieße für kurze Zeit 30% OFF!

07Tage00Std.00Min.00Sek.
Loading…
FAQ

Fragen zu Wan 3.0

Ein Durchgang. Eine ganze Szene, die spricht.

Behalte den Take, schreibe einen Satz um, verlängere das Ende. Deine erste Szene beginnt mit einem Prompt.