Équipes publicitaires
Un spot complet de 30 secondes — image, voix off et musique — à partir d’un brief, puis affiné prise après prise.
Écris une ligne, dépose une image ou fournis des références : tu obtiens jusqu’à 30 secondes de vidéo finalisée avec dialogue, musique et parole synchronisée aux lèvres.
Production preview
Des clips issus des démonstrations de lancement officielles d’Alibaba : plan long continu, jeu de personnage et ampleur cinématographique.
Un angelot monte un escalier en colimaçon à travers les nuages en un plan continu : le type de prise longue et cohérente pour lequel le modèle est conçu.

Un personnage stylisé fouille le réfrigérateur la nuit : expression, mouvement et lumière restent cohérents pendant toute la scène.

Des ruines éclairées aux lanternes, un immense bouddha de pierre, un guerrier : une cinématique de 30 secondes produite directement par le modèle.


Wan 3.0 est le modèle vidéo tout-en-un d’Alibaba : texte vers vidéo, image vers vidéo, génération guidée par références, retouche et prolongation dans un seul modèle. Donne-lui une phrase ou une première image : il produit jusqu’à 30 secondes en résolution maximale 1080p. L’audio est natif : dialogues, effets et musique arrivent dans la même passe, avec une parole qui anime les lèvres. En septembre 2026, il est premier du classement texte vers vidéo avec audio d’Artificial Analysis avec un Elo de 1242, devant Gemini Omni Flash et MiniMax H3 Max.
Choisis une durée en secondes entières, avec 5 par défaut, ou laisse le modèle adapter la durée à l’action.
Commence en 480p pour les essais, puis produis la version à garder en 1080p. Chaque clip tourne à 30 images/s constantes.
Dialogues, ambiances et musique sont générés avec l’image, et les répliques dirigent le mouvement des lèvres.
16:9, 4:3, 1:1, 3:4 ou 9:16, ou laisse le format en mode adaptatif.
Combine images, clips, audio, et même PDF, présentation ou page web : le modèle construit la scène à partir de l’ensemble.
Remplace des éléments, change le style d’un plan, réécris une réplique ou ajoute du temps avant ou après le clip, jusqu’à 30 secondes au total.
Décris l’action ou dépose une première image, une image finale ou plusieurs références.
Choisis de 2 à 30 secondes, une résolution de 480p à 1080p et un format de 16:9 à 9:16, ou laisse la durée automatique.
Le clip arrive avec voix, effets et musique. Garde-le, modifie une réplique ou prolonge la prise.
Une seule passe couvre ce qui demandait auparavant plusieurs outils.
Un spot complet de 30 secondes — image, voix off et musique — à partir d’un brief, puis affiné prise après prise.
De l’image à la vidéo à partir d’un visuel principal : la photo produit ouvre la scène et le modèle la met en mouvement.
Transforme un PDF, une présentation ou une page web en vidéo explicative commentée sans préparer d’abord un storyboard.
Des scènes verticales 9:16 au dialogue audible et synchronisé aux lèvres, prêtes pour le fil.
Des séquences cinématographiques aux personnages cohérents, mises en scène plan par plan et prolongées scène par scène.
Les changements par rapport à l’API Wan 2.7, d’après l’annonce de lancement d’Alibaba.
| Ce siteWan 3.0La génération tout-en-unGénérer | Wan 2.7Génération précédente de l’API | |
|---|---|---|
| Durée maximale en une passe | Jusqu’à 30 secondes | Limitée à 15 secondes |
| Organisation du modèle | Références, retouche, génération et prolongation dans un seul modèle | Réparties entre plusieurs modèles |
| Entrées | Texte et images, avec jusqu’à 20 références, dont documents et pages web | Un ensemble d’entrées plus limité |
Les abonnements ajoutent des crédits au compte : 19,90 $ apportent 1 000, soit 25 ébauches de cinq secondes ou 6 prises de dix secondes en 720p.
Profite de -30 % pendant une durée limitée !
De 2 à 30 secondes en une passe, avec 5 par défaut. Tu peux aussi laisser le modèle choisir la durée adaptée à l’action. Une prolongation garde la durée totale sous 30 secondes.
Oui : dialogues, ambiances et musique sont générés nativement dans la même passe, et les répliques dirigent les lèvres du personnage.
Oui : l’image vers vidéo part d’une seule image. Tu peux aussi fixer la première et la dernière ; le modèle crée le mouvement entre les deux.
Oui : les documents (PDF, Word, Excel, PowerPoint et autres, jusqu’à 100 Mo ou 50 pages) et les liens de pages web peuvent servir directement de références, dans la limite de 20 éléments au total.
Non : la sortie est en 480p, 720p ou 1080p à 30 images/s fixes. Le maximum est 1080p ; le générateur démarre en 480p pour limiter le coût des essais.
Non : c’est un modèle hébergé payant. Les forfaits commencent à 19,90 $ par mois pour 1 000 crédits. Le rendu est facturé à la seconde : une ébauche de cinq secondes en 480p coûte 40 crédits, une prise de dix secondes en 720p 150.
Non : cette génération est le modèle API hébergé d’Alibaba. Alibaba n’a pas publié les poids de 3.0 ; les modèles open source téléchargeables s’arrêtent à Wan 2.2. La génération 3.0 passe donc par un outil hébergé comme celui-ci.
Garde la prise, réécris une réplique, prolonge la fin : ta première scène commence par un prompt.