Wan-Animate-2: le transfert de mouvement open source d'Alibaba passe au temps réel
Wan-Animate-2 est un modèle open source d'animation de personnage développé par l'équipe Wan d'Alibaba. Vous fournissez une image de personnage et une vidéo de référence, il rejoue le mouvement, les expressions du visage et même l'angle de caméra que vous décrivez par texte. Les poids se téléchargent gratuitement sur Hugging Face et le support natif dans ComfyUI a suivi dès le jour de la sortie. Vidéastes, studios de jeu et adeptes du VTubing sont les premiers servis, avec une variante Lite taillée pour le direct.
- Mouvement transféré sans extraction de squelette préalable
- Identité du personnage préservée jusqu'aux doigts
- Angle de caméra modifiable par simple texte
- Variante Lite assez rapide pour le direct
- Poids ouverts et support ComfyUI natif
- Exigeant en local, un GPU musclé s'impose
- Documentation en anglais, exemples de prompts en chinois
- Pas d'application grand public officielle, tout passe par des workflows
La vidéo motrice entre directement dans Wan-Animate-2
Wan-Animate-2 envoie la vidéo motrice telle quelle dans un Diffusion Transformer repensé, sans extracteur de mouvement intermédiaire. La génération précédente, Wan 2.2 Animate, passait par une détection de pose avant génération, et tout ce que le squelette ne capturait pas se perdait en route, une position de doigts, une micro-expression. Ce goulot a disparu, ce qui améliore la fidélité du geste et la stabilité du visage d'un bout à l'autre du clip. Techniquement, on reste dans la famille des modèles de diffusion, mais branchés en direct sur la source.
La mise en situation tient en deux fichiers. Vous vous filmez au téléphone en train de jouer une scène, vous ajoutez le portrait d'une héroïne dessinée (une image générée la veille fait très bien l'affaire), et le modèle rejoue votre performance avec elle. Autre apport notable, le point de vue de la caméra se décrit par texte et peut donc différer de celui de la vidéo d'origine.
Du différé au direct, le pari de la variante Lite
Wan-Animate-2-Lite abaisse la latence d'inférence jusqu'au seuil du temps réel, ce qui rend possible l'animation de personnage en flux continu. Les modèles de cette catégorie travaillaient jusqu'ici en différé. Et c'est là que le programme change, puisque avatars numériques animés en direct et présentateurs virtuels deviennent des cas d'usage réalistes, un terrain que les générateurs d'avatars IA grand public abordaient sans mouvement corporel complet.
Télécharger et lancer Wan-Animate-2
Les poids du modèle 14B, les poids distillés et les scripts d'inférence sont publiés publiquement sur Hugging Face et GitHub, et la bibliothèque diffusers le prend en charge. ComfyUI l'intègre nativement avec deux nouveaux nœuds, dont un cache de la branche pose qui réduit le temps de génération de moitié environ. Comfy Cloud propose par ailleurs 5 exécutions gratuites sur GPU pour essayer sans installation. Côté public francophone, rien n'existe en français pour l'instant, il faudra composer avec des ressources en anglais.
| Variante | Particularité | Usage visé |
|---|---|---|
| Wan-Animate-2-Base | Qualité maximale, poids publics | Clips soignés, production vidéo |
| Wan-Animate-2-Lite | Latence abaissée au temps réel | Avatars en direct, streaming |
| Wan 2.2 Animate (génération précédente) | Extraction de pose préalable requise | Workflows existants, modes animation et remplacement |
Questions fréquentes
Wan-Animate-2 est-il gratuit ?
Oui, les poids de Wan-Animate-2 sont publiés publiquement et se téléchargent gratuitement sur Hugging Face et GitHub. Le vrai coût se situe côté matériel, un modèle de 14 milliards de paramètres réclame un GPU sérieux ou une location dans le cloud. Comfy Cloud inclut cinq exécutions d'essai sur GPU sans carte bancaire.
Quelle différence entre Wan-Animate-2 et Wan 2.2 Animate ?
La deuxième génération supprime l'extraction de pose, la vidéo motrice entre directement dans le modèle, ce qui préserve les gestes fins et l'identité du personnage. Elle ajoute aussi le contrôle du point de vue par texte et la variante Lite temps réel, deux capacités absentes de Wan 2.2 Animate, qui reposait sur des squelettes détectés en amont.
Faut-il écrire un prompt pour utiliser Wan-Animate-2 ?
Le dépôt officiel recommande de faire décrire l'image de référence par un modèle de langage, puis d'utiliser cette description comme prompt d'inférence. Dans les workflows ComfyUI, ce texte pilote aussi l'arrière-plan et la caméra du plan final. Les exemples fournis par l'équipe sont rédigés en chinois, mais rien n'empêche d'adapter la méthode.
Peut-on essayer Wan-Animate-2 sans installer ComfyUI ?
Comfy Cloud permet de lancer le workflow officiel dans le navigateur, avec cinq exécutions gratuites sur GPU pour se faire une idée. Des plateformes tierces hébergeant les modèles Wan ajoutent généralement les nouvelles versions à leur catalogue contre crédits, ce qui évite l'installation locale et l'achat d'une carte graphique haut de gamme.
Verdict : Le remplacement d'acteur relevait des studios d'effets spéciaux, il tient maintenant dans un workflow ComfyUI gratuit. Vidéastes équipés, studios d'animation, streamers et VTubers en quête d'un avatar animé en direct y trouveront un moteur ouvert et déjà bien entouré par la communauté.
