Une scène, deux prompts appariés : celui d'image fabrique le photogramme, celui de vidéo l'anime — personnage et rapport d'image identiques dans les deux.
La fonctionnalité principale du pipeline Dreamer : à partir d'une scène en langage naturel, une paire d'invites Image + Vidéo correspondantes en une seule étape. L'étape 1 génère l'image, l'étape 2 l'anime. En cas de dialogue, au lieu de Text-to-Video, synchronisation labiale sur l'image fixe conservée.
Termes liés
Quiz
1. Zu welchem Department gehört „Image-to-Video Matched Pair"?