Prompts de vidéo musicale AI qui fonctionnent réellement
Comment décrire un visuel pour que l'IA produise quelque chose d'utilisable, avec des structures de prompts et les cas d'échec à éviter.
L'écart entre un visuel AI mauvais et un bon est généralement la description, pas le modèle. Voici la structure qui fonctionne et les erreurs qui produisent de la bouillie.
L'ordre qui fonctionne
Mettez les informations dans cet ordre et les résultats s'améliorent immédiatement :
- Type de prise. Plan large, gros plan, aérien, angle bas.
- Sujet, concrètement. Un vélo rouge rouillé contre un mur de briques mouillées.
- Éclairage et moment. Heure dorée, nuageux, midi dur, néon la nuit.
- Mouvement. Lent zoom avant, sujet se déplace de gauche à droite, caméra statique.
- Aspect. Grain 16 mm, contraste élevé, palette atténuée.
Les modèles pèsent fortement le début d'un prompt, c'est pourquoi le type de prise et le sujet vont en premier et les notes stylistiques vont en dernier.
Les noms concrets battent les adjectifs
C'est la plus grande amélioration disponible.
Faible : une scène urbaine atmosphérique mélancolique avec une ambiance triste
Forte : une ruelle mouillée la nuit, une lumière clignotante, de la vapeur d'un conduit, pas de personnes
La première décrit un sentiment et laisse chaque décision réelle au modèle. La seconde décrit une image. Les sentiments sont ce que vous voulez que le spectateur ressente, pas ce que vous devriez taper.
Une idée par prise
Les prompts demandant deux événements ne produisent aucun. "Une femme passe par une porte dans une forêt" est deux prises, et demander cela en une seule génération produit de manière fiable quelque chose d'incohérent.
Séparez-le. La première prise est la porte, la seconde est la forêt. Vous vouliez une coupe là de toute façon.
Indiquez explicitement le mouvement
Le mouvement non déclaré est là où les modèles improvisent, et ils improvisent mal. Si vous ne dites pas ce qui bouge, vous obtiendrez des dérives, des déformations et des objets changeant silencieusement de forme.
Dites-le :
- "Caméra statique, seul la pluie bouge"
- "Lent zoom avant, sujet immobile"
- "Fixé, la fumée dérive à gauche"
"Caméra statique" est les deux mots les plus utiles dans le prompting vidéo AI et presque personne ne les utilise.
Cas d'échec connus
Évitez ou contournez-les, car ils échouent sur chaque modèle actuel :
- Mains, en particulier en faisant quoi que ce soit de spécifique
- Texte lisible. Panneaux, logos, écriture de tout type
- Foules. Les visages en arrière-plan seront faux
- Mouvement complexe rapide. Danse, sports, tout ce qui implique des membres à grande vitesse
- Continuité à travers une coupe. Le même objet ne correspondra pas entre deux générations à moins que vous n'utilisiez une image de référence
Si une prise nécessite l'un de ces éléments, concevez autour ou acceptez que vous devrez réessayer plusieurs fois.
Utilisez une image de référence pour la cohérence
C'est ainsi que vous maintenez un monde cohérent à travers huit scènes. Générez un cadre qui vous plaît, puis utilisez-le comme référence pour tout le reste. Cela transporte la palette, le cadre et le sujet à travers les prises d'une manière que aucune répétition de prompt ne pourra.
Modèles de prompts
Boucle atmosphérique, fonctionne pour Canvas : Gros plan, encre se dispersant dans l'eau, fond noir, source de lumière unique venant d'en haut, caméra statique, ralenti, contraste élevé
Scène d'établissement : Plan large, route côtière vide à l'aube, brouillard bas, lumière nuageuse, caméra statique, palette atténuée, grain 16 mm
Scène de sujet, sans risque de visage : Plan moyen de derrière, silhouette en manteau long s'éloignant, rue mouillée, reflets néon, suivi en dolly lent
Plan de texture : Gros plan extrême, pluie frappant une fenêtre de voiture la nuit, lampadaires flous en arrière-plan, caméra statique, faible profondeur de champ
Votre première vidéo musicale vous attend
Muzie fonctionne dans votre navigateur, aucune application nécessaire. Choisissez une chanson, ajoutez une photo et il fait le reste.
