Prompts de video musical AI que realmente funcionan
Cómo describir un visual para que la IA produzca algo utilizable, con estructuras de prompts y los casos de fallo a evitar.
La diferencia entre un visual AI malo y uno bueno suele ser la descripción, no el modelo. Aquí está la estructura que funciona y los errores que producen confusión.
El orden que funciona
Pon la información en este orden y los resultados mejoran inmediatamente:
- Tipo de toma. Toma amplia, primer plano, aérea, ángulo bajo.
- Sujeto, concretamente. Una bicicleta roja oxidada contra una pared de ladrillo mojada.
- Iluminación y hora. Hora dorada, nublado, medio día duro, neón por la noche.
- Movimiento. Desplazamiento lento, el sujeto se mueve de izquierda a derecha, cámara estática.
- Aspecto. Grano de 16 mm, alto contraste, paleta apagada.
Los modelos ponderan fuertemente el frente de un prompt, por lo que el tipo de toma y el sujeto van primero y las notas estilísticas van al final.
Sustantivos concretos superan a los adjetivos
Esta es la mejora más grande disponible.
Débil: una escena urbana atmosférica melancólica con una vibra triste
Fuerte: un callejón mojado por la noche, una luz de tira parpadeante, vapor de un respiradero, sin personas
La primera describe un sentimiento y deja cada decisión real al modelo. La segunda describe una imagen. Los sentimientos son lo que quieres que el espectador tenga, no lo que deberías estar escribiendo.
Una idea por toma
Los prompts que piden dos eventos producen ninguno. "Una mujer camina a través de una puerta hacia un bosque" son dos tomas, y pedirlo en una sola generación produce algo incoherente.
Divídelo. La toma uno es la puerta, la toma dos es el bosque. Quisiste un corte allí de todos modos.
Declara el movimiento explícitamente
El movimiento no declarado es donde los modelos improvisan, y ellos improvisan mal. Si no dices qué se mueve, obtendrás deriva, deformación y objetos cambiando de forma silenciosamente.
Dilo:
- "Cámara estática, solo se mueve la lluvia"
- "Empuje lento, sujeto quieto"
- "Fijo, humo desplazándose a la izquierda"
"Cámara estática" es las dos palabras más útiles en la solicitud de video AI y casi nadie las usa.
Casos de fallo conocidos
Evita o trabaja alrededor de estos, porque fallan en todos los modelos actuales:
- Manos, particularmente haciendo algo específico
- Texto legible. Señales, logotipos, escritura de cualquier tipo
- Multitudes. Las caras en el fondo estarán mal
- Movimiento rápido y complejo. Baile, deportes, cualquier cosa con extremidades a alta velocidad
- Continuidad a través de un corte. El mismo objeto no coincidirá entre dos generaciones a menos que uses una imagen de referencia
Si una toma necesita uno de estos, diseña alrededor de ello o acepta que tendrás que volver a generar varias veces.
Usa una imagen de referencia para consistencia
Así es como mantienes un mundo coherente a través de ocho escenas. Genera un fotograma con el que estés satisfecho, luego úsalo como referencia para todo lo demás. Lleva paleta, configuración y sujeto a través de las tomas de una manera que ninguna cantidad de repetición de prompts logrará.
Plantillas de prompts
Bucle atmosférico, funciona para Canvas: Primer plano, tinta dispersándose en agua, fondo negro, fuente de luz única desde arriba, cámara estática, cámara lenta, alto contraste
Escena de establecimiento: Toma amplia, carretera costera vacía al amanecer, niebla baja, luz nublada, cámara estática, paleta apagada, grano de 16 mm
Escena de sujeto, sin riesgo de cara: Toma media desde atrás, figura con un abrigo largo alejándose, calle empapada de lluvia, reflejos de neón, seguimiento de dolly lento
Corte de textura: Primer plano extremo, lluvia golpeando una ventana de coche por la noche, luces de calle desenfocadas detrás, cámara estática, poca profundidad de campo
Tu primer video musical te está esperando
Muzie funciona en tu navegador, no necesitas una app. Elige una canción, añade una foto y hace el resto.
