Prompts de Vídeo Musical AI que Realmente Funcionam
Como descrever um visual para que a IA produza algo utilizável, com estruturas de prompt e os casos de falha a evitar.
A diferença entre um visual AI ruim e um bom geralmente é a descrição, não o modelo. Aqui está a estrutura que funciona e os erros que produzem confusão.
A ordem que funciona
Coloque as informações nesta ordem e os resultados melhoram imediatamente:
- Tipo de plano. Plano geral, close-up, aéreo, ângulo baixo.
- Sujeito, concretamente. Uma bicicleta vermelha enferrujada contra uma parede de tijolos molhados.
- Iluminação e hora. Hora dourada, nublado, meio-dia intenso, neon à noite.
- Movimento. Movimento lento para frente, sujeito se movendo da esquerda para a direita, câmera estática.
- Aparência. Granulado 16mm, alto contraste, paleta suave.
Os modelos pesam fortemente a frente de um prompt, por isso o tipo de plano e o sujeito vão primeiro e as notas estilísticas vão por último.
Substantivos concretos superam adjetivos
Esta é a maior melhoria disponível.
Fraco: uma cena urbana atmosférica e melancólica
Forte: um beco molhado à noite, uma luz piscante, vapor de um duto, sem pessoas
A primeira descreve um sentimento e deixa cada decisão real para o modelo. A segunda descreve uma imagem. Sentimentos são o que você quer que o espectador tenha, não o que você deve estar digitando.
Uma ideia por plano
Prompts que pedem dois eventos produzem nenhum. "Uma mulher entra por uma porta em uma floresta" são dois planos, e pedir isso em uma única geração produz algo incoerente.
Divida. O plano um é a porta, o plano dois é a floresta. Você queria um corte ali de qualquer forma.
Declare o movimento explicitamente
Movimento não declarado é onde os modelos improvisam, e eles improvisam mal. Se você não disser o que se move, você terá distorções, deformações e objetos mudando de forma silenciosamente.
Diga:
- "Câmera estática, apenas a chuva se move"
- "Empurrão lento, sujeito parado"
- "Estático, fumaça se movendo para a esquerda"
"Câmera estática" é as duas palavras mais úteis em prompts de vídeo AI e quase ninguém as usa.
Casos de falha conhecidos
Evite ou contorne estes, porque falham em todos os modelos atuais:
- Mãos, especialmente fazendo algo específico
- Texto legível. Sinais, logotipos, escrita de qualquer tipo
- Multidões. Rostos ao fundo estarão errados
- Movimento complexo rápido. Dança, esportes, qualquer coisa com membros em velocidade
- Continuidade em um corte. O mesmo objeto não corresponderá entre duas gerações, a menos que você use uma imagem de referência
Se um plano precisar de um desses, ou você projeta ao redor ou aceita que terá que gerar várias vezes.
Use uma imagem de referência para consistência
Assim você mantém um mundo coerente em oito cenas. Gere um quadro com o qual você esteja satisfeito, depois use-o como referência para tudo o mais. Ele carrega paleta, cenário e sujeito entre os planos de uma forma que nenhuma quantidade de repetição de prompt fará.
Modelos de prompt
Loop atmosférico, funciona para Canvas: Close-up, tinta se dispersando na água, fundo preto, fonte de luz única de cima, câmera estática, movimento lento, alto contraste
Cena de estabelecimento: Plano geral, estrada costeira vazia ao amanhecer, neblina baixa, luz nublada, câmera estática, paleta suave, granulado 16mm
Cena de sujeito, sem risco de rosto: Plano médio por trás, figura em um casaco longo se afastando, rua molhada pela chuva, reflexos de neon, acompanhamento lento
Corte de textura: Extreme close-up, chuva batendo na janela de um carro à noite, luzes de rua desfocadas ao fundo, câmera estática, profundidade de campo rasa
O seu primeiro vídeo musical está à espera
O Muzie funciona no seu navegador, sem necessidade de app. Escolha uma canção, adicione uma foto e ele faz o resto.
