
LTX-2.5 lê prompts como um diretor de cinema lê a descrição de uma cena — frases completas descrevendo câmera, sujeito, ação, ambiente e estilo, não tags separadas por vírgulas. Domine essa estrutura e sua taxa de clipes utilizáveis salta de 1 em 10 para 1 em 3. Este guia oferece a fórmula exata, um vocabulário de movimentos de câmera, dicas de áudio, sintaxe multishot e templates que você pode colar diretamente no gerador LTX-2.5 do Soloa.
LTX-2.5 usa um codificador de texto de modelo de linguagem ajustado que analisa direção de cena, relações espaciais e causalidade. A estrutura de prompt confiável organiza cinco componentes em ordem:
| Camada | O Que Especificar | Exemplo de Fragmento |
|---|---|---|
| 1. Câmera e lente | Movimento, ângulo, distância focal | "Um dolly-in lento com lente anamórfica 35mm…" |
| 2. Sujeito | Quem/o quê + atributos definidores | "…uma ceramista de cabelos prateados com avental manchado de argila…" |
| 3. Ação e linha do tempo | O que acontece, em que ordem | "…molda uma tigela giratória, depois pausa para inspecionar a borda…" |
| 4. Ambiente e iluminação | Cenário, fonte de luz e direção | "…em um estúdio iluminado pelo sol, luz dourada da tarde atravessando o ar empoeirado…" |
| 5. Estilo e fidelidade | Visual, gradação, qualidade de renderização | "…realismo documental, profundidade de campo rasa, textura de pele fina." |
Mais uma camada é única do LTX-2.5: áudio. O modelo gera som no mesmo processo que a imagem, então ruído ambiente, música e diálogo pertencem ao prompt: "a roda zumbe suavemente, chuva bate na claraboia, sem música."
Nomeie um movimento de câmera explicitamente — é a frase de maior impacto no prompt. Movimentos que LTX-2.5 executa de forma confiável:
| Movimento de Câmera | Efeito | Usar Para |
|---|---|---|
| Slow dolly in | Aproximação suave em direção ao sujeito | Intensidade emocional, revelações |
| Dolly zoom (vertigo effect) | Zoom in enquanto recua | Tensão psicológica |
| Low-angle tracking shot | Movimento paralelo ao nível do chão | Ação, tomadas de poder |
| 360-degree orbit | Gira ao redor do ponto focal | Revelações de produto e personagem |
| FPV drone flythrough | Movimento aéreo rápido multi-eixo | Paisagens, planos de estabelecimento |
| Crane down / jib down | Descida vertical | Transições de amplo para íntimo |
| Macro rack focus | Foco muda primeiro plano ↔ fundo | Narrativa de detalhes, time-lapses |
| Locked-off tripod shot | Sem movimento algum | Diálogo, conteúdo estilo UGC |
Combine o movimento com uma lente e direção de iluminação: lente retrato 85mm, softbox principal da esquerda da câmera. Linguagem de lente (anamórfica 35mm, macro 100mm), referências de filme, e termos volumétricos (neblina, poeira, vapor, reflexos de chuva) todos influenciam visivelmente a renderização.
Uma órbita de 360 graus lenta ao redor de um estojo de fone de ouvido sem fio preto fosco sobre ardósia molhada, lente macro, gotas de água formando pérolas na tampa. O estojo abre conforme a câmera passa pela frente, LEDs pulsando azul suave. Escuridão de estúdio com um único softbox superior, reflexos deslizando pela superfície. Fidelidade nítida de fotografia de produto. Áudio: zumbido de sintetizador ambiente baixo, um clique suave quando a tampa abre.
Um plano fixo estilo smartphone de uma mulher no final dos 20 anos com cabelo cacheado e um cardigã mostarda, sentada em uma cozinha iluminada, falando diretamente para a câmera com gestos naturais das mãos. Luz da manhã de uma janela à direita, leve balanço de câmera na mão. Realismo casual de vlog, textura de pele natural. Áudio: sua voz dizendo "Eu testei isso por uma semana — aqui está o que aconteceu," leve ambiente de cozinha.
Um flythrough de drone FPV roçando baixo sobre águas rasas turquesa em direção a um penhasco de calcário no pôr do sol dourado, depois subindo rápido para revelar uma vila de pescadores iluminada. Sol criando flares através da névoa com lente grande angular 24mm, gradação cinemática quente com sombras azul-petróleo. Áudio: vento correndo, gaivotas distantes, uma trilha ambiente crescente.
Um macro rack focus começando no vapor subindo de uma tigela de ramen, mudando o foco para hashi levantando macarrão em câmera lenta, gotas de caldo capturando luz tungstênio quente. Fundo escuro de izakaya com lanternas desfocadas suaves. Estilização editorial rica de comida, alto detalhe. Áudio: chiado suave, murmúrio silencioso de restaurante, tilintar de hashi.
Uma sequência de três tomadas de 12 segundos. Shot 1: plano geral de estabelecimento de uma oficina de reparos iluminada por neon em uma rua chuvosa à noite, reflexos de poças ondulando. Corte para Shot 2: close-up das mãos manchadas de óleo de uma mecânica soldando um rotor de drone, faíscas iluminando seus óculos de segurança âmbar. Corte para Shot 3: por cima do ombro enquanto o drone levanta da palma dela e paira entre eles. Preservar aparência do personagem, intensidade da chuva, paleta de cores neon e direção de iluminação em todos os cortes. Áudio: batida de chuva durante todo o tempo, chiado de solda no shot 2, zumbido crescente do rotor no shot 3.
Shot 1… Corte para Shot 2… — LTX-2.5 nativamente gera múltiplos cortes em um único processo.Fraco: mulher cyberpunk, andando, luzes neon, rua chuvosa, 8k, cinemático
Tags empilhadas com vírgulas produzem movimento brusco e composição genérica porque o codificador não recebe relações espaciais ou causais para trabalhar. Reescreva como direção:
Forte: "Um tracking shot de ângulo baixo segue uma mulher com capa de chuva translúcida andando por um beco de mercado encharcado de neon à noite, placas magenta e ciano refletindo nas poças ao redor de suas botas, vapor flutuando entre as barracas. Gradação cinemática, profundidade de campo rasa. Áudio: chuva, música sintetizador distante, passos molhados."
| Parâmetro | Recomendado | Notas |
|---|---|---|
| Guidance (CFG) | 3.0–4.2 | Acima de ~5.0 causa supersaturação e queima de cor |
| Steps | 25–35 (completo) · 8–12 (destilado) | Equilíbrio entre velocidade e detalhe |
| Denoise (i2v) | 0.45–0.65 | 0.45 preserva a imagem de origem; 0.65 permite transformação |
| Duration | "auto" ou explícito | Auto prevê a duração do clipe a partir da ação descrita |
Um prompt negativo amplamente usado para LTX-2.5: blurry, distorted anatomy, warped faces, flickering background, unnatural jitter, overexposed, static freeze frame, watermarks, text overlays. No Soloa esses parâmetros são pré-ajustados — você apenas escreve o prompt e escolhe um modo (text-to-video, image-to-video, ou primeiro/último quadro).
Mesmo com estrutura perfeita, ótimos clipes vêm de variações: ajuste o movimento de câmera, troque a iluminação, refine a batida de ação. Em APIs premium a $0.10–$0.53/seg, dez takes de 10 segundos custam $10–$53 — então as pessoas param de iterar cedo e se acomodam. No LTX-2.5 do Soloa a $0.01/seg (720p), essas mesmas dez takes custam $1. Iteração barata é a diferença entre testar três ideias e testar trinta — veja como o preço se compara no mercado em nossa análise de custo por segundo, ou obtenha a análise completa do modelo em LTX-2.5 explicado.
De duas a cinco frases completas. Longo o suficiente para cobrir câmera, sujeito, ação, ambiente, estilo e áudio — curto o suficiente para que cada shot tenha uma batida clara. Prompts de palavra única ou lista de tags têm desempenho ruim.
Sim. Coloque a linha falada entre aspas dentro do prompt ("ela diz: 'vamos começar'") e descreva o tom de voz. O áudio é gerado no mesmo processo, sincronizado com os lábios do falante.
Use o modo image-to-video ou primeiro/último quadro com uma imagem de referência, repita a mesma descrição do personagem literalmente entre prompts, e adicione uma cláusula de consistência em prompts multishot. Ambos os modos estão disponíveis no Soloa.
Geralmente prompts empilhados com tags, instruções de movimento contraditórias, ou guidance configurado muito alto. Reescreva como direção em frases completas, mantenha um movimento de câmera por shot, e fique na faixa CFG 3.0–4.2.
Itere em baixa resolução primeiro — no Soloa, rascunhos 480p custam $0.005/seg, então cem clipes de prática de 10 segundos custam cerca de $5. Trave o prompt, depois renderize novamente o vencedor em 1080p por $0.02/seg.
Resumindo: direcione, não descreva — câmera primeiro, uma batida de ação por shot, áudio no prompt. Depois itere implacavelmente, porque a $0.01/seg no Soloa as tentativas que tornam os clipes ótimos são basicamente gratuitas.
Mais de 50 modelos de IA para imagem, vídeo, voz e música. Uma assinatura, sem trocar de ferramenta.