
LTX-2.5 lee prompts como un director de cine lee la descripción de una toma — oraciones completas que describen cámara, sujeto, acción, entorno y estilo, no etiquetas separadas por comas. Domina esa estructura y tu tasa de clips utilizables salta de 1 de cada 10 a 1 de cada 3. Esta guía te da la fórmula exacta, un vocabulario de movimientos de cámara, señales de audio, sintaxis multishot y plantillas que puedes pegar directamente en el generador LTX-2.5 de Soloa.
LTX-2.5 utiliza un codificador de texto de modelo de lenguaje ajustado que analiza dirección de escena, relaciones espaciales y causalidad. La estructura de prompt confiable organiza cinco componentes en orden:
| Capa | Qué Especificar | Fragmento de Ejemplo |
|---|---|---|
| 1. Cámara y lente | Movimiento, ángulo, distancia focal | "Un dolly-in lento con lente anamórfico 35mm…" |
| 2. Sujeto | Quién/qué + atributos definitorios | "…una ceramista de cabello plateado con delantal manchado de arcilla…" |
| 3. Acción y línea temporal | Qué sucede, en qué orden | "…moldea un cuenco giratorio, luego hace una pausa para inspeccionar el borde…" |
| 4. Entorno e iluminación | Escenario, fuente y dirección de luz | "…en un estudio iluminado por el sol, luz dorada de la tarde atravesando el aire polvoriento…" |
| 5. Estilo y fidelidad | Apariencia, gradación, calidad de renderizado | "…realismo documental, profundidad de campo reducida, textura fina de piel." |
Una capa más es única en LTX-2.5: audio. El modelo genera sonido en el mismo pase que la imagen, así que el ruido ambiente, música y diálogo pertenecen al prompt: "el torno zumba suavemente, la lluvia golpetea el tragaluz, sin música."
Nombra un movimiento de cámara explícitamente — es la frase de mayor impacto en el prompt. Movimientos que LTX-2.5 ejecuta confiablemente:
| Movimiento de Cámara | Efecto | Usar Para |
|---|---|---|
| Slow dolly in | Acercamiento suave hacia el sujeto | Intensidad emocional, revelaciones |
| Dolly zoom (vertigo effect) | Zoom in mientras se aleja | Tensión psicológica |
| Low-angle tracking shot | Movimiento paralelo a nivel del suelo | Acción, tomas de poder |
| 360-degree orbit | Gira alrededor del punto focal | Revelaciones de productos y personajes |
| FPV drone flythrough | Movimiento aéreo rápido multi-eje | Paisajes, planos de establecimiento |
| Crane down / jib down | Descenso vertical | Transiciones de amplio a íntimo |
| Macro rack focus | El enfoque cambia primer plano ↔ fondo | Narración de detalles, time-lapses |
| Locked-off tripod shot | Sin movimiento alguno | Diálogo, contenido estilo UGC |
Combina el movimiento con un lente y dirección de iluminación: lente de retrato 85mm, softbox clave desde la izquierda de la cámara. El lenguaje de lentes (anamórfico 35mm, macro 100mm), referencias a película cinematográfica y términos volumétricos (niebla, polvo, vapor, reflejos de lluvia) todos guían el renderizado notablemente.
Una órbita de 360 grados lenta alrededor de una caja de audífonos inalámbricos negra mate parada sobre pizarra húmeda, lente macro, gotas de agua formando perlas en la tapa. La caja se abre cuando la cámara pasa por el frente, LEDs pulsando azul suave. Oscuridad de estudio con un solo softbox superior, reflejos deslizándose por la superficie. Fidelidad nítida de fotografía de producto. Audio: zumbido sintético ambiental bajo, un clic suave cuando se abre la tapa.
Una toma estática estilo smartphone de una mujer de finales de sus 20s con cabello rizado y un cárdigan mostaza, sentada en una cocina luminosa, hablando directamente a la cámara con gestos naturales de manos. Luz matutina desde una ventana a la derecha, ligero balanceo de mano. Realismo casual de vlog, textura de piel natural. Audio: su voz diciendo "Probé esto durante una semana — esto es lo que pasó," ambiente tenue de cocina.
Un FPV drone flythrough rozando bajo sobre aguas turquesas hacia un acantilado de piedra caliza en la hora dorada, luego elevándose rápido para revelar un pueblo pesquero colgado de luces. El sol destella a través de la bruma con lente gran angular 24mm, gradación cinematográfica cálida con sombras turquesas. Audio: ráfaga de viento, gaviotas distantes, una banda sonora ambiental creciente.
Un macro rack focus comenzando en vapor saliendo de un tazón de ramen, cambiando el enfoque a palillos levantando fideos en cámara lenta, gotas de caldo capturando la luz cálida de tungsteno. Fondo oscuro de izakaya con linternas bokeh suaves. Estilismo rico de comida editorial, alto detalle. Audio: chisporroteo suave, murmullo silencioso de restaurante, clic de palillos.
Una secuencia de tres tomas de 12 segundos. Toma 1: plano de establecimiento amplio de un taller de reparaciones iluminado con neón en una calle lluviosa de noche, reflejos de charcos ondulando. Corte a Toma 2: primer plano de las manos manchadas de aceite de una mecánica soldando un rotor de dron, chispas iluminando sus lentes de seguridad en ámbar. Corte a Toma 3: sobre el hombro mientras el dron despega de su palma y flota entre ellos. Preservar apariencia del personaje, intensidad de lluvia, paleta de color neón y dirección de iluminación a través de todos los cortes. Audio: repiqueteo de lluvia en todo momento, silbido de soldadura en toma 2, zumbido creciente del rotor en toma 3.
Toma 1… Corte a Toma 2… — LTX-2.5 genera nativamente múltiples cortes en un solo pase.Débil: mujer cyberpunk, caminando, luces neón, calle lluviosa, 8k, cinematográfico
Las etiquetas apiladas con comas producen movimiento entrecortado y composición genérica porque el codificador no recibe relaciones espaciales o causales con las cuales trabajar. Reescribe como dirección:
Fuerte: "Una toma de seguimiento de ángulo bajo sigue a una mujer con chaqueta de lluvia translúcida caminando por un callejón de mercado empapado de neón de noche, letreros magenta y cian reflejándose en los charcos alrededor de sus botas, vapor flotando entre puestos. Gradación cinematográfica, profundidad de campo reducida. Audio: lluvia, música sintética distante, pasos húmedos."
| Parámetro | Recomendado | Notas |
|---|---|---|
| Guidance (CFG) | 3.0–4.2 | Por encima de ~5.0 causa sobresaturación y quemado de color |
| Steps | 25–35 (completo) · 8–12 (destilado) | Compromiso entre velocidad y detalle |
| Denoise (i2v) | 0.45–0.65 | 0.45 preserva la imagen fuente; 0.65 permite transformación |
| Duration | "auto" o explícito | Auto predice la duración del clip según la acción descrita |
Un prompt negativo ampliamente usado para LTX-2.5: blurry, distorted anatomy, warped faces, flickering background, unnatural jitter, overexposed, static freeze frame, watermarks, text overlays. En Soloa estos parámetros están pre-ajustados — solo escribes el prompt y eliges un modo (text-to-video, image-to-video, o first/last-frame).
Incluso con estructura perfecta, los grandes clips provienen de variaciones: ajusta el movimiento de cámara, cambia la iluminación, refina el beat de acción. En APIs premium a $0.10–$0.53/sec, diez tomas de 10 segundos cuestan $10–$53 — así que la gente deja de iterar temprano y se conforma. En LTX-2.5 de Soloa a $0.01/sec (720p), esas mismas diez tomas cuestan $1. La iteración económica es la diferencia entre probar tres ideas y probar treinta — mira cómo se comparan los precios en el mercado en nuestro desglose de costo por segundo, u obtén el resumen completo del modelo en LTX-2.5 explicado.
De dos a cinco oraciones completas. Lo suficientemente largo para cubrir cámara, sujeto, acción, entorno, estilo y audio — lo suficientemente corto para que cada toma tenga un beat claro. Los prompts de una sola palabra o listas de etiquetas tienen mal desempeño.
Sí. Pon la línea hablada entre comillas dentro del prompt ("ella dice: 'comencemos'") y describe el tono de voz. El audio se genera en el mismo pase, sincronizado con los labios del hablante.
Usa el modo image-to-video o first/last-frame con una imagen de referencia, repite la misma descripción del personaje palabra por palabra en los prompts, y agrega una cláusula de consistencia en prompts multishot. Ambos modos están disponibles en Soloa.
Usualmente por prompts con etiquetas apiladas, instrucciones de movimiento contradictorias, o guidance configurado muy alto. Reescribe como dirección en oraciones completas, mantén un movimiento de cámara por toma, y quédate en el rango CFG 3.0–4.2.
Itera primero en baja resolución — en Soloa, los borradores 480p cuestan $0.005/sec, así que cien clips de práctica de 10 segundos cuestan alrededor de $5. Fija el prompt, luego re-renderiza el ganador en 1080p por $0.02/sec.
Conclusión: dirige, no describas — cámara primero, un beat de acción por toma, audio en el prompt. Luego itera despiadadamente, porque a $0.01/sec en Soloa los reintentos que hacen grandes clips son básicamente gratis.
Más de 50 modelos de IA para imagen, video, voz y música. Una suscripción, sin cambiar de herramienta.