
LTX-2.5 lit les prompts comme un réalisateur lit une description de plan — des phrases complètes décrivant la caméra, le sujet, l'action, l'environnement et le style, pas des étiquettes séparées par des virgules. Maîtrisez cette structure et votre taux de clips utilisables passe de 1 sur 10 à 1 sur 3. Ce guide vous donne la formule exacte, un vocabulaire de mouvements de caméra, des indices audio, la syntaxe multiplan et des modèles que vous pouvez coller directement dans le générateur LTX-2.5 de Soloa.
LTX-2.5 utilise un encodeur de texte basé sur un modèle de langage affiné qui analyse la direction de scène, les relations spatiales et la causalité. La structure de prompt fiable superpose cinq composants dans l'ordre :
| Couche | Ce qu'il faut spécifier | Exemple de Fragment |
|---|---|---|
| 1. Caméra et objectif | Mouvement, angle, focale | « Un lent dolly-in sur un objectif anamorphique 35mm… » |
| 2. Sujet | Qui/quoi + attributs déterminants | « …une céramiste aux cheveux argentés portant un tablier taché d'argile… » |
| 3. Action et chronologie | Ce qui se passe, dans quel ordre | « …façonne un bol tournant, puis s'arrête pour inspecter le rebord… » |
| 4. Environnement et éclairage | Décor, source et direction de la lumière | « …dans un atelier ensoleillé, lumière dorée d'après-midi balayant l'air poussiéreux… » |
| 5. Style et fidélité | Aspect, étalonnage, qualité de rendu | « …réalisme documentaire, faible profondeur de champ, texture de peau fine. » |
Une couche supplémentaire est unique à LTX-2.5 : l'audio. Le modèle génère le son en même temps que l'image, donc le bruit ambiant, la musique et les dialogues appartiennent au prompt : « le tour bourdonne doucement, la pluie tapote contre le puits de lumière, pas de musique. »
Nommez explicitement un mouvement de caméra — c'est la phrase qui a le plus d'impact dans le prompt. Mouvements que LTX-2.5 exécute de manière fiable :
| Mouvement de Caméra | Effet | Utilisation |
|---|---|---|
| Slow dolly in | Approche fluide vers le sujet | Intensité émotionnelle, révélations |
| Dolly zoom (effet vertigo) | Zoom avant en reculant | Tension psychologique |
| Low-angle tracking shot | Mouvement parallèle au niveau du sol | Action, plans de puissance |
| 360-degree orbit | Rotation autour du point focal | Révélations de produits et personnages |
| FPV drone flythrough | Mouvement aérien rapide multi-axes | Paysages, plans d'établissement |
| Crane down / jib down | Descente verticale | Transitions large-intime |
| Macro rack focus | Changement de mise au point avant ↔ arrière | Narration détaillée, time-lapses |
| Locked-off tripod shot | Aucun mouvement | Dialogues, contenu style UGC |
Associez le mouvement à un objectif et une direction d'éclairage : objectif portrait 85mm, softbox principale depuis la gauche caméra. Le vocabulaire d'objectifs (anamorphique 35mm, macro 100mm), les références aux pellicules et les termes volumétriques (brouillard, poussière, vapeur, reflets de pluie) orientent tous notablement le rendu.
Une lente orbite à 360 degrés autour d'un boîtier d'écouteurs sans fil noir mat posé sur de l'ardoise humide, objectif macro, gouttelettes d'eau perlant sur le couvercle. Le boîtier s'ouvre lorsque la caméra passe devant, LED pulsant en bleu doux. Obscurité de studio avec une seule softbox en surplomb, reflets glissant sur la surface. Fidélité de photographie de produit nette. Audio : faible bourdonnement de synthétiseur ambiant, un léger clic lorsque le couvercle s'ouvre.
Un plan fixe style smartphone d'une femme d'environ 30 ans aux cheveux bouclés et portant un cardigan moutarde, assise dans une cuisine lumineuse, parlant directement à la caméra avec des gestes naturels des mains. Lumière matinale depuis une fenêtre à droite, léger balancement à main levée. Réalisme vlog décontracté, texture de peau naturelle. Audio : sa voix disant « J'ai essayé ça pendant une semaine — voici ce qui s'est passé », faible ambiance de cuisine.
Un survol FPV drone rasant les eaux turquoise peu profondes vers une falaise calcaire à l'heure dorée, puis montant rapidement pour révéler un village de pêcheurs illuminé de guirlandes lumineuses. Flares solaires à travers la brume sur un objectif grand angle 24mm, étalonnage cinématographique chaud avec ombres turquoise. Audio : rafale de vent, mouettes lointaines, partition ambiante montante.
Un rack focus macro commençant sur la vapeur s'élevant d'un bol de ramen, changeant la mise au point vers des baguettes soulevant des nouilles au ralenti, gouttelettes de bouillon captant la lumière tungstène chaude. Arrière-plan sombre d'izakaya avec lanternes en bokeh doux. Style riche de photographie culinaire éditoriale, détails élevés. Audio : léger grésillement, murmure tranquille de restaurant, tintement de baguettes.
Une séquence de trois plans de 12 secondes. Plan 1 : plan d'établissement large d'un atelier de réparation éclairé au néon dans une rue pluvieuse la nuit, reflets de flaques ondulant. Coupe vers Plan 2 : gros plan des mains tachées d'huile d'une mécanicienne soudant un rotor de drone, étincelles éclairant ses lunettes de sécurité en ambre. Coupe vers Plan 3 : vue par-dessus l'épaule alors que le drone décolle de sa paume et plane entre eux. Préserver l'apparence du personnage, l'intensité de la pluie, la palette de couleurs néon et la direction de l'éclairage à travers toutes les coupes. Audio : tapotement de pluie continu, sifflement de soudure dans le plan 2, montée du bourdonnement du rotor dans le plan 3.
Plan 1… Coupe vers Plan 2… — LTX-2.5 génère nativement plusieurs coupes en un seul passage.Faible : femme cyberpunk, marchant, lumières néon, rue pluvieuse, 8k, cinématique
Les étiquettes empilées par virgules produisent des mouvements saccadés et une composition générique parce que l'encodeur n'obtient aucune relation spatiale ou causale sur laquelle travailler. Réécrivez comme une direction :
Fort : « Un plan de suivi en contre-plongée suit une femme en veste de pluie translucide marchant dans une ruelle de marché saturée de néon la nuit, enseignes magenta et cyan se reflétant dans les flaques autour de ses bottes, vapeur dérivant entre les étals. Étalonnage cinématographique, faible profondeur de champ. Audio : pluie, musique synthétique lointaine, pas mouillés. »
| Paramètre | Recommandé | Notes |
|---|---|---|
| Guidance (CFG) | 3.0–4.2 | Au-dessus de ~5.0 provoque sursaturation et brûlure des couleurs |
| Steps | 25–35 (complet) · 8–12 (distillé) | Compromis vitesse vs détail |
| Denoise (i2v) | 0.45–0.65 | 0.45 préserve l'image source ; 0.65 permet la transformation |
| Duration | « auto » ou explicite | Auto prédit la durée du clip selon l'action décrite |
Un prompt négatif largement utilisé pour LTX-2.5 : flou, anatomie déformée, visages déformés, arrière-plan scintillant, saccade non naturelle, surexposé, arrêt sur image statique, filigranes, superpositions de texte. Sur Soloa, ces paramètres sont pré-réglés — vous écrivez simplement le prompt et choisissez un mode (text-to-video, image-to-video, ou première/dernière image).
Même avec une structure parfaite, les bons clips proviennent de variations : ajustez le mouvement de caméra, changez l'éclairage, resserrez la séquence d'action. Sur les API premium à $0.10–$0.53/sec, dix prises de 10 secondes coûtent $10–$53 — donc les gens arrêtent d'itérer tôt et se contentent de moins. Sur le LTX-2.5 de Soloa à $0.01/sec (720p), ces mêmes dix prises coûtent $1. L'itération abordable fait la différence entre tester trois idées et en tester trente — découvrez comment les tarifs se comparent sur le marché dans notre analyse du coût par seconde, ou obtenez le descriptif complet du modèle dans LTX-2.5 expliqué.
Deux à cinq phrases complètes. Assez long pour couvrir la caméra, le sujet, l'action, l'environnement, le style et l'audio — assez court pour que chaque plan ait une séquence claire. Les prompts à un seul mot ou en liste d'étiquettes donnent de mauvais résultats.
Oui. Mettez la ligne parlée entre guillemets dans le prompt (« elle dit : 'commençons' ») et décrivez le ton de la voix. L'audio est généré en même temps, synchronisé sur les lèvres du locuteur.
Utilisez le mode image-to-video ou première/dernière image avec une image de référence, répétez mot pour mot la même description de personnage dans tous les prompts, et ajoutez une clause de cohérence dans les prompts multiplan. Les deux modes sont disponibles sur Soloa.
Généralement des prompts empilés par étiquettes, des instructions de mouvement contradictoires, ou un guidance réglé trop haut. Réécrivez en phrases complètes avec direction, gardez un mouvement de caméra par plan, et restez dans la plage CFG 3.0–4.2.
Itérez d'abord en basse résolution — sur Soloa, les brouillons 480p coûtent $0.005/sec, donc une centaine de clips d'entraînement de 10 secondes coûte environ $5. Verrouillez le prompt, puis refaites le rendu du gagnant en 1080p pour $0.02/sec.
En résumé : dirigez, ne décrivez pas — caméra d'abord, une séquence d'action par plan, audio dans le prompt. Puis itérez sans relâche, car à $0.01/sec sur Soloa, les tentatives qui rendent les clips excellents sont pratiquement gratuites.
Plus de 50 modèles d'IA pour l'image, la vidéo, la voix et la musique. Un seul abonnement, sans jongler entre les outils.