
LTX-2.5 é um modelo de vídeo AI open-weights de 22 bilhões de parâmetros da LTX (desmembrada da Lightricks). Ele gera clipes de até 20 segundos em até 4K com áudio sincronizado nativo, e é mais rápido que tempo real — um clipe de 10 segundos renderiza em cerca de 6,8 segundos em hardware de ponta. A API oficial custa $0.09–$0.30/seg, mas Soloa o executa a partir de $0.01/seg — a geração de vídeo mais barata do mercado.
| LTX-2.5 em Resumo | Detalhes |
|---|---|
| Desenvolvedor | LTX (desmembrada da Lightricks) |
| Tamanho | 22B parâmetros, pesos abertos no Hugging Face |
| Saída | Até 4K, clipes de até 20 segundos, 24/25/48/50fps |
| Áudio | Áudio sincronizado nativo na mesma passagem |
| Velocidade | Clipe de 10s 720p em ~6,8s em NVIDIA GB200s duplas |
| Modos | Texto-para-vídeo, imagem-para-vídeo, primeiro/último quadro, áudio-para-vídeo |
| Licença | Grátis para organizações com menos de $10M ARR; licença comercial acima |
| Acesso mais barato | Soloa: $0.005–$0.02/seg, sem configuração |
LTX-2.5 é o mais novo modelo fundamental open-weights da família de vídeo LTX. Enquanto a maioria dos modelos de vídeo de fronteira (Veo, Kling, Seedance) são APIs fechadas, LTX publica seus pesos no Hugging Face — qualquer pessoa pode baixar, inspecionar, fazer fine-tuning ou hospedar o modelo. É gratuito para organizações com menos de $10 milhões em receita recorrente anual; empresas maiores negociam uma licença comercial.
Duas coisas o diferenciam tanto dos rivais fechados quanto de outros modelos abertos:
Na API oficial (fal.ai e outros provedores), LTX-2.5 vem em duas variantes:
| Variante | 720p | 1080p | 1440p | 4K |
|---|---|---|---|---|
| LTX-2.5 Fast | $0.09/seg | $0.13/seg | $0.19/seg | $0.30/seg |
| LTX-2.5 Pro | $0.12/seg | $0.17/seg | — | — |
Pro visa pipelines de nível cinematográfico (saída EXR, cor ACES, durações fixas de 6/8/10 segundos a 24/25/50fps). Fast cobre todo o resto, até 4K e 20 segundos, com um modo de duração "automática" que prevê o comprimento correto do clipe a partir da ação descrita. Ambas suportam 16:9 e 9:16 e incluem áudio em todos os níveis.
Baixe os pesos e execute-os localmente com uma GPU de 16GB+ VRAM. Não há taxa por clipe e sem marca d'água, mas você está pagando em hardware (ou ~$0.40–$2/hora em aluguel de GPU na nuvem), tempo de configuração, inícios frios e manutenção. Vale a pena para equipes de engenharia; exagero para criadores. Análise completa em nossa comparação de modelos open-weight.
Acesso simples de pagamento por segundo, com preços como outras APIs de fronteira. Um clipe de 20 segundos 1080p no Fast custa $2.60; dez iterações dele, $26.
Soloa opera seu próprio deployment LTX-2.5 sempre aquecido e repassa a economia de auto-hospedagem aos assinantes:
| Resolução | Soloa | API Oficial (Fast) | Economia |
|---|---|---|---|
| 480p | $0.005/seg | — | — |
| 720p | $0.01/seg | $0.09/seg | 9x mais barato |
| 1080p | $0.02/seg | $0.13/seg | 6.5x mais barato |
Está incluído em toda assinatura Soloa — planos incluem 20–50 gerações por dia — e suporta texto-para-vídeo, imagem-para-vídeo e primeiro/último-quadro-para-vídeo com áudio nativo, direto do navegador. Sem GPU, sem chaves API, sem inícios frios. Aquele clipe de 20 segundos 1080p custa $0.40; dez iterações, $4.
Nas classificações de qualidade, Seedance 2.5 da ByteDance e Veo 3.1 do Google ainda lideram em fidelidade cinematográfica. Mas a diferença de custo é enorme: texto-para-vídeo Seedance 2.5 custa $0.293/seg em 720p — cerca de 29x a taxa do LTX-2.5 da Soloa — e Veo 3.1 Standard com áudio é $0.40/seg, 40x mais. Para conteúdo social, rascunhos, b-roll, clipes de produtos e trabalho com muitas iterações, a qualidade-por-dólar do LTX-2.5 é incomparável em 2026. Veja a tabela completa do mercado em nossa comparação de custo por segundo.
A velocidade de geração parece um recurso de conveniência até você contar o que ela faz pela produção. Um modelo que leva 3–4 minutos por clipe (típico de modelos fechados pesados — MiniMax H3 tem média de ~264 segundos) permite testar talvez 10 ideias em uma hora. LTX-2.5 em infraestrutura aquecida retorna clipes em segundos a dezenas de segundos, então uma sessão de uma hora rende 40–60 iterações. Combinado com preços de $0.01/seg, isso transforma vídeo AI de uma ferramenta de "uma tomada cuidadosa" em um verdadeiro sandbox criativo — a mesma mudança que tornou a fotografia digital melhor que filme para a maioria dos fotógrafos profissionais.
LTX-2.5 usa um codificador de texto com fine-tuning que lê prompts como um diretor lê uma descrição de cena — frases completas superam listas de tags, e câmera, iluminação e áudio todos pertencem ao prompt. Escrevemos um guia de prompt LTX-2.5 dedicado com mais de 30 prompts para copiar e colar e um vocabulário de movimentos de câmera. E porque Soloa cobra $0.01/seg, você pode pagar pelas 5–10 iterações que separam um clipe decente de um ótimo — um luxo que custa dinheiro real em APIs de $0.09–$0.53/seg.
Os pesos são gratuitos para download e auto-hospedagem para organizações com menos de $10M ARR. Executá-los ainda custa dinheiro de GPU. O acesso hospedado mais barato é Soloa a $0.005–$0.02/seg, incluído em qualquer assinatura.
Mais rápido que tempo real em hardware de data center — cerca de 6,8 segundos para um clipe de 10 segundos 720p em NVIDIA GB200s duplas. Em plataformas hospedadas, as gerações normalmente são concluídas em bem menos de um minuto.
Sim. Ruído ambiente, música e diálogo são gerados nativamente na mesma passagem em todos os níveis de resolução — um dos poucos modelos abertos com áudio integrado.
Sim — imagem-para-vídeo com fixação opcional de quadro final, mais primeiro/último-quadro-para-vídeo, que interpola um clipe entre duas imagens estáticas. Ambos os modos estão disponíveis na aba LTX-2.5 da Soloa.
Uma GPU com pelo menos 16GB VRAM para o modelo base. Para a maioria dos criadores, acesso hospedado a $0.01/seg custa menos que a eletricidade e o tempo de executá-lo você mesmo.
Resumindo: LTX-2.5 tornou a geração de vídeo de qualidade de fronteira aberta e rápida. Soloa a tornou barata. Gere seu primeiro clipe a partir de $0.01/seg.
Mais de 50 modelos de IA para imagem, vídeo, voz e música. Uma assinatura, sem trocar de ferramenta.