
Quatro modelos sérios de vídeo AI de pesos abertos existem em agosto de 2026: LTX-2.5 (22B), MiniMax H3 (33B), família Wan da Alibaba e HunyuanVideo da Tencent. Todos publicam pesos para download — mas "aberto" não significa gratuito para executar. Entre GPUs, licenças e componentes exclusivos de API, a maneira mais barata de realmente usar o melhor deles é uma implantação hospedada como LTX-2.5 da Soloa a $0.01/seg.
| Modelo | Tamanho | Saída Máxima | Áudio | Licença | Hospedado A Partir De |
|---|---|---|---|---|---|
| LTX-2.5 (LTX / Lightricks) | 22B | 4K · 20s | ✅ Nativo | Gratuito abaixo de $10M ARR | $0.01/seg na Soloa |
| MiniMax H3 (Hailuo 3.0) | 33.1B | 768p aberto · 2K API | ✅ Estéreo | Licença Comunitária, <$20M receita | $0.1625/seg (API oficial, 2K) |
| Wan 2.2 / 2.5 (Alibaba) | Vários | 1080p · 10s (prévia 4K) | ✅ (2.5) | Apache 2.0 (2.2) | Varia por provedor |
| HunyuanVideo 1.5 (Tencent) | 13B | 720p · 15s | ✅ | Licença comunitária personalizada | Varia por provedor |
LTX-2.5 é um modelo de pesos abertos de 22B com pesos no Hugging Face, gratuito para organizações abaixo de $10M ARR. Ele gera clipes de até 4K, 20 segundos com áudio sincronizado nativo, e é o modelo mais rápido da classe — cerca de 6,8 segundos para um clipe de 10 segundos em 720p em hardware NVIDIA de ponta, mais rápido que o tempo real. Seu novo Diffusion Video Decoder e geração multishot nativa (personagens consistentes entre cortes) fecharam a maior parte da lacuna de qualidade com modelos fechados. Análise completa em nossa análise profunda do LTX-2.5.
MiniMax lançou H3 em 31 de julho de 2026 e tornou-o código aberto em 3 de agosto — um transformer de 33,1B que lê texto, imagens, vídeo e áudio como um contexto unificado e produz clipes de 4–15 segundos com som estéreo nativo. O lançamento aberto inclui dois checkpoints (FL2VA para texto/imagem-para-vídeo, Ref2VA para até 9 imagens de referência, 3 clipes de vídeo e 3 clipes de áudio), com quantizações até NVFP4. Suporte a ComfyUI foi disponibilizado no mesmo dia.
As ressalvas: os checkpoints abertos padrão são 768p — o upscaler 2K (H3-Regenerate-2K) e o pré-processador de prompt (H3-Context-IR) permanecem exclusivos de API. Apenas o codificador de texto tem 48GB em precisão total (14,6GB quantizado), então este não é um modelo para GPU de consumidor. A API oficial custa $0.1625/seg em 2K com latência de geração de ~4 minutos, e a Licença Comunitária limita o uso comercial gratuito a $20M de receita anual.
A família Wan da Alibaba é a favorita em licenciamento: Wan 2.2 é Apache 2.0 — sem limites de receita, sem restrições, genuinamente gratuito para uso comercial. O mais novo Wan 2.5 gera clipes de 1080p de até 10 segundos com diálogo sincronizado, som ambiente e música em uma passagem (4K em prévia). Se sua equipe jurídica precisa de uma licença limpa acima de tudo, Wan 2.2 é a resposta; se você quer as capacidades mais novas, verifique os termos de cada lançamento Wan individualmente — eles variam por versão.
HunyuanVideo 1.5 da Tencent compacta forte realismo cinemático em apenas 13B parâmetros usando um Causal 3D VAE, produzindo clipes de 15 segundos em 720p com integração de áudio. É o mais prático dos quatro para executar em hardware modesto, embora sua licença comunitária personalizada traga mais restrições que Apache 2.0 — leia antes de lançar um produto com ele.
Pesos abertos eliminam a margem do fornecedor do modelo — não a computação. Para realmente gerar vídeo você precisa de:
Digamos que clipes renderizem em velocidade de tempo real na sua GPU alugada e você pague $1/hora: isso é ~$0.017 por segundo de vídeo se a GPU nunca ficar ociosa — antes do seu tempo. É exatamente por isso que implantações hospedadas de pesos abertos fazem sentido: Soloa mantém LTX-2.5 em servidores sempre aquecidos e cobra $0.01/seg em 720p — igual ou abaixo do custo realista DIY, com zero configuração, e está incluído em toda assinatura (20–50 gerações/dia). Economia de modelo aberto, conveniência de modelo fechado.
Modelos fechados premium — Seedance 2.5, Veo 3.1 — ainda lideram em qualidade absoluta para tomadas principais, a 15–40x o preço por segundo. Veja a tabela de preços completa do mercado em nossa comparação de custo por segundo.
LTX-2.5 para qualidade-por-dólar geral e velocidade; MiniMax H3 para controle de referência multimodal; Wan 2.2 para licenciamento Apache 2.0 sem restrições. "Melhor" depende se você otimiza para saída, controle ou termos de licença.
Os checkpoints centrais de 33B (FL2VA, Ref2VA) são baixáveis sob a Licença Comunitária MiniMax H3 — gratuito para uso não comercial e para empresas abaixo de $20M de receita. Mas o upscaler 2K e o pré-processador de prompt permanecem exclusivos de API, então a experiência emblemática completa não é totalmente aberta.
LTX-2.5 e HunyuanVideo rodam em placas com 16GB+ VRAM (classe RTX 4080/4090). MiniMax H3 é realisticamente um trabalho multi-GPU ou em nuvem mesmo quantizado. Acesso hospedado a $0.01/seg é mais barato que atualizar uma GPU para a maioria das pessoas.
Sim, dentro de cada licença: Wan 2.2 (Apache 2.0) não tem limites, LTX-2.5 é gratuito abaixo de $10M ARR, H3 abaixo de $20M de receita. Acima desses limites você negocia uma licença comercial — ou usa uma plataforma hospedada que cuida do licenciamento para você.
Porque computação não é. Quando você conta aluguel de GPU, tempo ocioso e configuração, DIY custa aproximadamente o que Soloa cobra por LTX-2.5 ($0.01/seg em 720p) — sem a interface de navegador, servidores aquecidos, modos imagem-para-vídeo e cotas diárias de geração.
Resumindo: 2026 é o ano em que vídeo de pesos abertos alcançou os fechados. LTX-2.5 lidera em velocidade e custo, H3 em controle multimodal, Wan em licenciamento. E a maneira mais barata de usar o melhor deles não é uma GPU no seu armário — é $0.01/seg na Soloa.
Mais de 50 modelos de IA para imagem, vídeo, voz e música. Uma assinatura, sem trocar de ferramenta.