
Existen cuatro modelos serios de video AI de pesos abiertos en agosto de 2026: LTX-2.5 (22B), MiniMax H3 (33B), la familia Wan de Alibaba y HunyuanVideo de Tencent. Todos publican pesos descargables, pero "abierto" no significa gratis de ejecutar. Entre GPUs, licencias y componentes solo disponibles por API, la forma más económica de usar realmente el mejor de ellos es un despliegue alojado como LTX-2.5 de Soloa a $0.01/seg.
| Modelo | Tamaño | Salida Máx. | Audio | Licencia | Alojado Desde |
|---|---|---|---|---|---|
| LTX-2.5 (LTX / Lightricks) | 22B | 4K · 20s | ✅ Nativo | Gratis bajo $10M ARR | $0.01/seg en Soloa |
| MiniMax H3 (Hailuo 3.0) | 33.1B | 768p abierto · 2K API | ✅ Estéreo | Licencia Comunitaria, <$20M ingresos | $0.1625/seg (API oficial, 2K) |
| Wan 2.2 / 2.5 (Alibaba) | Varios | 1080p · 10s (vista previa 4K) | ✅ (2.5) | Apache 2.0 (2.2) | Varía según proveedor |
| HunyuanVideo 1.5 (Tencent) | 13B | 720p · 15s | ✅ | Licencia comunitaria personalizada | Varía según proveedor |
LTX-2.5 es un modelo de pesos abiertos de 22B con pesos en Hugging Face, gratuito para organizaciones bajo $10M ARR. Genera hasta clips de 4K de 20 segundos con audio sincronizado nativo, y es el modelo más rápido de su clase — aproximadamente 6.8 segundos para un clip de 10 segundos a 720p en hardware NVIDIA de gama alta, más rápido que tiempo real. Su nuevo Diffusion Video Decoder y generación multipano nativa (personajes consistentes entre cortes) cerraron la mayor parte de la brecha de calidad con los modelos cerrados. Desglose completo en nuestra inmersión profunda en LTX-2.5.
MiniMax lanzó H3 el 31 de julio de 2026 y lo hizo open-source el 3 de agosto — un transformador de 33.1B que lee texto, imágenes, video y audio como un contexto unificado y produce clips de 4–15 segundos con sonido estéreo nativo. La versión abierta incluye dos checkpoints (FL2VA para texto/imagen-a-video, Ref2VA para hasta 9 imágenes de referencia, 3 clips de video y 3 clips de audio), con cuantizaciones hasta NVFP4. El soporte de ComfyUI llegó el mismo día.
Las limitaciones: los checkpoints abiertos predeterminan a 768p — el upscaler 2K (H3-Regenerate-2K) y el preprocesador de prompts (H3-Context-IR) permanecen solo por API. El codificador de texto solo ocupa 48GB a precisión completa (14.6GB cuantizado), por lo que no es un modelo para GPU de consumidor. La API oficial cuesta $0.1625/seg en 2K con ~4 minutos de latencia de generación, y la Licencia Comunitaria limita el uso comercial gratuito a $20M de ingresos anuales.
La familia Wan de Alibaba es la favorita en licenciamiento: Wan 2.2 es Apache 2.0 — sin límites de ingresos, sin restricciones, genuinamente gratuito para uso comercial. El más reciente Wan 2.5 genera clips de 1080p de hasta 10 segundos con diálogo sincronizado, sonido ambiente y música en una pasada (4K en vista previa). Si tu equipo legal necesita una licencia limpia por encima de todo, Wan 2.2 es la respuesta; si quieres las capacidades más nuevas, revisa los términos de cada lanzamiento de Wan individualmente — varían según la versión.
HunyuanVideo 1.5 de Tencent empaqueta un fuerte realismo cinematográfico en solo 13B de parámetros usando un Causal 3D VAE, produciendo clips de 15 segundos a 720p con integración de audio. Es el más práctico de ejecutar en hardware modesto de los cuatro, aunque su licencia comunitaria personalizada conlleva más restricciones que Apache 2.0 — léela antes de lanzar un producto con ella.
Los pesos abiertos eliminan el margen del proveedor del modelo — no el cómputo. Para realmente generar video necesitas:
Digamos que los clips se renderizan a velocidad de tiempo real en tu GPU alquilada y pagas $1/hora: eso es ~$0.017 por segundo de video si la GPU nunca está inactiva — antes de tu tiempo. Por eso exactamente los despliegues alojados de pesos abiertos tienen sentido: Soloa mantiene LTX-2.5 en servidores siempre calientes y cobra $0.01/seg a 720p — al mismo precio o por debajo del costo realista de hacerlo tú mismo, con cero configuración, e incluido en cada suscripción (20–50 generaciones/día). Economía de modelo abierto, conveniencia de modelo cerrado.
Los modelos cerrados premium — Seedance 2.5, Veo 3.1 — aún lideran en calidad absoluta para tomas destacadas, a un precio 15–40x mayor por segundo. Ve la tabla completa de precios del mercado en nuestra comparación de costo por segundo.
LTX-2.5 para calidad-por-dólar general y velocidad; MiniMax H3 para control de referencia multimodal; Wan 2.2 para licenciamiento Apache 2.0 sin restricciones. "Mejor" depende de si optimizas por salida, control o términos de licencia.
Los checkpoints centrales de 33B (FL2VA, Ref2VA) son descargables bajo la Licencia Comunitaria MiniMax H3 — gratis para uso no comercial y para empresas bajo $20M de ingresos. Pero el upscaler 2K y el preprocesador de prompts permanecen solo por API, por lo que la experiencia insignia completa no es totalmente abierta.
LTX-2.5 y HunyuanVideo se ejecutan en tarjetas con 16GB+ VRAM (clase RTX 4080/4090). MiniMax H3 es realísticamente un trabajo de multi-GPU o nube incluso cuantizado. El acceso alojado a $0.01/seg es más económico que actualizar una GPU para la mayoría de la gente.
Sí, dentro de cada licencia: Wan 2.2 (Apache 2.0) no tiene límites, LTX-2.5 es gratuito bajo $10M ARR, H3 bajo $20M de ingresos. Por encima de esos umbrales negocias una licencia comercial — o usas una plataforma alojada que maneja el licenciamiento por ti.
Porque el cómputo no lo es. Una vez que cuentas el alquiler de GPU, tiempo inactivo y configuración, hacerlo tú mismo cuesta aproximadamente lo que Soloa cobra por LTX-2.5 ($0.01/seg a 720p) — sin la interfaz de navegador, servidores calientes, modos imagen-a-video y asignaciones diarias de generación.
Conclusión: 2026 es el año en que el video de pesos abiertos alcanzó a los demás. LTX-2.5 lidera en velocidad y costo, H3 en control multimodal, Wan en licenciamiento. Y la forma más económica de usar el mejor de ellos no es una GPU en tu armario — es $0.01/seg en Soloa.
Más de 50 modelos de IA para imagen, video, voz y música. Una suscripción, sin cambiar de herramienta.