
Quatre modèles vidéo IA open-weight sérieux existent en août 2026 : LTX-2.5 (22B), MiniMax H3 (33B), la famille Wan d'Alibaba et HunyuanVideo de Tencent. Tous publient des poids téléchargeables — mais « ouvert » ne signifie pas gratuit à exécuter. Entre les GPU, les licences et les composants API uniquement, le moyen le moins cher d'utiliser réellement le meilleur d'entre eux est un déploiement hébergé comme LTX-2.5 de Soloa à $0.01/sec.
| Modèle | Taille | Sortie Max | Audio | Licence | Hébergé À Partir De |
|---|---|---|---|---|---|
| LTX-2.5 (LTX / Lightricks) | 22B | 4K · 20s | ✅ Natif | Gratuit sous $10M ARR | $0.01/sec sur Soloa |
| MiniMax H3 (Hailuo 3.0) | 33.1B | 768p ouvert · 2K API | ✅ Stéréo | Licence Communautaire, <$20M revenus | $0.1625/sec (API officielle, 2K) |
| Wan 2.2 / 2.5 (Alibaba) | Variés | 1080p · 10s (aperçu 4K) | ✅ (2.5) | Apache 2.0 (2.2) | Varie selon le fournisseur |
| HunyuanVideo 1.5 (Tencent) | 13B | 720p · 15s | ✅ | Licence communautaire personnalisée | Varie selon le fournisseur |
LTX-2.5 est un modèle open-weights de 22B avec des poids sur Hugging Face, gratuit pour les organisations sous $10M ARR. Il génère jusqu'à des clips 4K de 20 secondes avec audio synchronisé natif, et c'est le modèle le plus rapide de sa catégorie — environ 6,8 secondes pour un clip 720p de 10 secondes sur du matériel NVIDIA haut de gamme, plus rapide qu'en temps réel. Son nouveau Diffusion Video Decoder et sa génération multishot native (personnages cohérents entre les plans) ont comblé la plupart de l'écart de qualité avec les modèles fermés. Analyse complète dans notre analyse approfondie de LTX-2.5.
MiniMax a lancé H3 le 31 juillet 2026 et l'a mis en open source le 3 août — un transformateur de 33,1B qui lit le texte, les images, la vidéo et l'audio comme un contexte unifié et produit des clips de 4 à 15 secondes avec son stéréo natif. La version ouverte fournit deux points de contrôle (FL2VA pour texte/image-vers-vidéo, Ref2VA pour jusqu'à 9 images de référence, 3 clips vidéo et 3 clips audio), avec des quantifications jusqu'à NVFP4. Le support ComfyUI a été ajouté le jour même.
Les limitations : les points de contrôle ouverts sont par défaut en 768p — l'upscaler 2K (H3-Regenerate-2K) et le préprocesseur de prompts (H3-Context-IR) restent API uniquement. L'encodeur de texte seul fait 48GB en pleine précision (14,6GB quantifié), donc ce n'est pas un modèle pour GPU grand public. L'API officielle coûte $0.1625/sec en 2K avec une latence de génération d'environ 4 minutes, et la Licence Communautaire limite l'utilisation commerciale gratuite à $20M de revenus annuels.
La famille Wan d'Alibaba est le favori en matière de licence : Wan 2.2 est Apache 2.0 — pas de plafond de revenus, pas de restrictions, véritablement gratuit pour un usage commercial. Le plus récent Wan 2.5 génère des clips 1080p jusqu'à 10 secondes avec dialogue synchronisé, son ambiant et musique en une seule passe (4K en aperçu). Si votre équipe juridique a besoin d'une licence claire avant tout, Wan 2.2 est la réponse ; si vous voulez les nouvelles capacités, vérifiez les conditions de chaque version de Wan individuellement — elles varient selon la version.
HunyuanVideo 1.5 de Tencent concentre un fort réalisme cinématographique dans seulement 13B de paramètres en utilisant un Causal 3D VAE, produisant des clips 720p de 15 secondes avec intégration audio. C'est le plus pratique à exécuter sur du matériel modeste des quatre, bien que sa licence communautaire personnalisée comporte plus de restrictions qu'Apache 2.0 — lisez-la avant de livrer un produit basé dessus.
Les poids ouverts éliminent la marge du fournisseur du modèle — pas le calcul. Pour générer réellement de la vidéo, vous avez besoin de :
Disons que les clips sont rendus en vitesse temps réel sur votre GPU loué et que vous payez $1/heure : cela fait ~$0.017 par seconde de vidéo si le GPU n'est jamais inactif — avant votre temps. C'est exactement pourquoi les déploiements open-weights hébergés ont du sens : Soloa maintient LTX-2.5 sur des serveurs toujours actifs et facture $0.01/sec en 720p — au niveau ou en dessous du coût DIY réaliste, sans configuration, et c'est inclus dans chaque abonnement (20–50 générations/jour). Économie de modèle ouvert, commodité de modèle fermé.
Les modèles fermés premium — Seedance 2.5, Veo 3.1 — mènent toujours en qualité pure pour les plans phares, à 15–40x le prix par seconde. Voir le tableau complet des tarifs du marché dans notre comparaison coût-par-seconde.
LTX-2.5 pour le meilleur rapport qualité-prix et vitesse ; MiniMax H3 pour le contrôle de référence multimodal ; Wan 2.2 pour la licence Apache 2.0 sans restriction. « Meilleur » dépend de si vous optimisez pour la sortie, le contrôle ou les conditions de licence.
Les points de contrôle 33B de base (FL2VA, Ref2VA) sont téléchargeables sous la Licence Communautaire MiniMax H3 — gratuit pour usage non commercial et pour les entreprises sous $20M de revenus. Mais l'upscaler 2K et le préprocesseur de prompts restent API uniquement, donc l'expérience phare complète n'est pas entièrement ouverte.
LTX-2.5 et HunyuanVideo fonctionnent sur des cartes 16GB+ VRAM (classe RTX 4080/4090). MiniMax H3 est de manière réaliste un travail multi-GPU ou cloud même quantifié. L'accès hébergé à $0.01/sec est moins cher que de mettre à niveau un GPU pour la plupart des gens.
Oui, dans le cadre de chaque licence : Wan 2.2 (Apache 2.0) n'a pas de limites, LTX-2.5 est gratuit sous $10M ARR, H3 sous $20M de revenus. Au-dessus de ces seuils vous négociez une licence commerciale — ou utilisez une plateforme hébergée qui gère la licence pour vous.
Parce que le calcul ne l'est pas. Une fois que vous comptez la location GPU, le temps d'inactivité et la configuration, le DIY coûte environ ce que Soloa facture pour LTX-2.5 ($0.01/sec en 720p) — sans l'interface navigateur, les serveurs actifs, les modes image-vers-vidéo et les quotas de génération quotidiens.
Conclusion : 2026 est l'année où la vidéo open-weight a rattrapé son retard. LTX-2.5 mène sur la vitesse et le coût, H3 sur le contrôle multimodal, Wan sur la licence. Et le moyen le moins cher d'utiliser le meilleur d'entre eux n'est pas un GPU dans votre placard — c'est $0.01/sec sur Soloa.
Plus de 50 modèles d'IA pour l'image, la vidéo, la voix et la musique. Un seul abonnement, sans jongler entre les outils.