La génération vidéo par IA a franchi un nouveau cap en 2026. Audio natif synchronisé, résolution 1080p voire 2K, durées de 15 à 30 secondes, scénarimage multi-plans intégré : les modèles d’aujourd’hui n’ont plus grand-chose à voir avec ceux de 2024. Et la hiérarchie vient encore de bouger : après un an de domination chinoise sans partage, Google est repassé en tête du classement avec Gemini Omni Flash, pendant qu’OpenAI achevait son retrait avec l’arrêt de Sora.
Qui domine vraiment le marché à la rentrée 2026 ? Quels sont les modèles à suivre pour vos créations vidéo ? Comment s’y retrouver entre Gemini Omni, MiniMax, Seedance, HappyHorse, Kling, Wan, SkyReels, Grok, Veo et Runway ? Pour y voir clair, je m’appuie sur le leaderboard officiel d’Artificial Analysis (arène « avec audio »), qui compare les modèles à l’aveugle via un système de votes humains et un score ELO comparable à celui utilisé aux échecs.
Voici mon tour d’horizon des 10 meilleurs modèles de génération vidéo IA en août 2026, avec les scores relevés le 1er août.
1. Gemini Omni Flash, Google (Score ELO : 1 245)
Google reprend la première place du leaderboard text-to-video, une position que la firme n’occupait plus depuis longtemps. Lancé auprès du grand public au Google I/O du 19 mai 2026 puis ouvert aux développeurs le 30 juin, Gemini Omni Flash confirme le choix stratégique de Google : plutôt que de sortir un « Veo 4 » séparé, la firme a fondu la vidéo dans la famille Gemini.
Sa force tient à cette intégration. Le modèle accepte n’importe quelle combinaison d’images, d’audio, de vidéo et de texte en entrée, et surtout il s’appuie sur la connaissance du monde réel des modèles Gemini, que je détaille dans mon classement des meilleurs LLM. Vous pouvez également retoucher vos vidéos par la conversation, sans repasser par un prompt complet. Autre argument de poids, le tarif : environ 6 $ la minute générée, soit quatre fois moins cher que Veo 3.1. La limite du moment, c’est la durée, plafonnée à 10 secondes par clip, un choix de déploiement assumé par Google plutôt qu’une contrainte du modèle. Accessible dans l’application Gemini, Google AI Studio, Flow et YouTube.
2. MiniMax H3, MiniMax (Score ELO : 1 238)
Voilà l’entrée fracassante du mois. Sorti le 31 juillet 2026, MiniMax H3 (aussi appelé Hailuo 3.0) s’installe immédiatement à la deuxième place, à sept points seulement du leader, alors qu’il n’avait que quelques jours d’existence au moment du relevé.
C’est le premier modèle du classement à générer nativement en 2K à 24 images par seconde, sur des clips de 4 à 15 secondes, avec un audio stéréo natif. Son système de contrôle accepte simultanément jusqu’à 9 images de référence, 3 extraits vidéo et 3 pistes audio, de quoi verrouiller le style, les personnages, les mouvements et les voix sur une série de plans. Il couvre le text-to-video, le contrôle de première et dernière image, la génération par référence, le transfert de mouvement et l’édition vidéo générative.
MiniMax annonce un coût de génération en 2K inférieur au tiers de celui des produits concurrents (7,80 $/minute mesurés par Artificial Analysis) et a prévu de publier les poids du modèle dans la foulée. Si cette promesse se confirme, ce serait le meilleur modèle vidéo librement téléchargeable du marché.
3. Seedance 2.0, ByteDance (Score ELO : 1 223)
Détrôné en text-to-video, Seedance 2.0 (décliné via Dreamina) reste numéro un mondial en image-to-video avec 1 196 points, sa spécialité historique. Sa force : une architecture unifiée audio-vidéo multimodale qui accepte simultanément des entrées texte, image, audio et vidéo, avec la possibilité de combiner jusqu’à 12 fichiers d’entrée. Vous pouvez ainsi utiliser une image pour fixer le style, une vidéo pour définir la caméra et un fichier audio pour caler le rythme.
Il produit du 1080p natif sur des plans continus de 10 à 20 secondes, avec une cohérence de personnage remarquable, et supporte le remplacement de personnage et l’édition de contenu à la volée. Comptez 9,07 $/minute. Intégré à CapCut et disponible sur le portail ByteDance Seed, qui pousse la même offensive sur l’image avec ses modèles Seedream, présents dans mon comparatif des meilleurs générateurs d’images IA.
Nouveauté à surveiller : Seedance 2.5, annoncé le 23 juin, promet des clips natifs de 30 secondes sans stitching et jusqu’à 50 références. Il est en bêta entreprise et n’est pas encore mesuré par l’arène.
4. Wan 2.7, Alibaba (Score ELO : 1 160)
Premier cheval d’Alibaba dans la course, Wan 2.7 progresse nettement grâce à sa révision de juin (référencée 260612), qui lui fait gagner une cinquantaine de points sur la version d’avril. Le modèle apporte des progrès marqués sur la qualité visuelle, l’audio et la dynamique de mouvement.
Mais c’est surtout sa fonction 9-grid qui marque les esprits : elle maintient l’identité de plusieurs personnages à la fois via jusqu’à neuf images de référence, un vrai bond pour la cohérence narrative multi-sujets. Pensé pour l’international, Wan 2.7 gère plus de 12 langues et excelle sur les contenus mêlant texte, tableaux et expressions mathématiques dans un même plan. À 9 $/minute, il se situe dans la moyenne du marché.
5. HappyHorse 1.1, Alibaba (Score ELO : 1 149)
La révélation de 2026 tient sa place. Développé par le Future Life Lab de Taotian (groupe Alibaba), HappyHorse 1.1, lancé le 22 juin, repose sur un Transformer auto-attentif unifié de 15 milliards de paramètres qui génère vidéo et audio en un seul passage, sans synchronisation labiale post-traitée.
La 1.1 ajoute une 4e modalité (l’édition vidéo), une synchronisation labiale « zero-drift » pour les dialogues longs et un rythme de parole contextuel. Il produit du 1080p, gère 7 langues nativement (dont le français) et génère un clip en une quarantaine de secondes sur un seul GPU H100, pour 9,90 $/minute.
Bon à savoir pour la souveraineté des données : Alibaba Cloud a ouvert deux zones de datacenter à Paris le 17 juin 2026, ce qui ouvre la voie à un déploiement conforme aux exigences européennes. C’est l’un des rares acteurs du haut de classement à pouvoir le proposer.
6. Kling 3.0 Pro, Kuaishou (Score ELO : 1 111)
Kling 3.0 Pro réunit génération text-to-video, image-to-video, référence-to-video et édition intra-vidéo dans un seul système unifié. Les atouts distinctifs : des clips jusqu’à 15 secondes en 1080p, un audio multilingue natif (anglais, mandarin, japonais, coréen, espagnol), et surtout une fonction AI Director qui permet de découper jusqu’à 6 plans dans une seule génération avec des transitions cohérentes. Kling excelle aussi sur la préservation du texte dans l’image (logos, signalétique, légendes), un atout clé pour les usages publicitaires e-commerce.
La variante Kling 3.0 Omni pousse plus loin la cohérence de personnage et le scénarimage multi-plans, avec sa fonction Elements qui extrait automatiquement les traits visuels et vocaux d’une vidéo de référence. Elle suit à 1 093 points.
Attention au budget : à 20,16 $/minute, Kling 3.0 Pro est l’un des modèles les plus chers du classement, pour un score inférieur à des concurrents deux fois moins onéreux. Accessible sur kling.ai, réservé aux abonnés Ultra.
7. SkyReels V4, Skywork AI (Score ELO : 1 108)
SkyReels V4 de Skywork AI reste un outsider crédible face aux géants chinois. Le modèle mise sur la qualité cinématographique et la cohérence des mouvements, avec un rendu 1080p et une bonne gestion de l’audio natif. Il se distingue par sa spécialisation sur les contenus narratifs et les formats courts.
Même réserve que pour Kling : à 21 $/minute, c’est le modèle le plus cher du top 10, ce qui le réserve aux productions où la signature visuelle prime sur le volume.
8. Veo 3.1, Google DeepMind (Score ELO : 1 095)
Veo 3.1 reste le modèle le plus accessible grand public grâce à son intégration dans Gemini, YouTube, Flow et Google Vids. Il produit du 1080p avec audio synchronisé sur des clips de 8 secondes, compensés par la fonction Extend qui permet de générer des vidéos d’une minute ou plus en enchaînant les séquences. La capacité « Ingredients to Video » (image de référence vers vidéo) et la fonction Insert (ajout d’un élément dans une scène existante) ont été largement améliorées.
Une précision utile désormais : avec l’arrivée de Gemini Omni Flash, Veo 3.1 devient le choix le moins rationnel de la gamme Google. À 24 $/minute contre 6 $ pour Omni Flash, et avec 150 points d’écart sur l’échelle ELO, il n’a plus vraiment d’argument sauf si votre workflow en dépend déjà. Les déclinaisons Veo 3.1 Fast (9 $/min) et Veo 3.1 Lite (4,80 $/min) restent en revanche pertinentes pour du volume.
9. PixVerse V6, PixVerse (Score ELO : 1 077)
PixVerse V6 transforme la génération vidéo IA en véritable workflow de production. Au menu : stabilité 1080p sur 15 secondes, moteur multi-plans intégré, génération audio native, plus de 20 contrôles de focale cinématographiques, et un support CLI pour les workflows développeurs.
Trois points forts : cohérence de personnage narratif entre les plans, gestion des mouvements de caméra extrêmes (fisheye POV, changements rapides d’éclairage) et réalisme physique dans les scènes d’action chaotiques (débris, étincelles, explosions). Le modèle répond particulièrement bien aux invites descriptives et littérales, évitez les métaphores pour obtenir le meilleur résultat. À 6,90 $/minute, PixVerse V6 offre l’un des meilleurs rapports qualité/prix du classement et cible en priorité les créateurs de contenu social media.
10. Grok Imagine Video, SpaceXAI (Score ELO : 1 067)
Changement de bannière à noter : depuis la fusion de xAI et SpaceX, le modèle d’Elon Musk apparaît désormais sous le nom de SpaceXAI dans les classements. Sa force reste la vitesse de génération (environ 30 secondes) et un audio natif de qualité généré sans post-production.
Surtout, ne vous fiez pas à son rang en text-to-video : la version grok-imagine-video-1.5 se place 4e mondial en image-to-video avec 1 114 points, juste derrière le trio de tête. Si vous partez d’une image existante, c’est un choix très sérieux. La limite : la résolution reste plafonnée à 720p. En contrepartie, la durée va jusqu’à 15 secondes, le modèle supporte tous les ratios d’aspect et son tarif est agressif, autour de 4,20 $/minute, dialogue et audio inclus. C’est le moins cher du top 10.
Runway Gen-4.5, la référence occidentale hors classement
Runway Gen-4.5 ne figure pas dans l’arène d’Artificial Analysis, mais reste la valeur sûre occidentale pour les créateurs professionnels. Son positionnement est clair : offrir le contrôle créatif maximal sur chaque paramètre de la génération, plutôt que de courir après le score ELO brut.
Le modèle excelle sur la précision physique (poids, élan, flux des liquides, interaction lumière-matière), la cohérence temporelle et la fidélité cinématographique, avec un rendu 720p par défaut et un upscaling 4K intégré. Il suit des directives de caméra détaillées et gère les scripts où un événement se déclenche après un trigger. Disponible sur tous les plans payants (environ 6,90 $/minute), avec l’un des écosystèmes logiciels les plus matures du marché, ce qui en fait un choix privilégié des studios et des agences.
Le cas Sora : OpenAI se retire de la course
Le pionnier de la génération vidéo IA a tiré sa révérence. OpenAI a définitivement arrêté les applications web et mobile de Sora le 26 avril 2026, et l’API Sora fermera le 24 septembre 2026. La génération vidéo est repliée à l’intérieur de ChatGPT : Sora 2 reste techniquement accessible aux abonnés Plus et Pro comme simple fonctionnalité, mais ce n’est plus un produit à part entière.
Si vous l’utilisez encore via l’API, il ne vous reste que quelques semaines pour migrer. La fin d’une époque, qui a libéré un espace que les acteurs chinois se sont empressés d’occuper, avant que Google ne revienne le reprendre.
Les grandes tendances à retenir en août 2026
Au-delà du classement, plusieurs mutations de fond se confirment :
- Google est revenu au sommet après un an de domination chinoise, et l’a fait avec le modèle le moins cher du podium. Gemini Omni Flash coûte 6 $/minute quand Kling 3.0 Pro en demande 20.
- Le prix ne suit plus la performance, et c’est le fait marquant de cette mise à jour. Les trois modèles les plus chers du classement (SkyReels V4, Kling 3.0 Pro, Veo 3.1) occupent les places 7, 6 et 8. Payer plus ne garantit plus rien.
- La 2K arrive, avec MiniMax H3 qui devient le premier modèle du top 10 à générer nativement dans cette résolution, audio stéréo compris.
- Les poids ouverts progressent, MiniMax ayant annoncé la publication des poids de H3, ce qui placerait un modèle de niveau podium à la portée de l’auto-hébergement.
- L’image-to-video reste un segment à part, où le classement diffère nettement : Seedance 2.0 y garde la tête et Grok Imagine 1.5 y grimpe à la 4e place, loin devant son rang en text-to-video.
- Le pionnier a fini de se retirer, l’API Sora fermant le 24 septembre. L’avance technologique ne suffit pas si le rythme d’itération décroche.
Comment choisir le bon modèle de génération vidéo IA ?
Le score ELO ne suffit pas pour décider : tout dépend de votre cas d’usage. Voici mes recommandations par profil.
Pour la création de contenu social media (TikTok, Reels, Shorts)
Grok Imagine Video reste le meilleur rapport rapidité/prix (4,20 $/minute, tous les ratios d’aspect), et PixVerse V6 tient la corde si vous voulez du 1080p sur 15 secondes. Gemini Omni Flash devient toutefois le choix par défaut dès que vos clips tiennent en 10 secondes.
Pour des productions professionnelles et cinématiques
Runway Gen-4.5 reste la valeur sûre grâce à son contrôle créatif granulaire et son écosystème mature. SkyReels V4 est une alternative crédible pour les contenus narratifs soignés, si le budget suit.
Pour des narrations multi-plans et des dialogues
MiniMax H3 prend l’avantage avec son système de références multiples (9 images, 3 vidéos, 3 pistes audio dans une même génération). Kling 3.0 Omni et son scénarimage multi-plans restent imbattables sur le contrôle plan par plan, et Wan 2.7 excelle sur la cohérence multi-personnages avec sa fonction 9-grid.
Pour partir d’une image existante
Le classement change complètement ici. Seedance 2.0 mène (1 196), suivi de Gemini Omni Flash (1 192) et MiniMax H3 (1 186), avec Grok Imagine 1.5 en embuscade à la 4e place. Ne reprenez pas le classement text-to-video pour cet usage.
Pour de l’édition et du compositing IA
Seedance 2.0 et HappyHorse 1.1 (avec sa modalité d’édition) excellent sur le remplacement de personnage et l’édition à la volée, tandis que MiniMax H3 ajoute l’édition vidéo générative et le transfert de mouvement. Des alternatives sérieuses aux outils de post-production traditionnels.
Pour les équipes enterprise
Gemini Omni Flash s’intègre nativement aux stacks Google Cloud via Vertex AI, et devient le choix le plus rationnel de la gamme. Runway propose des offres pro avec SLA, et Alibaba Cloud (HappyHorse), avec ses nouveaux datacenters à Paris, mise sur la conformité européenne.
Conclusion
Le paysage de la génération vidéo IA vient de connaître son deuxième basculement en un an. Après avoir laissé les laboratoires chinois prendre le contrôle du classement, Google est revenu en tête, et l’a fait sur le terrain du prix autant que sur celui de la qualité. Dans le même temps, MiniMax a prouvé qu’un modèle sorti depuis quelques jours pouvait se hisser à la deuxième place mondiale.
Choisir un modèle en 2026 revient donc à arbitrer entre des excellences différentes plutôt qu’entre des niveaux de qualité, et à vérifier le coût par minute avant de signer. Pour suivre l’évolution en temps réel, gardez un œil sur le leaderboard d’Artificial Analysis, mis à jour en continu et qui reste la référence la plus fiable du secteur.
Source : Artificial Analysis, Text-to-Video Arena Leaderboard (arène avec audio), données relevées le 1er août 2026.