Le classement de la génération vidéo IA a changé de tête en août. Alibaba a publié Wan 3.0, qui prend la première place et déloge Gemini Omni Flash après deux mois de règne. Dans le même temps, un modèle post-entraîné par fal s’est hissé sur le podium à 2,40 $ la minute, soit trois à dix fois moins cher que la concurrence directe.
Le marché se structure autour de deux logiques qui s’éloignent : d’un côté les modèles chinois, très bien classés et agressifs sur le prix, de l’autre les modèles occidentaux, plus chers mais mieux intégrés aux outils de production.
Ce classement s’appuie sur les arènes publiques d’Artificial Analysis, où des milliers d’utilisateurs comparent à l’aveugle deux vidéos générées à partir du même prompt. Les scores ELO ci-dessous portent sur les modèles avec audio et ont été relevés le 1er septembre 2026. Les tarifs sont exprimés par minute de vidéo générée.
1. Wan 3.0, Alibaba (Score ELO : 1 242)
Alibaba prend la tête du classement avec Wan 3.0, sorti en août. C’est la troisième génération du modèle en moins d’un an, et l’écart avec Wan 2.7 est net : 85 points ELO de mieux.
Le modèle génère de la vidéo avec audio synchronisé, gère les plans longs et tient la cohérence des personnages d’un plan à l’autre, ce qui reste le point de rupture de la plupart des concurrents.
À 12 $ la minute, il n’est pas donné, mais il reste deux fois moins cher que Veo 3.1 de Google pour un score supérieur de 150 points.
Le bémol : comme toute la gamme Wan, l’accès passe par les infrastructures d’Alibaba. Pour un usage professionnel européen impliquant des visages identifiables ou des données clients, la question de la conformité se pose sérieusement.
2. Gemini Omni Flash, Google (Score ELO : 1 237)
Google perd la première place pour cinq points, mais garde selon moi le meilleur rapport qualité/prix du haut de tableau. À 6 $ la minute, Omni Flash coûte deux fois moins cher que Wan 3.0 pour un score quasi identique.
Son autre avantage, c’est l’intégration. Le modèle est accessible depuis l’app Gemini, depuis Google Workspace et via l’API Vertex, avec des garanties contractuelles que les fournisseurs chinois n’offrent pas.
Il est aussi solide en image-to-video, où il se classe quatrième avec 1 179 points.
Le bémol : les rendus sont propres mais assez consensuels. Sur des demandes stylisées ou des univers visuels marqués, Kling et Seedance donnent des résultats plus intéressants.
3. MiniMax H3 Max (post-entraîné par fal), Fal (Score ELO : 1 235)
Voilà la vraie curiosité du mois. fal, une plateforme d’inférence, a repris le modèle open weights de MiniMax et l’a post-entraîné pour améliorer ses résultats. Le résultat dépasse le modèle d’origine de 8 points.
Surtout, il coûte 2,40 $ la minute, contre 7,80 $ pour le MiniMax H3 officiel. C’est le meilleur rapport score/prix du classement, et de loin.
Et ce n’est pas tout : ce modèle est aussi premier du classement image-to-video avec 1 203 points. Si vous partez d’une image fixe pour l’animer, c’est aujourd’hui le meilleur choix du marché, tous prix confondus.
Le bémol : vous dépendez d’une plateforme tierce plutôt que de l’éditeur du modèle. En cas de changement de politique tarifaire ou d’arrêt du service, il faut pouvoir basculer.
4. MiniMax H3, MiniMax (Score ELO : 1 227)
Le modèle original de MiniMax reste excellent et présente un avantage que les autres du top 5 n’ont pas : il est publié en poids ouverts. Vous pouvez donc l’héberger vous-même, ce qui règle d’un coup la question de la localisation des données.
Il tient la troisième place en image-to-video avec 1 185 points, et gère nativement l’audio.
À 7,80 $ la minute en API, il est cependant plus cher que la version post-entraînée par fal, pour un score inférieur. L’auto-hébergement est donc son vrai argument.
Le bémol : héberger un modèle vidéo demande une infrastructure GPU sérieuse. Ce n’est pas une option réaliste pour une petite structure.
5. Seedance 2.0, ByteDance (Score ELO : 1 221)
Le modèle de la maison mère de TikTok reste une valeur sûre, à 9,07 $ la minute. Il est deuxième en image-to-video avec 1 190 points, juste derrière la version fal de MiniMax.
Sa spécialité, c’est le contenu court et rythmé, calibré pour les formats verticaux des réseaux sociaux. Sans surprise vu son origine.
Le bémol : ByteDance reste opaque sur les conditions d’usage commercial de ses sorties. À vérifier avant d’en faire un pilier de production.
6. Wan 2.7, Alibaba (Score ELO : 1 157)
La génération précédente de Wan reste au classement et devient une option économique intéressante à 9 $ la minute. Si Wan 3.0 dépasse votre budget, la 2.7 offre encore un très bon niveau, notamment sur les scènes avec mouvement de caméra.
Le bémol : l’écart de 85 points avec la version 3.0 se voit sur les plans longs, où la cohérence se dégrade plus vite.
7. HappyHorse t1, Alibaba-ATH (Score ELO : 1 145)
HappyHorse continue de progresser et atteint 1 145 points dans sa version t1, contre 1 121 pour la 1.0. Il est aussi sixième en image-to-video.
Le modèle est réputé pour son rendu des mouvements naturels, en particulier les animaux et les scènes de foule, là où beaucoup de concurrents produisent des déformations.
À 9,90 $ la minute, il se positionne dans la moyenne haute du marché.
Le bémol : la documentation reste limitée et l’accès passe essentiellement par des plateformes tierces.
8. Kling 3.0 Pro, Kuaishou (Score ELO : 1 108)
Kling reste le modèle le plus utilisé par les créateurs pour une raison simple : son interface grand public est la plus aboutie. Vous n’avez pas besoin de toucher à une API pour produire une vidéo correcte.
La version 1080p Pro affiche 1 108 points, la 720p standard 1 100. Une déclinaison Omni existe également, autour de 1 089 points.
À 20,16 $ la minute en 1080p, c’est en revanche l’un des modèles les plus chers du classement, pour un score inférieur à des concurrents deux fois moins onéreux.
Le bémol : vous payez surtout le confort d’utilisation. Sur la performance pure au prix, Kling n’est plus compétitif.
9. SkyReels V4, Skywork AI (Score ELO : 1 103)
SkyReels garde sa niche : la génération de séquences narratives avec plusieurs plans enchaînés et des dialogues synchronisés. Pour un format court avec une histoire, c’est le modèle qui demande le moins de montage derrière.
Il est dixième en image-to-video avec 1 085 points.
À 21 $ la minute, c’est le plus cher du top 10. Le prix se justifie uniquement si vous exploitez sa capacité narrative.
Le bémol : sur un plan unique, vous payez très cher une fonctionnalité que vous n’utilisez pas.
10. Veo 3.1, Google DeepMind (Score ELO : 1 092)
Veo 3.1 recule dans le classement, mais reste incontournable pour une raison : c’est le modèle le mieux intégré aux outils professionnels. Il est disponible dans Vertex AI, dans Flow et dans YouTube, avec les garanties contractuelles de Google.
Deux déclinaisons méritent votre attention. Veo 3.1 Lite affiche 1 089 points pour seulement 4,80 $ la minute, soit un score quasi identique à la version complète pour cinq fois moins cher. Et Veo 3.1 Fast tourne à 9 $ la minute avec 1 086 points.
Franchement, à moins d’avoir besoin de la version complète pour une raison précise, la Lite est le meilleur choix de la gamme.
Le bémol : la version standard à 24 $ la minute est la plus chère du classement, pour un score que des modèles à 6 $ dépassent.
Les outsiders à surveiller
Trois modèles n’entrent pas dans le top 10 mais méritent votre attention selon votre usage.
PixVerse V6 (1 074 points, 6,90 $/min) reste un bon compromis pour les créateurs de contenus courts, avec une interface simple et des templates prêts à l’emploi.
Grok Imagine Video (1 062 points, 4,20 $/min) de SpaceXAI progresse surtout en image-to-video, où sa version t5 atteint 1 109 points et la cinquième place. C’est son meilleur terrain.
Agnes-Video-2.5 de Sapiens AI est la nouveauté à connaître pour les budgets serrés : 1 080 points pour 1,50 $ la minute, le tarif le plus bas du classement. À ce prix, l’écart de qualité avec le top 5 devient très discutable pour un usage web.
Enfin, Lightricks a publié LTX-2.5 en poids ouverts (1 060 points), une option à regarder si l’auto-hébergement est une contrainte de votre côté.
Le classement image-to-video, très différent du texte
Beaucoup d’utilisateurs partent d’une image plutôt que d’un texte. Sur cet usage, le classement n’a rien à voir :
| # | Modèle | Score ELO | Prix/min |
| 1 | MiniMax H3 Max (fal) | 1 203 | 2,40 $ |
| 2 | Seedance 2.0 720p | 1 190 | 9,07 $ |
| 3 | MiniMax H3 | 1 185 | 7,80 $ |
| 4 | Gemini Omni Flash | 1 179 | 6,00 $ |
| 5 | Grok Imagine Video t5 | 1 109 | 8,40 $ |
| 6 | HappyHorse t1 | 1 104 | 9,90 $ |
| 7 | MAGI-2 Preview (Sand.ai) | 1 099 | non communiqué |
| 8 | Veo 3.1 | 1 086 | 24,00 $ |
| 9 | SkyReels V4 | 1 085 | 21,00 $ |
Retenez surtout ceci : Wan 3.0, premier en text-to-video, n’apparaît pas dans le top de l’image-to-video. Si votre workflow part d’images, le modèle à choisir n’est pas le même.
Runway Gen-4.5, la référence occidentale hors classement
Runway reste absent des arènes publiques, faute d’accès API dans les conditions requises. Ce n’est pas pour autant un outil à ignorer.
Sa suite d’édition (motion brush, inpainting vidéo, contrôle de caméra) reste la plus complète du marché, et c’est encore l’outil que privilégient beaucoup de studios pour la post-production. Vous ne l’utilisez pas pour battre un score ELO, vous l’utilisez parce qu’il s’intègre dans une chaîne de production.
Le cas Sora : OpenAI toujours absent
OpenAI ne figure toujours dans aucun classement de génération vidéo. L’entreprise a recentré ses efforts sur les modèles de langage, les agents et sa propre infrastructure de calcul.
Concrètement, si vous cherchez un modèle vidéo aujourd’hui, l’offre se partage entre la Chine (Alibaba, ByteDance, MiniMax, Kuaishou) et Google. C’est une situation assez inhabituelle dans l’IA générative, où OpenAI donne généralement le tempo.
Les grandes tendances à retenir en septembre 2026
Le prix par minute s’écroule. Il y a six mois, générer une minute de vidéo correcte coûtait entre 15 et 25 $. Aujourd’hui, MiniMax H3 Max le fait pour 2,40 $ et Agnes-Video pour 1,50 $. C’est une division par dix en un semestre.
Le post-entraînement devient un métier. Le cas fal est révélateur : une plateforme d’inférence reprend un modèle ouvert, l’affine, et dépasse l’éditeur d’origine tout en divisant le prix par trois. Attendez-vous à voir se multiplier ces modèles dérivés.
Text-to-video et image-to-video divergent. Les deux classements n’ont plus grand-chose en commun. Choisir un modèle sans savoir de quoi part votre workflow n’a plus de sens.
L’écart Chine/Occident se creuse sur le prix. Les six premiers du classement sont chinois ou dérivés de modèles chinois. Google tient la comparaison sur la qualité, mais l’écart tarifaire avec la concurrence reste de un à quatre.
Comment choisir le bon modèle de génération vidéo IA ?
Pour la création de contenu social media
Seedance 2.0 pour les formats verticaux et le rythme, ou PixVerse V6 si vous voulez une interface simple avec des modèles prêts à l’emploi. Budget serré : Agnes-Video-2.5 à 1,50 $ la minute.
Pour des productions professionnelles et cinématiques
Wan 3.0 si la qualité prime, Gemini Omni Flash si vous voulez le meilleur compromis qualité/prix avec un cadre contractuel occidental. Pour la post-production, Runway reste incontournable.
Pour des narrations multi-plans et des dialogues
SkyReels V4 reste le seul à gérer proprement l’enchaînement de plusieurs plans avec des dialogues synchronisés. Cher, mais il vous fait gagner des heures de montage.
Pour partir d’une image existante
MiniMax H3 Max via fal, sans hésiter. Premier du classement image-to-video, à 2,40 $ la minute. Aucun autre modèle n’offre ce rapport aujourd’hui.
Pour un budget maîtrisé
Veo 3.1 Lite à 4,80 $ la minute avec un cadre Google, ou Agnes-Video-2.5 à 1,50 $ si vous acceptez un fournisseur moins établi.
Pour les équipes soumises au RGPD
MiniMax H3 ou LTX-2.5, tous deux en poids ouverts et donc auto-hébergeables. Sinon, Gemini Omni Flash via Vertex AI, avec un engagement contractuel sur la localisation des données.
Conclusion
Le classement a changé de tête, mais le vrai enseignement de ce mois-ci est ailleurs : vous n’avez plus besoin de payer 20 $ la minute pour obtenir une vidéo exploitable.
MiniMax H3 Max via fal offre le podium à 2,40 $. Veo 3.1 Lite vous donne du Google à 4,80 $. Agnes-Video descend à 1,50 $. Sur un projet de 30 minutes de rushes, le choix du modèle représente aujourd’hui un écart de plusieurs centaines de dollars pour une différence de qualité que votre audience ne verra pas.
Mon conseil reste le même : testez deux modèles sur votre propre cas d’usage avant de vous engager. Et vérifiez de quoi part votre workflow, texte ou image, parce que la réponse n’est pas la même.
Pour aller plus loin, j’ai aussi publié un classement des meilleurs modèles de langage et un comparatif des meilleurs générateurs d’images IA, tous deux mis à jour chaque mois.