Classement des meilleurs modèles d’IA (LLM) en septembre 2026

Classement des meilleurs modèles d’IA (LLM) en septembre 2026

Table des matières

Août n’a pas été un mois de rupture, mais de rattrapage. SpaceXAI a sorti Grok 4.6 le 12 août et a repris huit points d’un coup, de quoi se hisser au niveau de GPT-5.6 Sol. Z.ai a publié GLM-5.3, qui entre directement dans le top 6 alors que la version précédente pointait au-delà de la dixième place. Alibaba a enchaîné avec Qwen3.8, et Meta a mis à jour Muse Spark. Pendant ce temps, Anthropic n’a rien sorti de nouveau et garde quand même la première place avec Claude Opus 5.

Ce guide s’appuie sur les données d’Artificial Analysis, qui suit plus de 250 modèles et fait référence pour l’évaluation objective des IA. Un point de méthode important : la grille de notation a changé cet été. L’Intelligence Index intègre désormais des épreuves de travail de bureau agentique, de raisonnement physique, d’analyse d’incidents Kubernetes et de raisonnement visuel. Les scores ci-dessous ne sont donc pas comparables à ceux de mon classement du mois dernier : un modèle peut gagner deux points sans avoir bougé d’une ligne de code. Je le précise à chaque fois que ça compte.

Voici mon top 15 des LLM les plus performants en septembre 2026, avec leurs tarifs et mes recommandations selon votre cas d’usage.

Le top 15 des LLM les plus intelligents en septembre 2026

Le classement ci-dessous est basé sur l’Artificial Analysis Intelligence Index relevé le 1er septembre 2026. Le score synthétise les performances sur des benchmarks variés : agents autonomes, code, mathématiques, raisonnement scientifique, tenue d’instructions et compréhension du langage. J’ai retenu une ligne par modèle, dans sa meilleure configuration.

# Modèle Créateur Score Intelligence Contexte Prix/1M tokens (in/out)
1 Claude Opus 5 (max) Anthropic 63 1 M $5 / $25
2 Claude Fable 5 Anthropic 62 1 M $10 / $50
3 GPT-5.6 Sol (max) OpenAI 61 1 M $4 / $20
4 Grok 4.6 (high) SpaceXAI 61 500 K $2 / $6
5 Kimi K3 (max) Moonshot AI 60 1,05 M $3 / $15 (open)
6 GLM-5.3 (max) Z.ai 60 1 M $1,40 / $4,40 (open)
7 Qwen3.8 Max Alibaba 58 1 M $2 / $6
8 GLM-5.3-Flash Z.ai 57 1 M $0,15 / $0,50 (open)
9 Muse Spark 1.2 (xhigh) Meta 57 1,05 M $1,25 / $4,25
10 GPT-5.6 Terra (max) OpenAI 57 1 M $2 / $12
11 Gemini 3.7 Flash (high) Google 56 1 M $0,75 / $3,75
12 Qwen3.8-Flash-Next Alibaba 56 256 K $0,15 / $0,47
13 Claude Sonnet 5 (max) Anthropic 55 1 M $2 / $10
14 DeepSeek V4 Pro (max) DeepSeek 53 1 M $1,32 / $3,96 (open)
15 GPT-5.6 Luna (max) OpenAI 52 1 M $0,20 / $1,20

Analyse détaillée des modèles phares

Claude Opus 5 : premier pour le deuxième mois consécutif

Anthropic n’a rien lancé en août et reste pourtant en tête avec 63 points. Claude Opus 5 occupe même les quatre premières places du classement brut, puisque ses différents niveaux d’effort (max, xhigh, high) devancent la plupart des modèles concurrents.

Ce qui frappe, c’est la régularité. Le modèle ne gagne aucune épreuve avec un écart spectaculaire, mais il ne s’effondre nulle part. Sur le code agentique en particulier, il atteint 89 % au Terminal-Bench v2.1, la meilleure note du classement derrière une configuration de GPT-5.6.

Le prix reste son point faible : 5 $ par million de tokens en entrée et 25 $ en sortie. En coût réel par tâche, Artificial Analysis mesure 2,34 $, soit près de trois fois le tarif de Grok 4.6 pour un point d’avance.

Claude Fable 5 : le plus cher du marché

Fable 5 conserve la deuxième place avec 62 points, et reste le meilleur modèle sur les épreuves scientifiques (60 % au SciCode, premier du classement). C’est aussi le seul du top 3 à dépasser les 60 % sur le Terminal-Bench Hard.

Mais à 10 $ / 50 $ par million de tokens, il coûte deux fois le prix d’Opus 5 pour un point de moins. Je continue de le réserver aux tâches où la profondeur de raisonnement prime vraiment sur la facture : audit d’architecture, refactoring lourd, analyse scientifique.

GPT-5.6 Sol : OpenAI tient son rang

GPT-5.6 Sol grimpe à 61 points et reste la meilleure alternative américaine à Claude. Sa vraie force est ailleurs que dans le score global : c’est le meilleur modèle du classement sur le Terminal-Bench Hard (66 %), l’épreuve la plus difficile de code en autonomie, et il monte à 90 % sur le Terminal-Bench v2.1 dans sa configuration xhigh.

À 4 $ / 20 $, il est aussi 20 % moins cher qu’Opus 5. Pour un usage agentique intensif, c’est le rapport performance/prix le plus solide du haut de tableau.

Grok 4.6 : la vraie surprise du mois

C’est le mouvement le plus net d’août. Sorti le 12 août, Grok 4.6 affiche 61 points contre 56 pour Grok 4.5, et se hisse au niveau de GPT-5.6 Sol.

SpaceXAI n’a pourtant pas changé de modèle de base : l’entreprise a simplement passé plus de temps sur la phase de post-entraînement. Le résultat est là, avec 88 % au Terminal-Bench v2.1.

Surtout, c’est le modèle le moins cher du top 5, à 2 $ / 6 $ par million de tokens. Sa limite reste la fenêtre de contexte, plafonnée à 500 000 tokens quand la concurrence est à 1 million. Petit rappel utile : xAI n’existe plus sous ce nom, l’entité a été absorbée par SpaceX et s’appelle désormais SpaceXAI.

Les challengers qui redessinent le marché

GLM-5.3 : le meilleur rapport intelligence/prix du classement

Z.ai signe la plus grosse progression du mois. GLM-5.3 atteint 60 points et se place cinquième famille du classement, à égalité avec Kimi K3, alors que GLM-5.2 plafonnait à 53.

À 1,40 $ / 4,40 $, il coûte trois fois moins cher qu’Opus 5 pour trois points de moins. Et il est disponible en poids ouverts, donc auto-hébergeable. Si vous devez industrialiser un usage à gros volume sans exploser le budget, c’est aujourd’hui le meilleur candidat du marché.

La déclinaison GLM-5.3-Flash mérite aussi le détour : 57 points pour 0,15 $ / 0,50 $. C’est un rapport qualité/prix que personne d’autre n’approche à ce niveau de score.

Kimi K3 : l’open weights reste dans la course

Le modèle de Moonshot AI tient 60 points et confirme sa place parmi les meilleurs modèles en poids ouverts. Il est excellent en code scientifique (59 % au SciCode, deuxième du classement) et dispose de 1,05 million de tokens de contexte, le plus large du top 10.

Son défaut est mesuré : sa vitesse de génération plafonne à 38 tokens par seconde, contre 289 pour Gemini 3.7 Flash. Pour de l’interactif, ça se sent.

Qwen3.8 : Alibaba comble son retard

Qwen3.7 Max fermait la marche de mon classement d’août à 46 points. Qwen3.8 Max monte à 58, soit douze points de mieux. La version Qwen3.8-Flash-Next est encore plus intéressante pour un budget contraint : 56 points à 0,15 $ / 0,47 $, avec pour seule contrepartie un contexte réduit à 256 000 tokens.

Gemini 3.7 Flash : Google joue la vitesse

Google ne cherche plus à gagner le classement d’intelligence pure. Gemini 3.7 Flash affiche 56 points, mais génère 289 tokens par seconde, soit cinq fois plus vite que Claude Opus 5.

Pour tout ce qui est temps réel (chatbot, assistance en direct, traitement de flux), c’est le meilleur compromis du marché à 0,75 $ / 3,75 $.

Muse Spark 1.2 : Meta reste discret

Meta met à jour son modèle payant, qui passe de 51 à 57 points. Le contexte de 1,05 million de tokens et le tarif de 1,25 $ / 4,25 $ en font une option correcte, mais Meta reste absent des cas d’usage agentiques où se joue vraiment la compétition.

Comment choisir son LLM selon son cas d’usage

Pour la performance maximale

Claude Opus 5 reste le choix par défaut si le budget n’est pas le premier critère. C’est le modèle le plus régulier sur l’ensemble des épreuves, et le mieux placé sur le code agentique.

Pour le développement logiciel

GPT-5.6 Sol pour les agents en ligne de commande (meilleur score du classement sur les tâches les plus dures), Claude Opus 5 pour le travail sur des bases de code volumineuses. Si vous voulez le détail, j’ai consacré un classement complet aux meilleurs modèles IA pour coder.

Pour le meilleur rapport qualité/prix

Grok 4.6 à 2 $ / 6 $ pour un score de 61, ou GLM-5.3 à 1,40 $ / 4,40 $ pour 60 points. Ces deux modèles offrent aujourd’hui 95 % de la performance du leader pour moins de la moitié du prix.

Pour un budget serré ou la souveraineté

GLM-5.3-Flash (0,15 $ / 0,50 $) et Qwen3.8-Flash-Next (0,15 $ / 0,47 $) sont imbattables sur le prix. Les deux sont disponibles en poids ouverts, donc hébergeables sur vos propres serveurs si la localisation des données est un sujet. Gardez en tête qu’il s’agit de modèles chinois : pour un usage réglementé, l’auto-hébergement en Europe n’est pas une option, c’est une condition.

Pour traiter des documents volumineux

Kimi K3 et Muse Spark 1.2 offrent 1,05 million de tokens de contexte, soit environ 750 000 mots. Claude Opus 5, GPT-5.6 et Gemini 3.7 Flash sont à 1 million, ce qui suffit dans la quasi-totalité des cas.

Les tendances marquantes du marché en septembre 2026

L’écart se resserre par le bas. Il y a six mois, dix points séparaient le premier du dixième. Aujourd’hui, c’est six points. Les modèles chinois en poids ouverts (GLM, Qwen, Kimi, DeepSeek) occupent cinq des quinze places du classement, à des tarifs trois à dix fois inférieurs.

Le prix devient le vrai terrain de bataille. Artificial Analysis a d’ailleurs changé sa colonne principale : le classement affiche désormais un coût par tâche plutôt qu’un simple prix au token, parce que les modèles qui raisonnent longuement consomment beaucoup plus que leur tarif affiché ne le laisse croire. Claude Opus 5 coûte 2,34 $ par tâche, GLM-5.3 seulement 0,68 $.

La vitesse devient un critère de sélection à part entière. Entre Gemini 3.7 Flash à 289 tokens par seconde et Kimi K3 à 38, l’expérience utilisateur n’a rien à voir. Sur un usage conversationnel, ce facteur pèse souvent plus que deux points d’index.

Le post-entraînement compte autant que la taille. Grok 4.6 le démontre : même modèle de base que Grok 4.5, cinq points de plus. La course aux paramètres cède la place à la course au raffinage.

Conclusion : quel LLM choisir en septembre 2026 ?

Si vous voulez le meilleur sans compter, prenez Claude Opus 5. Il reste premier, et son avance sur le code agentique est réelle.

Si vous regardez la facture, la réponse a changé ce mois-ci. Grok 4.6 et GLM-5.3 rendent le haut de gamme discutable : 60 ou 61 points pour deux à quatre fois moins cher, c’est un arbitrage qui se défend dans la quasi-totalité des projets.

Et si vous industrialisez à gros volume, regardez sérieusement GLM-5.3-Flash et Qwen3.8-Flash-Next. Payer 0,15 $ le million de tokens en entrée pour un modèle à 56 ou 57 points, c’était impensable il y a six mois.

Je mets ce classement à jour chaque mois. Pensez à le mettre en favori pour suivre l’évolution du marché.

Passionné par les SaaS, l'IA et l'entrepreneuriat, j'ai fondé Digitiz en 2016. Mon objectif est de vous transmettre mon expérience et de pouvoir vous faire gagner du temps dans le choix de vos outils.

Partagez cet article sur les réseaux sociaux
Rejoignez la newsletter
+ de 100 000 professionels aidés grâce à Digitiz
Reviewer 1 Reviewer 2 Reviewer 3 Reviewer 4 Reviewer 5