Août n’a pas été un mois de rupture, mais de rattrapage. SpaceXAI a sorti Grok 4.6 le 12 août et a repris huit points d’un coup, de quoi se hisser au niveau de GPT-5.6 Sol. Z.ai a publié GLM-5.3, qui entre directement dans le top 6 alors que la version précédente pointait au-delà de la dixième place. Alibaba a enchaîné avec Qwen3.8, et Meta a mis à jour Muse Spark. Pendant ce temps, Anthropic n’a rien sorti de nouveau et garde quand même la première place avec Claude Opus 5.
Ce guide s’appuie sur les données d’Artificial Analysis, qui suit plus de 250 modèles et fait référence pour l’évaluation objective des IA. Un point de méthode important : la grille de notation a changé cet été. L’Intelligence Index intègre désormais des épreuves de travail de bureau agentique, de raisonnement physique, d’analyse d’incidents Kubernetes et de raisonnement visuel. Les scores ci-dessous ne sont donc pas comparables à ceux de mon classement du mois dernier : un modèle peut gagner deux points sans avoir bougé d’une ligne de code. Je le précise à chaque fois que ça compte.
Voici mon top 15 des LLM les plus performants en septembre 2026, avec leurs tarifs et mes recommandations selon votre cas d’usage.
Le top 15 des LLM les plus intelligents en septembre 2026
Le classement ci-dessous est basé sur l’Artificial Analysis Intelligence Index relevé le 1er septembre 2026. Le score synthétise les performances sur des benchmarks variés : agents autonomes, code, mathématiques, raisonnement scientifique, tenue d’instructions et compréhension du langage. J’ai retenu une ligne par modèle, dans sa meilleure configuration.
| # | Modèle | Créateur | Score Intelligence | Contexte | Prix/1M tokens (in/out) |
| 1 | Claude Opus 5 (max) | Anthropic | 63 | 1 M | $5 / $25 |
| 2 | Claude Fable 5 | Anthropic | 62 | 1 M | $10 / $50 |
| 3 | GPT-5.6 Sol (max) | OpenAI | 61 | 1 M | $4 / $20 |
| 4 | Grok 4.6 (high) | SpaceXAI | 61 | 500 K | $2 / $6 |
| 5 | Kimi K3 (max) | Moonshot AI | 60 | 1,05 M | $3 / $15 (open) |
| 6 | GLM-5.3 (max) | Z.ai | 60 | 1 M | $1,40 / $4,40 (open) |
| 7 | Qwen3.8 Max | Alibaba | 58 | 1 M | $2 / $6 |
| 8 | GLM-5.3-Flash | Z.ai | 57 | 1 M | $0,15 / $0,50 (open) |
| 9 | Muse Spark 1.2 (xhigh) | Meta | 57 | 1,05 M | $1,25 / $4,25 |
| 10 | GPT-5.6 Terra (max) | OpenAI | 57 | 1 M | $2 / $12 |
| 11 | Gemini 3.7 Flash (high) | 56 | 1 M | $0,75 / $3,75 | |
| 12 | Qwen3.8-Flash-Next | Alibaba | 56 | 256 K | $0,15 / $0,47 |
| 13 | Claude Sonnet 5 (max) | Anthropic | 55 | 1 M | $2 / $10 |
| 14 | DeepSeek V4 Pro (max) | DeepSeek | 53 | 1 M | $1,32 / $3,96 (open) |
| 15 | GPT-5.6 Luna (max) | OpenAI | 52 | 1 M | $0,20 / $1,20 |
Analyse détaillée des modèles phares
Claude Opus 5 : premier pour le deuxième mois consécutif
Anthropic n’a rien lancé en août et reste pourtant en tête avec 63 points. Claude Opus 5 occupe même les quatre premières places du classement brut, puisque ses différents niveaux d’effort (max, xhigh, high) devancent la plupart des modèles concurrents.
Ce qui frappe, c’est la régularité. Le modèle ne gagne aucune épreuve avec un écart spectaculaire, mais il ne s’effondre nulle part. Sur le code agentique en particulier, il atteint 89 % au Terminal-Bench v2.1, la meilleure note du classement derrière une configuration de GPT-5.6.
Le prix reste son point faible : 5 $ par million de tokens en entrée et 25 $ en sortie. En coût réel par tâche, Artificial Analysis mesure 2,34 $, soit près de trois fois le tarif de Grok 4.6 pour un point d’avance.
Claude Fable 5 : le plus cher du marché
Fable 5 conserve la deuxième place avec 62 points, et reste le meilleur modèle sur les épreuves scientifiques (60 % au SciCode, premier du classement). C’est aussi le seul du top 3 à dépasser les 60 % sur le Terminal-Bench Hard.
Mais à 10 $ / 50 $ par million de tokens, il coûte deux fois le prix d’Opus 5 pour un point de moins. Je continue de le réserver aux tâches où la profondeur de raisonnement prime vraiment sur la facture : audit d’architecture, refactoring lourd, analyse scientifique.
GPT-5.6 Sol : OpenAI tient son rang
GPT-5.6 Sol grimpe à 61 points et reste la meilleure alternative américaine à Claude. Sa vraie force est ailleurs que dans le score global : c’est le meilleur modèle du classement sur le Terminal-Bench Hard (66 %), l’épreuve la plus difficile de code en autonomie, et il monte à 90 % sur le Terminal-Bench v2.1 dans sa configuration xhigh.
À 4 $ / 20 $, il est aussi 20 % moins cher qu’Opus 5. Pour un usage agentique intensif, c’est le rapport performance/prix le plus solide du haut de tableau.
Grok 4.6 : la vraie surprise du mois
C’est le mouvement le plus net d’août. Sorti le 12 août, Grok 4.6 affiche 61 points contre 56 pour Grok 4.5, et se hisse au niveau de GPT-5.6 Sol.
SpaceXAI n’a pourtant pas changé de modèle de base : l’entreprise a simplement passé plus de temps sur la phase de post-entraînement. Le résultat est là, avec 88 % au Terminal-Bench v2.1.
Surtout, c’est le modèle le moins cher du top 5, à 2 $ / 6 $ par million de tokens. Sa limite reste la fenêtre de contexte, plafonnée à 500 000 tokens quand la concurrence est à 1 million. Petit rappel utile : xAI n’existe plus sous ce nom, l’entité a été absorbée par SpaceX et s’appelle désormais SpaceXAI.
Les challengers qui redessinent le marché
GLM-5.3 : le meilleur rapport intelligence/prix du classement
Z.ai signe la plus grosse progression du mois. GLM-5.3 atteint 60 points et se place cinquième famille du classement, à égalité avec Kimi K3, alors que GLM-5.2 plafonnait à 53.
À 1,40 $ / 4,40 $, il coûte trois fois moins cher qu’Opus 5 pour trois points de moins. Et il est disponible en poids ouverts, donc auto-hébergeable. Si vous devez industrialiser un usage à gros volume sans exploser le budget, c’est aujourd’hui le meilleur candidat du marché.
La déclinaison GLM-5.3-Flash mérite aussi le détour : 57 points pour 0,15 $ / 0,50 $. C’est un rapport qualité/prix que personne d’autre n’approche à ce niveau de score.
Kimi K3 : l’open weights reste dans la course
Le modèle de Moonshot AI tient 60 points et confirme sa place parmi les meilleurs modèles en poids ouverts. Il est excellent en code scientifique (59 % au SciCode, deuxième du classement) et dispose de 1,05 million de tokens de contexte, le plus large du top 10.
Son défaut est mesuré : sa vitesse de génération plafonne à 38 tokens par seconde, contre 289 pour Gemini 3.7 Flash. Pour de l’interactif, ça se sent.
Qwen3.8 : Alibaba comble son retard
Qwen3.7 Max fermait la marche de mon classement d’août à 46 points. Qwen3.8 Max monte à 58, soit douze points de mieux. La version Qwen3.8-Flash-Next est encore plus intéressante pour un budget contraint : 56 points à 0,15 $ / 0,47 $, avec pour seule contrepartie un contexte réduit à 256 000 tokens.
Gemini 3.7 Flash : Google joue la vitesse
Google ne cherche plus à gagner le classement d’intelligence pure. Gemini 3.7 Flash affiche 56 points, mais génère 289 tokens par seconde, soit cinq fois plus vite que Claude Opus 5.
Pour tout ce qui est temps réel (chatbot, assistance en direct, traitement de flux), c’est le meilleur compromis du marché à 0,75 $ / 3,75 $.
Muse Spark 1.2 : Meta reste discret
Meta met à jour son modèle payant, qui passe de 51 à 57 points. Le contexte de 1,05 million de tokens et le tarif de 1,25 $ / 4,25 $ en font une option correcte, mais Meta reste absent des cas d’usage agentiques où se joue vraiment la compétition.
Comment choisir son LLM selon son cas d’usage
Pour la performance maximale
Claude Opus 5 reste le choix par défaut si le budget n’est pas le premier critère. C’est le modèle le plus régulier sur l’ensemble des épreuves, et le mieux placé sur le code agentique.
Pour le développement logiciel
GPT-5.6 Sol pour les agents en ligne de commande (meilleur score du classement sur les tâches les plus dures), Claude Opus 5 pour le travail sur des bases de code volumineuses. Si vous voulez le détail, j’ai consacré un classement complet aux meilleurs modèles IA pour coder.
Pour le meilleur rapport qualité/prix
Grok 4.6 à 2 $ / 6 $ pour un score de 61, ou GLM-5.3 à 1,40 $ / 4,40 $ pour 60 points. Ces deux modèles offrent aujourd’hui 95 % de la performance du leader pour moins de la moitié du prix.
Pour un budget serré ou la souveraineté
GLM-5.3-Flash (0,15 $ / 0,50 $) et Qwen3.8-Flash-Next (0,15 $ / 0,47 $) sont imbattables sur le prix. Les deux sont disponibles en poids ouverts, donc hébergeables sur vos propres serveurs si la localisation des données est un sujet. Gardez en tête qu’il s’agit de modèles chinois : pour un usage réglementé, l’auto-hébergement en Europe n’est pas une option, c’est une condition.
Pour traiter des documents volumineux
Kimi K3 et Muse Spark 1.2 offrent 1,05 million de tokens de contexte, soit environ 750 000 mots. Claude Opus 5, GPT-5.6 et Gemini 3.7 Flash sont à 1 million, ce qui suffit dans la quasi-totalité des cas.
Les tendances marquantes du marché en septembre 2026
L’écart se resserre par le bas. Il y a six mois, dix points séparaient le premier du dixième. Aujourd’hui, c’est six points. Les modèles chinois en poids ouverts (GLM, Qwen, Kimi, DeepSeek) occupent cinq des quinze places du classement, à des tarifs trois à dix fois inférieurs.
Le prix devient le vrai terrain de bataille. Artificial Analysis a d’ailleurs changé sa colonne principale : le classement affiche désormais un coût par tâche plutôt qu’un simple prix au token, parce que les modèles qui raisonnent longuement consomment beaucoup plus que leur tarif affiché ne le laisse croire. Claude Opus 5 coûte 2,34 $ par tâche, GLM-5.3 seulement 0,68 $.
La vitesse devient un critère de sélection à part entière. Entre Gemini 3.7 Flash à 289 tokens par seconde et Kimi K3 à 38, l’expérience utilisateur n’a rien à voir. Sur un usage conversationnel, ce facteur pèse souvent plus que deux points d’index.
Le post-entraînement compte autant que la taille. Grok 4.6 le démontre : même modèle de base que Grok 4.5, cinq points de plus. La course aux paramètres cède la place à la course au raffinage.
Conclusion : quel LLM choisir en septembre 2026 ?
Si vous voulez le meilleur sans compter, prenez Claude Opus 5. Il reste premier, et son avance sur le code agentique est réelle.
Si vous regardez la facture, la réponse a changé ce mois-ci. Grok 4.6 et GLM-5.3 rendent le haut de gamme discutable : 60 ou 61 points pour deux à quatre fois moins cher, c’est un arbitrage qui se défend dans la quasi-totalité des projets.
Et si vous industrialisez à gros volume, regardez sérieusement GLM-5.3-Flash et Qwen3.8-Flash-Next. Payer 0,15 $ le million de tokens en entrée pour un modèle à 56 ou 57 points, c’était impensable il y a six mois.
Je mets ce classement à jour chaque mois. Pensez à le mettre en favori pour suivre l’évolution du marché.