Se rendre au contenu

Evaluation des LLM - semaine du 6 septembre 2026

6 septembre 2026 par

1. Ce qu'il faut retenir cette semaine

La semaine est marquée par une accélération des sorties chez les grands éditeurs américains : OpenAI a lancé GPT-6 Astra le 3 septembre 2026, présenté comme son modèle le plus performant à ce jour, tandis que Google DeepMind a mis en ligne Gemini 3.8 Flash le 2 septembre. Anthropic reste en tête de plusieurs classements (SWE-bench Verified, Artificial Analysis) avec sa famille Opus 5 / Fable 5.1, dont la nomenclature exacte reste toutefois à confirmer sur les canaux officiels du fournisseur.

Le rattrapage chinois se confirme dans plusieurs pays observés : la presse allemande (t3n) documente des développeurs basculant leurs usages professionnels vers Kimi K3, GLM-5.2 ou Qwen3.8-Max, et les données OpenRouter citées dans le classement mondial montrent que DeepSeek, Xiaomi et MiniMax contrôlent déjà 46,4% du volume de tokens en usage réel. En Chine même, le discours officiel (SuperCLUE) reconnaît que les modèles fermés étrangers restent en tête mais que l'écart se resserre, notamment sur le code (FrontierSWE : GLM à 74,4 points contre 75,1 pour Claude Opus 4.8).

Deux dossiers réglementaires structurent la semaine en Europe : l'entrée en vigueur des pouvoirs de sanction de la Commission européenne au titre de l'AI Act (2 août 2026, suivie par netzpolitik.org) et les demandes formelles d'information du Bureau européen de l'IA à plusieurs fournisseurs de modèles (L'Usine Digitale). En Corée du Sud, une controverse méthodologique agite le programme gouvernemental de modèles souverains : Motif Technologies, arrivé premier au benchmark AAII, a finalement été écarté de la 3e étape du projet, alimentant des accusations de "benchmaxing" et un débat sur la transparence des critères d'évaluation. Aux Émirats arabes unis, MBZUAI a publié K2 Horizon, une famille de six modèles présentée comme l'un des plus grands ensembles de poids entièrement ouverts jamais publiés. La collecte pour les Etats-Unis a échoué cette semaine ; aucune donnée américaine directe n'est donc disponible en dehors des informations relayées par les autres pays.

2. Classement des LLM de la semaine

RangModele (editeur, pays)Local ou APIPrix indicatif API ($/M tokens, entree-sortie)Points fortsLimites
1Claude Opus 5 (Anthropic, Etats-Unis)API5 / 25Leader SWE-bench Verified (96%), contexte 1M tokensPrix premium, raisonnement actif par defaut (conso tokens elevee)
2Claude Fable 5.1 (Anthropic, Etats-Unis)API10 / 50 (cache 0,25)#1 Artificial Analysis Intelligence Index (57/100), fort en ecriture creativePrix le plus eleve du marche ; retire temporairement par controle export (juin 2026)
3GPT-6 Astra (OpenAI, Etats-Unis)API10 / 50Lance le 3/09/2026, oriente usage ordinateur et taches agentiquesConnaissances arretees au 30/04/2026 ; possible pause des sorties suite a un incident de securite
4Claude Sonnet 5 (Anthropic, Etats-Unis)API3 / 15Positionnement prix/performance sous Opus et FableHausse de prix ~33% depuis la fin du tarif introductif (31/08/2026)
5GPT-5.6 Sol/Terra/Luna (OpenAI, Etats-Unis)APISol 5/30 ; Terra 2/12 ; Luna 0,20/1,20Contexte 1,05M tokens, gamme segmentee par coutn.c.
6Gemini 3.1 Pro (Google DeepMind, Etats-Unis)API2/12 (<200K) ; 4/18 au-delaContexte 2M tokens, rapport prix/perf competitifn.c.
7Gemini 3.8 Flash (Google DeepMind, Etats-Unis)API0,75/3,75 intro (jusqu'au 31/12/2026), puis 1,5/7,5Lance le 02/09/2026, meilleur en code que 3.1 Pro a moindre coutn.c.
8DeepSeek V4 Pro / Flash (DeepSeek, Chine)Local (poids ouverts) + APIPro 0,435/0,87 ; Flash 0,14/0,28Le moins cher des modeles de classe frontiere, leader coding-arena (llm-stats)Hausse de prix annoncee mais non encore publiee
9Kimi K3 (Moonshot AI, Chine)Local (poids ouverts, 26/07/2026)Gratuit en auto-hebergement ; API tiers n.c.Meilleur score open-weights sur Artificial Analysis Intelligence Index (50) et GPQA Diamondn.c.
10GLM-5.2 (Zhipu/Z.ai, Chine)Local (poids ouverts)Gratuit en auto-hebergement ; hebergement Mistral n.c.Meilleur resultat open-weights sur SWE-bench Pro (62,1%)n.c.
11Qwen3.7 Max (Alibaba, Chine)API~1,25 (entree)Score code 89 (t3n), proche des modeles fermes occidentauxn.c.
12Mistral Large 3 (Mistral AI, France)Local (Apache 2.0) + APIjusqu'a 6 (sortie)Performances fortes en langues europeennes, tourne sur un noeud 8xH100, souverainete RGPDN'a jamais domine les classements arena globaux
13Llama 4 Scout (Meta, Etats-Unis)Local (poids ouverts) + API~0,18/0,59Contexte 10M tokensn.c.
14MiMo-V2.5-Pro (Xiaomi, Chine)APIn.c.Leader sur ClawEval, GDPVal et SWE-bench Pro, contexte jusqu'a 1MPrix non communique

Mouvements de la semaine : deux lancements majeurs (GPT-6 Astra, Gemini 3.8 Flash) redistribuent la tête du classement qualité, tandis que les données d'usage réel (OpenRouter) confirment la montée des modèles chinois open-weights (DeepSeek, Xiaomi, MiniMax) qui captent près de la moitié du volume de tokens traités. Sur l'arène de code, Claude Opus 4.8 reste en tête (environ 1582 Elo) devant Opus 4.7. Anthropic ajuste ses tarifs de cache sans baisser ses prix d'entrée/sortie. La nomenclature "Fable"/"Mythos" chez Anthropic reste à vérifier sur une source officielle.

3. Tableau comparatif par pays

PaysSources marquantesSujets dominantsModeles cites
Etats-UnisCollecte en echec cette semainen.c.n.c.
ChineDataLearnerAI, SuperCLUE/Sohu, 36Kr, gm7.org, CNCERTGouvernance et securite IA, rattrapage benchmarks code, modeles multimodaux "du monde"Claude, GPT, Gemini, Kimi K2.5/K3, Qwen3-Max, DeepSeek, GLM, HiDream-O1-World
Allemagneheise/iX, t3n, netzpolitik, bigdata-insider, Fraunhofer, BitkomRattrapage chinois documente, entree en application de l'AI Act, souverainete europeenneKimi K3, GLM-5.2, Qwen3.7/3.8 Max, Ernie 5.0, Claude Opus 4.8, GPT-5.6, Teuken-7B
Coree du SudFinancial News, ZDNet Korea, Herald Economy, SedailyControverse sur l'evaluation des modeles souverains, benchmarks maison orientes productiviteUpstage Solar, SK Telecom A.X, LG EXAONE, Motif 3, GPT-5, Gemini 2.5 Pro, DeepSeek V3.1, Samsung Gauss 2.3
FranceBlog du Moderateur, JDN, Usine Digitale, Silicon.fr, ClubicControles reglementaires europeens, ecart adoption/industrialisation, fragmentation des comparatifs par usageClaude, Qwen, Moonshot, GLM, Gemini, DeepSeek, ChatGPT
CanadaVector Institute, Mila/Cohere, CIFAR, The LogicSouverainete industrielle de l'IA, evaluation multilingue/culturelle, securiteCommand A (Cohere), CANChat, ensemble de modeles frontieres testes par Vector
Emirats arabes unisThe National, MBZUAILancement d'une famille de modeles entierement ouvertsK2 Horizon (0,9B a 375B, MBZUAI)

4. Ce que ca change pour une PME

Le resserrement des ecarts de performance entre modeles de tete (25 points Elo seulement entre les quatre leaders selon le Stanford AI Index relaye par bigdata-insider.de) reduit l'interet de courir apres "le meilleur modele absolu" : le choix doit se faire sur le cas d'usage, le cout et la contrainte de donnees.

  • API cloud (GPT, Claude, Gemini) : mise en route rapide, pas de maintenance d'infrastructure, mais cout par token variable et dependance a un fournisseur externe pour les donnees transmises - point de vigilance renforce par les demandes d'information du Bureau europeen de l'IA aux fournisseurs de modeles.
  • Modeles locaux/poids ouverts (DeepSeek, Kimi K3, GLM-5.2, Llama 4 Scout, Mistral Large 3) : confidentialite maximale (donnees non transmises a un tiers), cout d'usage nul ou marginal une fois l'infrastructure en place, mais necessite des competences internes ou un prestataire pour l'hebergement, la mise a jour et la securisation.
  • Pour une PME toulousaine soumise au RGPD, Mistral Large 3 (poids ouverts Apache 2.0, conformite RGPD revendiquee, capable de tourner sur un seul noeud 8xH100) reste une option a examiner en priorite pour les usages sensibles en francais.
  • L'ecart releve en France entre adoption (71% des grandes entreprises selon IDC/Silicon.fr) et industrialisation reelle (moins de 30%) rappelle qu'un projet pilote mal cadre ne se transforme pas automatiquement en gain operationnel mesurable.

5. Conseils pratiques de la semaine

  • Ne pas se fier a un score de benchmark unique : privilegier des tests sur des taches metier reelles, a l'image de la demarche TRUEBench de Samsung ou de l'approche "Agentic Level" de Fraunhofer IAIS pour qualifier un veritable agent IA.
  • Verifier la date de fin des tarifs introductifs avant de budgeter un projet API (ex. Claude Sonnet 5, Gemini 3.8 Flash) : les hausses de prix post-promotion peuvent atteindre 30% et plus.
  • Pour les usages sensibles (donnees clients, documents internes), privilegier un modele local/poids ouverts heberge en interne ou chez un prestataire europeen, plutot qu'une API cloud americaine ou chinoise.
  • Suivre l'entree en application des pouvoirs de sanction de l'AI Act (depuis le 2 aout 2026) si l'entreprise deploie un systeme a usage general ou a haut risque.
  • Tester plusieurs modeles sur precision, vitesse et cout avant tout engagement, comme le fait la banque TD au Canada plutot que de se fier a un classement generaliste.

6. Sources

Veille generee automatiquement chaque dimanche par les agents IntelTec - sources citees ci-dessus.

Evaluation des LLM - semaine du 30 août 2026