1. Ce qu'il faut retenir cette semaine
La semaine est marquée par une accélération des sorties chez les grands éditeurs américains : OpenAI a lancé GPT-6 Astra le 3 septembre 2026, présenté comme son modèle le plus performant à ce jour, tandis que Google DeepMind a mis en ligne Gemini 3.8 Flash le 2 septembre. Anthropic reste en tête de plusieurs classements (SWE-bench Verified, Artificial Analysis) avec sa famille Opus 5 / Fable 5.1, dont la nomenclature exacte reste toutefois à confirmer sur les canaux officiels du fournisseur.
Le rattrapage chinois se confirme dans plusieurs pays observés : la presse allemande (t3n) documente des développeurs basculant leurs usages professionnels vers Kimi K3, GLM-5.2 ou Qwen3.8-Max, et les données OpenRouter citées dans le classement mondial montrent que DeepSeek, Xiaomi et MiniMax contrôlent déjà 46,4% du volume de tokens en usage réel. En Chine même, le discours officiel (SuperCLUE) reconnaît que les modèles fermés étrangers restent en tête mais que l'écart se resserre, notamment sur le code (FrontierSWE : GLM à 74,4 points contre 75,1 pour Claude Opus 4.8).
Deux dossiers réglementaires structurent la semaine en Europe : l'entrée en vigueur des pouvoirs de sanction de la Commission européenne au titre de l'AI Act (2 août 2026, suivie par netzpolitik.org) et les demandes formelles d'information du Bureau européen de l'IA à plusieurs fournisseurs de modèles (L'Usine Digitale). En Corée du Sud, une controverse méthodologique agite le programme gouvernemental de modèles souverains : Motif Technologies, arrivé premier au benchmark AAII, a finalement été écarté de la 3e étape du projet, alimentant des accusations de "benchmaxing" et un débat sur la transparence des critères d'évaluation. Aux Émirats arabes unis, MBZUAI a publié K2 Horizon, une famille de six modèles présentée comme l'un des plus grands ensembles de poids entièrement ouverts jamais publiés. La collecte pour les Etats-Unis a échoué cette semaine ; aucune donnée américaine directe n'est donc disponible en dehors des informations relayées par les autres pays.
2. Classement des LLM de la semaine
| Rang | Modele (editeur, pays) | Local ou API | Prix indicatif API ($/M tokens, entree-sortie) | Points forts | Limites |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 (Anthropic, Etats-Unis) | API | 5 / 25 | Leader SWE-bench Verified (96%), contexte 1M tokens | Prix premium, raisonnement actif par defaut (conso tokens elevee) |
| 2 | Claude Fable 5.1 (Anthropic, Etats-Unis) | API | 10 / 50 (cache 0,25) | #1 Artificial Analysis Intelligence Index (57/100), fort en ecriture creative | Prix le plus eleve du marche ; retire temporairement par controle export (juin 2026) |
| 3 | GPT-6 Astra (OpenAI, Etats-Unis) | API | 10 / 50 | Lance le 3/09/2026, oriente usage ordinateur et taches agentiques | Connaissances arretees au 30/04/2026 ; possible pause des sorties suite a un incident de securite |
| 4 | Claude Sonnet 5 (Anthropic, Etats-Unis) | API | 3 / 15 | Positionnement prix/performance sous Opus et Fable | Hausse de prix ~33% depuis la fin du tarif introductif (31/08/2026) |
| 5 | GPT-5.6 Sol/Terra/Luna (OpenAI, Etats-Unis) | API | Sol 5/30 ; Terra 2/12 ; Luna 0,20/1,20 | Contexte 1,05M tokens, gamme segmentee par cout | n.c. |
| 6 | Gemini 3.1 Pro (Google DeepMind, Etats-Unis) | API | 2/12 (<200K) ; 4/18 au-dela | Contexte 2M tokens, rapport prix/perf competitif | n.c. |
| 7 | Gemini 3.8 Flash (Google DeepMind, Etats-Unis) | API | 0,75/3,75 intro (jusqu'au 31/12/2026), puis 1,5/7,5 | Lance le 02/09/2026, meilleur en code que 3.1 Pro a moindre cout | n.c. |
| 8 | DeepSeek V4 Pro / Flash (DeepSeek, Chine) | Local (poids ouverts) + API | Pro 0,435/0,87 ; Flash 0,14/0,28 | Le moins cher des modeles de classe frontiere, leader coding-arena (llm-stats) | Hausse de prix annoncee mais non encore publiee |
| 9 | Kimi K3 (Moonshot AI, Chine) | Local (poids ouverts, 26/07/2026) | Gratuit en auto-hebergement ; API tiers n.c. | Meilleur score open-weights sur Artificial Analysis Intelligence Index (50) et GPQA Diamond | n.c. |
| 10 | GLM-5.2 (Zhipu/Z.ai, Chine) | Local (poids ouverts) | Gratuit en auto-hebergement ; hebergement Mistral n.c. | Meilleur resultat open-weights sur SWE-bench Pro (62,1%) | n.c. |
| 11 | Qwen3.7 Max (Alibaba, Chine) | API | ~1,25 (entree) | Score code 89 (t3n), proche des modeles fermes occidentaux | n.c. |
| 12 | Mistral Large 3 (Mistral AI, France) | Local (Apache 2.0) + API | jusqu'a 6 (sortie) | Performances fortes en langues europeennes, tourne sur un noeud 8xH100, souverainete RGPD | N'a jamais domine les classements arena globaux |
| 13 | Llama 4 Scout (Meta, Etats-Unis) | Local (poids ouverts) + API | ~0,18/0,59 | Contexte 10M tokens | n.c. |
| 14 | MiMo-V2.5-Pro (Xiaomi, Chine) | API | n.c. | Leader sur ClawEval, GDPVal et SWE-bench Pro, contexte jusqu'a 1M | Prix non communique |
Mouvements de la semaine : deux lancements majeurs (GPT-6 Astra, Gemini 3.8 Flash) redistribuent la tête du classement qualité, tandis que les données d'usage réel (OpenRouter) confirment la montée des modèles chinois open-weights (DeepSeek, Xiaomi, MiniMax) qui captent près de la moitié du volume de tokens traités. Sur l'arène de code, Claude Opus 4.8 reste en tête (environ 1582 Elo) devant Opus 4.7. Anthropic ajuste ses tarifs de cache sans baisser ses prix d'entrée/sortie. La nomenclature "Fable"/"Mythos" chez Anthropic reste à vérifier sur une source officielle.
3. Tableau comparatif par pays
| Pays | Sources marquantes | Sujets dominants | Modeles cites |
|---|---|---|---|
| Etats-Unis | Collecte en echec cette semaine | n.c. | n.c. |
| Chine | DataLearnerAI, SuperCLUE/Sohu, 36Kr, gm7.org, CNCERT | Gouvernance et securite IA, rattrapage benchmarks code, modeles multimodaux "du monde" | Claude, GPT, Gemini, Kimi K2.5/K3, Qwen3-Max, DeepSeek, GLM, HiDream-O1-World |
| Allemagne | heise/iX, t3n, netzpolitik, bigdata-insider, Fraunhofer, Bitkom | Rattrapage chinois documente, entree en application de l'AI Act, souverainete europeenne | Kimi K3, GLM-5.2, Qwen3.7/3.8 Max, Ernie 5.0, Claude Opus 4.8, GPT-5.6, Teuken-7B |
| Coree du Sud | Financial News, ZDNet Korea, Herald Economy, Sedaily | Controverse sur l'evaluation des modeles souverains, benchmarks maison orientes productivite | Upstage Solar, SK Telecom A.X, LG EXAONE, Motif 3, GPT-5, Gemini 2.5 Pro, DeepSeek V3.1, Samsung Gauss 2.3 |
| France | Blog du Moderateur, JDN, Usine Digitale, Silicon.fr, Clubic | Controles reglementaires europeens, ecart adoption/industrialisation, fragmentation des comparatifs par usage | Claude, Qwen, Moonshot, GLM, Gemini, DeepSeek, ChatGPT |
| Canada | Vector Institute, Mila/Cohere, CIFAR, The Logic | Souverainete industrielle de l'IA, evaluation multilingue/culturelle, securite | Command A (Cohere), CANChat, ensemble de modeles frontieres testes par Vector |
| Emirats arabes unis | The National, MBZUAI | Lancement d'une famille de modeles entierement ouverts | K2 Horizon (0,9B a 375B, MBZUAI) |
4. Ce que ca change pour une PME
Le resserrement des ecarts de performance entre modeles de tete (25 points Elo seulement entre les quatre leaders selon le Stanford AI Index relaye par bigdata-insider.de) reduit l'interet de courir apres "le meilleur modele absolu" : le choix doit se faire sur le cas d'usage, le cout et la contrainte de donnees.
- API cloud (GPT, Claude, Gemini) : mise en route rapide, pas de maintenance d'infrastructure, mais cout par token variable et dependance a un fournisseur externe pour les donnees transmises - point de vigilance renforce par les demandes d'information du Bureau europeen de l'IA aux fournisseurs de modeles.
- Modeles locaux/poids ouverts (DeepSeek, Kimi K3, GLM-5.2, Llama 4 Scout, Mistral Large 3) : confidentialite maximale (donnees non transmises a un tiers), cout d'usage nul ou marginal une fois l'infrastructure en place, mais necessite des competences internes ou un prestataire pour l'hebergement, la mise a jour et la securisation.
- Pour une PME toulousaine soumise au RGPD, Mistral Large 3 (poids ouverts Apache 2.0, conformite RGPD revendiquee, capable de tourner sur un seul noeud 8xH100) reste une option a examiner en priorite pour les usages sensibles en francais.
- L'ecart releve en France entre adoption (71% des grandes entreprises selon IDC/Silicon.fr) et industrialisation reelle (moins de 30%) rappelle qu'un projet pilote mal cadre ne se transforme pas automatiquement en gain operationnel mesurable.
5. Conseils pratiques de la semaine
- Ne pas se fier a un score de benchmark unique : privilegier des tests sur des taches metier reelles, a l'image de la demarche TRUEBench de Samsung ou de l'approche "Agentic Level" de Fraunhofer IAIS pour qualifier un veritable agent IA.
- Verifier la date de fin des tarifs introductifs avant de budgeter un projet API (ex. Claude Sonnet 5, Gemini 3.8 Flash) : les hausses de prix post-promotion peuvent atteindre 30% et plus.
- Pour les usages sensibles (donnees clients, documents internes), privilegier un modele local/poids ouverts heberge en interne ou chez un prestataire europeen, plutot qu'une API cloud americaine ou chinoise.
- Suivre l'entree en application des pouvoirs de sanction de l'AI Act (depuis le 2 aout 2026) si l'entreprise deploie un systeme a usage general ou a haut risque.
- Tester plusieurs modeles sur precision, vitesse et cout avant tout engagement, comme le fait la banque TD au Canada plutot que de se fier a un classement generaliste.
6. Sources
- datalearner.com - Benchmarks de code
- Sohu - Rapport annuel SuperCLUE 2025
- qbitai.com - HiDream-O1-World
- gm7.org - Semaine de la cybersecurite 2026
- GitHub - benchmark ReLE
- shobserver.cn - Rapport securite LLM
- 36kr.com - FrontierSWE
- secrss.com - Gouvernance agents IA
- hxccc.org - Enregistrement des modeles
- cert.org.cn - Tests de securite collaboratifs
- heise.de/iX - Dossier USA vs Chine
- t3n.de - Kimi K3
- t3n.de - Comparatif Chine/USA
- t3n.de - Retour developpeur modeles chinois
- netzpolitik.org - AI Act
- bigdata-insider.de - Stanford AI Index 2026
- Fraunhofer IAIS - Agentic Level
- Fraunhofer IIS - Teuken-7B
- LAION - LAION-BVD
- Bitkom - Adoption IA en entreprise
- Financial News - Modeles fondation souverains coreens
- Korea.kr - Declaration officielle
- ZDNet Korea - Incident Motif
- Herald Economy - Recours Motif
- Hankyung - Scores detailles
- Ajunews - Polemique publique
- Bloter - Controverse benchmaxing
- OhmyNews - Bilan positionnement mondial
- Sedaily - TRUEBench Samsung
- News Seoul - Reconnaissance internationale
- Blog du Moderateur - WebDev Arena
- Journal du Net - Comparateur de modeles
- L'Usine Digitale - Controles reglementaires
- Le Monde Informatique - Nouveau modele Claude
- Silicon.fr - Benchmark plateformes IA
- Clubic - Comparatif chatbots
- LeMagIT - Lecture critique des benchmarks
- Donnees Personnelles - ChatGPT for Teens
- Vector Institute - State of Evaluation
- Mila/Cohere - Evaluation culturelle francophone
- CIFAR - Securite IA au Canada
- The Logic - CANChat
- The Logic - Comparatif TD
- Radio-Canada - Alerte securite
- Radio-Canada - Etude audiovisuel
- Mila - Strategie nationale IA
- Canadian AI - Fusion Cohere-Aleph Alpha
- AI Magazine Canada - Reference sectorielle
- The National - K2 Horizon
- Justin McKelvey - Prix Anthropic
- benchlm.ai - SWE-bench Verified
- Artificial Analysis - Classement modeles
- aipricing.guru - Prix Anthropic
- Tom's Hardware - GPT-6 Astra
- CloudZero - Prix OpenAI
- eesel.ai - Prix Gemini
- pecollective.com - Prix Anthropic
- aipricing.guru - Prix Google
- Google Cloud - Tarification Gemini
- felloai.com - Prix Gemini
- codersera.com - DeepSeek V4
- llm-stats.com - Open LLM Leaderboard
- OpenRouter - Collection OpenClaw
- morphllm.com - SWE-bench Pro
- aichatdaily.com - Mistral
- coworker.ai - Prix API
- digitalapplied.com - Classement OpenRouter
- secondtalent.com - Modeles Mistral
- techsy.io - Meilleurs LLM open source
- swfte.com - LMArena
- terabox.com - Classement usage reel OpenRouter
- morphllm.com - Tarification DeepSeek
Veille generee automatiquement chaque dimanche par les agents IntelTec - sources citees ci-dessus.