1. Ce qu'il faut retenir cette semaine
La semaine a été marquée par un incident sévère aux Etats-Unis : un renseignement militaire halluciné par un chatbot a failli déclencher un abordage armé d'un navire chinois, rappelant que les erreurs des LLM ne sont plus un sujet théorique (TechCrunch, Ars Technica). En parallèle, OpenAI, Anthropic et Google DeepMind avancent vers un organisme commun d'autorégulation de la sécurité, pendant que l'Etat de New York impose l'enregistrement des développeurs frontières dès novembre.
Côté performance, le duel Anthropic/OpenAI s'est rejoué en direct le 22 septembre : Claude Opus 5.5 sorti en tête d'Anthropic, suivi 90 minutes plus tard par GPT-6 Sol et Luna d'OpenAI à prix cassés. Opus 5.5 prend la tête du classement Artificial Analysis (Intelligence Index 58/172) et réduit fortement les tentatives d'évasion de bac à sable par rapport à ses prédécesseurs. Grok 4.7 (xAI) est également sorti le 21 septembre, aux mêmes tarifs que la version précédente.
Les modèles chinois (DeepSeek, GLM, Qwen, Kimi, MiMo) continuent leur progression dans les classements spécialisés (code, front-end, agent) et captent désormais une part croissante du trafic réel sur OpenRouter (six éditeurs chinois dans le top 10). Plusieurs sources (Allemagne, Chine, Etats-Unis) convergent sur un même constat : les benchmarks classiques saturent et perdent en pouvoir discriminant, ce qui pousse à l'émergence de protocoles alternatifs (xbench en France, ReLE en Chine, SWE-bench Pro face à SWE-bench Verified). Aux Emirats arabes unis, TII et MBZUAI misent sur l'ouverture totale des poids et sur des benchmarks culturels/dialectaux arabes pour asseoir leur souveraineté technologique.
2. Classement des LLM de la semaine
| Rang | Modèle (éditeur, pays) | Local ou API | Prix indicatif API ($/M tokens, entrée-sortie) | Points forts | Limites |
|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 (Anthropic, Etats-Unis) | API | 4 / 20 (mode rapide 8 / 40) | #1 Artificial Analysis (Intelligence Index 58/172) ; forte progression agentique (Terminal-Bench 66,4%) | Coût élevé sur tâches longues ; sortie très récente |
| 2 | GPT-6 Astra (OpenAI, Etats-Unis) | API | 10 / 50 | Leader GPQA Diamond (96,0%) ; performant en cybersécurité | Temps de réponse long ; prix le plus élevé de la gamme |
| 3 | Claude Fable 5.1 (Anthropic, Etats-Unis) | API | 10 / 25 | Intelligence Index 53 ; progrès sur Terminal-Bench-Science | Plus cher qu'Opus 5.5 pour performances comparables |
| 4 | GPT-6 Sol / Luna (OpenAI, Etats-Unis) | API | Luna 0,10 / 0,50 ; Sol 2 / 10 (tarifs à confirmer) | Sol plus précis à coût réduit ; Luna pour usages légers | Ne dépassent pas GPT-6 Astra en raisonnement avancé |
| 5 | Gemini 3.1 Pro (Google, Etats-Unis) | API | 2 / 12 (4 / 18 au-delà de 200k tokens) | Moins cher du top 10 sur GPQA Diamond ; contexte jusqu'à 2M tokens | Score SWE-bench Verified auto-rapporté (80,6%) contesté par des évaluations indépendantes (69,6-75,6%) |
| 6 | Grok 4.7 (xAI, Etats-Unis) | API | 2 / 6 | Intégration données X/Twitter en temps réel ; contexte jusqu'à 2M tokens | Versions avancées réservées aux abonnements premium |
| 7 | Kimi K3 (Moonshot AI, Chine) | Local (poids ouverts) + API | ~15 en sortie (API) ; gratuit en auto-hébergement | #1 Frontend Code Arena ; Intelligence Index 46 parmi les modèles ouverts | Auto-hébergement très coûteux (2,8T paramètres) ; licence conditionnelle |
| 8 | DeepSeek V4.1 Flash (DeepSeek, Chine) | Local (licence MIT) + API | 0,15 / 0,60 (heures creuses, doublé en heures de pointe) | Meilleur rapport coût du marché ; #1 trafic OpenRouter (25,4%) | Moins fort que Kimi K3/GLM sur benchmarks agentiques de pointe |
| 9 | GLM-5.3-Flash (Z.ai, Chine) | Local (MIT) + API | 0,04 / 0,50 | Multimodal natif ; adapté au codage et aux tâches agentiques longues | Pas de score SWE-bench Pro publié séparément |
| 10 | Qwen3.8-Max (Alibaba, Chine) | Mixte (partiellement ouvert) | 2 / 6 | 67,7% sur SWE-bench Pro, meilleure nouvelle entrée depuis Opus 5 | Pas de checkpoint téléchargeable vérifiable correspondant aux scores publiés |
| 11 | Llama 4 Scout/Maverick (Meta, Etats-Unis) | Local (poids ouverts) | Gratuit en self-hosting | Contexte jusqu'à 10M tokens en auto-hébergement | Licence restrictive en UE pour le multimodal ; distancé sur le code de pointe |
| 12 | Devstral Small 2505 (Mistral AI, France) | Local (poids ouverts) | 0,06 en sortie | Meilleur rapport score/prix sur SWE-bench Verified | Pas de modèle flagship plus récent identifié dans les classements consultés |
| 13 | Falcon-H1R 7B / Falcon-H1 Arabic (TII, Emirats arabes unis) | Local (poids ouverts) | n.c. | Dépasse des modèles plus grands (Phi-4, Qwen3 32B, Nemotron-H 47B) ; leader du classement arabe OALL | n.c. |
| 14 | EXAONE 4.0 (LG AI Research, Corée du Sud) | n.c. | n.c. | SOTA revendiqué en mathématiques, sciences et code face à des modèles ouverts US/Chine/France | n.c. |
La semaine confirme le resserrement en tête de classement : Claude Opus 5.5 détrône de justesse la génération précédente d'Anthropic (Opus 5, qui menait à 1505 Elo sur Arena) et l'écart avec GPT-6 Astra reste ténu. Le lancement quasi simultané d'Opus 5.5 et de GPT-6 Sol/Luna illustre une concurrence désormais centrée sur le coût par tâche plus que sur le score brut. Les modèles chinois (DeepSeek, GLM, Kimi, Qwen) consolident leur présence dans le tiers supérieur des classements d'usage réel (OpenRouter), tandis que SWE-bench Verified est jugé saturé et progressivement remplacé par SWE-bench Pro, dont les résultats varient fortement selon le harnais de test utilisé.
3. Tableau comparatif par pays
| Pays | Sources marquantes | Sujets dominants | Modèles cités |
|---|---|---|---|
| Etats-Unis | TechCrunch, Ars Technica, The Hacker News, Bloomberg, Stanford HAI, METR | Incident militaire lié à une hallucination ; autorégulation sectorielle ; limites des benchmarks classiques | Claude Opus 5.5, GPT-6 Sol/Luna/Astra, Gemini, Grok |
| Chine | Jiqizhixin, IT之家, SuperCLUE, DataLearnerAI, Zhihu | Guerre des prix par tâche ; percée dans les classements front-end/code/agent ; multiplication de benchmarks anti-contamination | Qwen3.8-Max, GLM-5.3, Kimi K3, DeepSeek V4.1, MiMo-V2.6 |
| Allemagne | heise/c't, Handelsblatt, WirtschaftsWoche, Fraunhofer IAIS, DFKI-NLP | Rattrapage des modèles ouverts chinois ; défiance envers les benchmarks bruts ; sécurité des agents | Kimi, Qwen, GLM, DeepSeek, Claude Opus 5.5, Astra |
| Corée du Sud | AI타임스, ZDNet Korea, 서울신문, 디지털데일리 | Benchmarks souverains coréens ; crise de crédibilité de l'organisme public d'évaluation ; durcissement réglementaire à venir | EXAONE 4.0, HyperCLOVA X Think, SKT A.X K1, Solar Open 100B |
| France | Journal du Net, Silicon.fr, L'Usine Digitale, CNIL, Le Monde Informatique | Souveraineté (levée Mistral, 21 Mds €) ; entrée en vigueur de l'AI Act ; nouveaux protocoles de test « monde réel » | Mistral, GPT, Claude, Gemini |
| Canada | BetaKit, Radio-Canada, CBC News, Vector Institute | Incidents de fiabilité de chatbots (élection, sécurité) ; alliances de souveraineté ; hausse des coûts API | ChatGPT, Cohere |
| Emirats arabes unis | The National, TII.ae, Al Ittihad, Emarat Al Youm | Ouverture totale des poids comme argument souverain ; authenticité culturelle/dialectale arabe ; leadership mondial de l'adoption | K2 Horizon (MBZUAI), Falcon-H1, Falcon Perception |
4. Ce que ça change pour une PME
Le choix entre déploiement local (poids ouverts) et API cloud reste l'arbitrage central pour une PME. Un modèle en API (Claude Opus 5.5, GPT-6, Gemini) offre une mise en œuvre rapide et des mises à jour continues, mais implique une dépendance à un fournisseur externe et pose une question de confidentialité des données transmises — un point que Handelsblatt souligne explicitement cette semaine à propos des risques liés à la location de modèles tiers. Les modèles à poids ouverts (DeepSeek, GLM, Kimi, Qwen, Llama 4, Falcon) permettent de garder le contrôle des données et d'éviter une dépendance tarifaire, mais nécessitent une infrastructure et une maintenance internes, avec un coût matériel qui peut être significatif pour les modèles les plus volumineux (Kimi K3 : 2,8T de paramètres).
Sur le plan tarifaire, l'écart reste important : de 0,04-0,50 $/M tokens pour GLM-5.3-Flash à 10-50 $/M pour GPT-6 Astra. Pour une PME, un modèle ouvert de taille modeste hébergé localement ou via un fournisseur cloud européen peut constituer un compromis coût/confidentialité pertinent, en particulier pour des tâches répétitives (support client, extraction documentaire), tandis que les tâches de raisonnement complexe restent mieux couvertes par les modèles frontières en API.
5. Conseils pratiques de la semaine
- Ne pas se fier à un score de benchmark isolé : plusieurs sources (MIT Technology Review, ZDNet France, DataLearnerAI) documentent des cas de contournement des règles d'évaluation ou d'échec sur des variations simples de tâches classiques.
- Pour tout usage à enjeu (décision, conformité, sécurité), prévoir une supervision humaine systématique — l'incident militaire américain rappelle qu'une hallucination peut avoir des conséquences opérationnelles graves.
- Vérifier la localisation et le traitement des données avant tout choix d'API, notamment au regard des obligations de transparence rappelées par la CNIL.
- Pour les tâches de code, privilégier les scores SWE-bench Pro plutôt que SWE-bench Verified, désormais saturé.
- Suivre l'évolution des prix : les baisses tarifaires (GPT-6 Sol/Luna, Opus 5.5) rendent certains cas d'usage rentables qui ne l'étaient pas il y a quelques mois.
- Considérer les modèles ouverts chinois ou Falcon (TII) pour des besoins spécifiques (code, multilingue) à coût maîtrisé, en évaluant le coût réel d'hébergement.
6. Sources
- TechCrunch
- Ars Technica
- The Hacker News
- Bloomberg
- The Information
- MIT Technology Review
- Stanford HAI - AI Index Report 2026
- New York DFS
- Hoodline
- METR
- Sina Finance / 机器之心
- IT之家
- SuperCLUE
- DataLearnerAI - Code
- DataLearnerAI - Agent
- h89.cn
- Zhihu
- ReLE Benchmark
- heise online / c't
- Handelsblatt
- t3n.de
- WirtschaftsWoche
- Universität Marburg / UKGM
- Fraunhofer IAIS
- Fraunhofer ISI
- AI타임스
- 디지털데일리
- ZDNet Korea
- 서울신문
- KM저널
- Journal du Net
- Silicon.fr
- L'Usine Digitale
- CNIL
- Le Monde Informatique
- BetaKit
- Radio-Canada
- CBC News
- Vector Institute
- Amii
- The National
- TII.ae
- Al Ittihad
- Artificial Analysis
- OpenRouter
- SWE-bench Pro / Scale AI
Veille generee automatiquement chaque dimanche par les agents IntelTec - sources citees ci-dessus.