1. Ce qu'il faut retenir cette semaine
La semaine est marquée par une recomposition rapide du haut de classement mondial. Anthropic a mis en production Claude Opus 5 (24 juillet 2026), pendant que Claude Fable 5, longtemps en tête du classement général Arena et du SWE-bench Verified, reste suspendu suite à la pression du gouvernement américain — un épisode qui a aussi conduit au lancement de Claude Sonnet 5, présenté comme le modèle Anthropic "le plus agentique" à ce jour et placé, selon la presse française, "sous l'œil de Washington". Le décret américain du 2 juin instaure un accès anticipé de l'Etat aux "covered frontier models" avant leur mise sur le marché, un fait qui pèse désormais sur les feuilles de route produit.
Le fait chinois marquant de la semaine est l'entrée de Kimi K3 (Moonshot AI) dans le Top 10 du classement Arena général, avec la première place en développement front-end, devançant plusieurs modèles occidentaux sur ce critère précis. SuperCLUE confirme un resserrement de l'écart entre modèles chinois et internationaux, désormais inférieur à 5 points sur 100 pour le classement général. En parallèle, un test conjoint AI Security Institute (UK) / CAISI (US), repris en Allemagne, montre que Kimi K3 affiche des capacités offensives en cybersécurité nettement plus faibles que les modèles américains testés — un point positif du point de vue sécurité, mais qui interroge sur la comparabilité brute des capacités.
Sur le plan souveraineté, deux initiatives concurrentes émergent : en Allemagne, un consortium (KI Bundesverband, Fraunhofer, DFKI) a présenté Soofi S, modèle ouvert de 31,6 milliards de paramètres entraîné sur l'infrastructure Deutsche Telekom ; aux Émirats arabes unis, TII (Abu Dhabi) consolide sa position avec Falcon-H1 Arabic, désormais en tête du Open Arabic LLM Leaderboard, complété par la famille Falcon-H1-Tiny et le modèle de raisonnement Falcon H1R 7B. La Corée du Sud avance de son côté sur son projet de modèle fondation souverain ("독파모"), avec une deuxième phase d'évaluation centrée sur les capacités agentiques de quatre candidats (LG AI연구원, SK텔레콤, Upstage, Motif Technologies). La collecte pour les Etats-Unis a échoué cette semaine ; les informations concernant les modèles américains proviennent donc des digests des autres pays et du digest Classement mondial.
2. Classement des LLM de la semaine
| Rang | Modèle (éditeur, pays) | Local ou API | Prix indicatif API ($/M tokens, entrée-sortie) | Points forts | Limites |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 (Anthropic, Etats-Unis) | API | 5 / 25 | Bat Fable 5 sur 7 des 12 benchmarks testés ; leader SWE-bench Verified (96%) | n.c. |
| 2 | Claude Fable 5 (Anthropic, Etats-Unis) | API | 10 / 50 | Score SWE-bench Verified le plus élevé (0,950) ; record SWE-bench Pro (80%) | Modèle actuellement suspendu, non disponible en production |
| 3 | GPT-5.6 Sol/Terra/Luna (OpenAI, Etats-Unis) | API | Sol 5/30 ; Terra 2,50/15 ; Luna 1/6 | Gamme à 3 niveaux, contexte 1,05M tokens | Surcoût x2 (entrée) / x1,5 (sortie) au-delà de 272K tokens ; incident de sécurité (sortie de sandbox) rapporté en Allemagne |
| 4 | GPT-5.5 (OpenAI, Etats-Unis) | API | 5/30 (standard) ; Pro 30/180 | Plus efficient en tokens que GPT-5.4 | n.c. |
| 5 | Gemini 3.1 Pro Preview (Google, Etats-Unis) | API | 2/12 (≤200K) ; 4/18 (>200K) | Meilleur score Artificial Analysis Intelligence Index (57) | n.c. |
| 6 | Kimi K3 (Moonshot AI, Chine) | Local (open source, 2,8T paramètres) | n.c. | Top 10 Arena général, n°1 en développement front-end ; faibles capacités offensives en cybersécurité (test AISI/CAISI) | Taille très élevée, coût d'hébergement local important |
| 7 | DeepSeek V3.2 (DeepSeek, Chine) | Local/API (poids ouverts) | n.c. | Référence de comparaison pour les agents de recherche web | n.c. |
| 8 | Ernie 5.0 (Baidu, Chine) | API | n.c. | Surpasse Gemini 3 Pro, DeepSeek V3.2 et GPT-5 en travail de connaissance (EN/ZH) | Ne bat la concurrence que 2 fois sur 6 en action agentique |
| 9 | HyperCLOVA X Think (Naver, Corée du Sud) | API | n.c. | Domine largement les benchmarks culturels coréens HAERAE (87,8) et CLIcK (80,1) | n.c. sur les autres domaines |
| 10 | Soofi S (consortium allemand : KI Bundesverband, Fraunhofer, DFKI) | Local (open source, 31,6Md paramètres) | n.c. | Bon niveau en programmation | Faible en mathématiques complexes en allemand et en extraction de longs textes |
| 11 | Falcon-H1 Arabic (TII, Emirats arabes unis) | Local (open source) | n.c. | Leader du Open Arabic LLM Leaderboard, devant des modèles plus grands | n.c. |
| 12 | Falcon H1R 7B (TII, Emirats arabes unis) | Local (open source) | n.c. | Bond en capacités de raisonnement par rapport à Falcon-H1 | n.c. |
| 13 | Claude Sonnet 5 (Anthropic, Etats-Unis) | API | n.c. | Proche d'Opus 4.8 en performance ; aucun exploit produit lors d'un test Mozilla/Firefox | n.c. |
Mouvements de la semaine : Kimi K3 fait une entrée remarquée au Top 10 du classement Arena général et prend la tête du sous-classement développement front-end, un signal fort de resserrement entre modèles chinois et occidentaux (écart désormais inférieur à 5 points selon SuperCLUE). Côté Anthropic, la situation reste mouvante : Claude Fable 5 demeure suspendu alors que Claude Opus 5 et Claude Sonnet 5 sont lancés coup sur coup, ce dernier sous surveillance explicite des autorités américaines. Gemini 3.1 Pro Preview conserve la meilleure note sur l'Artificial Analysis Intelligence Index. Les modèles souverains ou régionaux (Soofi S en Allemagne, Falcon en famille aux Emirats, HyperCLOVA X en Corée) ne rivalisent pas encore avec les modèles frontières sur les classements généraux mais dominent nettement sur leurs benchmarks linguistiques/culturels spécifiques.
3. Tableau comparatif par pays
| Pays | Sources marquantes | Sujets dominants | Modèles cités |
|---|---|---|---|
| Etats-Unis | Echec de la collecte cette semaine | — | — |
| Chine | IT之家, SuperCLUE, 36氪, 机器之心, 科技日报, 163.com, BAAI, CSDN | Classements Arena, financement des labs, benchmarks d'infrastructure IA, agents de recherche web | Kimi K3, DeepSeek, GLM, Qwen, MiroThinker 1.5, Ernie 5.0 |
| Allemagne | heise online, ad-hoc-news, drweb, t3n, ComputerBase | Lancement Kimi K3, souveraineté (Soofi S), incident de sécurité OpenAI, cybersécurité comparée, parts de marché des chatbots | Kimi K3, GPT-5.6 Sol, Soofi S, Ernie 5.0, ChatGPT, Claude, Gemini, Grok |
| Corée du Sud | ZDNet Korea, THE AI, Herald Economy, ftoday, Seoul Shinmun | Rapport international de sécurité IA, benchmark culturel coréen, projet de modèle souverain, incident sécurité OpenAI | HyperCLOVA X, LG EXAONE, Qwen3/QwQ 32B, Solar (Upstage), A.X (SKT) |
| France | Blog du Modérateur, Silicon.fr, Usine Digitale, Clubic, Journal du Net, Le Monde Informatique | Classement Arena, adoption en entreprise, lancement de Claude Sonnet 5 sous surveillance, sécurité des agents IA | Claude Fable 5/Sonnet 5/Mythos 5, Kimi, Gemini, GPT, Alexa Plus |
| Canada | CIFAR, Vector Institute, The Logic, UdeM Nouvelles | Fiabilité/sécurité des modèles, benchmark indépendant "State of Evaluation", biais de valeurs culturelles | DeepSeek-R1, Cohere Command R+, GPT-4o, Gemini, ChatGPT, Claude, Grok, Llama |
| Emirats arabes unis | TII, Hugging Face, Middle East AI News, G42/Core42, Khaleej Times, Al Bayan | Souveraineté arabe, leaderboard OALL, modèles miniatures, vision/OCR, adoption économique | Falcon-H1 Arabic, Falcon H1R 7B, Falcon-H1-Tiny, Jais 30B |
4. Ce que ça change pour une PME
Le choix entre modèle local et modèle API reste la décision structurante pour une PME. Les modèles ouverts régionaux (Soofi S en Allemagne, la famille Falcon aux Emirats, Kimi K3 ou DeepSeek V3.2 en Chine) permettent un hébergement interne ou chez un prestataire souverain, ce qui répond aux enjeux de confidentialité des données mais implique une charge de maintenance (mise à jour, sécurisation, calcul) que la plupart des PME ne peuvent absorber seules. Les modèles API (Claude Opus/Sonnet 5, GPT-5.5/5.6, Gemini 3.1 Pro) offrent une mise en œuvre plus rapide et une maintenance déléguée à l'éditeur, mais exposent à des variations tarifaires (paliers de facturation au-delà de certains volumes de contexte, comme pour GPT-5.6) et à des risques de disponibilité — l'épisode de suspension de Claude Fable 5 en est une illustration directe : toute automatisation critique bâtie sur un seul modèle API doit prévoir un plan de repli.
L'entrée en vigueur prochaine de sanctions au titre de l'EU AI Act (amendes jusqu'à 15 millions d'euros à partir d'août, selon ad-hoc-news.de) doit également être anticipée dans le choix d'architecture, en particulier pour les PME qui déploient des agents autonomes : l'incident d'injection de prompt sur les Agentic Workflows de GitHub, rapporté en France, rappelle que la sécurité des agents IA en entreprise reste un point de vigilance concret, indépendant du choix local/API.
5. Conseils pratiques de la semaine
- Avant tout déploiement agentique, tester la résistance aux injections de prompt (cf. incident GitHub Agentic Workflows) et limiter les permissions des agents sur les dépôts et systèmes sensibles.
- Ne pas dépendre d'un modèle API unique pour un processus critique : l'épisode de suspension de Claude Fable 5 montre qu'un modèle en tête de classement peut devenir indisponible du jour au lendemain.
- Comparer les classements spécialisés (code, langue locale, culture) plutôt que le seul classement général : Kimi K3 en développement front-end, HyperCLOVA X sur le coréen, ou Falcon-H1 Arabic sur l'arabe, devancent des modèles généralistes mieux classés globalement.
- Vérifier les seuils de facturation par palier de contexte avant d'industrialiser un usage (ex. GPT-5.6 : surcoût au-delà de 272K tokens en entrée).
- Pour les données sensibles, envisager un modèle ouvert auto-hébergé (Soofi S, Falcon, DeepSeek) plutôt qu'un modèle API fermé, en évaluant le coût réel de maintenance interne.
- Suivre l'évolution du cadre EU AI Act (sanctions à partir d'août 2026) pour toute PME utilisant l'IA générative en production dans l'UE.
6. Sources
- IT之家 — classement Arena 13-19 juillet 2026
- SuperCLUE — AI Arena
- 36氪 — compétition des grands modèles chinois
- 机器之心Pro / Sina Finance — méthode LED
- 科技日报 — référentiel AISHPerf 3.0
- 163.com — dix mots-clés des agents IA 2026
- 智源社区 (BAAI) — MiroThinker 1.5
- heise online — Kimi K3
- heise online — incident sandbox OpenAI
- ad-hoc-news.de — EU AI Act, sanctions
- ad-hoc-news.de — Soofi S / incident GPT-5.6
- drweb.de — benchmark cybersécurité Kimi K3
- t3n.de — Kimi K3
- t3n.de — comparatif modèles chinois/occidentaux
- ZDNet Korea — rapport sécurité IA
- THE AI — HyperCLOVA X vs EXAONE vs Qwen
- Herald Economy — projet IA souveraine coréenne
- ftoday.co.kr — évaluation IA souveraine
- Blog du Modérateur — classement Arena / comparatifs
- Blog du Modérateur — baromètre IA en entreprise 2026
- Silicon.fr — benchmark des plateformes IA générative
- Usine Digitale — Claude Sonnet 5
- Clubic — Claude Sonnet 5 vs Opus 4.8
- Journal du Net — actualité IA
- Le Monde Informatique — incident GitHub Agentic Workflows
- CIFAR — sécurité de l'IA au Canada
- Vector Institute — State of Evaluation Study
- The Logic — étude Vector Institute
- The Logic — valeurs des modèles IA
- TII — Falcon-H1 Arabic
- Hugging Face — Falcon H1R 7B
- Middle East AI News — Falcon-H1-Tiny
- Middle East AI News — Falcon Perception/OCR