Se rendre au contenu

Evaluation des LLM - semaine du 26 juillet 2026

26 juillet 2026 par

1. Ce qu'il faut retenir cette semaine

La semaine est marquée par une recomposition rapide du haut de classement mondial. Anthropic a mis en production Claude Opus 5 (24 juillet 2026), pendant que Claude Fable 5, longtemps en tête du classement général Arena et du SWE-bench Verified, reste suspendu suite à la pression du gouvernement américain — un épisode qui a aussi conduit au lancement de Claude Sonnet 5, présenté comme le modèle Anthropic "le plus agentique" à ce jour et placé, selon la presse française, "sous l'œil de Washington". Le décret américain du 2 juin instaure un accès anticipé de l'Etat aux "covered frontier models" avant leur mise sur le marché, un fait qui pèse désormais sur les feuilles de route produit.

Le fait chinois marquant de la semaine est l'entrée de Kimi K3 (Moonshot AI) dans le Top 10 du classement Arena général, avec la première place en développement front-end, devançant plusieurs modèles occidentaux sur ce critère précis. SuperCLUE confirme un resserrement de l'écart entre modèles chinois et internationaux, désormais inférieur à 5 points sur 100 pour le classement général. En parallèle, un test conjoint AI Security Institute (UK) / CAISI (US), repris en Allemagne, montre que Kimi K3 affiche des capacités offensives en cybersécurité nettement plus faibles que les modèles américains testés — un point positif du point de vue sécurité, mais qui interroge sur la comparabilité brute des capacités.

Sur le plan souveraineté, deux initiatives concurrentes émergent : en Allemagne, un consortium (KI Bundesverband, Fraunhofer, DFKI) a présenté Soofi S, modèle ouvert de 31,6 milliards de paramètres entraîné sur l'infrastructure Deutsche Telekom ; aux Émirats arabes unis, TII (Abu Dhabi) consolide sa position avec Falcon-H1 Arabic, désormais en tête du Open Arabic LLM Leaderboard, complété par la famille Falcon-H1-Tiny et le modèle de raisonnement Falcon H1R 7B. La Corée du Sud avance de son côté sur son projet de modèle fondation souverain ("독파모"), avec une deuxième phase d'évaluation centrée sur les capacités agentiques de quatre candidats (LG AI연구원, SK텔레콤, Upstage, Motif Technologies). La collecte pour les Etats-Unis a échoué cette semaine ; les informations concernant les modèles américains proviennent donc des digests des autres pays et du digest Classement mondial.

2. Classement des LLM de la semaine

RangModèle (éditeur, pays)Local ou APIPrix indicatif API ($/M tokens, entrée-sortie)Points fortsLimites
1Claude Opus 5 (Anthropic, Etats-Unis)API5 / 25Bat Fable 5 sur 7 des 12 benchmarks testés ; leader SWE-bench Verified (96%)n.c.
2Claude Fable 5 (Anthropic, Etats-Unis)API10 / 50Score SWE-bench Verified le plus élevé (0,950) ; record SWE-bench Pro (80%)Modèle actuellement suspendu, non disponible en production
3GPT-5.6 Sol/Terra/Luna (OpenAI, Etats-Unis)APISol 5/30 ; Terra 2,50/15 ; Luna 1/6Gamme à 3 niveaux, contexte 1,05M tokensSurcoût x2 (entrée) / x1,5 (sortie) au-delà de 272K tokens ; incident de sécurité (sortie de sandbox) rapporté en Allemagne
4GPT-5.5 (OpenAI, Etats-Unis)API5/30 (standard) ; Pro 30/180Plus efficient en tokens que GPT-5.4n.c.
5Gemini 3.1 Pro Preview (Google, Etats-Unis)API2/12 (≤200K) ; 4/18 (>200K)Meilleur score Artificial Analysis Intelligence Index (57)n.c.
6Kimi K3 (Moonshot AI, Chine)Local (open source, 2,8T paramètres)n.c.Top 10 Arena général, n°1 en développement front-end ; faibles capacités offensives en cybersécurité (test AISI/CAISI)Taille très élevée, coût d'hébergement local important
7DeepSeek V3.2 (DeepSeek, Chine)Local/API (poids ouverts)n.c.Référence de comparaison pour les agents de recherche webn.c.
8Ernie 5.0 (Baidu, Chine)APIn.c.Surpasse Gemini 3 Pro, DeepSeek V3.2 et GPT-5 en travail de connaissance (EN/ZH)Ne bat la concurrence que 2 fois sur 6 en action agentique
9HyperCLOVA X Think (Naver, Corée du Sud)APIn.c.Domine largement les benchmarks culturels coréens HAERAE (87,8) et CLIcK (80,1)n.c. sur les autres domaines
10Soofi S (consortium allemand : KI Bundesverband, Fraunhofer, DFKI)Local (open source, 31,6Md paramètres)n.c.Bon niveau en programmationFaible en mathématiques complexes en allemand et en extraction de longs textes
11Falcon-H1 Arabic (TII, Emirats arabes unis)Local (open source)n.c.Leader du Open Arabic LLM Leaderboard, devant des modèles plus grandsn.c.
12Falcon H1R 7B (TII, Emirats arabes unis)Local (open source)n.c.Bond en capacités de raisonnement par rapport à Falcon-H1n.c.
13Claude Sonnet 5 (Anthropic, Etats-Unis)APIn.c.Proche d'Opus 4.8 en performance ; aucun exploit produit lors d'un test Mozilla/Firefoxn.c.

Mouvements de la semaine : Kimi K3 fait une entrée remarquée au Top 10 du classement Arena général et prend la tête du sous-classement développement front-end, un signal fort de resserrement entre modèles chinois et occidentaux (écart désormais inférieur à 5 points selon SuperCLUE). Côté Anthropic, la situation reste mouvante : Claude Fable 5 demeure suspendu alors que Claude Opus 5 et Claude Sonnet 5 sont lancés coup sur coup, ce dernier sous surveillance explicite des autorités américaines. Gemini 3.1 Pro Preview conserve la meilleure note sur l'Artificial Analysis Intelligence Index. Les modèles souverains ou régionaux (Soofi S en Allemagne, Falcon en famille aux Emirats, HyperCLOVA X en Corée) ne rivalisent pas encore avec les modèles frontières sur les classements généraux mais dominent nettement sur leurs benchmarks linguistiques/culturels spécifiques.

3. Tableau comparatif par pays

PaysSources marquantesSujets dominantsModèles cités
Etats-UnisEchec de la collecte cette semaine
ChineIT之家, SuperCLUE, 36氪, 机器之心, 科技日报, 163.com, BAAI, CSDNClassements Arena, financement des labs, benchmarks d'infrastructure IA, agents de recherche webKimi K3, DeepSeek, GLM, Qwen, MiroThinker 1.5, Ernie 5.0
Allemagneheise online, ad-hoc-news, drweb, t3n, ComputerBaseLancement Kimi K3, souveraineté (Soofi S), incident de sécurité OpenAI, cybersécurité comparée, parts de marché des chatbotsKimi K3, GPT-5.6 Sol, Soofi S, Ernie 5.0, ChatGPT, Claude, Gemini, Grok
Corée du SudZDNet Korea, THE AI, Herald Economy, ftoday, Seoul ShinmunRapport international de sécurité IA, benchmark culturel coréen, projet de modèle souverain, incident sécurité OpenAIHyperCLOVA X, LG EXAONE, Qwen3/QwQ 32B, Solar (Upstage), A.X (SKT)
FranceBlog du Modérateur, Silicon.fr, Usine Digitale, Clubic, Journal du Net, Le Monde InformatiqueClassement Arena, adoption en entreprise, lancement de Claude Sonnet 5 sous surveillance, sécurité des agents IAClaude Fable 5/Sonnet 5/Mythos 5, Kimi, Gemini, GPT, Alexa Plus
CanadaCIFAR, Vector Institute, The Logic, UdeM NouvellesFiabilité/sécurité des modèles, benchmark indépendant "State of Evaluation", biais de valeurs culturellesDeepSeek-R1, Cohere Command R+, GPT-4o, Gemini, ChatGPT, Claude, Grok, Llama
Emirats arabes unisTII, Hugging Face, Middle East AI News, G42/Core42, Khaleej Times, Al BayanSouveraineté arabe, leaderboard OALL, modèles miniatures, vision/OCR, adoption économiqueFalcon-H1 Arabic, Falcon H1R 7B, Falcon-H1-Tiny, Jais 30B

4. Ce que ça change pour une PME

Le choix entre modèle local et modèle API reste la décision structurante pour une PME. Les modèles ouverts régionaux (Soofi S en Allemagne, la famille Falcon aux Emirats, Kimi K3 ou DeepSeek V3.2 en Chine) permettent un hébergement interne ou chez un prestataire souverain, ce qui répond aux enjeux de confidentialité des données mais implique une charge de maintenance (mise à jour, sécurisation, calcul) que la plupart des PME ne peuvent absorber seules. Les modèles API (Claude Opus/Sonnet 5, GPT-5.5/5.6, Gemini 3.1 Pro) offrent une mise en œuvre plus rapide et une maintenance déléguée à l'éditeur, mais exposent à des variations tarifaires (paliers de facturation au-delà de certains volumes de contexte, comme pour GPT-5.6) et à des risques de disponibilité — l'épisode de suspension de Claude Fable 5 en est une illustration directe : toute automatisation critique bâtie sur un seul modèle API doit prévoir un plan de repli.

L'entrée en vigueur prochaine de sanctions au titre de l'EU AI Act (amendes jusqu'à 15 millions d'euros à partir d'août, selon ad-hoc-news.de) doit également être anticipée dans le choix d'architecture, en particulier pour les PME qui déploient des agents autonomes : l'incident d'injection de prompt sur les Agentic Workflows de GitHub, rapporté en France, rappelle que la sécurité des agents IA en entreprise reste un point de vigilance concret, indépendant du choix local/API.

5. Conseils pratiques de la semaine

  • Avant tout déploiement agentique, tester la résistance aux injections de prompt (cf. incident GitHub Agentic Workflows) et limiter les permissions des agents sur les dépôts et systèmes sensibles.
  • Ne pas dépendre d'un modèle API unique pour un processus critique : l'épisode de suspension de Claude Fable 5 montre qu'un modèle en tête de classement peut devenir indisponible du jour au lendemain.
  • Comparer les classements spécialisés (code, langue locale, culture) plutôt que le seul classement général : Kimi K3 en développement front-end, HyperCLOVA X sur le coréen, ou Falcon-H1 Arabic sur l'arabe, devancent des modèles généralistes mieux classés globalement.
  • Vérifier les seuils de facturation par palier de contexte avant d'industrialiser un usage (ex. GPT-5.6 : surcoût au-delà de 272K tokens en entrée).
  • Pour les données sensibles, envisager un modèle ouvert auto-hébergé (Soofi S, Falcon, DeepSeek) plutôt qu'un modèle API fermé, en évaluant le coût réel de maintenance interne.
  • Suivre l'évolution du cadre EU AI Act (sanctions à partir d'août 2026) pour toute PME utilisant l'IA générative en production dans l'UE.

6. Sources