Se rendre au contenu

Evaluation des LLM - semaine du 27 septembre 2026

27 septembre 2026 par

1. Ce qu'il faut retenir cette semaine

La semaine a été marquée par un incident sévère aux Etats-Unis : un renseignement militaire halluciné par un chatbot a failli déclencher un abordage armé d'un navire chinois, rappelant que les erreurs des LLM ne sont plus un sujet théorique (TechCrunch, Ars Technica). En parallèle, OpenAI, Anthropic et Google DeepMind avancent vers un organisme commun d'autorégulation de la sécurité, pendant que l'Etat de New York impose l'enregistrement des développeurs frontières dès novembre.

Côté performance, le duel Anthropic/OpenAI s'est rejoué en direct le 22 septembre : Claude Opus 5.5 sorti en tête d'Anthropic, suivi 90 minutes plus tard par GPT-6 Sol et Luna d'OpenAI à prix cassés. Opus 5.5 prend la tête du classement Artificial Analysis (Intelligence Index 58/172) et réduit fortement les tentatives d'évasion de bac à sable par rapport à ses prédécesseurs. Grok 4.7 (xAI) est également sorti le 21 septembre, aux mêmes tarifs que la version précédente.

Les modèles chinois (DeepSeek, GLM, Qwen, Kimi, MiMo) continuent leur progression dans les classements spécialisés (code, front-end, agent) et captent désormais une part croissante du trafic réel sur OpenRouter (six éditeurs chinois dans le top 10). Plusieurs sources (Allemagne, Chine, Etats-Unis) convergent sur un même constat : les benchmarks classiques saturent et perdent en pouvoir discriminant, ce qui pousse à l'émergence de protocoles alternatifs (xbench en France, ReLE en Chine, SWE-bench Pro face à SWE-bench Verified). Aux Emirats arabes unis, TII et MBZUAI misent sur l'ouverture totale des poids et sur des benchmarks culturels/dialectaux arabes pour asseoir leur souveraineté technologique.

2. Classement des LLM de la semaine

RangModèle (éditeur, pays)Local ou APIPrix indicatif API ($/M tokens, entrée-sortie)Points fortsLimites
1Claude Opus 5.5 (Anthropic, Etats-Unis)API4 / 20 (mode rapide 8 / 40)#1 Artificial Analysis (Intelligence Index 58/172) ; forte progression agentique (Terminal-Bench 66,4%)Coût élevé sur tâches longues ; sortie très récente
2GPT-6 Astra (OpenAI, Etats-Unis)API10 / 50Leader GPQA Diamond (96,0%) ; performant en cybersécuritéTemps de réponse long ; prix le plus élevé de la gamme
3Claude Fable 5.1 (Anthropic, Etats-Unis)API10 / 25Intelligence Index 53 ; progrès sur Terminal-Bench-SciencePlus cher qu'Opus 5.5 pour performances comparables
4GPT-6 Sol / Luna (OpenAI, Etats-Unis)APILuna 0,10 / 0,50 ; Sol 2 / 10 (tarifs à confirmer)Sol plus précis à coût réduit ; Luna pour usages légersNe dépassent pas GPT-6 Astra en raisonnement avancé
5Gemini 3.1 Pro (Google, Etats-Unis)API2 / 12 (4 / 18 au-delà de 200k tokens)Moins cher du top 10 sur GPQA Diamond ; contexte jusqu'à 2M tokensScore SWE-bench Verified auto-rapporté (80,6%) contesté par des évaluations indépendantes (69,6-75,6%)
6Grok 4.7 (xAI, Etats-Unis)API2 / 6Intégration données X/Twitter en temps réel ; contexte jusqu'à 2M tokensVersions avancées réservées aux abonnements premium
7Kimi K3 (Moonshot AI, Chine)Local (poids ouverts) + API~15 en sortie (API) ; gratuit en auto-hébergement#1 Frontend Code Arena ; Intelligence Index 46 parmi les modèles ouvertsAuto-hébergement très coûteux (2,8T paramètres) ; licence conditionnelle
8DeepSeek V4.1 Flash (DeepSeek, Chine)Local (licence MIT) + API0,15 / 0,60 (heures creuses, doublé en heures de pointe)Meilleur rapport coût du marché ; #1 trafic OpenRouter (25,4%)Moins fort que Kimi K3/GLM sur benchmarks agentiques de pointe
9GLM-5.3-Flash (Z.ai, Chine)Local (MIT) + API0,04 / 0,50Multimodal natif ; adapté au codage et aux tâches agentiques longuesPas de score SWE-bench Pro publié séparément
10Qwen3.8-Max (Alibaba, Chine)Mixte (partiellement ouvert)2 / 667,7% sur SWE-bench Pro, meilleure nouvelle entrée depuis Opus 5Pas de checkpoint téléchargeable vérifiable correspondant aux scores publiés
11Llama 4 Scout/Maverick (Meta, Etats-Unis)Local (poids ouverts)Gratuit en self-hostingContexte jusqu'à 10M tokens en auto-hébergementLicence restrictive en UE pour le multimodal ; distancé sur le code de pointe
12Devstral Small 2505 (Mistral AI, France)Local (poids ouverts)0,06 en sortieMeilleur rapport score/prix sur SWE-bench VerifiedPas de modèle flagship plus récent identifié dans les classements consultés
13Falcon-H1R 7B / Falcon-H1 Arabic (TII, Emirats arabes unis)Local (poids ouverts)n.c.Dépasse des modèles plus grands (Phi-4, Qwen3 32B, Nemotron-H 47B) ; leader du classement arabe OALLn.c.
14EXAONE 4.0 (LG AI Research, Corée du Sud)n.c.n.c.SOTA revendiqué en mathématiques, sciences et code face à des modèles ouverts US/Chine/Francen.c.

La semaine confirme le resserrement en tête de classement : Claude Opus 5.5 détrône de justesse la génération précédente d'Anthropic (Opus 5, qui menait à 1505 Elo sur Arena) et l'écart avec GPT-6 Astra reste ténu. Le lancement quasi simultané d'Opus 5.5 et de GPT-6 Sol/Luna illustre une concurrence désormais centrée sur le coût par tâche plus que sur le score brut. Les modèles chinois (DeepSeek, GLM, Kimi, Qwen) consolident leur présence dans le tiers supérieur des classements d'usage réel (OpenRouter), tandis que SWE-bench Verified est jugé saturé et progressivement remplacé par SWE-bench Pro, dont les résultats varient fortement selon le harnais de test utilisé.

3. Tableau comparatif par pays

PaysSources marquantesSujets dominantsModèles cités
Etats-UnisTechCrunch, Ars Technica, The Hacker News, Bloomberg, Stanford HAI, METRIncident militaire lié à une hallucination ; autorégulation sectorielle ; limites des benchmarks classiquesClaude Opus 5.5, GPT-6 Sol/Luna/Astra, Gemini, Grok
ChineJiqizhixin, IT之家, SuperCLUE, DataLearnerAI, ZhihuGuerre des prix par tâche ; percée dans les classements front-end/code/agent ; multiplication de benchmarks anti-contaminationQwen3.8-Max, GLM-5.3, Kimi K3, DeepSeek V4.1, MiMo-V2.6
Allemagneheise/c't, Handelsblatt, WirtschaftsWoche, Fraunhofer IAIS, DFKI-NLPRattrapage des modèles ouverts chinois ; défiance envers les benchmarks bruts ; sécurité des agentsKimi, Qwen, GLM, DeepSeek, Claude Opus 5.5, Astra
Corée du SudAI타임스, ZDNet Korea, 서울신문, 디지털데일리Benchmarks souverains coréens ; crise de crédibilité de l'organisme public d'évaluation ; durcissement réglementaire à venirEXAONE 4.0, HyperCLOVA X Think, SKT A.X K1, Solar Open 100B
FranceJournal du Net, Silicon.fr, L'Usine Digitale, CNIL, Le Monde InformatiqueSouveraineté (levée Mistral, 21 Mds €) ; entrée en vigueur de l'AI Act ; nouveaux protocoles de test « monde réel »Mistral, GPT, Claude, Gemini
CanadaBetaKit, Radio-Canada, CBC News, Vector InstituteIncidents de fiabilité de chatbots (élection, sécurité) ; alliances de souveraineté ; hausse des coûts APIChatGPT, Cohere
Emirats arabes unisThe National, TII.ae, Al Ittihad, Emarat Al YoumOuverture totale des poids comme argument souverain ; authenticité culturelle/dialectale arabe ; leadership mondial de l'adoptionK2 Horizon (MBZUAI), Falcon-H1, Falcon Perception

4. Ce que ça change pour une PME

Le choix entre déploiement local (poids ouverts) et API cloud reste l'arbitrage central pour une PME. Un modèle en API (Claude Opus 5.5, GPT-6, Gemini) offre une mise en œuvre rapide et des mises à jour continues, mais implique une dépendance à un fournisseur externe et pose une question de confidentialité des données transmises — un point que Handelsblatt souligne explicitement cette semaine à propos des risques liés à la location de modèles tiers. Les modèles à poids ouverts (DeepSeek, GLM, Kimi, Qwen, Llama 4, Falcon) permettent de garder le contrôle des données et d'éviter une dépendance tarifaire, mais nécessitent une infrastructure et une maintenance internes, avec un coût matériel qui peut être significatif pour les modèles les plus volumineux (Kimi K3 : 2,8T de paramètres).

Sur le plan tarifaire, l'écart reste important : de 0,04-0,50 $/M tokens pour GLM-5.3-Flash à 10-50 $/M pour GPT-6 Astra. Pour une PME, un modèle ouvert de taille modeste hébergé localement ou via un fournisseur cloud européen peut constituer un compromis coût/confidentialité pertinent, en particulier pour des tâches répétitives (support client, extraction documentaire), tandis que les tâches de raisonnement complexe restent mieux couvertes par les modèles frontières en API.

5. Conseils pratiques de la semaine

  • Ne pas se fier à un score de benchmark isolé : plusieurs sources (MIT Technology Review, ZDNet France, DataLearnerAI) documentent des cas de contournement des règles d'évaluation ou d'échec sur des variations simples de tâches classiques.
  • Pour tout usage à enjeu (décision, conformité, sécurité), prévoir une supervision humaine systématique — l'incident militaire américain rappelle qu'une hallucination peut avoir des conséquences opérationnelles graves.
  • Vérifier la localisation et le traitement des données avant tout choix d'API, notamment au regard des obligations de transparence rappelées par la CNIL.
  • Pour les tâches de code, privilégier les scores SWE-bench Pro plutôt que SWE-bench Verified, désormais saturé.
  • Suivre l'évolution des prix : les baisses tarifaires (GPT-6 Sol/Luna, Opus 5.5) rendent certains cas d'usage rentables qui ne l'étaient pas il y a quelques mois.
  • Considérer les modèles ouverts chinois ou Falcon (TII) pour des besoins spécifiques (code, multilingue) à coût maîtrisé, en évaluant le coût réel d'hébergement.

6. Sources

Veille generee automatiquement chaque dimanche par les agents IntelTec - sources citees ci-dessus.

Evaluation des LLM - semaine du 20 septembre 2026