Ce qu'il faut retenir cette semaine
La collecte pour les Etats-Unis a echoue cette semaine ; aucune information originaire de sources americaines n'est disponible dans ce numero. Le reste du panorama mondial confirme une tendance de fond deja observee ces dernieres semaines : l'ecart de performance entre les meilleurs modeles chinois et les modeles occidentaux continue de se reduire, aussi bien selon les classements chinois (SuperCLUE, AIHOT) que selon des sources allemandes citant l'AI Index 2026 de Stanford (Claude Opus 4.6 devant Dora-Seed 2.0 de seulement 2,7 % en mars 2026).
Le digest mondial signale par ailleurs la retraite officielle du "Open LLM Leaderboard" de Hugging Face, juge obsolete face aux modeles de raisonnement, au profit de plateformes comme Artificial Analysis ou Arena. Plusieurs pays (Allemagne, Coree du Sud) documentent un glissement des classements academiques vers des criteres d'usage reel et de specialisation par tache. La Coree du Sud illustre bien cette tension avec la controverse Motif Technologies : le modele le mieux note sur le benchmark international AAII a ete elimine du programme gouvernemental 독파모 faute de bons scores en evaluation humaine.
Cote souverainete, plusieurs pays avancent en parallele : l'Allemagne multiplie les initiatives de LLM europeens (Teuken-7B, Soofi S), le Canada obtient un acces exclusif au modele non public "Mythos" d'Anthropic, la France voit Mistral AI lever 3 milliards d'euros et depasser 21 milliards de valorisation, et les Emirats arabes unis consolident leur position de hub IA souverain avec la famille Falcon du TII, citee par des rapports tiers (Stanford HAI, Banque mondiale).
Classement des LLM de la semaine
| Rang | Modele (editeur, pays) | Local ou API | Prix indicatif API ($/M tokens, entree-sortie) | Points forts | Limites |
|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (Anthropic, Etats-Unis) | API | 10 / 50 | Leader LMArena et Artificial Analysis Intelligence Index ; 80,0 % sur SWE-bench Pro (agrege llm-stats) | Modele le plus cher du marche, a parite avec GPT-6 Astra |
| 2 | GPT-6 Astra (OpenAI, Etats-Unis) | API | 10 / 50 | Egale Fable 5.1 sur l'Intelligence Index a moindre cout ; superieur sur OSWorld 2.0 | Cout eleve ; contexte au-dela de 272K tokens facture au double |
| 3 | Claude Opus 5 (Anthropic, Etats-Unis) | API | 5 / 25 | Leader classement coding Arena (~1582 Elo) ; 96,0 % SWE-bench Verified | Absent des classements SWE-bench Pro publics |
| 4 | GPT-5.6 Sol (OpenAI, Etats-Unis) | API | 4 / 20 (tarif promotionnel) | Bon rapport qualite/prix ; ex-leader Artificial Analysis (score 0,590) | Tarif promotionnel temporaire, garanti jusqu'au 21 novembre 2026 seulement |
| 5 | Gemini 3.1 Pro (Google, Etats-Unis) | API | 2 / 12 (jusqu'a 200K), 4 / 18 au-dela | Score Intelligence 47,7 (98e percentile) ; contexte jusqu'a 1-2M tokens, fort en multimodal | Retrait du palier gratuit depuis avril 2026 |
| 6 | Grok 4.6 (xAI, Etats-Unis) | API | 2 / 6 (cache 0,5) | Ratio output/input favorable (3x contre 5-6x ailleurs) ; acces temps reel aux donnees X | Contexte limite a 500K tokens |
| 7 | Mistral Large 3 (Mistral AI, France) | API (poids non confirmes en libre acces) | n.c. | MoE 675 Md parametres (41 Md actifs) ; option souverainete numerique europeenne, entree vision | Contexte limite a 256K tokens |
| 8 | DeepSeek V4.1 Flash / V4 Pro (DeepSeek, Chine) | Local (poids ouverts) et API | 0,14 / 0,28 | Leader cout ; #1 LiveCodeBench mondial ; leader d'usage reel sur OpenRouter (19/09/2026) | Sur SWE-bench Verified reste derriere la frontiere fermee (80,6 % vs 96,2 %) |
| 9 | Kimi K3 (Moonshot AI, Chine) | Local (poids ouverts) et API | 15 (sortie) | Plus grand modele a poids ouverts (2,8 billions de parametres) ; 4e Artificial Analysis Intelligence Index ; leader Frontend Code Arena | Hebergement local tres lourd (super-noeud 64 accelerateurs recommande) |
| 10 | GLM-5.3 (Zhipu AI / Z.ai, Chine) | Local (poids ouverts, MIT) | 1,00 / 3,41 | Meilleur modele a poids ouverts sur Intelligence Index (score 45) ; fort en codage long-horizon | Score en retrait face aux modeles proprietaires |
| 11 | Qwen3.8 Max (Alibaba, Chine) | API uniquement | ~6 (sortie) | 67,7 % sur SWE-bench Pro (agrege) | Souvent presente a tort comme open source ; poids non publies |
| 12 | Qwen3.8-27B / Qwen3-Coder-Next (Alibaba, Chine) | Local (Apache 2.0) | 0,11 / 0,80 | Meilleur modele local executable sur 46 Go ; 70,6 % SWE-bench Verified | Performances en retrait par rapport aux modeles frontieres |
| 13 | Meta Muse Spark (Meta, Etats-Unis) | API uniquement | n.c. | Premier modele frontiere ferme de Meta ; leader SWE-bench Pro selon Scale AI (61,5 %) | Llama 5 reporte a 2027, rupture avec la strategie open weights de Meta |
| 14 | Llama 4 Maverick (Meta, Etats-Unis) | Local (poids ouverts, gratuit) | 0 | Modele open source largement deploye et etudie | Licence privant les developpeurs UE des droits multimodaux ; depasse par des modeles chinois recents |
| 15 | NVIDIA Nemotron 3 Ultra (NVIDIA, Etats-Unis) | Local (poids ouverts, gratuit) | 0 | MoE 550 Md parametres (55 Md actifs) ; en tete des modeles gratuits sur OpenRouter | Moins couvert par les benchmarks academiques independants |
Mouvements de la semaine : GPT-6 Astra (lance le 3 septembre) a rejoint Claude Fable 5.1 en tete des deux indices phares d'Artificial Analysis le 14 septembre, a moindre cout. Sur OpenRouter, DeepSeek V4.1 Flash occupe la premiere place en usage reel au 19 septembre ; les modeles d'origine chinoise representent desormais six des dix premieres positions de la plateforme, contre moins de 2 % du trafic fin 2024. Cote open weights, l'arrivee des poids de Kimi K3 (2,8 billions de parametres, publies le 27 juillet) continue de bousculer la hierarchie, notamment sur le Frontend Code Arena. Chez Anthropic, la hausse de prix prevue pour Sonnet 5 a ete annulee, le tarif introductif devenant definitif. Enfin, Artificial Analysis a ajuste sa methodologie le 16 septembre (nouveaux benchmarks agentiques et test de contexte long), entrainant une baisse generale des scores affiches.
Tableau comparatif par pays
| Pays | Sources marquantes | Sujets dominants | Modeles cites |
|---|---|---|---|
| Etats-Unis | Collecte en echec cette semaine | n.c. | n.c. |
| Chine | SuperCLUE, CAC, CAICT, 36Kr, ReLE/Jiqizhixin, Zhihu, InfoQ, CSDN, OpenCompass | Resserrement de l'ecart avec l'international, structuration reglementaire (enregistrement CAC), priorite a la performance d'infrastructure (latence, debit, cout par token) | Qwen3.8, DeepSeek-V4, GLM-5.3, Kimi K3 |
| Allemagne | t3n, heise online, Wirtschaftswoche, netzpolitik.org, Fraunhofer IAIS/IIS, Uni Hannover | Souverainete numerique europeenne, scepticisme sur le deploiement dans le service public et l'education, passage a une evaluation par cas d'usage | Qwen 3.6-27B, Claude Opus 4.6, Dora-Seed 2.0, DeepSeek V4 Pro, Teuken-7B, Soofi S |
| Coree du Sud | OhmyNews, ETNews, Dealsite, Edaily, Nate News, AI Times, Financial News, Law Times, Asia Today | Programme national 독파모 (benchmarks vs evaluation humaine), fatigue des modeles face au rythme des sorties, entree en vigueur de la loi-cadre sur l'IA | Solar Open2, Motif 3, modeles SKT/LG AI Research, GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash |
| France | Blog du Moderateur, Journal du Net, Journal du Geek, Silicon.fr, Le Monde Informatique, CNIL, Usine Digitale, LeMagIT | Classement agentique Arena, consolidation de Mistral AI, renforcement reglementaire (omnibus IA, CNIL) | Claude Fable 5.1, GPT-6 Astra, Claude Opus 5, Mistral Large 3 |
| Canada | Vector Institute, The Globe and Mail, BetaKit, Mila, UdeM Nouvelles | Souverainete et acces controle aux modeles frontieres, transparence des evaluations (leaderboard ouvert), primaute des tests en conditions reelles sur les benchmarks academiques | DeepSeek-R1, Command R+, GPT-4o, Gemini 1.5, Mythos (Anthropic) |
| Emirats arabes unis | TII.ae, MarkTechPost, Middle East AI News, G42.ai, The National, Al Khaleej, Khaleej Times, Al Bayan | Domination et diversification de la famille Falcon, recherche sur l'arabe dialectal et culturel, reconnaissance internationale du statut de hub IA souverain | Falcon-H1 Arabic, Falcon H1R 7B, Falcon Perception, Jais 30B, K2 Horizon |
Ce que ca change pour une PME
Le choix entre modele local (poids ouverts) et API reste le premier arbitrage a formaliser. Sur le plan de la confidentialite, les modeles a poids ouverts (DeepSeek V4, Qwen3.8-27B, GLM-5.3, ou l'europeen Teuken-7B presente comme "pleinement conforme au RGPD") permettent de garder les donnees en interne, un point souligne par plusieurs sources allemandes qui notent la persistance des inquietudes des entreprises europeennes sur la protection des donnees.
Sur le plan du cout, l'ecart est net : DeepSeek V4.1 Flash/V4 Pro est facture 0,14/0,28 $ par million de tokens contre 10/50 $ pour Claude Fable 5.1 ou GPT-6 Astra, soit un rapport de plus de 100 pour 1. A l'inverse, l'hebergement local a un cout de maintenance qui n'est pas nul : l'article allemand de heise online montre qu'un modele comme Qwen 3.6-27B necessite plus de 54 Go en pleine precision, contre moins de 10 Go en quantification 2 bits, avec une degradation sensible des connaissances en dessous de 4-5 bits. Kimi K3, tres performant, exige un super-noeud d'au moins 64 accelerateurs pour un hebergement local serieux, ce qui l'exclut de facto pour une PME.
En pratique, une PME sans equipe infrastructure dediee a interet a privilegier l'API pour les usages courants (moins de maintenance, mise a jour automatique), et a reserver le local aux cas ou la confidentialite des donnees est critique et ou les volumes justifient l'investissement en materiel ou en cloud prive.
Conseils pratiques de la semaine
- Ne pas chercher un modele unique universel : plusieurs sources (36Kr, t3n, Journal du Net) convergent vers une logique de routage multi-modeles selon la tache (code, raisonnement, redaction).
- Tester avant de choisir : la methode recommandee par LeMagIT consiste a batir un corpus d'une centaine de questions representatives de vos cas d'usage plutot que de se fier aux seuls benchmarks academiques.
- Verifier la duree de validite des prix API avant de contractualiser : plusieurs tarifs actuels (GPT-5.6 Sol) sont promotionnels et peuvent evoluer a court terme.
- Pour l'hebergement local, tester plusieurs niveaux de quantification (4 a 8 bits) avant de investir dans du materiel : la degradation de qualite reste souvent limitee jusqu'a 4-5 bits.
- Se mefier des scores de benchmarks isoles (type SWE-bench) : les sources signalent des ecarts de 20 a 30 points selon la methodologie utilisee pour un meme modele.
- Verifier les conditions de licence des modeles a poids ouverts avant deploiement (ex. restrictions multimodales pour les utilisateurs europeens sur Llama 4 Maverick).
- Pour les usages sensibles (juridique, RH, finance), privilegier une evaluation humaine complementaire aux benchmarks automatises, comme le montre l'exemple coreen du programme 독파모.
Sources
- SuperCLUE
- CAC.gov.cn
- Sina Finance / CAICT
- 36Kr - tokenisation
- 36Kr - comparatif prix
- ReLE Benchmark
- Zhihu
- InfoQ - AIHOT
- CSDN
- OpenCompass
- heise online
- t3n - comparatif cas d'usage
- t3n - Federal Register
- t3n - Chine vs Occident
- Wirtschaftswoche
- netzpolitik.org - administration
- netzpolitik.org - education
- Fraunhofer IAIS
- Fraunhofer IIS - Teuken-7B
- Uni Hannover - Soofi S
- OhmyNews
- ETNews
- Dealsite
- Edaily
- Nate News - Motif
- AI Times
- Financial News
- Nate News - Artificial Analysis
- Law Times
- Asia Today
- Blog du Moderateur - Agent Arena
- Journal du Net - comparatif
- Journal du Net - comparateur
- Journal du Geek
- Silicon.fr
- Le Monde Informatique
- CNIL
- Blog du Moderateur - Mistral
- L'Usine Digitale
- LeMagIT
- Vector Institute
- The Globe and Mail
- BetaKit - strategie IA
- BetaKit - Mythos
- International AI Safety Report
- UdeM Nouvelles
- TII.ae - Falcon-H1 Arabic
- TII.ae - Falcon H1R 7B
- MarkTechPost
- TII.ae - Falcon Perception
- Middle East AI News
- G42.ai
- The National
- Al Khaleej
- Khaleej Times
- Al Bayan
- Anthropic - pricing
- Artificial Analysis Intelligence Index
- CloudZero - GPT-6 pricing
- BenchLM - OpenAI pricing
- Google AI - pricing
- BenchLM - xAI pricing
- Wikipedia - Mistral AI
- MorphLLM
- DeepInfra - comparatif
- Tech Insider
- SWFTE - leaderboard
- Wavect
- OpenRouter
Veille generee automatiquement chaque dimanche par les agents IntelTec - sources citees ci-dessus.