01 – 2,8 trillions de paramètres, la démesure comme stratégie
Kimi K3 n'est pas une itération incrémentale : c'est une déclaration de suprématie infrastructurelle qui change l'échelle du possible

Moonshot AI a dévoilé Kimi K3 avec un chiffre qui écrase tout ce que l'industrie a connu : 2,8 trillions de paramètres. C'est 75 % de plus que DeepSeek V4 Pro (environ 1,6 trillion), et pratiquement le double de ce que les laboratoires occidentaux ont rendu public en open source. Comme le rapporte VentureBeat, qui a obtenu les données techniques en exclusivité, ce n'est pas un exercice de gonflement spéculatif : les poids complets seront publiés le 27 juillet 2026 sur Hugging Face et les plateformes chinoises. La fenêtre de contexte d'un million de tokens intègre une compréhension visuelle native et un « mode réflexion » toujours actif – la capacité de raisonner en continu plutôt que de basculer entre un mode rapide et un mode profond. Deux innovations architecturales publiées accompagnent le lancement : Kimi Delta Attention (attention linéaire hybride, arXiv:2510.26692) et Attention Residuals (remplacement des connexions résiduelles standard, arXiv:2603.15031). Ces contributions ne sont pas cosmétiques – elles résolvent des problèmes réels de scaling que les architectures transformer classiques rencontrent au-delà du trillion de paramètres. Un exécutif de Moonshot AI, cité par l'agence Xinhua et repris par VentureBeat, résume la philosophie : « Les paramètres sont comme des connexions neuronales – près de 3 trillions d'entre eux signifient que le modèle peut stocker plus de connaissances et de motifs dans son cerveau, comprendre plus profondément, raisonner plus précisément. » La métaphore biologique n'est pas fortuite : elle révèle une approche de la mise à l'échelle qui n'est pas une course au chiffre mais une théorie de l'émergence de capacités par la masse.

2 800 Md
Paramètres de Kimi K3 – 75 % de plus que DeepSeek V4 Pro, le précédent record
Poids complets disponibles le 27 juillet 2026. Fenêtre de contexte : 1 million de tokens.
02 – Face à Claude et GPT-5.6 : la nouvelle hiérarchie
L'open source ne traîne plus six mois derrière le propriétaire : il est désormais en concurrence frontale avec les meilleurs modèles fermés du monde

Les benchmarks publiés par Moonshot AI et relayés par VentureBeat racontent une histoire que l'industrie occidentale va mettre du temps à digérer. Sur GDPval-AA v2, le test de référence pour les tâches du monde réel couvrant 44 professions, Kimi K3 atteint 1 687 points – troisième derrière Claude Fable 5 Max (1 815) et GPT-5.6 Sol Max (1 747,8), mais devant Claude Opus 4.8 (1 600). Sur AA-Briefcase, le benchmark de travail agentique de longue durée le plus exigeant, Kimi K3 se classe deuxième (1 527), dépassant GPT-5.6 Sol Max (1 495) et n'étant devancé que par Claude Fable 5 Max (1 587). Sur BrowseComp, le test de recherche d'information complexe, Kimi K3 atteint 91,2/100 – état de l'art, en configuration mono-agent avec contexte d'un million de tokens, sans compression ni contournement. Sur Frontend Code Arena (Arena.AI), il prend la première place avec 1 679, dépassant à la fois Claude Fable 5 et GPT-5.6 Sol. Sur six benchmarks de codage, il est dans le top 3 de tous, et premier sur SWE Marathon et Program Bench. Sur huit benchmarks d'automatisation de tâches réelles, il est premier sur quatre (Automation Bench, SpreadsheetBench 2, BrowseComp, et un quatrième non nommé). Le message est sans ambiguïté : un modèle open source chinois est désormais compétitif avec les meilleurs modèles propriétaires américains sur l'ensemble des tâches cognitives complexes. La phrase d'un commentateur IA sur les réseaux sociaux, citée par VentureBeat, résume le séisme : « L'open source n'a plus six mois de retard sur les modèles fermés occidentaux. Relisez cette phrase, et réfléchissez à ce qu'elle implique. »

1 687
GDPval-AA v2
3e mondial, derrière Claude Fable 5 Max et GPT-5.6 Sol Max. Devant Claude Opus 4.8. 44 professions testées.
91,2
BrowseComp
État de l'art mondial. Recherche d'information complexe en mono-agent, 1M tokens de contexte, sans compression.
1 679
Frontend Code
1er mondial sur Arena.AI. Dépasse Claude Fable 5 et GPT-5.6 Sol. Top 3 sur les 6 benchmarks de codage.
03 – Puce en 48h, astrophysique en 2h
Les démonstrations de Kimi K3 ne sont pas des benchmarks : ce sont des preuves d'autonomie agentique de longue durée qui n'avaient jamais été réalisées

Au-delà des scores de benchmark, Moonshot AI a publié deux démonstrations qui redéfinissent ce qu'un agent autonome peut accomplir. La première est la conception d'une puce électronique : Kimi K3 a fonctionné de manière entièrement autonome pendant 48 heures continues, exécutant le pipeline complet depuis l'architecture jusqu'à la vérification. Résultat : une puce fonctionnelle de 4 mm², avec fermeture temporelle à 100 MHz, capable de simuler plus de 8 700 tokens par seconde. Ce n'est pas un exercice académique – c'est une démonstration qu'un agent peut remplacer une équipe d'ingénieurs sur un cycle de conception complet. La deuxième démonstration est en astrophysique computationnelle : Kimi K3 a reproduit la relation universelle I-Love-Q (reliant moment d'inertie, nombre de Love et moment quadrupolaire des étoiles à neutrons) en environ deux heures, une tâche qui prend normalement une à deux semaines à un chercheur senior. L'agent a lu et validé de manière croisée plus de 20 articles scientifiques pendant l'exécution. Ces démonstrations illustrent une capacité que les benchmarks ne capturent pas : l'endurance agentique. Ce n'est pas la performance sur une tâche unitaire qui impressionne, c'est la capacité à maintenir une cohérence et une progression sur des durées qui excèdent de plusieurs ordres de grandeur ce que les agents actuels peuvent gérer sans déraillement.

Mono-tâche Les benchmarks classiques (MMLU, HumanEval) mesurent la performance sur une requête unique. Utile pour comparer, inutile pour prédire l'autonomie.
→
Agentique court terme SWE-Bench, MCP Atlas : l'agent exécute une tâche en quelques étapes. La fenêtre est de quelques minutes à une heure.
→
Agentique longue durée 48h de conception de puce autonome. L'agent planifie, exécute, vérifie, corrige – sans intervention humaine. Le nouveau standard.
04 – Mooncake : l'infrastructure invisible
Derrière Kimi K3 se cache une innovation infrastructurelle qui a remporté le Best Paper à FAST 2025 – et que personne en Occident n'a reproduite

La performance de Kimi K3 ne s'explique pas uniquement par la taille du modèle ou l'architecture. Le facteur différenciant est infrastructurel. Le projet Mooncake, développé par Moonshot AI, a remporté le prix du meilleur article à FAST 2025 (la conférence de référence sur les systèmes de stockage) pour son architecture de serving désagrégé centré sur le cache KV. En pratique, cela signifie que Kimi K3 peut servir des inférences avec un cache de contexte automatique – pas de cache ID à gérer, pas de TTL à configurer – ce qui réduit drastiquement la latence et le coût des tâches à long contexte. Cette infrastructure n'est pas un détail d'implémentation : c'est ce qui rend économiquement viable un modèle de 2,8 trillions de paramètres avec une fenêtre d'un million de tokens. La grille tarifaire reflète cette efficacité : 3 dollars par million de tokens en entrée, 15 dollars en sortie, 0,30 dollar pour les tokens en cache. À titre de comparaison, GPT-5.6 Sol Max facture 15 dollars par million de tokens en entrée et 75 dollars en sortie. Kimi K3 est cinq fois moins cher en entrée et cinq fois moins cher en sortie que le modèle phare d'OpenAI, pour des performances comparables sur la majorité des benchmarks. Cette asymétrie de coût est structurelle : elle résulte de choix architecturaux (Mooncake) et non d'une guerre de prix temporaire. Moonshot AI propose même une remise promotionnelle de 30 % en vouchers pour les recharges supérieures à 1 000 dollars jusqu'au 12 août 2026 – une stratégie d'acquisition agressive qui rappelle les débuts d'AWS.

Comparaison tarifaire : Kimi K3 vs GPT-5.6 Sol Max (par million de tokens)
01Input : Kimi K3 = 3 $ vs GPT-5.6 Sol Max = 15 $. Kimi est 5× moins cher. L'écart provient de l'architecture Mooncake de serving désagrégé.
02Output : Kimi K3 = 15 $ vs GPT-5.6 Sol Max = 75 $. Kimi est 5× moins cher. L'écart se creuse avec la longueur des réponses.
03Input caché : Kimi K3 = 0,30 $. Cache automatique, pas de gestion manuelle. Aucune offre équivalente chez OpenAI pour ce niveau de prix.
05 – Le pivot stratégique : de la survie à la domination
Quand DeepSeek R1 a disrupté le marché chinois en janvier 2025, Moonshot AI a perdu sa place dans le top 3 – et a pris la décision qui allait tout changer

Pour comprendre Kimi K3, il faut remonter à janvier 2025, quand DeepSeek a lancé R1. Ce lancement a provoqué un séisme sur le marché chinois de l'IA : le MAU (utilisateurs actifs mensuels) de Kimi est passé de la 3e à la 7e place. Moonshot AI, fondée en 2023 par Yang Zhilin – un chercheur passé par Google et Meta, diplômé de Tsinghua – avait levé environ 1,5 milliard de dollars en plusieurs tours, avec une valorisation passée de 2,5 à 4,3 milliards. Mais face à DeepSeek, l'entreprise risquait de devenir un acteur de second rang. La réponse de Yang Zhilin a été radicale : un pivot complet vers l'open source. Kimi K2 est sorti en juillet 2025, K2.5 en janvier 2026, et maintenant K3 – le point culminant d'une stratégie d'accélération qui a comprimé trois générations de modèles en 18 mois. Comme le rapporte le Financial Times, ce pivot s'inscrit dans une stratégie plus large décrite par Reuters : les entreprises chinoises utilisent l'open source pour « démontrer leurs capacités technologiques et étendre leurs communautés de développeurs ainsi que leur influence mondiale, une stratégie susceptible d'aider la Chine à contrer les efforts américains visant à limiter les progrès technologiques de Pékin ». L'open source devient un instrument de soft power technologique. La gamme de modèles confirme cette ambition : K3 (flagship), K2.7 Code (codage spécialisé à 0,95 $/1M tokens input), K2.6 (usage général). Et Kimi Code, un CLI open source avec plus de 3 100 étoiles GitHub, intègre VSCode, Cursor et Zed, avec des fonctionnalités de sous-agents, tâches en arrière-plan, mode plan et agents imbriqués – en concurrence directe avec Claude Code (1 milliard de dollars d'ARR).

06 – Implications structurelles
Kimi K3 n'est pas qu'un modèle : c'est le symptôme d'un basculement de l'équilibre technologique mondial que les contrôles d'exportation n'ont pas empêché

Le lancement de Kimi K3 survient dans un contexte où le président Xi Jinping a explicitement fixé comme objectif national de faire de la Chine le leader mondial de l'IA. Selon le Financial Times, cette directive place l'IA au même niveau de priorité stratégique que la souveraineté alimentaire et énergétique. Kimi K3 démontre que les contrôles d'exportation américains sur les semi-conducteurs avancés n'ont pas empêché la Chine de produire le plus grand modèle open source jamais créé – ils ont peut-être même accéléré l'innovation en forçant des optimisations architecturales et infrastructurelles que les laboratoires occidentaux, disposant de hardware abondant, n'avaient pas besoin de développer. L'innovation Mooncake en est l'exemple parfait : une contrainte de ressources qui se transforme en avantage compétitif. La question stratégique n'est plus de savoir si l'open source chinois rattrapera l'Occident – Kimi K3 prouve qu'il l'a déjà fait sur plusieurs dimensions critiques. La question est de savoir si les entreprises et gouvernements occidentaux, qui dépendent massivement des modèles propriétaires américains (OpenAI, Anthropic, Google), peuvent se permettre d'ignorer une alternative open source chinoise qui est moins chère, plus performante sur les tâches de longue durée, et dont les poids seront librement téléchargeables dans dix jours.

01
L'asymétrie de coût est structurelle, pas conjoncturelle : Kimi K3 est 5× moins cher que GPT-5.6 Sol Max grâce à l'architecture Mooncake – un avantage qui ne disparaîtra pas avec une baisse de prix d'OpenAI. Si cette asymétrie persiste, l'open source chinois deviendra l'option par défaut pour les déploiements à grande échelle sensibles au coût.
02
Les contrôles d'exportation accélèrent l'innovation contrainte : en limitant l'accès aux GPU avancés, les sanctions américaines ont forcé Moonshot AI à optimiser chaque couche de sa stack – du serving (Mooncake) à l'architecture (Delta Attention). Le résultat est un modèle plus efficace par unité de calcul que ses concurrents américains qui n'ont pas eu à résoudre ces contraintes.
03
L'open source comme instrument de soft power : quand les poids de Kimi K3 seront libérés le 27 juillet, des milliers de développeurs, d'entreprises et de gouvernements dans le monde les téléchargeront – créant une dépendance technique envers une infrastructure chinoise que les régulateurs occidentaux n'ont pas anticipée. La bataille de l'IA ne se gagnera pas seulement sur les benchmarks : elle se gagnera sur les dépendances installées.

Sources :

  • VentureBeat – China's Moonshot AI releases Kimi K3, the largest open-source model ever, rivaling top U.S. systems, Juillet 2026
  • Financial Times – Chinese AI start-up Moonshot to launch model challenging Anthropic's lead, Juillet 2026
  • Financial Times – Xi sets out China's goal to be global AI leader, Juillet 2026