Moonshot AI a dévoilé Kimi K3 avec un chiffre qui écrase tout ce que l'industrie a connu : 2,8 trillions de paramètres. C'est 75 % de plus que DeepSeek V4 Pro (environ 1,6 trillion), et pratiquement le double de ce que les laboratoires occidentaux ont rendu public en open source. Comme le rapporte VentureBeat, qui a obtenu les données techniques en exclusivité, ce n'est pas un exercice de gonflement spéculatif : les poids complets seront publiés le 27 juillet 2026 sur Hugging Face et les plateformes chinoises. La fenêtre de contexte d'un million de tokens intègre une compréhension visuelle native et un « mode réflexion » toujours actif – la capacité de raisonner en continu plutôt que de basculer entre un mode rapide et un mode profond. Deux innovations architecturales publiées accompagnent le lancement : Kimi Delta Attention (attention linéaire hybride, arXiv:2510.26692) et Attention Residuals (remplacement des connexions résiduelles standard, arXiv:2603.15031). Ces contributions ne sont pas cosmétiques – elles résolvent des problèmes réels de scaling que les architectures transformer classiques rencontrent au-delà du trillion de paramètres. Un exécutif de Moonshot AI, cité par l'agence Xinhua et repris par VentureBeat, résume la philosophie : « Les paramètres sont comme des connexions neuronales – près de 3 trillions d'entre eux signifient que le modèle peut stocker plus de connaissances et de motifs dans son cerveau, comprendre plus profondément, raisonner plus précisément. » La métaphore biologique n'est pas fortuite : elle révèle une approche de la mise à l'échelle qui n'est pas une course au chiffre mais une théorie de l'émergence de capacités par la masse.
Poids complets disponibles le 27 juillet 2026. Fenêtre de contexte : 1 million de tokens.
Les benchmarks publiés par Moonshot AI et relayés par VentureBeat racontent une histoire que l'industrie occidentale va mettre du temps à digérer. Sur GDPval-AA v2, le test de référence pour les tâches du monde réel couvrant 44 professions, Kimi K3 atteint 1 687 points – troisième derrière Claude Fable 5 Max (1 815) et GPT-5.6 Sol Max (1 747,8), mais devant Claude Opus 4.8 (1 600). Sur AA-Briefcase, le benchmark de travail agentique de longue durée le plus exigeant, Kimi K3 se classe deuxième (1 527), dépassant GPT-5.6 Sol Max (1 495) et n'étant devancé que par Claude Fable 5 Max (1 587). Sur BrowseComp, le test de recherche d'information complexe, Kimi K3 atteint 91,2/100 – état de l'art, en configuration mono-agent avec contexte d'un million de tokens, sans compression ni contournement. Sur Frontend Code Arena (Arena.AI), il prend la première place avec 1 679, dépassant à la fois Claude Fable 5 et GPT-5.6 Sol. Sur six benchmarks de codage, il est dans le top 3 de tous, et premier sur SWE Marathon et Program Bench. Sur huit benchmarks d'automatisation de tâches réelles, il est premier sur quatre (Automation Bench, SpreadsheetBench 2, BrowseComp, et un quatrième non nommé). Le message est sans ambiguïté : un modèle open source chinois est désormais compétitif avec les meilleurs modèles propriétaires américains sur l'ensemble des tâches cognitives complexes. La phrase d'un commentateur IA sur les réseaux sociaux, citée par VentureBeat, résume le séisme : « L'open source n'a plus six mois de retard sur les modèles fermés occidentaux. Relisez cette phrase, et réfléchissez à ce qu'elle implique. »
Au-delà des scores de benchmark, Moonshot AI a publié deux démonstrations qui redéfinissent ce qu'un agent autonome peut accomplir. La première est la conception d'une puce électronique : Kimi K3 a fonctionné de manière entièrement autonome pendant 48 heures continues, exécutant le pipeline complet depuis l'architecture jusqu'à la vérification. Résultat : une puce fonctionnelle de 4 mm², avec fermeture temporelle à 100 MHz, capable de simuler plus de 8 700 tokens par seconde. Ce n'est pas un exercice académique – c'est une démonstration qu'un agent peut remplacer une équipe d'ingénieurs sur un cycle de conception complet. La deuxième démonstration est en astrophysique computationnelle : Kimi K3 a reproduit la relation universelle I-Love-Q (reliant moment d'inertie, nombre de Love et moment quadrupolaire des étoiles à neutrons) en environ deux heures, une tâche qui prend normalement une à deux semaines à un chercheur senior. L'agent a lu et validé de manière croisée plus de 20 articles scientifiques pendant l'exécution. Ces démonstrations illustrent une capacité que les benchmarks ne capturent pas : l'endurance agentique. Ce n'est pas la performance sur une tâche unitaire qui impressionne, c'est la capacité à maintenir une cohérence et une progression sur des durées qui excèdent de plusieurs ordres de grandeur ce que les agents actuels peuvent gérer sans déraillement.
La performance de Kimi K3 ne s'explique pas uniquement par la taille du modèle ou l'architecture. Le facteur différenciant est infrastructurel. Le projet Mooncake, développé par Moonshot AI, a remporté le prix du meilleur article à FAST 2025 (la conférence de référence sur les systèmes de stockage) pour son architecture de serving désagrégé centré sur le cache KV. En pratique, cela signifie que Kimi K3 peut servir des inférences avec un cache de contexte automatique – pas de cache ID à gérer, pas de TTL à configurer – ce qui réduit drastiquement la latence et le coût des tâches à long contexte. Cette infrastructure n'est pas un détail d'implémentation : c'est ce qui rend économiquement viable un modèle de 2,8 trillions de paramètres avec une fenêtre d'un million de tokens. La grille tarifaire reflète cette efficacité : 3 dollars par million de tokens en entrée, 15 dollars en sortie, 0,30 dollar pour les tokens en cache. À titre de comparaison, GPT-5.6 Sol Max facture 15 dollars par million de tokens en entrée et 75 dollars en sortie. Kimi K3 est cinq fois moins cher en entrée et cinq fois moins cher en sortie que le modèle phare d'OpenAI, pour des performances comparables sur la majorité des benchmarks. Cette asymétrie de coût est structurelle : elle résulte de choix architecturaux (Mooncake) et non d'une guerre de prix temporaire. Moonshot AI propose même une remise promotionnelle de 30 % en vouchers pour les recharges supérieures à 1 000 dollars jusqu'au 12 août 2026 – une stratégie d'acquisition agressive qui rappelle les débuts d'AWS.
Pour comprendre Kimi K3, il faut remonter à janvier 2025, quand DeepSeek a lancé R1. Ce lancement a provoqué un séisme sur le marché chinois de l'IA : le MAU (utilisateurs actifs mensuels) de Kimi est passé de la 3e à la 7e place. Moonshot AI, fondée en 2023 par Yang Zhilin – un chercheur passé par Google et Meta, diplômé de Tsinghua – avait levé environ 1,5 milliard de dollars en plusieurs tours, avec une valorisation passée de 2,5 à 4,3 milliards. Mais face à DeepSeek, l'entreprise risquait de devenir un acteur de second rang. La réponse de Yang Zhilin a été radicale : un pivot complet vers l'open source. Kimi K2 est sorti en juillet 2025, K2.5 en janvier 2026, et maintenant K3 – le point culminant d'une stratégie d'accélération qui a comprimé trois générations de modèles en 18 mois. Comme le rapporte le Financial Times, ce pivot s'inscrit dans une stratégie plus large décrite par Reuters : les entreprises chinoises utilisent l'open source pour « démontrer leurs capacités technologiques et étendre leurs communautés de développeurs ainsi que leur influence mondiale, une stratégie susceptible d'aider la Chine à contrer les efforts américains visant à limiter les progrès technologiques de Pékin ». L'open source devient un instrument de soft power technologique. La gamme de modèles confirme cette ambition : K3 (flagship), K2.7 Code (codage spécialisé à 0,95 $/1M tokens input), K2.6 (usage général). Et Kimi Code, un CLI open source avec plus de 3 100 étoiles GitHub, intègre VSCode, Cursor et Zed, avec des fonctionnalités de sous-agents, tâches en arrière-plan, mode plan et agents imbriqués – en concurrence directe avec Claude Code (1 milliard de dollars d'ARR).
Le lancement de Kimi K3 survient dans un contexte où le président Xi Jinping a explicitement fixé comme objectif national de faire de la Chine le leader mondial de l'IA. Selon le Financial Times, cette directive place l'IA au même niveau de priorité stratégique que la souveraineté alimentaire et énergétique. Kimi K3 démontre que les contrôles d'exportation américains sur les semi-conducteurs avancés n'ont pas empêché la Chine de produire le plus grand modèle open source jamais créé – ils ont peut-être même accéléré l'innovation en forçant des optimisations architecturales et infrastructurelles que les laboratoires occidentaux, disposant de hardware abondant, n'avaient pas besoin de développer. L'innovation Mooncake en est l'exemple parfait : une contrainte de ressources qui se transforme en avantage compétitif. La question stratégique n'est plus de savoir si l'open source chinois rattrapera l'Occident – Kimi K3 prouve qu'il l'a déjà fait sur plusieurs dimensions critiques. La question est de savoir si les entreprises et gouvernements occidentaux, qui dépendent massivement des modèles propriétaires américains (OpenAI, Anthropic, Google), peuvent se permettre d'ignorer une alternative open source chinoise qui est moins chère, plus performante sur les tâches de longue durée, et dont les poids seront librement téléchargeables dans dix jours.
Sources :
- VentureBeat – China's Moonshot AI releases Kimi K3, the largest open-source model ever, rivaling top U.S. systems, Juillet 2026
- Financial Times – Chinese AI start-up Moonshot to launch model challenging Anthropic's lead, Juillet 2026
- Financial Times – Xi sets out China's goal to be global AI leader, Juillet 2026