Le 31 juillet 2026, DeepSeek publie V4-Flash, un modèle qui coùte 0,03 dollar pour exécuter une batterie de benchmarks standard selon Artificial Analysis. À titre de comparaison, le même ensemble de tests coùte 0,86$ avec Kimi K3 (Moonshot AI), 1,86$ avec GPT-5.6 Sol (OpenAI) et 3,15$ avec Claude Fable 5 (Anthropic). DeepSeek V4-Flash est donc plus de 100 fois moins cher que le modèle phare d'Anthropic. Le score d'intelligence est certes inférieur – 50 sur 100 à l'Intelligence Index contre environ 59 pour Fable 5 – mais pour les tâches de résumé, de code standard et d'automatisation de back-office, le différentiel de qualité ne justifie pas un multiplicateur de prix de 105 (sources : ZeroHedge, The Economist, aoùt 2026).
Le Token Expenditure Index, qui agrège les prix des API et des modèles open-weight pondérés par l'utilisation, a culminé au-dessus de 2,0 en mai 2026 après avoir presque doublé depuis décembre 2025. Il est désormais à 1,3394, en baisse d'environ 33 % par rapport au sommet. Selon le stratège Andreas Steno Larsen, une faiblesse durable des prix des tokens « mettrait fin au cycle mémoire, hardware et data centers ». Bloomberg a signalé ce retournement comme la preuve que « les fournisseurs d'IA perdent leur pouvoir de fixation des prix à mesure que les clients deviennent sensibles aux coùts » (source : ZeroHedge).
Entre le 16 juillet et le 3 aoùt 2026, l'écosystème chinois de l'IA a livré une séquence sans précédent. Le 16 juillet, Moonshot AI publie Kimi K3 (2 800 milliards de paramètres), qui prend la première place du classement Frontend Code d'Arena.ai. Le 19 juillet, Alibaba présente Qwen3.8-Max à la World AI Conference. Le 27 juillet, Moonshot passe K3 en open weights – la plus grande publication open-weight de l'histoire. Le 31 juillet, DeepSeek sort V4-Flash à 0,03$ le benchmark. Le 3 aoùt, Alibaba rend Qwen3.8-Max généralement disponible, avec 2 400 milliards de paramètres totaux (95 milliards actifs) et une fenêtre de contexte de 1 million de tokens (sources : ZeroHedge, VentureBeat, The Economist).
The Economist résume la situation avec une économie de mots : « L'investissement chinois est très inférieur à celui de l'Amérique. Ses modèles ne le sont pas. » Le contraste avec la Silicon Valley est saisissant : pendant que Nvidia et OpenAI négocient un data center à 500 milliards de dollars, la Chine produit des modèles compétitifs avec une fraction du capital (source : The Economist, aoùt 2026).
Qwen3.8-Max n'est pas un modèle low-cost comme V4-Flash. C'est un modèle de classe frontier à 2 400 milliards de paramètres en architecture Mixture-of-Experts, positionné pour les tâches agentiques de longue durée : projets logiciels de plus de 10 jours, reproduction d'articles de recherche avec des milliers de lignes de code, optimisation itérative de conception de puces. Sur OSWorld-Verified, le benchmark de référence pour les agents informatiques, Qwen3.8-Max obtient 86,1, devant GPT-5.6 Sol Max (83,2) et Fable 5 (85,0). Sur Terminal-Bench 2.1, il atteint 86,6 contre 84,6 pour Fable 5 (source : VentureBeat, aoùt 2026).
La tarification API via QwenCloud est de 2$ par million de tokens en entrée et 6$ en sortie, soit 8$ combinés. Claude Opus 5 coùte 30$, GPT-5.6 Sol Max 35$, Gemini 3.1 Pro 14$. Pour des charges de travail agentiques qui consomment régulièrement des millions de tokens par tâche, l'écart de coùt devient structurel. Qwen3.8-Max coùte moins d'un quart du prix de GPT-5.6 Sol Max. OpenAI a déjà réagi en réduisant les prix de GPT-5.6 Terra/Luna de 20 à 80 %, signalant une guerre des prix généralisée (source : VentureBeat).
Qwen3.8-Max à 8$/M tokens → Pression sur GPT-5.6 Sol Max (35$/M)→ OpenAI réduit prix GPT-5.6 de 20–80 %→ Compression des marges sur l'ensemble du segment frontier→ Les hyperscalers US (Alphabet 205 Md$ de capex) voient leur retour sur investissement se comprimer
Alibaba promet de publier les poids de Qwen3.8-Max « la semaine prochaine » avec Qwen3.8-27B, mais la licence n'est pas encore divulguée. Une licence permissive (Apache 2.0) permettrait l'auto-hébergement, le fine-tuning et l'intégration commerciale, rendant le modèle incontournable. Une licence restrictive (comme celle de Kimi K3, qui exige une licence commerciale pour le « Model as a Service ») limiterait l'adoption enterprise. Jusqu'à la publication de la licence, l'avantage open-weight reste « prometteur mais incomplet », note VentureBeat (source : VentureBeat).
DeepSeek n'avait jamais accepté d'argent extérieur avant mai 2026. En l'espace de quelques semaines, tout a changé. Premier tour externe : plus de 50 milliards de yuans (environ 7,4 milliards de dollars) à une valorisation supérieure à 50 milliards de dollars. Structure inhabituelle : les investisseurs commerciaux (Tencent, CATL selon les informations) achètent des parts dans un partenariat limité contrôlé par le fondateur Liang Wenfeng – sans droit de vote, avec une période de blocage de 5 ans. Une seule entité obtient des actions directes avec droit de vote : le Fonds national d'investissement dans l'industrie de l'IA, soutenu par l'État chinois. Quelques semaines plus tard, DeepSeek entre en négociations pour un deuxième tour à environ 71 milliards de dollars, destiné aux data centers et aux puces. Le tout assorti d'une réduction permanente de 75 % sur l'API (source : ZeroHedge).
ZeroHedge résume le modèle avec une formule frappante : « L'arrangement commence à ressembler à de la politique industrielle conduite via une API : du capital à privilège étatique qui subventionne des tokens vendus à perte pour capturer des parts de marché mondiales. » Le résultat est déjà visible : en juin, DeepSeek a capturé environ 23 % des dizaines de billions de tokens transitant par la passerelle IA enterprise de Vercel, contre 32 % pour Anthropic. L'écart se resserre rapidement, et le moteur n'est pas la supériorité technique mais le prix (source : ZeroHedge).
Les investisseurs commencent à douter du récit qui a porté les valorisations tech depuis dix-huit mois. Les dépenses d'investissement dans les data centers pourraient dépasser 740 milliards de dollars cette année selon Bloomberg Intelligence. Le 26 juillet, l'information selon laquelle Nvidia négociait la souscription de 250 milliards de dollars d'un méga-data center de plus de 500 milliards, rempli de ses propres puces et exploité par OpenAI, a fait chuter l'action Nvidia. Quelques jours plus tôt, Alphabet annonçait une augmentation de ses dépenses IA à 205 milliards de dollars pour l'année, provoquant la même réaction de rejet des investisseurs. Les valeurs IA au Japon, en Corée du Sud et à Taïwan ont également chuté en tandem (source : The Economist).
The Economist souligne une asymétrie cruciale : aux États-Unis, l'expansion des data centers fait face à des protestations croissantes, des blocages républicains sur le foncier, l'eau et l'énergie. Pékin ne rencontre aucune résistance comparable. Les contrôles à l'exportation ne peuvent pas arrêter les modèles open-weight, et les fournisseurs d'inférence américains serviront les modèles chinois à des marges réduites. Le paradoxe est complet : les restrictions américaines sur les puces ont accéléré l'efficacité chinoise, et cette efficacité menace désormais le modèle économique qui justifiait les restrictions (source : The Economist).
La domination chinoise sur la frontière coùt/performance est spectaculaire, mais trois fragilités structurelles tempèrent le récit d'une inévitable conquête du marché mondial de l'inférence.
DeepSeek a confirmé travailler sur V4-Pro, un modèle plus lourd sans date de sortie. Si V4-Pro atteint des scores de niveau frontier (59+ à l'Intelligence Index) avec une tarification proche de V4-Flash, les 37 points d'écart d'Elo que facturent OpenAI et Anthropic pour financer leurs infrastructures seront directement menacés. La question n'est pas de savoir si la Chine peut produire des modèles moins chers – elle l'a prouvé – mais si elle peut combler l'écart de performance tout en maintenant l'avantage de prix. V4-Pro est le modèle à surveiller (source : ZeroHedge).