← Blog

Chine en Question

294 000 $ au lieu de 100 millions : la vérité sur la guerre des prix chez DeepSeek La dernière innovation de la société chinoise d'IA DeepSeek soulève des questions fondamentales sur l'avenir de l'intelligence artificielle. Fin décembre 2025, l'entreprise a présenté une nouvelle méthode d'entraînement (appelée Manifold-Constrained Hyper-Connections) susceptible de bouleverser l'ensemble du secteur. Alors…

Accueil À propos Actualités Revue de presse Revue presse 2024 Revue presse 2023 Revue presse 2022 Revue presse 2021 Revue presse 2020 Revue presse 2019 Revue presse 2018 Dazibao Contact Chine en Question Blog dédié au Monde asiatique Chine et DeepSeek Poster un commentaire Publié par Monde en Question le 13/01/2026 294 000 $ au lieu de 100 millions : la vérité sur la guerre des prix chez DeepSeek La dernière innovation de la société chinoise d’IA DeepSeek soulève des questions fondamentales sur l’avenir de l’intelligence artificielle. Fin décembre 2025, l’entreprise a présenté une nouvelle méthode d’entraînement (appelée Manifold-Constrained Hyper-Connections) susceptible de bouleverser l’ensemble du secteur. Alors que les géants technologiques occidentaux investissent des centaines de milliards de dollars dans d’immenses centres de données et des puces spécialisées, DeepSeek propose une approche alternative fondée sur la sophistication architecturale plutôt que sur de simples investissements de capitaux. Cette avancée pourrait ébranler les fondements économiques de l’industrie de l’IA et inaugurer une transformation où le succès ou l’échec ne dépendra plus de la simple disponibilité des ressources, mais de l’expertise en ingénierie. L’approche chinoise n’était pas le fruit d’un choix, mais d’une nécessité. Les restrictions à l’exportation imposées par les États-Unis empêchaient les entreprises chinoises d’accéder aux puces d’IA les plus performantes de Nvidia. Ce qui apparaissait initialement comme un désavantage stratégique s’est transformé en un accélérateur de développement. DeepSeek a dû optimiser les performances avec un matériel limité, créant ainsi des méthodes qui remettent aujourd’hui en question la structure des coûts de l’ensemble du secteur. La sortie, en janvier 2025, du modèle R1, rivalisant avec les modèles américains haut de gamme pour un coût bien moindre, a provoqué un véritable séisme sur les marchés boursiers et contraint les analystes du monde entier à revoir leurs modèles d’évaluation. Des hyperconnexions à la stabilité mathématique Le fondement technique de la nouvelle méthode DeepSeek repose sur le développement des réseaux au sein de l’IA. Les réseaux neuronaux traditionnels utilisent des connexions résiduelles, sortes de « raccourcis » permettant la transmission d’informations entre les couches du réseau. Ces connexions permettent d’entraîner des réseaux plus profonds en évitant la perte des signaux d’apprentissage. Les « hyper-connexions » de DeepSeek étendent ce concept en élargissant le flux d’informations entre les couches et en autorisant des configurations plus flexibles. Ceci améliore les performances, mais présente un inconvénient majeur : la complexité accrue compromet la stabilité, car la transmission d’informations n’est plus aussi fiable qu’avec les connexions classiques. Avec les connexions traditionnelles, l’information reste globalement inchangée lors de sa circulation dans le réseau, ce qui garantit un entraînement stable. Les nouvelles hyperconnexions sacrifient cette caractéristique au profit d’une capacité d’apprentissage accrue, mais cela entraîne des fluctuations importantes lors de l’entraînement de grands modèles. DeepSeek a observé lors d’expériences que les taux d’erreur augmentaient de manière inattendue après environ 12 000 étapes d’entraînement, un signe évident d’instabilité. Les signaux de contrôle du processus d’apprentissage se comportaient de manière chaotique, rendant pratiquement impossible le passage à des modèles plus performants. Parallèlement, l’élargissement des connexions augmentait le trafic de données, car davantage d’informations devaient être transférées entre la mémoire et le processeur. La solution de DeepSeek projette ces connexions complexes dans un espace mathématique contrôlé (une « variété ») selon des règles fixes. Cette astuce mathématique rétablit la stabilité tout en préservant les avantages d’un échange d’informations plus riche. Cet espace est défini par des matrices spéciales dont les valeurs s’équilibrent pour maintenir la stabilité globale. Bien que cette contrainte puisse paraître technique, elle a des conséquences pratiques importantes : elle garantit que les signaux ne sont ni perdus ni amplifiés de manière incontrôlée lors de leur circulation dans le réseau. Des essais pratiques menés avec un modèle de 27 milliards de paramètres ont confirmé son efficacité. Les hyperconnexions, tant standard que stabilisées, ont surpassé le modèle de référence, mais la version stabilisée a systématiquement obtenu les meilleurs résultats. La stabilité de l’apprentissage s’est considérablement améliorée. Alors que le modèle standard présentait des pertes de données importantes après 12 000 étapes, l’apprentissage avec la nouvelle méthode s’est déroulé sans problème et a suivi de près le comportement du modèle de référence stable. Les signaux d’apprentissage sont restés dans la plage normale tout au long du processus, ce qui indique une solution fondamentale au problème de stabilité. Les gains de performance ne sont pas sans conséquence, mais leur coût reste étonnamment modéré. La méthode augmente l’effort de calcul d’environ 6,7 % par rapport à la méthode standard. Ce léger surcroît d’effort est négligeable au regard des gains de performance considérables, faisant de cette méthode l’une des stratégies les plus efficaces de la recherche actuelle. DeepSeek a également mis en œuvre des optimisations rigoureuses de l’infrastructure afin de réduire la charge sur les voies de transmission des données. Ces optimisations sont cruciales car, pour les modèles volumineux, le goulot d’étranglement n’est souvent pas la puissance de calcul elle-même, mais plutôt la vitesse de transfert des données entre la mémoire et le processeur. La réalité économique derrière les gros titres Le débat public autour des coûts de DeepSeek a été marqué par de nombreux malentendus dès le départ. Lors de la présentation de son modèle R1 en janvier 2025, les chiffres qui circulaient laissaient entendre que le coût d’entraînement du modèle de base V3 était inférieur à six millions de dollars. Ce montant était souvent comparé aux cent millions de dollars estimés pour GPT-4 d’OpenAI, donnant l’impression que DeepSeek bénéficiait d’un avantage de coût vingt-cinq fois supérieur. En septembre 2025, DeepSeek publiait un article dans la revue Nature affirmant que le coût d’entraînement de R1 n’était que de 294 000 dollars. Ce chiffre a de nouveau dominé la couverture médiatique et renforcé la perception d’un avantage de coût fondamental. Une analyse plus approfondie révèle cependant une situation plus complexe. Les 294 000 $ concernent exclusivement la phase dite de post-entraînement, durant laquelle un modèle déjà intelligent est affiné par la pratique et le retour d’information. Le coût total réel dépasse 5,87 millions de dollars pour le seul temps de calcul, auxquels s’ajoutent des investissements matériels d’environ 51 millions de dollars. Ces chiffres n’incluent toujours pas les coûts de recherche, de préparation des données, de personnel et d’expérimentations infructueuses. Une fois ces facteurs pris en compte, les coûts de développement réels, bien qu’inférieurs aux chiffres comparables en Occident, n’atteignent pas l’ampleur spectaculaire des chiffres souvent cités. La structure des coûts du développement de l’IA est intrinsèquement difficile à appréhender. OpenAI n’a jamais publié de chiffres précis concernant GPT-4. L’estimation souvent citée de 100 millions de dollars provient de Sam Altman, qui, en 2023, évoquait des coûts d’entraînement de modèles de base nettement supérieurs. Des estimations analogues pour des modèles plus récents comme GPT-4o suggèrent que les coûts ont considérablement diminué grâce aux techniques modernes telles que les réseaux d’experts spécialisés, des méthodes plus efficaces et une infrastructure optimisée. Certaines analyses situent les coûts d’entraînement de GPT-4o entre 5 et 16 millions de dollars, ce qui signifierait que l’écart de coût avec DeepSeek est considérablement moindre que ce que l’on croit généralement. Néanmoins, la performance de DeepSeek reste remarquable. L’entreprise a entraîné son modèle V3 avec près de 2,8 millions d’heures de calcul GPU sur 2 048 puces H800 pendant deux mois. La H800 est une version bridée de la H100 de Nvidia, destinée au marché chinois, son débit de transfert de données étant considérablement réduit pour se conformer à la réglementation américaine sur les exportations. Ces puces sont nettement moins puissantes que les modèles originaux utilisés dans les centres de données occidentaux ou même que les processeurs Blackwell, pourtant plus récents. Le fait que DeepSeek ait réussi à développer des modèles compétitifs avec ce matériel limité constitue une véritable avancée. L’architecture « mixte d’experts » joue un rôle central. DeepSeek V3 possède 671 milliards de paramètres, mais n’en active que 37 milliards par mot. Cela signifie que seule une fraction du modèle est réellement sollicitée pour chaque requête. Le modèle est composé de nombreux « experts » spécialisés et d’un pool de connaissances partagé, seuls quelques spécialistes étant sélectionnés pour chaque étape. Cette conception permet d’accroître considérablement les connaissances du modèle sans augmenter proportionnellement les coûts de calcul. Chaque expert peut se spécialiser dans des domaines spécifiques, ce qui améliore les performances et l’efficacité. Le défi de cette approche par experts réside dans l’équilibrage de la charge. Si certains experts sont constamment sollicités tandis que d’autres restent inactifs, des problèmes d’efficacité surviennent. Les approches traditionnelles utilisent des « fonctions de pénalité » qui contraignent le modèle à utiliser tous les experts de manière égale. Cependant, cette méthode conduit souvent à des résultats moins performants, car le meilleur expert n’est pas toujours sélectionné. DeepSeek a mis en œuvre une stratégie d’équilibrage de charge intelligente, sans ces pénalités artificielles, garantissant une utilisation équilibrée des experts sans compromettre la qualité. Cette innovation a été cruciale pour la réussite du passage à l’échelle du modèle. L’impératif stratégique d’innovation pour la Chine Le développement de DeepSeek ne peut être compris indépendamment du contexte géopolitique. En octobre 2022, les États-Unis ont considérablement durci leurs contrôles à l’exportation sur les puces d’IA et les équipements de fabrication vers la Chine. Ces mesures visaient à limiter la capacité de la Chine à développer des systèmes d’IA avancés et leurs applications militaires. Nvidia a été contrainte de développer des puces spécifiquement adaptées au marché chinois. Les modèles A800 et H800 sont ainsi apparus comme des versions allégées des modèles haut de gamme, avec des vitesses réduites juste assez pour se conformer aux restrictions américaines à l’exportation. En 2023, les États-Unis ont de nouveau renforcé leurs contrôles, bloquant même ces solutions transitoires. Parallèlement, des restrictions à l’exportation ont été imposées sur la mémoire haute performance, un composant essentiel des puces d’IA modernes. Ces mesures ont contraint les entreprises chinoises à développer des alternatives ou à recourir à du matériel plus ancien et moins performant. Huawei, autrefois géant mondial des télécommunications, s’est retrouvé de fait privé d’accès à la technologie des puces occidentales et a été contraint de développer ses propres solutions. Si les processeurs Ascend de Huawei n’atteignent qu’une fraction des performances par puce de Nvidia, ils compensent en partie ce déficit par leur volume de production important. Les chiffres de production illustrent bien le défi. Huawei devrait produire environ 200 000 puces d’IA en 2025, tandis que la Chine a pu importer légalement près d’un million de puces Nvidia modifiées durant la même période. De plus, l’écart de performances se creuse. Les analyses montrent que les meilleures puces américaines sont actuellement environ cinq fois plus puissantes que les meilleures puces Huawei, et cet écart devrait s’accroître considérablement d’ici 2027. Même si Huawei augmentait massivement sa production, l’entreprise serait encore loin d’égaler la puissance de calcul déployée par Nvidia à l’échelle mondiale d’ici 2027. Ces restrictions ont contraint les développeurs chinois à une efficacité radicale. Liang Wenfeng, fondateur de DeepSeek, a perçu très tôt cette nécessité et, dès 2021, avant le durcissement des contrôles, a acquis dix mille GPU Nvidia A100. Cet investissement visionnaire a conféré à DeepSeek un avantage crucial sur ses concurrents, qui n’ont eu accès par la suite qu’à du matériel inférieur. L’ancien gestionnaire de fonds spéculatifs a appliqué la même clairvoyance stratégique qui avait fait son succès dans le secteur financier. Son fonds, High-Flyer, gérait des milliards et figurait parmi les sociétés financières les plus avancées technologiquement en Chine. La création de DeepSeek en juillet 2023 était bien plus qu’une simple expérience. Liang considérait le développement de l’intelligence artificielle générale comme le projet technologique clé du siècle et souhaitait placer la Chine à l’avant-garde de ce domaine. Dans une interview, il expliquait que les jeunes start-ups spécialisées en IA étaient bien placées pour rivaliser avec les entreprises établies, car le marché connaissait une transformation profonde. Le facteur décisif, selon lui, n’était pas de suivre les anciennes règles, mais plutôt la capacité de s’adapter avec souplesse et de réagir au changement. Cette philosophie s’est reflétée dans l’approche de développement de DeepSeek. Dès le départ, l’entreprise s’est concentrée sur l’obtention de résultats optimaux avec des ressources limitées. Tandis que des entreprises occidentales comme OpenAI et Anthropic investissaient des milliards dans des modèles toujours plus volumineux et d’immenses centres de données, DeepSeek a optimisé l’architecture, l’entraînement et l’application pour une efficacité maximale. Le modèle R1 a démontré avec brio la pertinence de cette stratégie. Il a obtenu des résultats sur des tâches mathématiques comparables aux meilleurs modèles américains, tout en nécessitant une architecture consommant beaucoup moins de puissance de calcul par réponse. Source : Chine et DeepSeek – Comment une nouvelle architecture bouleverse le marché des puces, Xpert, 11/01/2026. Lire aussi • Dossier documentaire Techniques – Énergies CHINE (avec liens partagés). • Livres & Revues : Chine en Question – Monde en Question – Mundo en Cuestión – Palestine en Question – Ciné Monde. • Dossiers documentaires : Classés par date – Chine en Question – Monde en Question – Monde en Question (2004-2019) – Palestine en Question. • Revue de presse, Monde en Question. Partager : Imprimer(ouvre dans une nouvelle fenêtre) Imprimer Envoyer un lien par e-mail à un ami(ouvre dans une nouvelle fenêtre) E-mail Partager sur Facebook(ouvre dans une nouvelle fenêtre) Facebook Partager sur X(ouvre dans une nouvelle fenêtre) X J’aime Chargement… Similaire 600 Techniques, Tribune libre Chine, Intelligence Artificielle, Sciences chinoises, Techniques chinoises ← Histoire hétérodoxe d’un lit brodé La Chine, l’Inde et la cosmologie du renouveau civilisationnel → Commenter cet article sinon utiliser le Forum Annuler la réponse. Flux RSS Translate Chine en Question n'héberge aucun fichier, mais propose des liens fournis par les moteurs de recherche. Ni Chine en Question, ni l'hébergeur ne pourront être tenus responsables d'une mauvaise utilisation de ce site. Dossiers documentairesContact Administrateur Articles récents “Elle va tous nous tuer” (sic) Le marketing de la peur de l’IA Anthologie de la littérature chinoise classique Mathématiques PISA 2025 La « théorie du ralentissement de l’IA » Ciné MondeNaza (2026)Filmographie Philippe LÉOTARDLe chagrin et la pitié (1969)Filmographie PaysansDe profundis (2007)Filmographie TANIZAKI Jun’ichirōCommentaires 2-3 TANIZAKI Jun’ichirōCommentaires 0-1 TANIZAKI Jun’ichirōFilmographie Jack LONDONCommentaires 2-3 Jack LONDON Monde en Question“Elle va tous nous tuer” (sic)Le marketing de la peur de l’IALe procès EichmannMathématiques PISA 2025La « théorie du ralentissement de l’IA »L’olfactionEuro-Med dénonce l’usage de drones par Israël pour tuer les civils de GazaLa question de PalestineSources de l’électricité en EuropeNaza (2026)Suivre ce blog RSS - Articles RSS - Commentaires Articles plus lus hierHaïkusCatégories TagsAsie Barack Obama Bibliographie BRICS Brésil Chine Chine - Hong Kong Chine - Taïwan Chine - Tibet Chine - Xinjiang Chine vue par Colonisation Chine Corée Covid-19 Crise économique Donald Trump Droits de l'homme Démocratie chinoise Encyclopédie Europe Europe/Chine G20 Guerre contre Chine Histoire chinoise HU Jintao Inde Initiative Ceinture Route Intelligence Artificielle Japon L'im-Monde Littérature chinoise Littérature japonaise Livres & Revues hebdomadaires OZU Yasujirō Propagande anti-chinoise Propagande médiatique Péril jaune Relations internationales Revue de presse hebdomadaire Russie Sciences chinoises Sinologie Sinologue Techniques chinoises USA/Chine XI Jinping ZHANG Yimou Économie chinoise Énergies chinoises États-UnisArchives Archives Sélectionner un mois septembre 2026 (10) août 2026 (9) juillet 2026 (8) juin 2026 (2) Mai 2026 (3) avril 2026 (7) mars 2026 (8) février 2026 (2) janvier 2026 (8) décembre 2025 (4) novembre 2025 (10) octobre 2025 (6) septembre 2025 (7) août 2025 (4) juillet 2025 (4) juin 2025 (4) Mai 2025 (3) avril 2025 (1) mars 2025 (3) février 2025 (1) janvier 2025 (1) décembre 2024 (1) septembre 2024 (1) juillet 2024 (5) juin 2024 (11) Mai 2024 (11) avril 2024 (13) mars 2024 (9) février 2024 (12) janvier 2024 (14) décembre 2023 (11) novembre 2023 (12) octobre 2023 (15) septembre 2023 (8) août 2023 (1) juillet 2023 (1) juin 2023 (1) Mai 2023 (15) avril 2023 (16) mars 2023 (22) février 2023 (16) janvier 2023 (12) décembre 2022 (9) novembre 2022 (22) octobre 2022 (19) septembre 2022 (13) août 2022 (9) juillet 2022 (4) juin 2022 (14) Mai 2022 (11) avril 2022 (8) mars 2022 (11) février 2022 (10) janvier 2022 (8) décembre 2021 (9) novembre 2021 (8) octobre 2021 (8) septembre 2021 (9) août 2021 (2) juillet 2021 (3) juin 2021 (10) Mai 2021 (11) avril 2021 (13) mars 2021 (17) février 2021 (12) janvier 2021 (12) décembre 2020 (10) novembre 2020 (11) octobre 2020 (12) septembre 2020 (13) août 2020 (4) juillet 2020 (9) juin 2020 (10) Mai 2020 (14) avril 2020 (15) mars 2020 (11) février 2020 (13) janvier 2020 (13) décembre 2019 (12) novembre 2019 (15) octobre 2019 (12) septembre 2019 (6) août 2019 (4) juillet 2019 (5) juin 2019 (11) Mai 2019 (12) avril 2019 (7) mars 2019 (4) février 2019 (6) janvier 2019 (12) décembre 2018 (3) novembre 2018 (3) octobre 2018 (4) septembre 2018 (3) août 2018 (2) juillet 2018 (1) juin 2018 (3) avril 2018 (7) mars 2018 (12) février 2018 (10) janvier 2018 (12) décembre 2017 (11) novembre 2017 (13) octobre 2017 (10) septembre 2017 (9) août 2017 (7) juillet 2017 (4) juin 2017 (9) Mai 2017 (11) avril 2017 (11) mars 2017 (11) février 2017 (8) janvier 2017 (1) décembre 2016 (4) novembre 2016 (7) octobre 2016 (4) septembre 2016 (3) août 2016 (1) juillet 2016 (1) juin 2016 (4) Mai 2016 (9) avril 2016 (9) mars 2016 (5) février 2016 (5) janvier 2016 (4) décembre 2015 (2) novembre 2015 (1) octobre 2015 (13) septembre 2015 (12) août 2015 (10) juillet 2015 (8) juin 2015 (13) Mai 2015 (8) avril 2015 (15) mars 2015 (10) février 2015 (3) janvier 2015 (6) décembre 2014 (5) novembre 2014 (2) octobre 2014 (1) septembre 2014 (1) août 2014 (1) juin 2014 (2) Mai 2014 (5) avril 2014 (2) décembre 2013 (2) novembre 2013 (4) octobre 2013 (1) septembre 2013 (1) avril 2013 (6) mars 2013 (7) février 2013 (3) janvier 2013 (5) décembre 2012 (2) novembre 2012 (10) octobre 2012 (4) septembre 2012 (1) mars 2012 (1) février 2012 (1) septembre 2011 (1) août 2011 (8) juillet 2011 (2) juin 2011 (9) Mai 2011 (2) avril 2011 (4) mars 2011 (11) février 2011 (9) janvier 2011 (4) décembre 2010 (6) novembre 2010 (11) octobre 2010 (7) septembre 2010 (1) août 2010 (1) juin 2010 (1) avril 2010 (1) mars 2010 (2) février 2010 (6) août 2009 (2) juillet 2009 (4) Mai 2009 (4) avril 2009 (4) mars 2009 (1) décembre 2008 (3) novembre 2008 (24) octobre 2008 (21) septembre 2008 (1) décembre 2005 (1) XinhuaErreur, le flux RSS est probablement en panne. Essayez plus tard. Renmin Ribao MondeIran: les prochaines manouvres dans le détroit d'Ormuz ciblées sur la sécurité régionale (ministre de la Défense)Le président yéménite adopte des réformes majeures de l'arméeBan Ki-Moon se dit prêt à se rendre à PyongyangPoutine appelle l'OTSC d'établir un programme d'actions pour l'AfghanistanRussie: la Chambre basse durcit la législation sur les adoptions américainesLe président franais Hollande déclare qu'il ne vient en Algérie pas pour "faire repence ou excuse"Obama annonce une mission spéciale sur le contrle des armes sous la direction du vice-président BidenPark Geun-hye remporte l'élection présidentielle en Corée du SudLa France cherche un partenariat stratégique d'égal à égal avec l'Algérie (Hollande) L'état de santé du président irakien s'améliore après une attaque cérébrale Renmin Ribao ChineQuel signal vont donner les derniers contacts de haut niveau entre la Chine et les Etats-Unis ?Mécontentement de la Chine face à l'accusation du Royaume-Uni concernant les droits de l'HommeOuverture des négociations commerciales annuelles sino-américaines à WashingtonChine: un rapport sur la lutte anti-corruption propose de restreindre le pouvoir des fonctionnairesChine: You Quan nommé chef du Parti pour la province du FujianChine: Peng Qinghua nommé chef du PCC pour la région autonome du GuangxiUn ancien responsable provincial condamné à mort pour corruptionLa Chine déplore le décès d'un sénateur américainXi Jinping rencontre une délégation du parti Russie unie Actualités ChineDanielle Elisseeff et la recherche en archéologie et en histoire de l’artChin’electrodoc fait suite aux «Actualités scientifiques sur la Chine»L’islam ? Pourquoi pas jusqu’en Chine ?Global Public Goods National Policies and Private Interests (the 9th Chinese Internet Research Conference)Online Society in ChinaSérie de reportages sur l’usage d’internet en Chine (CNN)Titres sur la Chine en version électronique sur CAIRNBuilding capacity in gender and sexuality education: developing training material and running trainings of trainersAu carrefour de l’historiographie japonaise d’après-guerre : le débat sur l’histoire de ShôwaTransports urbains, enquête sur trois villes chinoises Carnets ChineCoraline Jortay, nouvellement affectée au CCJ-CECMCPrix de la Fondation Tilsit-Institut de France décerné à Zhang Gong Politique ChineLa diplomatie publique chinoise : séduire l’ennemi américainConférences de Mme Li Danhui et M. Shen ZhihuaDe la nature de l’Etat local en Chine : repenser les relations centre-périphérieIntroduction aux institutions politiques de la République Populaire de ChineJournée d’étude : ” Famines soviétique et chinoise “Anatomie politique de la vie de quartier : la dimension ethnographique du cinéma de Ning YingExégèse des institutions villageoises : un échelon de l’autonomie ?Le 18e Congrès du PCC : institutionnalisation du Parti et jeu des factionsJournée d’étude sur la représentation politique en ChineRevue Le Banquet : Qu’est-ce que la Chine ? ↑ Haut Propulsé par WordPress.com. Commentaire Rebloguer S'abonner Abonné Chine en Question Have a WordPress.com account? Log in now. Confidentialité Chine en QuestionCopier lien courtVoir la publication dans le LecteurGérer les abonnementsS’inscrireConnexionSignaler ce contenuRéduire cette barre %d Concevoir un site comme celui-ci avec WordPress.comCommencer