Intelligence artificielle

DeepSeek : une arrivée volatile et précoce de l’IA commercialisée ?

mm
Ajouter Securities.io à vos sources préférées sur Google
Divulgation : Securities.io peut recevoir une compensation via les liens vers les produits évalués. Cela n’influence pas nos évaluations éditoriales. Nous ne sommes pas un conseiller en placement inscrit ; ceci ne constitue pas un conseil en placement. Consultez notre politique d’affiliation.

DeepSeek bouleversant le paysage de l’IA

Pour quiconque n’était pas au courant et qui a consulté les marchés financiers le lundi 27th janvier 2025, la question était probablement « Que s’est‑il passé ? ». L’ascension apparemment inarrêtable du cours de l’action Nvidia (NVDA ) – jusqu’à présent – a été interrompue par une chute brutale de 18 % en une seule journée.

Avec une perte de capitalisation boursière de 560 milliards de dollars, aucune entreprise n’avait jamais perdu autant de valeur en une journée. D’ailleurs, les investisseurs de Nvidia s’habituent probablement à l’extrême volatilité de l’action, qui figure parmi les 8 plus fortes baisses quotidiennes sur 10.

Le déclencheur a été le lancement de DeepSeek, un LLM (modèle de langage de grande taille) fabriqué en Chine et rivalisant avec les meilleurs produits d’OpenAI et d’autres grandes entreprises d’IA en termes de performances. Sauf qu’il est open source et offre un accès à un prix très bas. Il est également affirmé qu’il a été développé avec seulement 6 M$ comme « projet secondaire » d’un fonds de couverture quantitatif.

Si cela est vrai, il pourrait renverser le récit selon lequel le développement de l’IA serait extrêmement gourmand en calcul et nécessiterait des milliards, voire des billions, de dollars dans des centres de données IA. En tant que leader du matériel IA, il n’est pas surprenant que Nvidia ait été le plus impacté par la panique des investisseurs.

Avec le calme qui revient un peu, examinons ce que DeepSeek peut réellement faire, et ce que l’industrie IA chinoise pourrait faire bientôt.

Contexte de DeepSeek

High-Flyer

DeepSeek a été développé par un fonds de trading financier / fonds de couverture quantitatif chinois, High-Flyer, fondé par Liang Wenfeng.

Liang a 40 ans et a d’abord travaillé dans la vision industrielle. Il a fondé High-Flyer en 2015, dans la trentaine, pionnier de l’utilisation de l’IA dans les stratégies de trading, en s’appuyant sur le machine learning. Le fonds gère aujourd’hui 8 milliards de dollars d’actifs.

Habituellement très discret, Liang a été aperçu assis à côté du Premier ministre chinois Li Qiang (le deuxième membre du Comité permanent du Politburo du Parti communiste chinois) lors d’une réunion sur la technologie IA à Pékin le 20 janvier 2025.

Il convient de préciser que, dans la confusion initiale et en raison des rares apparitions publiques de Liang, de nombreux médias ont utilisé la photo d’une personne du même nom, totalement non liée à DeepSeek, et qui travaille comme décorateur d’intérieur.

“Not Liang Wenfeng” – Source: Business Day

DeepSeek

En 2021, Liang Wenfeng a acheté environ 10 000 puces H800 de Nvidia, avant que les sanctions américaines n’entrent en vigueur, pour lancer ce qui allait devenir DeepSeek, et a fait appel aux meilleurs chercheurs IA de High‑Flyer pour le projet.

Les puces H800 sont, relativement, des puces à faible performance comparées aux H100 et B200 plus avancées, avec trois fois la consommation d’énergie.

DeepSeek affirme avoir entraîné son modèle DeepSeek V3 en moins de deux mois, pour 5,58 M$. Ainsi, même si cela n’inclut pas le coût des 10 000 puces H800, c’est quand même plusieurs ordres de grandeur moins cher que tout autre LLM à ce jour.

En fait, cela rendrait l’entraînement de DeepSeek V3 moins cher que le seul salaire des dirigeants des équipes IA chez OpenAI, Meta, Microsoft (MSFT ), Google, etc.

Performances de DeepSeek

Combinées au faible prix de développement, ce qui a choqué les analystes et les investisseurs, c’est que les performances de DeepSeek sont similaires voire supérieures aux derniers et meilleurs modèles d’OpenAI et d’autres grandes sociétés IA, y compris le tout récent et acclamé comme potentiel AGI o3.

Source: GitHub

La réaction immédiate a été de suspecter une tricherie et que les temps et coûts de développement étaient falsifiés (plus d’informations ci‑dessous).

Quoi qu’il en soit, il est probable que la méthode de DeepSeek soit 10 à 100 fois plus efficace que ce que l’industrie IA a fait jusqu’à présent.

Le coup de pied supplémentaire à l’industrie IA américaine a été le prix de DeepSeek. Avec des tokens bien en dessous de 1 $, il représente environ 3 % à 5 % du prix de tous ses concurrents.

Source: Jason Clarck

« Nous avons réduit les prix parce que, premièrement, en explorant les structures de modèles de prochaine génération, nos coûts ont diminué ; deuxièmement, nous croyons que les services IA et API doivent être abordables et accessibles à tous. »

Liang Wenfeng

Timing parfait

Le lancement percutant de DeepSeek V3 a, évidemment, été parfaitement coordonné par l’entreprise pour un impact maximal.

Il est survenu quelques jours seulement après l’annonce du président Trump du « Project Stargate », une initiative de 500 milliards de dollars visant à construire 20 méga‑centres de données IA, dirigée par SoftBank (SFTBY ), OpenAI et Oracle (ORCL ).

Alors que les marchés paniquaient, le président américain semblait largement imperturbable.

« Si vous pouvez le faire moins cher, si vous pouvez le faire [pour] moins [et] obtenir le même résultat final. Je pense que c’est une bonne chose pour nous. »

Il a également déclaré ne pas être inquiet de la percée, ajoutant que les États‑Unis resteront un acteur dominant dans le domaine.

Source: BBC

Après le LLM, génération d’images

L’accomplissement de DeepSeek dans le domaine du LLM le pousse maintenant à reproduire le succès avec la génération d’images IA et le lancement de Janus‑Pro‑7B.

Source: Hugging Face

Bien que le débat persiste quant à savoir s’il est réellement comparable à Midjourney, DALL‑E et aux autres générateurs d’images, il reste néanmoins impressionnant.

Et s’il suit le même schéma que le LLM DeepSeek v3, il est probable qu’il soit remarquablement efficace.

Les effets immédiats

Impact sur l’industrie de l’IA

Alors qu’il a pris d’assaut l’industrie IA, DeepSeek a eu quelques conséquences immédiates :

  • Turbulence du marché : le cours de l’action Nvidia et l’ensemble du Nasdaq se sont effondrés lorsque les marchés ont compris les implications d’un gaspillage potentiel de centaines de milliards de dollars en matériel IA (voir ci‑dessous pour une discussion plus approfondie).
  • Accélération de la course à l’IA : alors que la Chine était considérée comme « irrelevant » par les magnats technologiques américains il y a quelques mois, une nouvelle course à l’IA s’engage désormais de l’autre côté du Pacifique.
  • Succès du jour au lendemain : DeepSeek est presque instantanément devenu l’application la plus téléchargée sur l’App Store.
  • Tests hors ligne : de nombreuses personnes testent également comment le modèle peut fonctionner localement sur leur ordinateur domestique haut de gamme, les exigences de calcul semblant nettement inférieures à celles des LLM précédents.

Dégâts collatéraux

Les dommages causés par DeepSeek ne se limitent pas aux images et aux profits futurs potentiels des entreprises américaines d’IA et de technologie.

Par exemple, les entreprises nucléaires innovantes qui devaient constituer le cœur de l’alimentation des centres de données IA à l’échelle du mégawatt ont été encore plus durement touchées : le 27th janvier 2025, le développeur de SMR Nuscale (SMR ) a chuté de 27,5 % et le producteur d’uranium Cameco a perdu 15 %.

Une autre victime collatérale sont les actions technologiques hors des États‑Unis. Les actions technologiques japonaises comme Advantest, fournisseur de Nvidia, ont également baissé de 8,6 % et l’action SoftBank a reculé de 8,3 %. Pendant ce temps, le fabricant néerlandais de puces ASML a perdu 6,5 %.

Comment DeepSeek a‑t‑il géré cela ?

Pas de réponse définitive pour l’instant

C’est évidemment un sujet encore très débattu peu de temps après le lancement. Nous pouvons discuter de quelques points de vue différents une fois que nous aurons considéré quelques faits connus.

Le premier fait est que, quoi qu’il en soit, DeepSeek V3 est aussi puissant que le meilleur IA publié à ce jour.

Peut‑être plus important encore, étant open‑source, de nombreuses personnes testent déjà et confirment qu’il nécessite beaucoup moins de puissance de calcul.

DeepSeek R1 est l’une des percées les plus étonnantes et impressionnantes que j’aie jamais vues – et en tant qu’open source, c’est un cadeau profond pour le monde.

Marc Andreessen

Il ne faut donc pas le rejeter comme du simple « buzz » ou le résultat d’une conspiration du gouvernement chinois. C’est également l’opinion de poids lourds de la Silicon Valley comme Marc Andreessen et Chamath Palihapitiya.

La construction de modèles IA est un piège à argent (…) L’open source est le gagnant clair.

Les IA propriétaires seront contraintes de garder leurs meilleurs modèles secrets et de les vendre aux entreprises OU d’essayer de créer une application grand public incroyable avec.

Chamath Palihapitiya

Une interview avec Liang Wenfeng de juillet 2024, donnée juste après le lancement de DeepSeek V2, peut également nous apporter des éclairages.

Une approche différente

La première explication possible est que DeepSeek a simplement adopté une stratégie différente pour le développement de l’IA.

Un facteur clé ici est qu’il s’agit d’un projet interne à l’entreprise de Liang Wenfeng, et non d’une société financée par du capital‑risque. À ce titre, cela rappelle un peu les débuts de Tesla (TSLA ) et SpaceX (SPCX ), qui reposaient sur l’argent d’Elon Musk.

Cette différence a apporté à DeepSeek un focus sur le développement de sa propre architecture de modèle, au lieu de copier Llama pour produire rapidement des applications.

« Notre objectif est l’AGI (Intelligence Générale Artificielle), ce qui nous oblige à explorer de nouvelles structures de modèles afin d’obtenir des capacités supérieures avec des ressources limitées. C’est de la recherche fondamentale pour l’échelle. Au‑delà de l’architecture, nous avons étudié la curation de données et le raisonnement humain – tout cela se reflète dans nos modèles. »

Liang Wenfeng

Cela se reflète également dans la culture d’entreprise, moins axée sur le profit, car il s’agit du « job » du fonds de couverture High‑Flyer. Au lieu de cela, l’innovation elle‑même est l’objectif déclaré.

« Pendant trois décennies, nous avons privilégié le profit au détriment de l’innovation. L’innovation n’est pas purement motivée par le business ; elle requiert curiosité et ambition créative. Nous sommes enchaînés par de vieilles habitudes, mais c’est une phase.

Les entreprises américaines les plus rentables sur le long terme sont les géants technologiques construits sur la R&D à long terme. 

Liang Wenfeng

De ce point de vue, la culture DeepSeek pourrait constituer un avantage durable, et représente une critique cinglante de la plupart des leaders d’opinion en IA.

« Nous croyons que l’IA chinoise ne peut pas rester un suiveur indéfiniment. Souvent, nous disons qu’il y a un écart d’un ou deux ans entre l’IA chinoise et américaine, mais le vrai fossé est entre originalité et imitation. Si cela ne change pas, la Chine restera toujours un suiveur. Certaines explorations sont inévitables. »

Liang Wenfeng

L’évolution naturelle de la technologie IA

Une autre option est simplement que, à mesure que davantage de chercheurs développent leurs compétences en création d’IA, les innovations continuent de pousser le domaine en avant. Ce que DeepSeek a accompli, une startup IA débrouillarde était destinée à le faire un jour à mesure que la technologie mûrit. Et à cause des sanctions limitant l’accès aux puces avancées, les entreprises IA chinoises sont les premières à se concentrer sur faire plus avec moins.

On pourrait également considérer cela comme la supériorité à long terme du logiciel open‑source par rapport aux systèmes fermés et à but lucratif qui cherchent à maximiser les profits en créant des monopoles.

Ce point de vue ne reflète pas non plus très bien les centaines de milliards de dollars que les géants technologiques prévoyaient de dépenser rien qu’en 2025.

Ainsi, il s’agirait moins d’une condamnation de la supériorité de DeepSeek, et davantage d’une dénonciation de la bureaucratisation des anciens géants technologiques innovants, tant chinois qu’américains.

 Une conspiration

Probablement inévitable dans le contexte d’une compétition intense entre grandes puissances entre l’Occident et l’Eurasie (Russie / Chine / Iran), beaucoup ont rapidement vu en DeepSeek une opération hostile étrangère contre la partie la plus compétitive de l’économie américaine.

Une théorie du complot clairement rejetable est qu’il s’agit simplement d’une copie d’IA occidentales ou d’une falsification de ses performances, alors que cela est déjà confirmé de façon indépendante. Étant donné que DeepSeek est un logiciel open‑source, il est également illogique de le qualifier d’espionnage ou d’outil censuré par le PCC, car littéralement n’importe qui peut le déployer et le modifier librement.

Cependant, un point valable est que DeepSeek aurait pu obtenir l’accès à des puces plus avancées, officiellement sanctionnées et interdites d’exportation vers la Chine. Si tel était le cas, il serait logique pour l’entreprise de ne pas l’admettre publiquement et de mentir à ce sujet.

Une possibilité est un soutien caché du gouvernement, allant du financement direct à l’accès à de grands clusters de puces H100 de Nvidia détournées pour l’entraînement de l’IA. Nous savons, par exemple, que de nombreuses puces sont vendues à Singapour, puis probablement revendue à la Chine.

« Les laboratoires chinois possèdent plus de H100 que ce que les gens imaginent. Ma compréhension est que DeepSeek possède environ 50 000 H100, dont ils ne peuvent pas parler, évidemment, parce que cela contrevient aux contrôles à l’exportation que les États‑Unis ont mis en place. »

Alexandr Wang, PDG du fournisseur de données d’entraînement Scale AI

Une autre contestation porte sur le coût d’entraînement, qui n’a pas été vérifié de façon indépendante.

Une dernière possibilité est que DeepSeek, indépendamment de toute conspiration géopolitique, aurait massivement parié contre l’action Nvidia avant de publier ses affirmations impressionnantes. High‑Flyer est un fonds de couverture après tout, bien que cela puisse être considéré comme une manipulation de marché et donc un mouvement risqué.

Premières conclusions

L’IA est un domaine qui évolue incroyablement vite, et DeepSeek a déjà changé la donne de plusieurs manières importantes :

  • Nous disposons désormais d’une nouvelle méthode pour générer des LLM ultra‑efficaces et probablement des modèles IA en général.
  • L’IA open‑source a une réelle chance de rivaliser avec le modèle plus fermé promu par (ironiquement nommé) OpenAI.
  • La compétition entre les États‑Unis et la Chine sur l’IA devient encore plus intense.
  • Les sanctions sur l’exportation de puces IA avancées vers la Chine sont un échec, soit parce que DeepSeek y a quand même accès, soit parce qu’elles ne sont tout simplement pas nécessaires.
    • En arrière‑plan, Huawei est probablement aussi un concurrent sérieux pour fournir à DeepSeek davantage de puces.
    • Cela n’empêchera pas certains de continuer à essayer.

« Le fait que DeepSeek ait réussi à construire R1 illustre l’impact retardé de l’échec des contrôles à l’exportation d’octobre 2022. Mais très bientôt, nous vivrons le succès des contrôles à l’exportation d’octobre 2023.

M. Greg Allen, directeur du Wadhwani AI Centre au Centre for Strategic and International Studies.

Oubliez DeepSeek, qu’en est‑il de la revanche de TikTok ?

Une information importante a été négligée dans les analyses paniquées et les théories du complot entourant DeepSeek.

Une autre entreprise chinoise, le créateur de TikTok ByteDance, a également lancé Doubao‑1.5‑pro le 24th janvier – sa propre réponse à ChatGPT‑4o.

Il est également beaucoup moins cher que ses homologues américains, 5 fois moins cher que le modèle de DeepSeek et plus de 200 fois moins cher que le GPT‑4o d’OpenAI.

Le nouveau Doubao 1.5 Pro utilise une approche plus efficace pour entraîner son modèle IA, ce que ByteDance affirme aider à équilibrer les performances du système avec des coûts plus bas.

Cela est réalisé grâce à une conception qui combine à la fois l’entraînement et l’utilisation en temps réel du modèle, l’optimisant pour de meilleurs résultats tout en maintenant les coûts d’infrastructure bas.

Source: Financial Express

Ce modèle bat également les modèles leaders d’OpenAI, Anthropic et Alibaba.

Si cela résulte d’un effort indépendant, cela prouverait que la pénurie de puces a, au contraire, forcé les entreprises chinoises à rivaliser sur l’efficacité, révélant un certain niveau de complaisance chez les entreprises américaines d’IA, inondées d’un cash et d’une puissance de calcul apparemment illimités.

Il n’est pas non plus improbable que ByteDance, après des mois de lutte pour éviter une interdiction ou une vente forcée de TikTok aux États‑Unis, ait cherché des moyens de concurrencer et de riposter.

Autres modèles chinois

Avec deux entreprises qui semblent désormais écraser le marché IA sur le prix pour des performances similaires, l’attention se portera probablement aussi sur d’autres modèles IA chinois. Cela pourrait inclure :

En le regardant d’une perspective globale plutôt que centrée sur DeepSeek, cela ressemble davantage à une vague de nouveaux modèles IA améliorés en provenance de Chine, qu’à une frappe surprise de DeepSeek seule, comme on le décrit souvent aujourd’hui.

Conclusion

Alors que la guerre de l’IA s’intensifie, il n’est plus si clair que l’accès au financement et la montée en puissance rapide de la capacité de calcul seront les seuls facteurs déterminants.

Il n’est pas non plus certain à quel point le secteur sera réellement rentable à terme, si les prix des tokens LLM peuvent chuter de 50 à 200 fois du jour au lendemain pour la même performance. Cependant, cela ne devrait pas déclencher une réaction trop forte. Au final, une IA moins chère et plus efficace signifie également une IA qui sera massivement adoptée et omniprésente.

Cela signifiera également que la demande ultime de puces IA restera probablement élevée, même si elle est légèrement inférieure aux prévisions initiales.

Tout aussi important, des LLM largement accessibles et ultra‑bon marché grâce à l’open source annoncent une arrivée précoce de tout effet que l’IA devrait avoir sur les marchés du travail, la productivité, la fabrication, l’éducation, le commerce international, etc.

Jonathan est un ancien chercheur en biochimie qui a travaillé dans l'analyse génétique et les essais cliniques. Il est maintenant analyste boursier et rédacteur financier, spécialisé dans l'innovation, les cycles de marché et la géopolitique dans sa publication 'The Eurasian Century'.