DeepSeek : la direction choisie n'est pas le prix cassé, c'est l'efficience de calcul comme discipline
L'essentiel
DeepSeek n'a pas fait le choix de coûter moins cher par posture commerciale. Adossé au fonds quantitatif High-Flyer et confronté aux restrictions américaines sur l'accès aux puces avancées, le laboratoire a fait de l'efficience de calcul une direction stratégique stable, que chaque génération de modèle pousse plus loin plutôt qu'un coup ponctuel réussi une fois.
DeepSeek reste souvent résumé à une image : un modèle chinois soudainement moins cher, qui a fait chuter Nvidia en bourse le temps d’une séance. Cette image décrit un événement, pas une direction. Une direction stratégique se lit sur plusieurs générations de modèles, pas sur une annonce. Celle de DeepSeek tient en deux choix stables, poursuivis depuis la création du laboratoire : rechercher l’efficience de calcul plutôt que l’échelle brute, et publier ses modèles en poids ouverts de façon systématique plutôt qu’en exception ponctuelle.
Une direction née d’un fonds quantitatif, pas d’un laboratoire généraliste
Ce que les données établissent. DeepSeek n’est pas parti d’un laboratoire de recherche fondamentale qui aurait ensuite cherché un modèle économique. Le laboratoire a été fondé par Liang Wenfeng, également cofondateur du fonds spéculatif quantitatif chinois High-Flyer, et a été incubé au sein de ce fonds à partir de 2023, financé sur son propre budget de recherche et développement plutôt que par une levée de capital-risque classique.
Mon interprétation. Cette origine compte pour comprendre la direction prise, au-delà du simple fait biographique. Un fonds quantitatif vit d’extraire un signal exploitable à partir de ressources de calcul contraintes : chaque unité de calcul doit produire le meilleur résultat possible, parce que la rentabilité d’une stratégie de trading se joue sur cette efficacité-là, pas sur la taille brute de l’infrastructure. Rien ne prouve formellement que cette culture s’est transposée telle quelle à la conception des modèles de DeepSeek, mais la coïncidence entre l’origine du laboratoire et la direction qu’il a prise mérite d’être nommée plutôt que passée sous silence.
Les grands laboratoires américains — OpenAI, Anthropic, Google DeepMind — ont construit leur direction sur un pari inverse : investir dans l’échelle de calcul la plus grande possible, financée par des levées de fonds massives, en pariant qu’elle continuerait à produire des gains de capacité. DeepSeek a choisi de maximiser ce qu’un budget de calcul plus contraint pouvait produire. Ce n’est pas une posture marketing a posteriori : c’est une direction cohérente avec la structure de capital du laboratoire dès son origine.
Le jalon qui a rendu cette direction visible au monde entier
Ce que les données établissent. DeepSeek-R1, décrit dans un article publié par DeepSeek-AI en janvier 2025 (arXiv:2501.12948), est un modèle de raisonnement entraîné notamment par apprentissage par renforcement, publié en poids ouverts. DeepSeek a revendiqué pour ses modèles de cette génération un coût d’entraînement nettement inférieur à celui des modèles occidentaux comparables. L’annonce a coïncidé avec une réaction boursière brutale et immédiate sur les valeurs liées à l’infrastructure IA : le 27 janvier 2025, l’action Nvidia a perdu environ 17 % en une séance, soit près de 600 milliards de dollars de capitalisation boursière effacés en une journée — la plus forte perte de capitalisation en une séance jamais enregistrée pour une entreprise cotée. Le titre a partiellement regagné du terrain dès le lendemain.
Mon interprétation. Ce choc boursier a rendu la direction de DeepSeek visible d’un coup, mais il ne l’a pas créée. Le marché a réagi à un signal ponctuel — un modèle compétitif annoncé à un coût très inférieur — qui remettait en cause une croyance implicite des investisseurs : que produire un modèle de premier plan exigeait nécessairement une échelle de calcul considérable, donc une demande de puces massive et durable. Ce que le marché a découvert en un jour, DeepSeek le construisait depuis sa création.
L’architecture au service de la direction, pas l’inverse
Ce que les données établissent. Le choix architectural le plus visible qui sert cette direction est l’usage de la mixture of experts : une conception qui permet de disposer d’un vaste répertoire de paramètres sans faire supporter à chaque requête le coût de calcul de leur totalité. Le mécanisme précis — pourquoi et comment ce découplage fonctionne, ce qu’il change concrètement au coût d’inférence — est détaillé dans notre fiche dédiée, Mixture of experts : pourquoi DeepSeek R1 n’active que 37 des 671 milliards de paramètres, et ne sera pas repris ici. Le point à retenir à ce niveau stratégique : ce choix architectural n’est pas une trouvaille isolée, c’est l’outil technique le plus cohérent avec la direction d’efficience de calcul déjà décrite plus haut. Chaque génération de modèle qui affine encore ce mécanisme de routage pousse la même direction plus loin, elle ne change pas de cap.
Le deuxième pilier stable : les poids ouverts comme choix systématique
Ce que les données établissent. DeepSeek publie ses modèles en poids ouverts de façon répétée, pas comme une exception ponctuelle sur un seul modèle. Ce choix place le laboratoire dans le même espace stratégique que la mouvance des modèles ouverts au sens large. DeepSeek y occupe cependant une position à part : contrairement à une grande partie des modèles ouverts disponibles, ses modèles rivalisent directement avec les meilleurs modèles propriétaires sur les bancs d’essai publics, plutôt que de se positionner comme une alternative de second rang moins capable mais plus accessible.
Mon interprétation. Combiné au premier pilier, ce choix dessine une direction cohérente plutôt que deux décisions indépendantes : un laboratoire moins dépendant d’une levée de capital massive a moins à perdre à publier ses poids, puisque son modèle économique ne repose pas sur la même exclusivité commerciale qu’un laboratoire financé pour rentabiliser une infrastructure propriétaire coûteuse. Le contexte des restrictions américaines sur l’exportation des puces avancées vers la Chine, largement documenté par ailleurs, a pu renforcer cette direction en rendant l’efficience de calcul moins un avantage concurrentiel optionnel qu’une nécessité pratique face à un accès au matériel plus contraint — une hypothèse d’interprétation, pas un mécanisme causal démontré ici.
La direction de DeepSeek n’est pas d’avoir produit un modèle moins cher une fois : c’est d’avoir construit, depuis un fonds quantitatif plutôt qu’un laboratoire financé par le pari de l’échelle, une discipline d’efficience de calcul que chaque nouvelle génération de modèle approfondit, doublée d’un choix systématique de poids ouverts qui la distingue autant des labs américains que du reste de la mouvance open source.
Mes réserves
- Le chiffre de coût d’entraînement revendiqué par DeepSeek a été publiquement mis en doute par plusieurs analystes et dirigeants du secteur, qui estiment qu’il ne couvrirait que la dernière phase d’entraînement, sans inclure la R&D antérieure, les essais non aboutis ni le coût complet de l’infrastructure de calcul. Un analyste a qualifié l’annonce de récit largement enjolivé. Ce doute porte spécifiquement sur le chiffre communiqué, pas sur la réalité du modèle produit ni sur l’existence d’un gain d’efficience réel : les deux questions sont distinctes et ne doivent pas être confondues.
- Le lien entre la culture du trading quantitatif chez High-Flyer et les choix d’architecture de DeepSeek reste une interprétation de ma part, appuyée sur la cohérence entre l’origine du laboratoire et la direction observée, pas sur une déclaration explicite de DeepSeek établissant ce lien de cause à effet.
- Le rôle des restrictions américaines sur les puces avancées comme facteur ayant renforcé cette direction est une hypothèse plausible, pas un mécanisme démontré dans cet article : d’autres facteurs (choix de recherche interne, opportunité de marché) ont pu peser tout autant.
Concrètement, juger DeepSeek sur le seul chiffre de coût communiqué revient à confondre l’événement médiatique et la direction stratégique qui l’a produit. Cette direction — efficience de calcul et poids ouverts systématiques — reste lisible indépendamment de la validité exacte d’un chiffre ponctuel, et c’est elle qui permet d’anticiper ce que fera la génération suivante de modèles, plutôt que de se laisser surprendre à nouveau par la prochaine annonce.
Retour au dossier Comprendre les modèles post-LLM. Voir aussi Mixture of experts : pourquoi DeepSeek R1 n’active que 37 des 671 milliards de paramètres et Google Gemini : la direction stratégique choisie.

Analyse les sujets qui l'intéressent et publie ce qu'il en tire, avec méthodologie, sans jargon inutile. Choix du sujet, validation finale du plan, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des éléments d'illustration par l'auteur Axel Morel. Rédaction, choix des sources initiales, création du plan de rédaction initial par l'IA.
En savoir plus