DeepSeek-R1 et le choc d'efficacité (2025)
Une start-up chinoise a publié un modèle de raisonnement à poids ouverts rivalisant avec les meilleurs pour une fraction du coût annoncé, et le 27 janvier 2025 il a effacé une somme record de la valeur de Nvidia.
Le 20 janvier 2025, la start-up chinoise DeepSeek a publié R1, un modèle de raisonnement qui égalait OpenAI o1 sur de nombreux tests publics. Deux choses l’ont fait tomber comme un coup de tonnerre : il est sorti avec des poids ouverts, de sorte que chacun pouvait le télécharger et l’exécuter, et l’entreprise affirmait avoir entraîné son modèle de base pour quelques millions de dollars, une fraction infime de ce que dépensaient les laboratoires occidentaux.
Pourquoi le marché a paniqué
Pendant deux ans, le récit de l’IA à Wall Street avait une forme simple : le progrès exige un calcul énorme, alors achetez les puces. DeepSeek a remis cette prémisse en cause. Si un modèle puissant peut être entraîné à bas coût et donné gratuitement, l’argument en faveur de centaines de milliards de dépenses paraissait plus fragile.
Le lundi 27 janvier 2025, le doute a frappé le marché. Nvidia a chuté d’environ 17 pour cent en une seule journée et a perdu près de 600 milliards de dollars de valeur, la plus forte perte en une journée pour une entreprise de l’histoire de Wall Street jusque-là, entraînant avec elle fabricants de puces et fournisseurs d’électricité.
Ce qui était vraiment nouveau
R1 s’est appuyé sur l’apprentissage par renforcement pour apprendre au modèle à produire de longues chaînes de pensée avant de répondre, à la manière d’o1, mais la recette était décrite ouvertement. Il reposait aussi sur une conception en mélange d’experts, qui n’active qu’une partie du réseau par requête pour économiser du calcul. DeepSeek a même publié des versions « distillées » plus petites, prolongeant la tradition de poids ouverts de Llama 2.
Les analystes ont noté ensuite que le chiffre du coût d’entraînement ne couvrait qu’un seul run et laissait de côté une grande partie de la facture réelle, et que l’entreprise possédait encore une vaste flotte de puces Nvidia. L’efficacité était réelle ; la présentation, généreuse.
Pourquoi c’est important
DeepSeek-R1 a réajusté les attentes sur qui peut construire un modèle de pointe et combien cela doit coûter. Il a renforcé le camp des poids ouverts, compliqué la géopolitique des contrôles à l’exportation de puces et imposé une question plus dure sur les dépenses à l’échelle de Stargate que le même mois on annonçait comme l’avenir de l’IA.