Chaîne de pensée (Chain-of-thought)

Une technique de prompting et d'entraînement où un modèle déroule par écrit des étapes intermédiaires avant de donner une réponse finale, ce qui améliore souvent la précision sur les problèmes en plusieurs étapes.

La chaîne de pensée (en anglais chain-of-thought) consiste à amener un modèle à expliciter des étapes de raisonnement intermédiaires au lieu de sauter directement à la réponse. Sur de nombreuses tâches de mathématiques, de logique et de programmation, ce raisonnement « à voix haute » améliore les résultats de façon mesurable.

L’idée a commencé comme une astuce de prompting (« réfléchissons étape par étape ») avant de devenir quelque chose que les modèles apprennent à faire par entraînement. Des modèles de raisonnement comme OpenAI o1 et DeepSeek-R1 utilisent l’apprentissage par renforcement pour produire de longues chaînes internes avant de répondre, en consacrant plus de calcul au moment de la réponse pour obtenir un meilleur résultat.