Calcul au moment de l'inférence (Test-time compute)
Calcul supplémentaire dépensé quand un modèle répond à une question, au moment de l'inférence, et non seulement à l'entraînement ; un levier pour les tâches de raisonnement difficiles.
Le calcul au moment de l’inférence (test-time compute) consiste à donner à un modèle plus de traitement lorsqu’on lui pose une question, pas seulement à l’entraînement. Des systèmes de raisonnement comme OpenAI o1 et DeepSeek-R1 passent plus de temps sur des chaînes de pensée à la réponse, échangeant vitesse et coût contre précision sur des tâches difficiles.
Cela complète la montée en données d’entraînement et en paramètres : un second axe de progrès après la taille brute du modèle. Des repères comme l’or à l’IMO en 2025 ont montré jusqu’où ce levier avait bougé en un an.