Cadena de pensamiento (Chain-of-thought)
Una técnica de prompting y entrenamiento en la que un modelo desarrolla por escrito pasos intermedios antes de dar una respuesta final, lo que suele mejorar la precisión en problemas de varios pasos.
La cadena de pensamiento (en inglés chain-of-thought) consiste en lograr que un modelo exponga pasos de razonamiento intermedios en lugar de saltar directamente a la respuesta. En muchas tareas de matemáticas, lógica y programación, pensar «en voz alta» de este modo mejora los resultados de forma medible.
La idea empezó como un truco de prompting («pensemos paso a paso») y luego se convirtió en algo que los modelos aprenden a hacer con entrenamiento. Modelos de razonamiento como OpenAI o1 y DeepSeek-R1 usan aprendizaje por refuerzo para producir largas cadenas internas antes de responder, gastando más cómputo en el momento de la respuesta para obtener un mejor resultado.