OpenAI o1: modelos que piensan antes de responder (2024)
OpenAI presentó una línea de modelos entrenada para razonar los problemas paso a paso antes de responder, cambiando velocidad por precisión y reviviendo la idea de que pensar más tiempo puede compensar.
El 12 de septiembre de 2024, OpenAI presentó o1, una nueva línea de modelos diseñada para dedicar tiempo a pensar antes de responder. Donde un gran modelo de lenguaje estándar tiende a producir una respuesta en una pasada rápida, o1 recorre primero un problema en una larga cadena interna de pasos y solo entonces da su respuesta final.
Cómputo en el momento de uso
La idea central suele llamarse cómputo en tiempo de prueba: dejar que un modelo use más cálculo en el momento en que le preguntas, no solo durante el entrenamiento. Dale a o1 un problema difícil de matemáticas o de programación y, en efecto, deliberará, probará enfoques, revisará su trabajo y retrocederá, antes de comprometerse con una respuesta.
Fue un cambio notable. Buena parte de la era anterior, de GPT-3 a GPT-4, planteaba el progreso sobre todo como entrenar modelos más grandes con más datos. o1 subrayó una segunda palanca: un modelo también puede dar mejores respuestas pensando más tiempo en el momento de uso. El comportamiento se moldeó con aprendizaje por refuerzo, premiando las cadenas de pensamiento que llegaban a resultados correctos.
En qué era bueno y qué costaba
o1 informó de mejoras claras en tareas con respuestas correctas nítidas: matemáticas de competición, preguntas de ciencias y programación, justo los dominios donde más ayuda un razonamiento cuidadoso paso a paso. Las contrapartidas eran igual de claras. Era más lento y más caro de ejecutar, y OpenAI optó por ocultar el razonamiento interno en bruto a los usuarios, mostrando solo resúmenes, lo que reavivó el debate sobre cuán inspeccionables deberían ser estos sistemas.
También recordó que los referentes no son toda la historia: destacar en problemas de concurso no se traduce automáticamente en fiabilidad en el trabajo desordenado y abierto.
Por qué importa
o1 replanteó una pregunta que el campo había apartado en buena medida: no solo “¿qué tamaño tiene el modelo?”, sino “¿cuánto debería pensar?”. Al mostrar que el razonamiento deliberado de varios pasos podía entrenarse y pagarse en el momento de la inferencia, abrió un nuevo eje de progreso más allá de la mera escala.
Se sitúa al final del tramo de historia que cubre esta cronología, y apunta hacia delante. Las próximas discusiones, sobre razonamiento, fiabilidad, coste y cómo evaluar todo ello, empiezan aquí.