OpenAI o1: modelos que piensan antes de responder (2024)
OpenAI presentó una línea de modelos entrenada para razonar los problemas paso a paso antes de responder, cambiando velocidad por precisión y reviviendo la idea de que pensar más tiempo puede compensar.
El 12 de septiembre de 2024, OpenAI presentó o1, una nueva línea de modelos diseñada para dedicar tiempo a pensar antes de responder. Donde un gran modelo de lenguaje estándar tiende a producir una respuesta en una pasada rápida, o1 recorre primero un problema en una larga cadena interna de pasos y solo entonces da su respuesta final.
Cómputo en el momento de uso
La idea central suele llamarse cómputo en tiempo de prueba: dejar que un modelo use más cálculo en el momento en que le preguntas, no solo durante el entrenamiento. Dale a o1 un problema difícil de matemáticas o de programación y, en efecto, deliberará, probará enfoques, revisará su trabajo y retrocederá, antes de comprometerse con una respuesta.
Fue un cambio notable. Buena parte de la era anterior, de GPT-3 a GPT-4, planteaba el progreso sobre todo como entrenar modelos más grandes con más datos. o1 subrayó una segunda palanca: un modelo también puede dar mejores respuestas pensando más tiempo en el momento de uso. El comportamiento se moldeó con aprendizaje por refuerzo, premiando las cadenas de pensamiento que llegaban a resultados correctos.
En qué era bueno y qué costaba
o1 informó de mejoras claras en tareas con respuestas correctas nítidas: matemáticas de competición, preguntas de ciencias y programación, justo los dominios donde más ayuda un razonamiento cuidadoso paso a paso. Las contrapartidas eran igual de claras. Era más lento y más caro de ejecutar, y OpenAI optó por ocultar el razonamiento interno en bruto a los usuarios, mostrando solo resúmenes, lo que reavivó el debate sobre cuán inspeccionables deberían ser estos sistemas.
También recordó que los referentes no son toda la historia: destacar en problemas de concurso no se traduce automáticamente en fiabilidad en el trabajo desordenado y abierto.
Por qué importa
o1 replanteó una pregunta que el campo había apartado en buena medida: no solo “¿qué tamaño tiene el modelo?”, sino “¿cuánto debería pensar?”. Al mostrar que el razonamiento deliberado de varios pasos podía entrenarse y pagarse en el momento de la inferencia, abrió un nuevo eje de progreso más allá de la mera escala.
Ayudó a establecer el razonamiento en tiempo de inferencia como estrategia de producto habitual. Los debates sobre fiabilidad, coste y evaluación en los años siguientes se apoyan en las preguntas que o1 planteó.