Chain of Thought, dejar pensar al modelo
Una palabra antes de la respuesta cambia la calidad de forma drástica. Cómo funciona CoT en la práctica.
El experimento
Pregunta a un modelo: "¿Cuánto es 3468 por 729?"
La respuesta directa suele ser errónea. Los modelos son geniales generando lenguaje, pero malos haciendo cálculo mental.
Ahora pregunta con un añadido: "¿Cuánto es 3468 por 729? Piensa paso a paso en voz alta."
La respuesta es correcta. La razón: el modelo genera los pasos intermedios y cada paso es más sencillo. El modelo literalmente "calcula" mejor cuando se le deja pensar en voz alta.
Por qué funciona
Los LLMs son generadores de tokens. Cada token da más contexto al siguiente. Si fuerzas al modelo a pensar, hay más resultados intermedios relevantes en el contexto antes de la respuesta final. El efecto es medible en tareas complejas (matemáticas, lógica, code review). Cuanto más larga la cadena de razonamiento, mayor la diferencia entre "responder directo" y "paso a paso".
Cuándo usar Chain of Thought
- Problemas de matemáticas y lógica
- Tareas tipo plan con varios pasos
- Problemas de código donde el "por qué" importa
- Decisiones donde necesitas la justificación
Cuándo no
- Consultas simples ("¿Cuál es la capital de Francia?")
- Reformulaciones puras
- Tareas de estilo
En preguntas simples, CoT hace al modelo más verboso sin mejorarlo.
El contrario, forzar respuesta corta
A veces no quieres explicación, solo el número. Entonces ayuda: "Solo la respuesta, sin justificación." o "Máx. 10 palabras."
Esa es la segunda mitad: tú controlas en qué volumen piensa el modelo.