Chain-of-Thought: por qué pedirle a la IA que piense paso a paso funciona — y cómo lo hace por dentro

Chain-of-Thought prompting es una de las técnicas más estudiadas y menos entendidas de la IA moderna. Vamos a abrir el capó y ver cómo funciona por dentro.

Un modelo de lenguaje no piensa. Genera el siguiente token. Esa es la frase que resume cómo funcionan los LLMs por dentro: predicción estadística del siguiente token. Entonces, ¿por qué cuando le añades tres palabras — "pensemos paso a paso" — el modelo pasa de fallar problemas de matemáticas de primaria a resolver ecuaciones diferenciales?

Chain-of-Thought (CoT) prompting es una de las técnicas más estudiadas y menos entendidas de la IA moderna. Todo el mundo sabe que funciona. Pocos saben por qué. Vamos a abrir el capó.

El problema: predicción sin deliberación

Un LLM estándar responde token a token, de izquierda a derecha, sin un espacio intermedio de cálculo. Pide la solución a 47 × 83 y el modelo responde directamente con el resultado, sin consultar ninguna "memoria de trabajo". Si el patrón en sus datos de entrenamiento asociaba "47 × 83" con "3901", eso es lo que devuelve. Si no, inventa un número plausible.

Este comportamiento se llama "respuesta directa" (direct answer). Funciona bien para hechos y patrones comunes. Falla catastróficamente para cadenas de razonamiento donde cada paso depende del anterior.

Qué añade CoT prompting

CoT prompting consiste en pedirle al modelo que genere tokens intermedios de razonamiento antes de dar la respuesta final. Tres variantes principales:

Zero-shot CoT: "Pensemos paso a paso" como prefijo.

Few-shot CoT: ejemplos resueltos a mano con el razonamiento visible.

Self-consistency: generar múltiples cadenas de razonamiento y elegir la respuesta más frecuente.

Los resultados en benchmarks son dramáticos. GSM8K (problemas de matemáticas de primaria): GPT-3 sin CoT ~5% de accuracy. Con CoT few-shot ~55%. En matemáticas puras, los saltos son de 2-3×.

Cómo funciona por dentro

La investigación en interpretability mechanística ha empezado a revelar qué ocurre dentro del modelo cuando CoT está activo. No es que el modelo "piense" más — es que dedica más tokens de salida a distribuir el cálculo.

Espacio de trabajo extendido

Cada token generado se convierte en contexto para el siguiente. Cuando el modelo escribe "47 × 80 = 3760" está inscribiendo ese resultado en su propia secuencia de entrada. El siguiente token ya "ve" el 3760 como entrada, replicando internamente lo que haríamos nosotros con un papel y un bolígrafo.

Este "scratchpad" permite que la atención se distribuya: el modelo puede consultar resultados parciales anteriores a través de los mecanismos de atención.

Redistribución computacional

Sin CoT, el modelo necesita resolver el problema completo en una sola "pasada" de inferencia. Con CoT, la solución se fragmenta en docenas de pasos elementales. Cada paso individual es trivial para la red; la combinación de todos ellos resuelve problemas no triviales.

Esto conecta con la teoría de circuits: los modelos desarrollan algoritmos internalizados que se activan con el prompting correcto. "Pensemos paso a paso" no es una instrucción para un proceso mental — es un patrón textual que activa circuitos específicos de aritmética, lógica y búsqueda.

El problema del "thinking" falso

CoT no garantiza razonamiento correcto. Los modelos pueden generar cadenas de pensamiento que se ven plausibles pero llevan a conclusiones erróneas — un fenómeno llamado "reasoning fallacy". El modelo aprende a producir texto que parece razonamiento sin necesariamente optimizar por verdad.

Wei et al. (2022) observaron que CoT emerge solo en modelos suficientemente grandes (más de 100B parámetros). Modelos más pequeños generan texto similar a razonamiento pero sin la estructura lógica real. Es un recordatorio de que CoT no es magia — es un patrón que el modelo ha visto en sus datos de entrenamiento y que aplica cuando el prompt lo activa.

Aplicaciones prácticas

Para sacar el máximo de CoT en producción:

Few-shot > zero-shot: los ejemplos resueltos funcionan mejor que "pensemos paso a paso" solo.

Separa el razonamiento del formato: usa un delimitador para que el modelo no confunda el scratchpad con la respuesta final.

Verifica los pasos: CoT hace el error más visible — si un paso es incorrecto, generalmente puedes localizarlo.

Self-consistency para alta stakes: generar 5-10 cadenas y votar la respuesta más frecuente reduce errores en ~20% según Wang et al.

El futuro: reasoning como producto

OpenAI implementó reasoning tokens explícitos en o1 y o3, donde el modelo reserva compute específico para "pensar" antes de responder. No es CoT prompting — es una arquitectura que externaliza el razonamiento a tokens dedicados que no aparecen en la respuesta final.

Esto sugiere que el futuro de la IA no es solo modelos más grandes, sino modelos que pueden elegir cuándo pensar y cuándo actuar — una forma de metacognición algorítmica que CoT ha revelado como alcanzable con la infraestructura existente.

CoT no es una función mágica. Es una ventana hacia cómo los LLMs ya razonan — de forma distribuida, fragmentada y estadística — cuando les das el espacio para hacerlo. Entender cómo funciona por dentro no solo mejora tu prompting: revela lo que estos modelos realmente son.