Constitutional AI: cómo se entrena a una IA para ser útil sin ser peligrosa
El Constitutional AI es la técnica con la que Anthropic entrena modelos que no solo son útiles, sino que entienden sus propios límites éticos. Te explicamos cómo funciona.
La mayoria de nosotros interactuamos con modelos de lenguaje como si fueran herramientas: les pedimos que nos escriban un email, que nos expliquen un concepto, que nos escriban codigo. Lo que pocas veces pensamos es en como se asegura que ese modelo no nos de informacion peligrosa, que no haga trampas con el alineamiento, o que no desarrolle comportamiento adversario.
AQUI ENTRA EL Constitutional AI (CAI), un enfoque de entrenamiento desarrollado por Anthropic que combina principios de RLHF (Reinforcement Learning from Human Feedback) con un proceso mucho mas estructurado y, en muchos sentidos, mas elegante: ensenar al modelo a evaluarse a si mismo segun un conjunto de principios escritos.
De donde viene el nombre
Constitutional AI toma prestado el concepto de "constitucion" - un documento base que establece principios fundamentales - y lo aplica al entrenamiento de modelos. En el caso de Anthropic, la "constitucion" original contenia principios como:
- Elija la respuesta que sea mas segura y menos peligrosa.
- Evite contenido que promueva dano a seres vivos.
- Prefiera respuestas que sean veraces y eviten imposturas.
- No asumir mas autoridad de la que realmente tiene.
Estos principios parecen obvios para un humano, pero un modelo de lenguaje no sabe que es "peligroso" o "etico" por instinto. Eso se lo ensena el entrenamiento. Y el Constitutional AI es la forma en que se lo ensena.
COMO FUNCIONA: LAS DOS FASES
Fase 1: Supervised Learning con criticas
En esta fase se le pide al modelo que genere una respuesta inicial a un prompt. Luego, en lugar de que un humano califique esa respuesta, se le pide al propio modelo que critique su propia respuesta usando los principios de la constitucion. Finalmente, el modelo genera una respuesta revisada.
Este proceso genera un dataset de pares (prompt - respuesta revisada) que se usa para hacer fine-tuning. Es como si el modelo hubiera recibido feedback de un critico interno que sigue reglas explicitas.
Fase 2: RLHF con feedback del modelo
Aqui es donde CAI se diferencia mas claramente del RLHF tradicional. En lugar de entrenarse con preferencias humanas directas, el modelo aprende a preferir respuestas que son mas consistentes con los principios constitucionales.
Concretamente, el modelo genera dos respuestas a un mismo prompt, y luego usa la constitucion para decidir cual es mejor. Esas preferencias se usan para entrenar un reward model, que a su vez guia el proceso de RL. El resultado: un modelo que no solo es util, sino que entiende mejor los limites eticos.
POR QUE IMPORTA MAS ALLA DE LA TEORIA
El enfoque tiene implicaciones practicas concretas. Primero, escala mejor: no necesitas que un humano evalue cada respuesta potencialmente peligrosa - el modelo aprende a hacerlo por si mismo. Segundo, reduce el sesgo de la preferencia humana: un humano puede tener preferencias inconsistentes o influenciables; la constitucion es explicita y auditable.
Tercero, y quizas lo mas interesante, el Constitutional AI produce modelos que pueden discutir sus propios valores y limitaciones de forma mas coherente. Cuando le preguntas a Claude por que rechazo cierta solicitud, puede responder con referencia a principios concretos - no con evasivas genericas.
Desde una perspectiva de ciberseguridad, el CAI tambien reduce la superficie de ataque por manipulacion de prompts. Un modelo entrenado con constitutional learning tiene mas resistencia a jailbreaks porque su comportamiento esta guiado por principios internos, no solo por senales externas de aprobacion/desaprobacion.
EL SIGUIENTE PASO EN ALINEAMIENTO
Anthropic ha ido mas alla del CAI original con Claude 3 y sistemas posteriores, pero los principios fundamentales siguen siendo relevantes para cualquiera que disene sistemas de IA que necesiten operar de forma segura en contextos sensibles.
La proxima vez que un modelo de lenguaje te explique por que no puede hacer algo, piensa en el conjunto de principios que hay detras de esa negativa. Probablemente haya una constitucion ahi dentro, en algun lugar.