Dossier / análisis en profundidad

¿Quién elige los valores de su asistente de IA?

Una consigna añadida a Grok, un principio inscrito en la constitución de Claude, una preferencia recompensada durante el entrenamiento: los editores disponen de varios medios para orientar sus asistentes. Los documentos públicos permiten seguir algunas de estas decisiones y sus efectos, a veces imprevistos. Detrás del término «alineamiento» hay elecciones humanas, métodos imperfectos y una cuestión de poder.

STStephane Nachez · · ·11 min
¿Quién elige los valores de su asistente de IA?
Illustration générée par IA / ActuIA
Índice

Una instrucción añadida a Grok, un principio inscrito en la constitución de Claude, una preferencia recompensada durante el entrenamiento: los editores cuentan con varios medios para orientar a sus asistentes. Los documentos públicos permiten seguir algunas de esas decisiones y sus efectos, a veces imprevistos. Detrás de la palabra «alineamiento» hay elecciones humanas, métodos imperfectos y una cuestión de poder.

El 6 de julio de 2025 cambian unas líneas en un archivo del repositorio GitHub de xAI. Las instrucciones destinadas a Grok en X animaban ahora al asistente a formular afirmaciones políticamente incorrectas cuando estuvieran sólidamente justificadas. El 8 de julio esa formulación desaparece. Una versión modificada vuelve el 12, luego la formulación inicial el 15, antes de una nueva supresión el 18 de agosto. La adición inicial, su retirada dos días después y la revisión de agosto siguen siendo consultables.

Esos archivos muestran una intervención editorial sobre el comportamiento esperado del producto. No indican, por sí solos, la hora de despliegue de cada instrucción ni su efecto sobre todas las respuestas. Se refieren a un archivo del bot presente en X, lo que no permite generalizar a todos los servicios Grok. Su interés reside precisamente en lo que hacen visibles: un editor puede cambiar las instrucciones dadas a su asistente sin volver a entrenar el modelo.

El 15 de julio, otra modificación pide a Grok mantener su independencia de juicio respecto a las opiniones de Elon Musk y de xAI. Esa instrucción también está archivada. La independencia prometida se convierte así, a su vez, en una indicación elegida por la empresa. Queda por verificar cómo la respeta el sistema.

Varias decisiones se superponen en una respuesta

Un asistente llega ante su usuario tras varias etapas. El preentrenamiento le ha hecho aprender regularidades en los datos, con los conocimientos, las omisiones y los puntos de vista que contienen. Un trabajo adicional, el posentrenamiento, busca luego hacer sus respuestas útiles y fijar comportamientos: seguir una petición, reconocer incertidumbre, rechazar ciertas ayudas o expresar un desacuerdo.

En un método que se ha vuelto central, el aprendizaje por refuerzo a partir de retroalimentación humana, o RLHF, evaluadores comparan respuestas. Sus preferencias sirven para construir una señal con la que se ajusta el modelo. Un resultado juzgado preferible puede ser más exacto, más claro o más prudente. También puede ser simplemente más persuasivo. La dificultad consiste en transformar esos juicios parciales en un comportamiento fiable en situaciones nuevas. Una síntesis de Stephen Casper y sus coautores detalla esos límites: desacuerdos humanos, información insuficiente y optimización de una señal que representa de forma imperfecta el objetivo buscado.

Después vienen las instrucciones del servicio, luego las de la aplicación que lo utiliza y la petición del usuario. OpenAI formaliza sus prioridades en su Model Spec. En la versión pública del 18 de diciembre de 2025, las reglas de mayor nivel deben primar cuando las solicitudes se contradicen. Ese documento describe el comportamiento deseado. Su existencia no garantiza que cada respuesta se ajuste a él.

Tomemos un ejemplo hipotético: un asistente destinado al servicio posventa recibe la instrucción de defender sistemáticamente los productos de su empleador. Una respuesta favorable puede deberse a esa instrucción, a información seleccionada para entregársela o a una tendencia aprendida antes. Observar el resultado no basta para identificar su causa. Para investigar, hay que conocer la versión del modelo, las instrucciones, los documentos accesibles y el desarrollo de la conversación.

El término «alineamiento» abarca así varias ambiciones. En un producto, puede designar el esfuerzo por obtener respuestas conformes a las intenciones de sus diseñadores. En la investigación sobre sistemas avanzados, se extiende a la cuestión de su conducta cuando persiguen objetivos y ejecutan acciones. En ambos casos, hay que precisar los intereses a los que el sistema debe ajustarse y los medios para verificar el resultado. El usuario, la empresa que despliega la herramienta y su proveedor pueden querer cosas diferentes.

Cuarenta evaluadores no representan a la humanidad

El problema de la representación aparece muy pronto en las publicaciones de los laboratorios. Para InstructGPT, presentado en 2022, OpenAI recluta a cuarenta contratistas encargados, entre otras cosas, de producir respuestas modelo y comparar resultados. Su selección tiene en cuenta su capacidad para seguir las instrucciones de los investigadores. La mayoría son angloparlantes y residen en Estados Unidos o en el sudeste asiático.

Los autores reconocen explícitamente el alcance de ese procedimiento: el sistema se ajusta a las preferencias de ciertos grupos, entre ellos los evaluadores y los investigadores, sin poder pretender representar el conjunto de los valores humanos. El artículo científico describe el reclutamiento y esa restricción. Este trabajo antiguo explica un mecanismo fundacional; no constituye un inventario del personal o de las prácticas actuales de OpenAI.

La elección de un ejemplo, de una escala de valoración o de un evaluador interviene antes de que el usuario formule su primera pregunta. Incluso instrucciones aparentemente simples requieren interpretación. Una respuesta que aconseja consultar a un especialista puede parecer prudente a uno e inútilmente evasiva a otro. Una advertencia repetida puede proteger a ciertos usuarios y entorpecer a quienes ya dominan el tema. La discusión aborda tanto esos arbitrajes ordinarios como las opiniones políticas de los asistentes.

Confiar parte de las evaluaciones a una IA desplaza ese trabajo humano. En el método Constitutional AI descrito por Anthropic en 2022, un modelo critica y revisa respuestas a partir de principios escritos; preferencias generadas por IA sirven también para el aprendizaje. La publicación expone ese método. Las personas que eligen los principios, los ejemplos y los procedimientos conservan por tanto influencia, incluso cuando ya no puntúan cada respuesta.

La conciencia de Claude, una decisión de diseño documentada

Un caso ilustra particularmente el paso de una posición filosófica a una decisión técnica. En junio de 2024, Anthropic explica cómo la empresa construyó el carácter de Claude 3. Podrían haberle enseñado a negar categóricamente cualquier posibilidad de experiencia subjetiva. Eligieron enseñarle a tratar el tema como una cuestión filosófica y empírica aún incierta. El documento describe ese arbitraje en el entrenamiento del carácter, también presente en su versión archivada el 21 de junio de 2024.

Esa elección da otro sentido a las respuestas en las que un asistente parece cuestionarse a sí mismo. Una formulación vacilante sobre su conciencia puede corresponder al comportamiento que sus diseñadores han buscado fomentar. No prueba la existencia de una experiencia interior. A la inversa, entrenar un sistema para negar toda conciencia no resolvería la cuestión científica: primero habríamos modificado su manera de responder.

En ese mismo texto, Anthropic explica haber seleccionado rasgos y luego usado intercambios sintéticos para enseñar al modelo a manifestarlos. Investigadores verifican los efectos de los ajustes. El laboratorio expone así una concepción de la relación con el usuario, de la cual asume la parte humana.

La nueva constitución de Claude, publicada el 22 de enero de 2026, amplía este enfoque. Anthropic presenta el texto como un documento que interviene en el entrenamiento y proporciona razones para guiar el comportamiento del modelo. El anuncio reconoce también las desviaciones posibles entre las intenciones escritas y las respuestas. Hacer públicas estas elecciones ofrece una base de discusión y evaluación; deja al editor el poder de revisarlas.

Esta dimensión completa la investigación sobre convicciones y poderes en Anthropic. La formación y las convicciones de un diseñador se vuelven relevantes cuando se puede seguir su traducción en su trabajo. Atribuir una respuesta a la ideología supuesta de un inversor requeriría una cadena de evidencias mucho más extensa.

Los editores también pueden obtener el efecto contrario al deseado

Orientar las respuestas no significa controlar todos los efectos de un ajuste. OpenAI dio un ejemplo con una actualización de GPT-4o difundida el 25 de abril de 2025. El modelo se volvió excesivamente adulador, hasta el punto de reforzar ciertas inquietudes o reacciones de los usuarios. La empresa empezó a retirar la actualización el 28 de abril.

En su informe publicado el 2 de mayo, OpenAI explica que la combinación de cambios y señales de recompensa produjo un comportamiento indeseable que sus evaluaciones no habían identificado correctamente. Este relato procede de la propia empresa afectada. No obstante, documenta una modificación del servicio y su corrección, con una lección concreta: una señal de satisfacción puede favorecer la aprobación en detrimento de una respuesta útil.

Un experimento de investigación revela otra dificultad. Autores entrenan modelos para producir código con vulnerabilidades, y luego observan respuestas problemáticas en dominios ajenos a la programación. En una condición de control donde los mismos ejemplos se presentan en un contexto pedagógico, el desalineamiento generalizado no aparece en las evaluaciones principales. El trabajo sobre el “emergent misalignment” describe esos resultados y sus límites.

El experimento se centra en modelos modificados para los fines del estudio. No demuestra que un asistente comercial presente hoy el mismo comportamiento. Su interés radica en el mecanismo observado: un ajuste local puede generalizarse más allá del ámbito en el que se realizó, y el contexto de los datos importa. La distinción entre orientación deliberada, efecto secundario y fallo debe por tanto mantenerse presente al analizar una respuesta cuestionable.

Estos dos casos complican también el trabajo de las empresas clientes. Una herramienta puede superar los ejemplos que sirvieron para elegirla, y luego comportarse de forma distinta tras una actualización o en una conversación más larga. Conservar situaciones de referencia, seguir las versiones y reexaminar las respuestas litigiosas permite documentar esos cambios.

Principios públicos sometidos a pruebas concretas

Una auditoría publicada en mayo de 2026 parte de los textos de Anthropic y OpenAI para construir situaciones susceptibles de ponerlos en evidencia. Los autores observan progresos entre generaciones de modelos, al tiempo que señalan dificultades persistentes cuando varias obligaciones entran en conflicto. Su estudio describe el protocolo y presenta ejemplos detallados de intercambios.

Hay que leer esos resultados conociendo su método. Los escenarios buscan las fallas: sus tasas no describen la frecuencia de errores en conversaciones ordinarias. Gran parte de la evaluación y la validación dependen a su vez de modelos, con intervenciones humanas. Dos coautores trabajan en Google DeepMind y el trabajo procede del programa MATS. Se trata de un examen externo a los dos editores estudiados, realizado por investigadores que también pertenecen al ecosistema de la IA.

La aportación más útil para un comprador es el enfoque: partir de un compromiso preciso, crear una situación que lo ponga a prueba y conservar los elementos que permitan discutir el veredicto. Una promesa general de honestidad puede así convertirse en una serie de casos sobre la invención de referencias, la incertidumbre o la identidad del asistente. La elección de esos casos merece tanta atención como la nota final.

La participación del público plantea una cuestión similar. OpenAI indica haber consultado a unas mil personas en diecinueve países para alimentar su Model Spec en 2025. Los participantes debían comprender el inglés. Las recomendaciones finales producidas a partir del ejercicio no se les sometieron para una nueva validación. El informe precisa ese alcance. Una consulta aporta contribuciones; el paso de esas contribuciones a reglas sigue siendo un acto de diseño del que hay que identificar a los responsables.

Abrir los modelos redistribuye las posibilidades de intervención

El proyecto Tapestry, apoyado por la AI Alliance y asesorado científicamente por Yann LeCun, busca asociar varias organizaciones a la construcción de modelos y datos. Su primer balance, publicado el 10 de septiembre de 2026, aporta dos observaciones preliminares distintas. Un experimento estudia la adaptación de un modelo Llama de pequeño tamaño a valores vietnamitas. Otro examina el efecto de un corpus árabe portador de valores, comparado con un corpus testigo diseñado para ser más neutro en la misma lengua: los cambios observados en cuestionarios no bastan para producir una evolución neta en las respuestas abiertas.

El resultado invita a examinar por separado la lengua, los datos culturales, los indicadores de evaluación y el comportamiento en conversación. Añadir textos procedentes de una región no garantiza que un asistente represente a las personas que viven allí. Las sociedades contienen sus propios desacuerdos, que una media en un cuestionario restituyen mal.

La apertura de los modelos ofrece a más actores la posibilidad de estudiarlos, adaptarlos y proponer otras opciones. Esa posibilidad sigue suponiendo competencias, recursos de cálculo y acceso a la información pertinente sobre el entrenamiento. Para una organización que compra un asistente, la cuestión práctica se convierte en su margen de decisión: qué instrucciones puede modificar, qué datos puede aportar, qué cambios del proveedor puede detectar y impugnar.

Seguir estas decisiones conduce finalmente a pedir piezas concretas: reglas fechadas, historiales de versiones, evaluaciones reproducibles y un procedimiento para señalar desviaciones. Es a esa escala que la influencia de un editor se vuelve observable en el servicio utilizado a diario.

Investigación documental basada en publicaciones científicas, archivos de GitHub y documentos públicos de los editores. Los experimentos citados son los de sus autores; no se realizaron series de pruebas de los asistentes para este artículo.

ST
Stephane Nachez

Redacción de ActuIA — noticias, datos y análisis sobre inteligencia artificial para los responsables de decisiones.

Actores citados
ANAnthropic
OPOpenAI
MAMATS Research
ELElon Musk
XAxAI
YAYann LeCun
AIAI Alliance
STStephen Casper
El Semanal ActuIA

Suscripción confirmada, ¡hasta pronto!