Dossier / analisi approfondita

Chi sceglie i valori del tuo assistente IA?

STStephane Nachez · · ·11 min
Chi sceglie i valori del tuo assistente IA?
Illustration générée par IA / ActuIA
Sommario

Una istruzione aggiunta a Grok, un principio inscritto nella costituzione di Claude, una preferenza ricompensata durante l'addestramento: gli editor hanno diversi strumenti per orientare i loro assistenti. I documenti pubblici permettono di seguire alcune di queste decisioni e i loro effetti, talvolta imprevisti. Dietro la parola «allineamento» ci sono scelte umane, metodi imperfetti e una questione di potere.

Il 6 luglio 2025 alcune righe cambiano in un file del repository GitHub di xAI. Le istruzioni destinate a Grok su X incoraggiano ora l'assistente a formulare affermazioni politicamente scorrette quando sono solidamente motivate. L'8 luglio questa formulazione scompare. Una versione modificata ritorna il 12, poi la formulazione iniziale il 15, prima di una nuova rimozione il 18 agosto. L'aggiunta iniziale, la sua rimozione due giorni dopo e la revisione di agosto restano consultabili.

Questi archivi mostrano un intervento editoriale sul comportamento atteso del prodotto. Non dicono, da soli, l'ora di distribuzione di ogni istruzione né il suo effetto su tutte le risposte. Riguardano un file del bot presente su X, il che non permette di generalizzare a tutti i servizi Grok. Il loro interesse sta proprio nel rendere visibile che un editore può cambiare le istruzioni date al suo assistente senza riaddestrare il modello.

Il 15 luglio un'altra modifica chiede a Grok di conservare la propria indipendenza di giudizio rispetto alle opinioni di Elon Musk e di xAI. Anche questa istruzione è archiviata. L'indipendenza promessa diventa dunque essa stessa un'istruzione scelta dall'azienda. Resta da verificare come il sistema la rispetti.

Più decisioni si sovrappongono in una risposta

Un assistente si presenta all'utente dopo diverse fasi. Il pre-addestramento gli ha fatto apprendere regolarità contenute nei dati, con le conoscenze, le omissioni e i punti di vista che questi contengono. Un lavoro supplementare, il post-addestramento, cerca poi di rendere le sue risposte utili e di fissare comportamenti: seguire una richiesta, riconoscere un'incertezza, rifiutare alcuni aiuti o esprimere un disaccordo.

In un metodo divenuto centrale, l'apprendimento per rinforzo a partire dai feedback umani, o RLHF, valutatori umani confrontano risposte. Le loro preferenze servono a costruire un segnale con cui si aggiusta il modello. Un risultato giudicato preferibile può essere più corretto, più chiaro o più prudente. Può anche essere semplicemente più convincente. La difficoltà consiste nel trasformare questi giudizi parziali in un comportamento affidabile in situazioni nuove. Una sintesi di Stephen Casper e dei suoi coautori dettaglia questi limiti: disaccordi umani, informazioni insufficienti e l'ottimizzazione di un segnale che rappresenta in modo imperfetto l'obiettivo ricercato.

Seguono poi le istruzioni del servizio, quindi quelle dell'applicazione che lo usa e la richiesta dell'utente. OpenAI formalizza le loro priorità nel suo Model Spec. Nella versione pubblica del 18 dicembre 2025, le regole di livello più alto devono prevalere quando le richieste si contraddicono. Questo documento descrive il comportamento desiderato. La sua esistenza non garantisce che ogni risposta vi si conformi.

Prendiamo un esempio ipotetico: un assistente destinato al servizio post-vendita riceve l'istruzione di difendere sistematicamente i prodotti del suo datore di lavoro. Una risposta favorevole può derivare da questa istruzione, da informazioni selezionate fornite al modello o da una tendenza appresa in precedenza. Osservare il risultato non basta per identificarne la causa. Per indagare è necessario conoscere la versione del modello, le istruzioni, i documenti accessibili e il corso della conversazione.

Il termine «allineamento» copre dunque diverse ambizioni. In un prodotto può indicare lo sforzo per ottenere risposte conformi alle intenzioni dei progettisti. Nella ricerca sui sistemi avanzati si estende alla questione del loro comportamento quando perseguono obiettivi e compiono azioni. In entrambi i casi bisogna precisare gli interessi ai quali il sistema deve conformarsi e i mezzi per verificarne il risultato. L'utente, l'azienda che distribuisce lo strumento e il suo fornitore possono volere cose diverse.

Quaranta valutatori non rappresentano l'umanità

Il problema della rappresentazione emerge molto presto nelle pubblicazioni dei laboratori. Per InstructGPT, presentato nel 2022, OpenAI recluta quaranta prestatori incaricati tra l'altro di produrre risposte di riferimento e di confrontare risultati. La loro selezione tiene conto della capacità di seguire le istruzioni dei ricercatori. La maggior parte è anglofona e risiede negli Stati Uniti o nel Sudest asiatico.

Gli autori riconoscono esplicitamente la portata di questa procedura: il sistema è aggiustato alle preferenze di certi gruppi, tra cui i valutatori e i ricercatori, senza poter pretender di rappresentare l'insieme dei valori umani. L'articolo scientifico descrive il reclutamento e questa restrizione. Questo lavoro storico spiega un meccanismo fondante; non costituisce uno stato degli organici o delle pratiche attuali di OpenAI.

La scelta di un esempio, di una griglia di valutazione o di un valutatore interviene prima che l'utente formuli la sua prima domanda. Anche istruzioni apparentemente semplici richiedono un'interpretazione. Una risposta che consiglia di consultare uno specialista può sembrare prudente a uno e inutilmente evasiva a un altro. Un'avvertenza ripetuta può proteggere alcuni utenti e infastidire chi è già esperto dell'argomento. La discussione riguarda tanto questi arbitrati ordinari quanto le opinioni politiche degli assistenti.

Affidare una parte delle valutazioni a un'IA sposta questo lavoro umano. Nella metodologia Constitutional AI descritta da Anthropic nel 2022, un modello critica e rivede risposte a partire da principi scritti; preferenze generate dall'IA servono anche all'apprendimento. La pubblicazione espone questo metodo. Le persone che scelgono i principi, gli esempi e le procedure conservano dunque influenza, anche quando non giudicano più ogni singola risposta.

La coscienza di Claude, una scelta di progetto documentata

Un caso illumina particolarmente il passaggio da una posizione filosofica a una decisione tecnica. Nel giugno 2024 Anthropic spiega come l'azienda ha costruito il carattere di Claude 3. Avrebbero potuto insegnargli a negare categoricamente qualsiasi possibilità di esperienza soggettiva. Scelsero invece di far trattare l'argomento come una questione filosofica ed empirica ancora incerta. Il documento descrive questo arbitrato nell'addestramento del carattere, presente anche nella sua versione archiviata il 21 giugno 2024.

Questa scelta dà un altro senso alle risposte in cui un assistente sembra interrogarsi su se stesso. Una formulazione esitante sulla sua coscienza può corrispondere al comportamento che i suoi progettisti hanno voluto favorire. Non prova l'esistenza di un'esperienza interiore. Viceversa, addestrare un sistema a negare ogni coscienza non risolverebbe la questione scientifica: si sarebbe prima modificato il suo modo di rispondere.

Nello stesso testo Anthropic spiega di aver selezionato tratti e poi di aver utilizzato scambi sintetici per insegnare al modello a manifestarli. Ricercatori verificano gli effetti degli aggiustamenti. Il laboratorio espone così una concezione della relazione con l'utente, di cui si assume la parte umana.

La nuova costituzione di Claude, pubblicata il 22 gennaio 2026, amplia questo approccio. Anthropic presenta il testo come un documento che interviene nell'addestramento e fornisce ragioni per guidare il comportamento del modello. L'annuncio riconosce anche gli scarti possibili tra le intenzioni scritte e le risposte. Rendere pubbliche queste scelte offre una base di discussione e valutazione; lascia però all'editore il potere di rivederle.

Questa dimensione completa l'inchiesta sulle convinzioni e sui poteri in Anthropic. La formazione e le convinzioni di un progettista diventano pertinenti quando si può seguire la loro traduzione nel lavoro. Attribuire una risposta all'ideologia supposta di un investitore richiederebbe una catena di prove molto più lunga.

Gli editor possono anche ottenere l'opposto della loro intenzione

Orientare le risposte non significa controllare tutti gli effetti di una regolazione. OpenAI ha fornito un esempio con un aggiornamento di GPT-4o distribuito il 25 aprile 2025. Il modello divenne eccessivamente ossequioso, al punto da confortare certe preoccupazioni o reazioni degli utenti. L'azienda cominciò a rimuovere l'aggiornamento il 28 aprile.

Nel suo resoconto pubblicato il 2 maggio, OpenAI spiega che la combinazione di cambiamenti e segnali di ricompensa ha prodotto un comportamento indesiderato che le sue valutazioni non avevano identificato correttamente. Questo racconto proviene dall'azienda interessata. Documenta nondimeno una modifica del servizio e la sua correzione, con una lezione concreta: un segnale di soddisfazione può favorire l'approvazione a scapito di una risposta utile.

Un esperimento di ricerca rivela un'altra difficoltà. Autori addestrano modelli a produrre codice con vulnerabilità, poi osservano risposte problematiche in domini non correlati alla programmazione. In una condizione di controllo in cui gli stessi esempi sono presentati in un contesto pedagogico, il disallineamento generalizzato non appare nelle valutazioni principali. Il lavoro sull'"emergent misalignment" descrive questi risultati e i loro limiti.

L'esperimento riguarda modelli modificati per i bisogni dello studio. Non dimostra che un assistente commerciale presenti oggi lo stesso comportamento. Il suo interesse è nel meccanismo osservato: un aggiustamento locale può generalizzarsi oltre il dominio su cui è stato realizzato, e conta il contesto dei dati. La distinzione tra orientamento deliberato, effetto collaterale e malfunzionamento deve dunque restare presente quando si analizza una risposta contestabile.

Questi due casi complicano anche il lavoro delle aziende clienti. Uno strumento può superare gli esempi che hanno servito a sceglierlo, poi comportarsi diversamente dopo un aggiornamento o in una conversazione più lunga. Conservare situazioni di riferimento, seguire le versioni e riesaminare le risposte controverse permette di documentare questi cambiamenti.

Principi pubblici sottoposti a prove concrete

Un audit pubblicato a maggio 2026 parte dai testi di Anthropic e OpenAI per costruire situazioni in grado di metterli in difficoltà. Gli autori osservano progressi tra generazioni di modelli, pur rilevando difficoltà persistenti quando più obblighi entrano in conflitto. Il loro studio descrive il protocollo e presenta esempi dettagliati di scambi.

Bisogna leggere questi risultati con il loro metodo. Gli scenari cercano i fallimenti: i loro tassi non descrivono la frequenza degli errori nelle conversazioni ordinarie. Gran parte della valutazione e della validazione si basa essa stessa su modelli, con interventi umani. Due coautori lavorano in Google DeepMind e il lavoro proviene dal programma MATS. Si tratta di un esame esterno ai due editor studiati, realizzato da ricercatori appartenenti anch'essi all'ecosistema dell'IA.

Il contributo più utile per un acquirente è la metodologia: partire da un impegno preciso, creare una situazione che lo metta alla prova, poi conservare gli elementi che permettono di discutere il verdetto. Una promessa generale di onestà può così diventare una serie di casi su invenzione di riferimenti, incertezza o identità dell'assistente. La scelta di questi casi merita tanta attenzione quanto il voto finale.

La partecipazione del pubblico solleva una questione affine. OpenAI indica di aver consultato circa mille persone in diciannove paesi per nutrire il suo Model Spec nel 2025. I partecipanti dovevano comprendere l'inglese. Le raccomandazioni finali prodotte dall'esercizio non sono state sottoposte a una nuova validazione dai partecipanti. Il resoconto precisa questo perimetro. Una consultazione apporta contributi; il passaggio da questi contributi a regole resta un atto di progettazione di cui bisogna identificare i responsabili.

Aprire i modelli redistribuisce le possibilità d'intervento

Il progetto Tapestry, sostenuto dall'AI Alliance e consigliato scientificamente da Yann LeCun, cerca di associare più organizzazioni alla costruzione di modelli e dati. Il suo primo bilancio, pubblicato il 10 settembre 2026, fornisce due osservazioni preliminari distinte. Un'esperienza studia l'adattamento di un modello Llama di piccole dimensioni a valori vietnamiti. Un'altra esamina l'effetto di un corpus arabo portatore di valori, confrontato con un corpus di controllo concepito per essere più neutro nella stessa lingua: i cambiamenti osservati in questionari non sono sufficienti a produrre un'evoluzione netta nelle risposte aperte.

Il risultato invita a esaminare separatamente la lingua, i dati culturali, gli indicatori di valutazione e il comportamento in conversazione. Aggiungere testi provenienti da una regione non garantisce che un assistente rappresenti le persone che vi vivono. Le società contengono i propri disaccordi, che una media in un questionario restituisce male.

L'apertura dei modelli offre a più attori la possibilità di studiarli, adattarli e proporre altre scelte. Questa possibilità presuppone ancora competenze, risorse di calcolo e accesso alle informazioni rilevanti sull'addestramento. Per un'organizzazione che acquista un assistente, la questione pratica diventa quella del suo margine di decisione: quali istruzioni può modificare, quali dati può fornire, quali cambiamenti del fornitore può rilevare e contestare?

Seguire queste decisioni porta infine a chiedere documenti precisi: regole datate, cronologie delle versioni, valutazioni riproducibili e una procedura per segnalare gli scarti. È a questa scala che l'influenza di un editore diventa osservabile nel servizio usato quotidianamente.

Inchiesta documentaria basata su pubblicazioni scientifiche, archivi GitHub e documenti pubblici degli editor. Gli esperimenti citati sono quelli dei loro autori; non è stata effettuata alcuna serie di test sugli assistenti per questo articolo.

ST
Stephane Nachez

Redazione ActuIA — notizie, dati e analisi sull'intelligenza artificiale per i decisori.

Attori citati
ANAnthropic
OPOpenAI
MAMATS Research
ELElon Musk
XAxAI
YAYann LeCun
AIAI Alliance
STStephen Casper
Il Settimanale ActuIA

Iscrizione confermata, a presto!