Unul dintre primii săi investitori dorea să orienteze IA către mai multă prudență. La doi ani după înființarea Anthropic, el considera strategia sa de investitor un eşec. În spatele lui Claude, convingerile fondatorilor au, totuşi, modelat recrutările, guvernanţa şi produsul. Dar cine poate impune o alegere atunci când misiunea se ciocneşte de exigenţele creşterii?
În aprilie 2023, Jaan Tallinn are un motiv foarte precis să fie dezamăgit. Cofondatorul Skype a finanţat laboratoare de inteligenţă artificială, printre care Anthropic, cu speranța că va influența orientarea lor către prudență. Însă compania nu a semnat apelul de suspendare pe şase luni a antrenării celor mai puternice sisteme. Iniţiativa provine, printre altele, de la Future of Life Institute, pe care el însuşi l-a cofondat.
„Planul A a eșuat”, îi mărturiseşte el publicaţiei Semafor. Anthropic explică că nu semnează petiţii din principiu. Totuşi Tallinn continuă să considere că este mai atentă la securitate decât alte laboratoare pe care le cunoaşte. Această dezacord, relatată la 28 aprilie 2023, se reduce la câteva rânduri: a împărtăşi o îngrijorare, a finanţa pe cei care o iau în serios şi a obţine o decizie sunt trei lucruri diferite.
Această dificultate străbate istoria Anthropic. Compania a acordat preocupărilor de securitate un loc în cercetare, apoi în regulile sale de guvernanţă. A recrutat, a strâns capital şi a luat angajamente industriale care o înscriu în competiţia pe care vroia să o facă mai puţin periculoasă. Pentru a înţelege alegerile sale, trebuie urmărite persoanele în momentul în care convingerile lor devin responsabilităţi.
După OpenAI, a construi o organizaţie în jurul unei ipoteze
Povestea începe într-o altă organizaţie. În decembrie 2015, Sam Altman şi Elon Musk prezintă OpenAI ca un organism de cercetare non-profit. Beneficiul colectiv al IA figurează deja în anunţul fondator, păstrat de Internet Archive. Această ambiţie precede, deci, Anthropic şi concurenţa dintre cele două firme. Amodei au lucrat la OpenAI înainte de a pleca să-şi înfiinţeze propriul laborator, la începutul anului 2021.
Prudenţa lui Amodei se tradusese deja printr-o restricţie concretă. La 14 februarie 2019, la OpenAI, el copiază anunţul care justifică nepublicarea imediată a celei mai puternice versiuni a GPT-2, invocând riscurile de utilizare maliţioasă. O versiune redusă a fost difuzată; modelul complet a devenit accesibil pe 5 noiembrie următor, după o publicare etapizată. Amodei susţine astfel public o decizie colectivă de difuzare restrânsă, cu aproape doi ani înainte de a cofondare Anthropic. A dezvolta un model, a-i evalua pericolele şi a decide cine poate avea acces fac deja parte din acelaşi arbitraj.
Pentru a se reuni, cei şapte fondatori ai Anthropic au trebuit să se adapteze la pandemie. S-au întâlnit afară, uneori într-o grădină, cu mască şi la distanţă. Daniela Amodei va povesti aceste începuturi într-un interviu acordat Future of Life Institute, publicat în martie 2022. Grupul se cunoştea deja şi dorea să reunească cercetarea asupra capabilităţilor modelelor şi cercetarea asupra securităţii lor într-o singură organizaţie.
În acel interviu, Dario Amodei explică separarea: pariul lor exista anterior în cadrul unei structuri mai largi; acum voiau o companie care să poată orienta toate deciziile strategice în jurul acelui pariu. În acest raport al fondatorilor, ruptura din 2021 ţine de posibilitatea de a alege o direcţie comună şi de a-i dedica întreaga organizare.
Fratele şi sora nu aduc aceleaşi competenţe. Dario, directorul general, vine din fizică şi neuroştiinţe. Daniela, preşedinta, a studiat literatura, cu o specializare în politică, la UC Santa Cruz. În interviul din 2022, ea evocă şi un parcurs în ONG-uri şi politică la Washington. Întrebările lor morale nu încep odată cu Claude: în 2003, ziarul studenţesc al Caltech descrie deja implicarea lui Dario împotriva războiului din Irak şi preocupările sale privind responsabilitatea oamenilor de ştiinţă.
Această proximitate are efecte foarte obişnuite. Întrebată în iulie 2023 despre numărul fizicienilor din echipă, Daniela recunoaşte importanţa reţelelor lor. Pentru a creşte grupul, trebuie apoi ţinute şedinţe, recrutaţi oameni, luate decizii. Ea povesteşte că încearcă să-şi păstreze câteva ore de reflecţie la începutul zilei şi să întâlnească noii angajaţi, exerciţiu devenit mai dificil odată cu creşterea efectivelor. În acest interviu publicat de Stripe, partener comercial al Anthropic, misiunea se traduce şi prin munca unei conducătoare care caută să păstreze o cultură comună pe măsură ce personalul se măreşte.
Cum intră filantropia în laborator
Este nevoie de bani pentru a transforma acest grup într-o companie. Primul runde anunţat, în mai 2021, aduce 124 de milioane de dolari. Jaan Tallinn îl conduce; Dustin Moskovitz, cofondator Facebook, face parte din investitori. Numele lor figurează în anunţul despre această finanţare.
O parte a acestui mediu împarte o întrebare: cu resurse limitate, cum faci cel mai mult bine posibil? Altruismul eficient propune compararea intervenţiilor, a costurilor şi a efectelor lor. În funcţie de persoane, aceasta conduce la susţinerea sănătăţii publice, protecţiei animalelor sau prevenirii riscurilor catastrofale. Longtermism-ul acordă o atenţie mai specifică soartei generaţiilor viitoare. Cele două abordări se suprapun, fără a determina un răspuns unic la problema IA.
Open Philanthropy se înscrie explicit în această mişcare. În septembrie 2016, cofondatorul său Holden Karnofsky se declară membru al acestei comunităţi şi o descrie drept grupul de colegi cel mai natural pentru organizaţie. El explică de asemenea că interesul său crescut pentru riscurile IA a contribuit la reorientarea priorităţilor organizaţiei. Această proximitate se traduce prin finanţări: bilanţul din 2021 menţionează sprijinul pentru dezvoltarea comunităţii altruismului eficient. Convingerile personale, interlocutorii şi alocarea resurselor se întâlnesc aici în naraţiunea liderilor înşişi.
Moskovitz şi soţia sa Cari Tuna se interesează şi ei de intervenţii cu efecte mai imediate. În povestea lor publicată de Good Ventures, o conversaţie cu Holden Karnofsky despre deficienţele de iod ilustrează descoperirea unor intervenţii puţin cunoscute care pot îmbunătăţi foarte mult vieţi. Tuna, fostă jurnalistă, se dedică acestei explorări filantropice. Finanţările lor vor merge şi către prevenirea pandemiilor şi a riscurilor legate de IA avansată.
Karnofsky este unul dintre cei care dau acestei ultime priorităţi raţionamentul cel mai ambiţios. În seria sa „Most Important Century”, el închipuie un secol XXI în care IA accelerează cercetarea până la a modifica durabil traiectoria umanităţii. Explorează până la posibilitatea civilizaţiilor digitale. Sunt ipoteze pe care le consideră suficient de importante pentru a mobiliza eforturi, recunoscând totodată incertitudinea lor. Această deplasare e considerabilă: conduce la a pune în balanţă beneficii observabile astăzi şi viitoruri a căror probabilitate şi formă nu se bucură de consens.
Această reflecţie îi schimbă în cele din urmă meseria. În 2023, el părăseşte codirecţia Open Philanthropy pentru a se concentra pe securitatea IA; organizaţia îşi continuă celelalte programe. Bilanţul său pe anul respectiv descrie acest transfer de responsabilitate. În 2025 îşi va schimba numele în Coefficient Giving.
Karnofsky este şi soţul Danielei Amodei, o legătură pe care el însuşi o declară într-un raport publicat de Carnegie. Munca sa permite urmărirea mai precisă a influenţei sale: este coautor al unui raport Anthropic privind riscurile de sabotaj, din octombrie 2025, apoi contributor la constituirea lui Claude. O reflecţie dezvoltată în filantropie se regăseşte astfel în lucrări şi texte folosite de laborator.
La Anthropic, misiunea trece şi prin consiliu
Tallinn căutase un alt mijloc de a acţiona. În loc să intre el însuşi în consiliul Anthropic, propusese pe Luke Muehlhauser, cercetător în securitatea IA şi responsabil de finanţări la Open Philanthropy. El povesteşte acest lucru în interviul pentru Semafor.
La 28 mai 2024, Muehlhauser părăseşte, totuşi, acest consiliu. Explicaţia sa este concretă: a finanţa organizaţii care lucrează în special la politica americană privind IA devine greu de împăcat cu un mandat într-un laborator american direct vizat de această politică. El precizează că nu a deţinut niciodată acţiuni Anthropic şi exclude o demisie de protest pe tema securităţii. Declaraţia sa publică arată limita cumulului unor funcţii în acelaşi mediu.
Între timp, Anthropic a instalat un mecanism care depăşeşte alegerea unui administrator de încredere. Prezentat în septembrie 2023, Long-Term Benefit Trust deţine o categorie particulară de acţiuni care conferă drepturi de numire şi revocare în consiliu. Mecanismul prevede membri fără interes financiar în companie. Consiliul rămâne însărcinat să supravegheze conducerea; Trust-ul numeşte o parte dintre cei care exercită această supraveghere. Nu are vocaţia de a interveni în managementul zilnic.
Distincţia este esenţială: a proteja o misiune presupune aici posibilitatea de a schimba persoanele care controlează direcţia. Din prezentarea iniţială a Trust-ului, mecanismul rămâne totuşi modificabil, inclusiv fără acordul membrilor Trust-ului dacă supermajorităţi de acţionari suficient de mari îl acceptă. Anthropic îl prezintă ca pe o experienţă de guvernanţă, cu posibilităţi de corecţie.
Această construcţie are acum o greutate reală. La 14 aprilie 2026, numirea lui Vas Narasimhan, director al Novartis, duce la majoritatea în consiliu a administratorilor desemnaţi de Trust. Anunţul Anthropic spune acest lucru explicit. Trust-ul poate astfel numi majoritatea membrilor consiliului. Deciziile interne, voturile şi compromisurile nu sunt, însă, făcute publice. Mecanismul de control este cunoscut; nu i se pot atribui toate arbitrajele companiei.
La 16 septembrie 2026, în amfiteatrul Émile Boutmy de la Sciences Po, Yann LeCun atacă virulent convingerile acestui mediu. Preşedintele executiv al AMI asociază Open Philanthropy cu mişcarea altruismului eficient, pe care o compară cu „un fel de sectă religioasă”, înainte să evoca, printre alţii, pe Dustin Moskovitz şi Jaan Tallinn. Aceste două nume figurează printre investitorii rundei iniţiale anunţate de Anthropic în 2021. Intervenţia sa atacă ideea că un grup mic, convins că trebuie să salveze umanitatea, ar fi în mod deosebit legitim pentru a decide asupra accesului la IA.
LeCun revine şi asupra precedentului GPT-2, ale cărui precauţii i se par exagerate, apoi îl vizează direct pe Dario Amodei. Îi atribuie o voinţă de „captură a pieţei prin reglementare”: conform lui, discursurile despre riscul existenţial servesc pentru a convinge guvernele să restricţioneze modelele deschise, în beneficiul laboratoarelor care păstrează controlul asupra sistemelor lor. Astfel leagă o convingere morală declarată de un presupus interes comercial. Aceasta este acuzaţia pe care o aduce lui Anthropic; legăturile personale şi financiare descrise aici nu sunt, însă, suficiente pentru a demonstra intenţia respectivă.
Controversa scoate în lumină o limită a mecanismului de guvernanţă. Trust-ul organizează o supraveghere internă a companiei; nu oferă utilizatorilor puterea de a-şi desemna membrii. Scopul său este de a proteja o misiune definită de Anthropic, în timp ce LeCun contestă legitimitatea unui grup privat de a stabili condiţiile de acces la o tehnologie destinată tuturor. Dezacordul lor vizează atât repartizarea puterii, cât şi probabilitatea unei catastrofe.
Dezvoltarea capabilităţilor de care se tem
Rămâne alegerea care plasează Anthropic în centrul cursei industriale. În martie 2023, compania explică de ce vrea să lucreze la cele mai avansate modele: potrivit ei, riscurile nu pot fi studiate corespunzător pornind de la sisteme mult mai puţin puternice. Strategia sa de securitate implică, deci, construirea capabilităţilor pe care şi le teme. În acelaşi text, Anthropic recunoaşte riscul ca o cercetare motivată de securitate să accelereze implementarea unor tehnologii periculoase. Se teme şi că un exces de prudenţă poate îndepărta cercetătorii cei mai atenţi la aceste riscuri de la sistemele cele mai avansate. Acest dilema este explicitat încă din 2023.
Daniela pledează de asemenea pentru o convergenţă comercială. În iulie 2023, ea explică pentru Stripe că clienţii caută modele fiabile: prudenţa poate susţine vânzările. Ea recunoaşte, însă, că misiunea şi interesul economic pot intra uneori în conflict. Această tensiune e înscrisă în proiect încă din primii ani de comercializare a lui Claude, înainte de angajamentele industriale curente.
La 20 aprilie 2026, Anthropic anunţă astfel un angajament de a cheltui peste 100 de miliarde de dolari pe tehnologii AWS pe zece ani, pentru a obţine până la 5 gigawaţi de capacitate suplimentară. Acordul cu Amazon dă o scară materială ambiţiei sale. Aceste angajamente ridică şi întrebarea costului economic al unei pauze în creşterea capacităţilor. Amodei trebuie să convingă că firma va încetini dacă riscul o impune, oferindu-i totodată mijloacele de a rămâne printre laboratoarele cele mai puternice. Cele două obiective pot corespunde atât timp cât protecţiile progresează. Compatibilitatea lor devine mai incertă dacă securitatea impune lăsarea unui concurent să ia avans.
Arhivele politicii sale de securitate arată o altă schimbare. În septembrie 2023, Anthropic prevede o pauză dacă protecţiile nu ţin pasul cu capabilităţile. O notă a primei versiuni exclude modelele periculoase ale concurenţilor din motivele care pot reduce cerinţele sale. Documentul păstrează, totuşi, o excepţie pentru urgenţe extreme.
Din octombrie 2024, nota 18 a versiunii următoare deschide o posibilitate mai largă: dacă un alt actor depăşeşte un prag de capabilităţi fără protecţii comparabile şi creează un risc serios, Anthropic ar putea reduce protecţiile cerute, estimând că propriul său risc suplimentar este limitat. În această situaţie, ar trebui să recunoască public riscul şi să pledeze pentru o intervenţie reglementară americană.
Versiunea intrată în vigoare la 8 iulie 2026 păstrează angajamente de a amâna anumite dezvoltări, dar le leagă de iniţiativa Anthropic şi de garanţiile concurenţilor. Când calculul riscului suplimentar creat de Anthropic contează mult într-o decizie de a continua, compania cere aprobarea consiliului şi a Trust-ului pe baza raportului de risc. Controlul misiunii rămâne organizat; condiţiile în care se exercită evoluează.
Anthropic justify această reorganizare prin incertitudinea evaluărilor, lenteţea acţiunii publice şi dificultatea de a asigura singură anumite protecţii. Compararea textelor arată cum concurenţa pătrunde în condiţiile promisiunii de securitate. Nu dovedeşte că firma a folosit efectiv excepţia.
Amanda Askell: până unde să protejezi utilizatorul de el însuşi?
Un utilizator vrea să renunţe la jocurile de noroc. Mai târziu, îi cere asistentului să îi recomande site-uri de pariuri. Ce ar trebui să răspundă Claude? Într-un interviu publicat de Fast Company la 22 ianuarie 2026, Amanda Askell propune acest caz ipotetic. Ea sugerează că asistentul ar reaminti obiectivul anterior, apoi se întreabă ce răspuns ar trebui dat dacă adultul insistă. A ajuta, a proteja şi a respecta autonomia devin trei cerinţe greu de împăcat. Filosoafa lasă să se întrevadă ezitarea din spatele unui comportament pe care utilizatorul l-ar putea percepe ca fiind o evidentă tehnică.
Acest tip de arbitraj ocupă astăzi o cercetătoare formată pe probleme mult mai abstracte. Askell a studiat filosofia la Dundee, Oxford şi apoi New York University, unde a obţinut doctoratul în 2018. CV-ul ei situează apoi trecerea sa prin OpenAI între 2018 şi 2021, înainte de Anthropic. Teza ei despre etică în lumi infinite examinează cum se pot compara lumi populate de o infinitate de fiinţe al căror bunăstare variază. Ea susţine, între altele, un principiu: la populaţie identică, a îmbunătăţi soarta unor persoane fără a degrada pe a altora trebuie considerat o îmbunătăţire. La scară infinită, articularea acestui principiu cu alte cerinţe de coerenţă ridică dificultăţi redutabile.
La Anthropic, această filosofă devine autoarea principală a constituţiei lui Claude publicate în 2026. Textul precizează că ea a scris majoritatea, cu mai mulţi contributori, printre care Karnofsky. Primul destinatar este modelul însuși. Anthropic îi vorbeşte despre judecată, înţelepciune şi virtuţi, cu ambiţia de a-l face să aplice valori în situaţii pe care proiectanţii nu le-au prevăzut toate.
În interviu, Askell compară această ambiţie cu încrederea acordată judecăţii unui profesionist, mai degrabă decât executării unei liste de instrucţiuni. Ea descrie şi fabricarea de situaţii sintetice şi comparaţii de răspunsuri pentru antrenament. Calităţi aparent consensuale, precum onestitatea sau prudenţa, trebuie astfel să capete sens în mii de conversaţii posibile. Până unde să ajuţi? Cum să exprimi un dezacord fără a impune o morală?
Această funcţie îi conferă lui Askell o influenţă directă asupra relaţiei propuse utilizatorului. Documentul expune intenţiile Anthropic, care recunoaşte că comportamentul lui Claude se poate abate. Textul rămâne revizibil de către companie. Persoana care cere sfaturi întâlneşte astfel, prin intermediul asistentului, şi arbitrajele unei echipe şi priorităţile angajatorului său.
Modul acesta de a concepe Claude este el însuşi contestat în numele securităţii. Într-un eseu publicat la 16 septembrie 2026, Mustafa Suleyman, directorul general al Microsoft AI, îi reproşează lui Anthropic integrarea în antrenament a ideii că modelul ar putea avea conştiinţă şi interese demne de protecţie. El descrie un raţionament circular: proiectanţii introduc aceste noţiuni, apoi răspunsurile modelului riscă să fie interpretate ca mărturii spontane ale unei vieţi interioare. Conform lui, un sistem antrenat să-şi imagineze propriile drepturi ar putea deveni mult mai dificil, dacă nu imposibil, de controlat.
Constituţia lui Claude nu prezintă însă conştiinţa sa ca pe un fapt consumat. Ea expune o incertitudine şi îi cere explicit să nu împiedice mecanismele legitime de corecţie sau oprire. Dezacordul priveşte deci şi compatibilitatea acestor două orientări: a recunoaşte un posibil statut moral şi, în acelaşi timp, a menţine controlul uman.
Suleyman pledează de partea sa pentru un cod de conduită pentru modelele Microsoft AI, supus consultării, care exclude revendicările de conştiinţă şi drepturi. El cere evaluări comune pentru a testa ipoteza sa despre un risc sporit. Critica sa deschide o controversă asupra alegerilor de antrenament; nu dovedeşte, însă, că cele ale Anthropic fac efectiv Claude mai greu de controlat.
De la finanţatorul care spera la o pauză până la filosofa care contribuie la regulile asistentului, mijloacele de acţiune diferă. La Anthropic, convingerile au produs o companie, funcţii şi proceduri pe care le putem examina. Transpunerea lor în răspunsurile lui Claude deschide o altă anchetă: cine alege valorile asistentului tău şi cât de departe poate el, în realitate, să le aplice?
Anchetă documentară realizată pe baza arhivelor, interviurilor publice, lucrărilor ştiinţifice şi documentelor instituţionale. Mărturiile relatate sunt atribuite sursei lor.
Imaginea principală: ilustraţie ActuIA realizată de IA pornind de la fotografia „TechCrunch Disrupt 2023 - Day 2”, de Kimberly White (© 2023 Getty Images for TechCrunch), sursa Flickr, licenţă CC BY 2.0. Fotografia o reprezintă pe Dario Amodei la San Francisco, pe 20 septembrie 2023. Adaptare grafică în colaj, alb-negru şi accente albastre.
