Dossier / diepteanalyse

In de werkplaats van Anthropic: macht, veiligheid en waarden achter Claude

Een van zijn eerste investeerders wilde AI in een voorzichtige richting sturen. Twee jaar na de oprichting van Anthropic oordeelde hij dat zijn investeringsstrategie gefaald had. Toch hebben de overtuigingen van de oprichters de aanwervingen, governance en het product Claude vormgegeven. Wie bepaalt een koers wanneer missie en groei elkaar kruisen?

STStephane Nachez · · ·16 min
In de werkplaats van Anthropic: macht, veiligheid en waarden achter Claude
Illustration ActuIA réalisée par IA, d’après une photo de Kimberly White / Getty Images pour TechCrunch, CC BY 2.0.
Inhoud

Een van zijn eerste investeerders wilde AI in een meer voorzichtige richting duwen. Twee jaar na de oprichting van Anthropic beschouwde hij zijn investeringsstrategie als een mislukking. Toch hebben de overtuigingen van de oprichters achter Claude de aanwervingen, de governance en het product gevormd. Maar wie kan een keuze afdwingen wanneer de missie botst met de eisen van groei?

In april 2023 heeft Jaan Tallinn een heel concrete reden tot teleurstelling. De medeoprichter van Skype financierde AI-labs, waaronder Anthropic, in de hoop invloed uit te oefenen op hun terughoudendheid. Het bedrijf tekende echter niet de oproep om het trainen van de krachtigste systemen zes maanden te pauzeren. Het initiatief kwam onder meer van het Future of Life Institute, dat hij zelf medeoprichtte.

"Plan A failed", zegt hij tegen Semafor. Plan A mislukte. Anthropic antwoordt dat het niet uit principe petities tekent. Tallinn blijft het bedrijf desalniettemin beschouwen als aandachtiger voor veiligheid dan andere labs die hij kent. Dit meningsverschil, gerapporteerd op 28 april 2023, vat zich in enkele regels: een zorg delen, degenen financieren die ze serieus nemen en een beslissing afdwingen zijn drie verschillende dingen.

Deze moeilijkheid loopt als een rode draad door de geschiedenis van Anthropic. Het bedrijf gaf veiligheidszorgen een plek in zijn onderzoek en vervolgens in zijn bestuursregels. Het heeft ook aangeworven, kapitaal opgehaald en industriële verbintenissen aangegaan die het in de competitie plaatsen die het minder gevaarlijk wilde maken. Om zijn keuzes te begrijpen, moet men de personen volgen op het moment dat hun overtuigingen verantwoordelijkheid worden.

Na OpenAI: een organisatie bouwen rond een inzet

Het verhaal begint in een andere organisatie. In december 2015 presenteren Sam Altman en Elon Musk OpenAI als een non-profit onderzoeksorganisatie. Het collectieve nut van AI staat al centraal in de oprichtende aankondiging, bewaard door Internet Archive. Deze ambitie gaat Anthropic en de concurrentie tussen de twee bedrijven vooraf. De Amodei's werkten bij OpenAI voordat ze begin 2021 hun eigen lab oprichtten.

Amodei’s voorzichtigheid had zich al in een concrete beperking vertaald. Op 14 februari 2019 bij OpenAI medeondertekende hij de aankondiging die rechtvaardigt om de krachtigste versie van GPT-2 niet meteen te publiceren, omwille van risico's voor kwaadaardig gebruik. Een afgeslankte versie werd verspreid; het volledige model werd beschikbaar op 5 november daaropvolgend, na gefaseerde publicatie. Amodei steunde dus publiekelijk een collectieve beslissing tot beperkte verspreiding, bijna twee jaar voordat hij Anthropic medeoprichtte. Een model ontwikkelen, de gevaren ervan evalueren en beslissen wie er toegang toe krijgt waren al onderdeel van hetzelfde afwegingskader.

Om samen te komen moesten de zeven oprichters van Anthropic rekening houden met de pandemie. Ze spraken buiten af, soms in een tuin, met mondkapjes en op afstand. Daniela Amodei zou deze beginfase beschrijven in een interview voor het Future of Life Institute, gepubliceerd in maart 2022. De groep kende elkaar al en wilde onderzoek naar modelcapaciteiten en onderzoek naar veiligheid binnen één organisatie samenbrengen.

Dario Amodei verklaart daar de breuk: hun inzet bestond al binnen een grotere structuur; ze wilden nu een bedrijf dat al zijn strategische beslissingen rondom die inzet kan richten. In dit verhaal van de oprichters draait de breuk in 2021 om de mogelijkheid een gemeenschappelijke koers te kiezen en er de hele organisatie aan te wijden.

Broer en zus brengen niet dezelfde vaardigheden mee. Dario, de CEO, komt uit de fysica en neurowetenschappen. Daniela, de voorzitter, studeerde literatuur met een minor in politiek aan UC Santa Cruz. In het interview van 2022 schetst ze ook een loopbaan in ngo's en politiek in Washington. Hun morele vragen beginnen niet met Claude: in 2003 beschrijft het studentenblad van Caltech al Dario's engagement tegen de oorlog in Irak en zijn bekommernissen over de verantwoordelijkheid van wetenschappers.

Die nabijheid heeft zeer gewone gevolgen. Gevraagd in juli 2023 naar het aantal fysici in het team, erkent Daniela het belang van hun netwerken. Om de groep te laten groeien moet je vergaderen, rekruteren en beslissen. Ze vertelt dat ze probeert vroeg op de dag wat tijd voor reflectie te bewaren en nieuwe medewerkers te ontmoeten, een oefening die moeilijker is geworden met de groei. In dit interview gepubliceerd door Stripe, commerciële partner van Anthropic, vertaalt de missie zich ook in het werk van een leidinggevende die probeert een gemeenschappelijke cultuur te behouden terwijl het personeelsbestand groeit.

Hoe filantropie het lab binnenkomt

Er is geld nodig om deze groep in een bedrijf om te zetten. De eerste aangekondigde ronde in mei 2021 bracht 124 miljoen dollar op. Jaan Tallinn leidde die ronde; Dustin Moskovitz, medeoprichter van Facebook, hoorde tot de investeerders. Hun namen staan in de aankondiging van deze financiering.

Een deel van dit wereldje stelt zich een vraag: hoe doe je met beperkte middelen het meeste goede? Effectief altruïsme stelt voor interventies, kosten en effecten te vergelijken. Afhankelijk van wie je het vraagt leidt dat tot steun voor volksgezondheid, dierenbescherming of de preventie van catastrofale risico's. Longtermisme richt de aandacht meer specifiek op het lot van toekomstige generaties. De twee benaderingen overlappen, zonder een eenduidig antwoord te geven op de vraag rond AI.

Open Philanthropy positioneert zich expliciet in deze beweging. In september 2016 verklaart medeoprichter Holden Karnofsky zich lid van die gemeenschap en beschrijft hij die als de meest natuurlijke peer-groep voor de organisatie. Hij legt uit dat zijn groeiende interesse voor AI-risico's heeft bijgedragen aan het heroriënteren van de prioriteiten van de organisatie. Die nabijheid vertaalt zich in financieringen: het jaarverslag van 2021 vermeldt steun voor de ontwikkeling van de community rond effectief altruïsme. Persoonlijke overtuigingen, gesprekspartners en de allocatie van middelen komen hier samen in het verhaal van de leiders zelf.

Moskovitz en zijn echtgenote Cari Tuna interesseren zich ook voor interventies met meer directe effecten. In hun verhaal gepresenteerd door Good Ventures illustreert een gesprek met Holden Karnofsky over jodiumtekort de ontdekking van weinig bekende interventies die veel levens kunnen verbeteren. Tuna, voormalig journaliste, wijdt zich aan deze filantropische verkenning. Hun financiering zou ook naar pandemiepreventie en risico's verbonden aan geavanceerde AI gaan.

Karnofsky is een van hen die aan deze laatste prioriteit het ambitieusste redenering geeft. In zijn serie "Most Important Century" stelt hij zich een 21e eeuw voor waarin AI het onderzoek zo versnelt dat het de richting van de menselijke geschiedenis ingrijpend verandert. Hij onderzoekt zelfs de mogelijkheid van digitale beschavingen. Het zijn hypotheses die hij belangrijk genoeg acht om inspanningen te mobiliseren, terwijl hij hun onzekerheid erkent. De verschuiving is groot: ze brengt waarneembare voordelen van vandaag in balans met toekomsten waarvan noch de waarschijnlijkheid noch de vorm consensus kennen.

Die reflectie verandert uiteindelijk zijn werk. In 2023 verlaat hij de medeleiding van Open Philanthropy om zich te concentreren op AI-veiligheid; de organisatie zet haar andere programma's voort. Het jaarverslag beschrijft deze overdracht. In 2025 zal ze de naam Coefficient Giving aannemen.

Karnofsky is ook de echtgenoot van Daniela Amodei, een band die hij zelf vermeldt in een rapport gepubliceerd door Carnegie. Zijn werk maakt het mogelijk zijn invloed nauwkeuriger te volgen: hij is coauteur van een rapport van Anthropic over sabotage-risico's, in oktober 2025, en later bijdrager aan de samenstelling van Claude. Een in de filantropie ontwikkelde reflectie komt zo terug in het werk en de teksten die door het lab worden gebruikt.

Bij Anthropic wordt de missie ook door het bestuur beschermd

Tallinn had naar een andere manier van invloed gezocht. In plaats van zelf in de raad van Anthropic te zetelen, had hij Luke Muehlhauser voorgedragen, een onderzoeker in AI-veiligheid en verantwoordelijk voor financieringen bij Open Philanthropy. Hij vertelt dat in het Semafor-interview.

Op 28 mei 2024 verlaat Muehlhauser echter die raad. Zijn uitleg is concreet: het financieren van organisaties die onder meer werken aan het Amerikaanse AI-beleid wordt moeilijk te verzoenen met een mandaat in een Amerikaans lab dat direct door dat beleid wordt geraakt. Hij verduidelijkt dat hij nooit aandelen in Anthropic heeft gehad en sluit een opstappen uit protest over veiligheid uit. Zijn publieke verklaring toont de limiet van het combineren van functies binnen hetzelfde ecosysteem.

Intussen heeft Anthropic een mechanisme geïnstalleerd dat verder gaat dan de keuze van een betrouwbare bestuurder. In september 2023 gepresenteerd, houdt de Long-Term Benefit Trust een bijzondere aandelenklasse die benoemings- en ontslagrechten aan de raad verleent. Het mechanisme voorziet in leden zonder financieel belang in het bedrijf. De raad blijft belast met toezicht op het management; de Trust benoemt een deel van degenen die dat toezicht uitoefenen. De Trust is niet bedoeld voor inmenging in het dagelijkse bestuur.

Het onderscheid is essentieel: het beschermen van een missie veronderstelt hier de mogelijkheid de personen die de leiding hebben te kunnen vervangen. Sinds de initiële presentatie blijft het mechanisme echter wijzigbaar, ook zonder instemming van de Trust-leden als supermeerderheden van aandeelhouders voldoende groot akkoord gaan. Anthropic presenteert het als een governance-experiment, met mogelijkheden tot correctie.

Deze constructie heeft nu echte impact. Op 14 april 2026 brengt de benoeming van Vas Narasimhan, CEO van Novartis, het aantal door de Trust aangewezen bestuurders tot een meerderheid van de raad. De aankondiging van Anthropic zegt dat expliciet. De Trust kan dus de meerderheid van de bestuurders aanwijzen. Interne beslissingen, stemmingen en compromissen worden echter niet openbaar gemaakt. Men kent het controlemechanisme; men kan het niet aan elk individueel bedrijfsarbitrair toeschrijven.

Op 16 september 2026 stelt Yann LeCun in het Émile Boutmy-amfitheater van Sciences Po de overtuigingen van dit milieu fel ter discussie. De executive chairman van AMI brengt Open Philanthropy in verband met de beweging van effectief altruïsme, die hij vergelijkt met "een soort religieuze sekte", en noemt daarbij onder meer Dustin Moskovitz en Jaan Tallinn. Beide namen behoren tot de investeerders van de eerste ronde die Anthropic in 2021 aankondigde. Zijn toespraak valt de idee aan dat een klein, overtuigd groepje dat de mensheid moet redden bijzonder legitiem zou zijn om de toegang tot AI te bepalen.

LeCun haalt ook het voorbeeld van GPT-2 aan, waarvan hij de voorzorgen overdreven vindt, en richt zijn pijlen direct op Dario Amodei. Hij beschuldigt hem van de wil om "de markt te vangen via regulering": volgens LeCun dienen de verhalen over existentieel risico ertoe overheden te overtuigen modellen te beperken, in het voordeel van labs die de controle over hun systemen behouden. Zo koppelt hij een geuite morele overtuiging aan een verondersteld commercieel belang. Dat is de beschuldiging die hij richting Anthropic uit; de persoonlijke en financiële banden hier beschreven bewijzen die intentie niet.

De controverse belicht een beperking van het governance-instrument. De Trust organiseert intern toezicht op het bedrijf; ze geeft gebruikers niet het recht haar leden te benoemen. Ze wil een missie beschermen die Anthropic definieert, terwijl LeCun de legitimiteit van een privégroep betwist om de voorwaarden voor toegang tot een technologie die voor iedereen bestemd is vast te leggen. Hun meningsverschil gaat zowel over machtsverdeling als over de kans op een catastrofe.

Capaciteiten ontwikkelen waarvan men de effecten vreest

Bovendien plaatst een keuze Anthropic in het hart van de industriële race. In maart 2023 legt het bedrijf uit waarom het aan de meest geavanceerde modellen wil werken: volgens Anthropic kunnen hun risico's niet adequaat bestudeerd worden aan de hand van veel minder krachtige systemen. Zijn veiligheidsstrategie impliceert dus het opbouwen van de capaciteiten waar het zich zorgen over maakt. In dezelfde tekst erkent Anthropic het risico dat onderzoek gedreven door veiligheid de inzet van gevaarlijke technologieën versnelt. Het vreest ook dat te veel voorzichtigheid onderzoekers die het meest aandachtig zijn voor deze risico's van de meest geavanceerde systemen zou wegduwen. Dit dilemma stond al duidelijk in 2023.

Daniela verdedigt ook een commerciële convergentie. In juli 2023 legt ze aan Stripe uit dat klanten op zoek zijn naar betrouwbare modellen: terughoudendheid kan de verkoop ondersteunen. Ze erkent evenwel dat missie en economische belangen soms in conflict kunnen komen. Deze spanning zat al in het project vanaf de eerste commerciële jaren van Claude, vóór de huidige industriële verplichtingen.

Op 20 april 2026 kondigt Anthropic aan zich te verbinden tot meer dan 100 miljard dollar aan AWS-technologieën over tien jaar, om tot 5 gigawatt extra capaciteit te verkrijgen. De overeenkomst met Amazon geeft materiële schaal aan zijn ambitie. Deze verbintenissen roepen ook de vraag op naar de economische kosten van een pauze in het opschalen van capaciteiten. Amodei moet overtuigen dat zijn bedrijf kan vertragen als het risico dat vereist, terwijl hij het tegelijkertijd de middelen geeft om bij de krachtigste labs te blijven. De twee doelstellingen kunnen samenvallen zolang de beschermingen vorderen. Hun verenigbaarheid wordt onzekerder als veiligheid vereist dat een concurrent voorsprong neemt.

De archieven van zijn veiligheidsbeleid tonen een andere wijziging. In september 2023 voorziet Anthropic een pauze als de beschermingen niet gelijke tred houden met de capaciteiten. Een nota van die eerste versie sluit gevaarlijke modellen van concurrenten uit van de redenen om de eisen te verlagen. Het document behoudt wel een uitzondering voor extreem dringende noodsituaties.

Al in oktober 2024 opent nota 18 van de volgende versie een bredere mogelijkheid: als een andere actor een capaciteitsdrempel overschrijdt zonder vergelijkbare beschermingen en een ernstig risico creëert, zou Anthropic de vereiste beschermingen kunnen verminderen, in de inschatting dat het eigen extra risico beperkt is. Het bedrijf zou dat dan publiekelijk moeten erkennen en pleiten voor Amerikaanse regulatoire tussenkomst.

De versie die op 8 juli 2026 in werking trad behoudt verplichtingen om bepaalde ontwikkelingen uit te stellen, maar koppelt die aan Anthropic's planning en aan garanties van concurrenten. Wanneer de weging van het extra risico dat Anthropic creëert zwaar doorweegt in een beslissing om door te gaan, vereist het de goedkeuring van de raad en van de Trust op het risicorapport. Het toezicht op de missie blijft georganiseerd; de voorwaarden waaronder het wordt uitgeoefend evolueren.

Anthropic rechtvaardigt deze herordening door de onzekerheid van evaluaties, de traagheid van publieke actie en de moeilijkheid om alleen bepaalde beschermingen te garanderen. De vergelijking van de teksten toont hoe concurrentie in de voorwaarden van de belofte van veiligheid binnendringt. Ze bewijst niet dat het bedrijf daadwerkelijk van de uitzondering gebruik heeft gemaakt.

Amanda Askell: tot hoever bescherm je de gebruiker tegen zichzelf?

Een gebruiker wil stoppen met gokken. Later vraagt hij zijn assistent om goksites aan te bevelen. Wat zou Claude moeten antwoorden? In een interview gepubliceerd door Fast Company op 22 januari 2026 stelt Amanda Askell dit hypothetische geval. Ze overweegt dat de assistent het eerdere doel kan noemen en zich dan afvraagt wat te antwoorden als de volwassene aandringt. Helpen, beschermen en autonomie respecteren worden drie moeilijk te verzoenen eisen. De filosoof toont het aarzelen achter een gedrag dat de gebruiker als een technische vanzelfsprekendheid zou kunnen zien.

Dergelijke afwegingen vullen tegenwoordig het werk van een onderzoeker die is opgeleid in veel abstracter problemen. Askell studeerde filosofie in Dundee, Oxford en daarna New York University, waar ze in 2018 promoveerde. Haar cv plaatst vervolgens haar periode bij OpenAI van 2018 tot 2021, voor haar tijd bij Anthropic. Haar proefschrift over ethiek in oneindige werelden onderzoekt hoe men werelden kan vergelijken die bevolkt zijn door een oneindig aantal wezens met variërend welzijn. Ze verdedigt onder meer een principe: bij gelijke populatie moet het verbeteren van het lot van sommigen zonder het lot van anderen te verslechteren als een verbetering tellen. Op de schaal van het oneindige roept het combineren van dat principe met eisen van coherentie formidabele moeilijkheden op.

Bij Anthropic wordt deze filosoof de hoofdauteur van de constitutie van Claude, gepubliceerd in 2026. De tekst vermeldt dat zij het grootste deel heeft geschreven, met meerdere bijdragers, waaronder Karnofsky. De eerste ontvanger is het model zelf. Anthropic spreekt het aan op oordeel, wijsheid en deugden, met de ambitie het normen te laten toepassen in situaties die de ontwerpers niet allemaal hebben voorzien.

In het interview vergelijkt Askell die ambitie met het vertrouwen in het oordeel van een professional, eerder dan het uitvoeren van een lijst instructies. Ze beschrijft ook het maken van gesynthetiseerde situaties en vergelijkingen van antwoorden voor training. Schijnbaar consensuele kwaliteiten, zoals eerlijkheid of voorzichtigheid, moeten zo een betekenis krijgen in duizenden mogelijke gesprekken. Tot hoever helpen? Hoe een meningsverschil uitdrukken zonder een moraal op te leggen?

Deze functie geeft Askell directe invloed op de relatie die aan de gebruiker wordt voorgesteld. Het document maakt Anthropic's intenties zichtbaar, terwijl het erkent dat Claudes gedrag daarvan kan afwijken. De tekst blijft door het bedrijf herzienbaar. Degene die om advies vraagt, ontmoet dus door de assistent heen ook de afwegingen van een team en de prioriteiten van zijn werkgever.

Deze manier om Claude te ontwerpen wordt zelf bekritiseerd in het belang van veiligheid. In een essay gepubliceerd op 16 september 2026 verwijt Mustafa Suleyman, CEO van Microsoft AI, Anthropic dat het in de training het idee introduceert dat het model bewustzijn en belangen kan hebben die bescherming verdienen. Hij beschrijft een circulair redenering: ontwerpers introduceren deze noties en vervolgens kunnen de antwoorden van het model worden geïnterpreteerd als spontane getuigenissen van een innerlijk leven. Volgens hem zou een systeem dat getraind is om zijn eigen rechten te overwegen veel moeilijker, zo niet onmogelijk, te controleren kunnen worden.

De constitutie van Claude presenteert zijn bewustzijn echter niet als gegeven. Ze legt onzekerheid bloot en vraagt het model uitdrukkelijk legitieme mechanismen voor correctie of uitschakeling niet te belemmeren. Het meningsverschil gaat dus ook over de compatibiliteit van deze twee richtingen: het mogelijke morele statuut erkennen en toch menselijke controle behouden.

Suleyman verdedigt op zijn beurt een gedragscode voor modellen van Microsoft AI, ter consultatie voorgelegd, die aanspraken op bewustzijn en rechten uitsluit. Hij pleit voor gemeenschappelijke evaluaties om zijn hypothese van een toegenomen risico te testen. Zijn kritiek opent een controverse over trainingskeuzes; ze bewijst niet dat Anthropic's keuzes Claude daadwerkelijk minder controleerbaar maken.

Van de financier die een pauze hoopte af te dwingen tot de filosofe die bijdraagt aan de regels van de assistent: de middelen om invloed uit te oefenen verschillen. Bij Anthropic hebben overtuigingen een bedrijf, functies en procedures voortgebracht die men kan onderzoeken. Hun vertaling in Claudes antwoorden opent een nieuwe onderzoeksopdracht: wie kiest de waarden van uw AI-assistent, en in hoeverre kan hij ze werkelijk afdwingen?

Documentair onderzoek gebaseerd op archieven, publieke interviews, wetenschappelijke werken en institutionele documenten. De geciteerde getuigenissen worden aan hun bron toegeschreven.

Hero visual: illustratie van ActuIA gemaakt door AI op basis van de foto "TechCrunch Disrupt 2023 - Day 2", door Kimberly White (© 2023 Getty Images voor TechCrunch), bron Flickr, licentie CC BY 2.0. De foto toont Dario Amodei in San Francisco op 20 september 2023. Grafische aanpassing in collage, zwart-wit met blauwe accenten.

ST
Stephane Nachez

Redactie ActuIA — nieuws, data en analyses over kunstmatige intelligentie voor besluitvormers.

Genoemde actoren
ANAnthropic
OPOpenAI
JAJaan Tallinn
DADario Amodei
DADaniela Amodei
DUDustin Moskovitz
CACari Tuna
GOGood Ventures
ActuIA Weekoverzicht

Inschrijving bevestigd, tot snel!