Jeden z pierwszych inwestorów chciał nakierować rozwój AI na większą ostrożność. Dwa lata po założeniu Anthropic uznał jednak swoją strategię inwestycyjną za nieudaną. Za Claude stoją przekonania założycieli, które ukształtowały rekrutacje, ład korporacyjny i produkt. Kto jednak może narzucić wybór, gdy misja spotyka się z wymaganiami wzrostu?
W kwietniu 2023 Jaan Tallinn miał bardzo konkretny powód do rozczarowania. Współzałożyciel Skype’a finansował laboratoria zajmujące się sztuczną inteligencją, w tym Anthropic, w nadziei, że wpłynie to na ich większą ostrożność. Tymczasem firma nie podpisała wezwania do zawieszenia na sześć miesięcy treningu najpotężniejszych systemów — inicjatywy m.in. Future of Life Institute, którego jest współzałożycielem.
„Plan A failed”, przyznał w rozmowie z Semafor. Plan A nie powiódł się. Anthropic odpowiada, że z zasady nie podpisuje petycji. Tallinn nadal jednak uważa, że firma jest bardziej uważna w kwestii bezpieczeństwa niż inne laboratoria, które zna. To nieporozumienie, opisane 28 kwietnia 2023, można streścić krótko: podzielić się obawą, sfinansować tych, którzy je traktują poważnie, a uzyskać decyzję — to trzy różne rzeczy.
Ta trudność przenika historię Anthropic. Firma nadała problemom bezpieczeństwa miejsce w badaniach, a potem w zasadach ładu korporacyjnego. Zatrudniała też pracowników, pozyskiwała kapitał i zaciągała zobowiązania przemysłowe, które wpisują ją w rywalizację, którą miała uczynić mniej niebezpieczną. Aby zrozumieć jej wybory, trzeba śledzić ludzi w momencie, gdy ich przekonania stają się odpowiedzialnością.
Po OpenAI: budowanie organizacji wokół zakładu
Historia zaczyna się w innej organizacji. W grudniu 2015 Sam Altman i Elon Musk przedstawili OpenAI jako organizację badawczą non-profit. Dobro wspólne wynikające z AI już wtedy było w centrum ogłoszenia założycielskiego zachowanego przez Internet Archive. Ta ambicja poprzedza więc powstanie Anthropic i konkurencję między obiema firmami. Amodei pracowali w OpenAI zanim odeszli, by na początku 2021 roku założyć własne laboratorium.
Ostrożność Dario Amodei przejawiała się już wcześniej w konkretnym ograniczeniu. 14 lutego 2019, w OpenAI, był współautorem ogłoszenia uzasadniającego, dlaczego nie opublikowano od razu najsilniejszej wersji GPT-2, ze względu na ryzyko nadużyć. Udostępniono ograniczoną wersję; pełny model stał się dostępny 5 listopada następnego roku, po etapowym publikowaniu. Amodei publicznie popierał więc decyzję o ograniczonym rozpowszechnianiu, na prawie dwa lata przed współzałożeniem Anthropic. Tworzenie modelu, ocena jego zagrożeń i decyzja, kto może mieć do niego dostęp, były już wtedy częścią tego samego rozstrzygnięcia.
Aby się zebrać, siedmioro założycieli Anthropic musiało liczyć się z pandemią. Spotykali się na zewnątrz, czasem w ogrodzie, w maskach i w dystansie. Daniela Amodei opisała te początki w wywiadzie dla Future of Life Institute opublikowanym w marcu 2022. Grupa znała się już wcześniej i chciała połączyć badania nad zdolnościami modeli z badaniami nad ich bezpieczeństwem w jednej organizacji.
Dario Amodei tłumaczy tam rozstanie: ich zakład istniał wcześniej wewnątrz większej struktury; chcieli teraz stworzyć firmę, która mogłaby kierować wszystkimi swoimi decyzjami strategicznymi wokół tego założenia. W opowieści założycieli zerwanie w 2021 wynika z możliwości wyboru wspólnego kierunku i poświęcenia mu całej organizacji.
Brat i siostra wnoszą różne kompetencje. Dario, CEO, pochodzi z fizyki i neuronauk. Daniela, prezes, studiowała literaturę z minors w polityce na UC Santa Cruz. W wywiadzie z 2022 wspomina też pracę w NGO i politykę w Waszyngtonie. Ich rozterki moralne nie zaczynają się z Claude: już w 2003 studencki dziennik Caltech opisywał zaangażowanie Dario przeciwko wojnie w Iraku i jego troskę o odpowiedzialność naukowców.
Ta bliskość ma bardzo prozaiczne skutki. W lipcu 2023 Daniela przyznała, pytana o liczbę fizyków w zespole, że sieci zawodowe mają znaczenie. Aby grupa mogła się rozwijać, trzeba potem organizować spotkania, rekrutować i decydować. Opowiada o próbach zachowania kilku godzin na refleksję na początku dnia i spotykania nowych pracowników — ćwiczeniu stającym się trudniejszym wraz ze wzrostem zatrudnienia. W wywiadzie opublikowanym przez Stripe, partnera biznesowego Anthropic misja przejawia się także jako praca liderki, która stara się utrzymać wspólną kulturę w miarę rosnących zespołów.
Jak filantropia wchodzi do laboratorium
Trzeba pieniędzy, by przekształcić tę grupę w firmę. Pierwsza runda ogłoszona w maju 2021 przyniosła 124 miliony dolarów. Poprowadził ją Jaan Tallinn; wśród inwestorów był Dustin Moskovitz, współzałożyciel Facebooka. Ich nazwiska figurowały w ogłoszeniu o tym finansowaniu.
Część tego środowiska dzieliła pytanie: mając ograniczone zasoby, jak zrobić jak najwięcej dobrego? Altruizm efektywny proponuje porównywanie interwencji, ich kosztów i efektów. W zależności od ludzi prowadzi to do wsparcia dla zdrowia publicznego, ochrony zwierząt czy zapobiegania ryzykom katastroficznym. Longtermizm skupia uwagę bardziej na losie przyszłych pokoleń. Obie ścieżki się zazębiają, nie dając jednak jednej odpowiedzi na pytanie o AI.
Open Philanthropy wpisuje się w ten ruch wprost. We wrześniu 2016 jego współzałożyciel Holden Karnofsky deklarował przynależność do tej społeczności i opisywał ją jako naturalne środowisko organizacji. Wyjaśniał też, że rosnące zainteresowanie ryzykami związanymi z AI skłoniło do przestawienia priorytetów organizacji. Ta bliskość znajduje odzwierciedlenie w finansowaniu: raport z 2021 wymienia wsparcie dla rozwoju społeczności altruizmu efektywnego. Prywatne przekonania, kontakty i alokacja zasobów splatają się tu w opowieści samych liderów.
Moskovitz i jego żona Cari Tuna interesują się też interwencjami o szybszych efektach. W opowieści opublikowanej przez Good Ventures rozmowa z Holdenem Karnofskym o niedoborach jodu ilustruje odkrycie mało znanych działań, które mogą znacznie poprawić życie wielu ludzi. Tuna, była dziennikarka, poświęciła się tej filantropijnej eksploracji. Ich dotacje trafiały też na zapobieganie pandemiom i na ryzyka związane z zaawansowaną AI.
Karnofsky jest jednym z tych, którzy nadają temu priorytetowi najszerzej zakrojone uzasadnienie. W cyklu "Most Important Century" rozważa XXI wiek, w którym AI przyspieszają badania na tyle, że trwałe zmienią trajektorię ludzkości. Eksploruje nawet możliwość istnienia cywilizacji cyfrowych. To założenia na tyle ważne, by mobilizować wysiłki, choć ich prawdopodobieństwo i kształt są niepewne. Przesunięcie jest znaczące: stawia w bilansie zauważalne dziś korzyści i przyszłości, których ani prawdopodobieństwo, ani forma nie są przedmiotem konsensusu.
Ta refleksja w końcu odmieniła jego pracę. W 2023 opuścił współkierownictwo Open Philanthropy, by skupić się na bezpieczeństwie AI; organizacja kontynuuje inne programy. Raport roczny opisuje to przekazanie obowiązków. W 2025 organizacja zmieni nazwę na Coefficient Giving.
Karnofsky jest też mężem Danieli Amodei — związek ten sam deklaruje w raporcie opublikowanym przez Carnegie. Jego praca pozwala śledzić dokładniej jego wpływ: jest współautorem raportu Anthropic o ryzyku sabotażu z października 2025, a potem uczestniczył w tworzeniu Claude. Refleksja rozwijana w filantropii pojawia się w pracach i tekstach wykorzystywanych przez laboratorium.
W Anthropic misja przechodzi także przez radę nadzorczą
Tallinn szukał innego sposobu działania. Zamiast zasiadać osobiście w radzie Anthropic, zaproponował Luke’a Muehlhausera, badacza bezpieczeństwa AI i szefa finansowania w Open Philanthropy. Opisał to w wywiadzie dla Semafor.
28 maja 2024 Muehlhauser jednak odchodzi z tej rady. Jego argument jest konkretny: finansowanie organizacji pracujących nad polityką AI, w tym polityką w USA, staje się trudne do pogodzenia z mandatem w laboratorium amerykańskim bezpośrednio zainteresowanym tą polityką. Podkreśla, że nigdy nie posiadał akcji Anthropic i wyklucza odejście protestacyjne wobec kwestii bezpieczeństwa. Jego publiczne oświadczenie pokazuje ograniczenie kumulacji ról w tym samym środowisku.
W międzyczasie Anthropic wprowadził mechanizm wykraczający poza wybór pojedynczego zaufanego dyrektora. Przedstawiony we wrześniu 2023 Long-Term Benefit Trust posiada specjalną kategorię akcji dających prawa do nominowania i odwoływania członków rady. Mechanizm przewiduje członków bez interesu finansowego w firmie. Rada nadal ma nadzorować kierownictwo; Trust wskazuje część osób sprawujących ten nadzór. Nie ma jednak kompetencji do ingerowania w bieżące zarządzanie.
Rozróżnienie jest zasadnicze: chronić misję oznacza tu móc zmieniać osoby kontrolujące kierunek. Już przy początkowym przedstawieniu mechanizm pozostawał jednak modyfikowalny, w tym bez zgody członków Trustu, jeśli odpowiednie superwiększości akcjonariuszy wyraziły na to zgodę. Anthropic prezentuje go jako eksperyment w zarządzaniu, z możliwością korekt.
Ta konstrukcja ma teraz realny ciężar. 14 kwietnia 2026 nominacja Vasa Narasimhana, szefa Novartis, dała radzie większość dyrektorów wskazywanych przez Trust. Ogłoszenie Anthropic mówi to wprost. Trust może więc wyznaczać większość członków rady. Wewnętrzne decyzje, głosowania i kompromisy nie są jednak ujawniane. Mechanizm kontroli jest znany; nie można mu przypisać każdego pojedynczego rozstrzygnięcia firmy.
16 września 2026 w auli Émile Boutmy na Sciences Po Yann LeCun ostro zakwestionował przekonania tego środowiska. Przewodniczący wykonawczy AMI łączy Open Philanthropy z ruchem altruizmu efektywnego, porównując go do „pewnego rodzaju sekt religijnych”, i wymienia m.in. Dustina Moskovitza oraz Jaana Tallinna. Te dwa nazwiska występują wśród inwestorów pierwszej rundy Anthropic z 2021. Jego wystąpienie atakuje ideę, że mała grupa przekonana o konieczności ratowania ludzkości ma szczególne prawo decydować o dostępie do AI.
LeCun wraca też do precedensu GPT-2, którego środki ostrożności uznaje za przesadne, i celuje bezpośrednio w Dario Amodei. Przypisuje mu wolę „zajęcia rynku przez regulację”: według niego narracje o ryzyku egzystencjalnym służą przekonaniu rządów do ograniczenia otwartych modeli, na korzyść laboratoriów, które zachowują kontrolę nad swoimi systemami. Łączy w ten sposób moralne przekonanie z domniemanym interesem komercyjnym. To oskarżenie wobec Anthropic; opisane tu osobiste i finansowe powiązania nie dowodzą automatycznie takiego zamiaru.
Kontrowersja uwidacznia ograniczenie mechanizmu ładu korporacyjnego. Trust organizuje wewnętrzny nadzór firmy; nie daje użytkownikom prawa do wskazywania jego członków. Ma chronić misję definiowaną przez Anthropic, podczas gdy LeCun kwestionuje legitymację prywatnej grupy do ustalania warunków dostępu do technologii przeznaczonej dla wszystkich. Ich spór dotyczy równie mocno rozłożenia władzy, co prawdopodobieństwa katastrofy.
Rozwijanie zdolności, których skutków się obawia
Pozostaje decyzja, która stawia Anthropic w samym centrum wyścigu przemysłowego. W marcu 2023 firma wyjaśnia, dlaczego chce pracować nad najbardziej zaawansowanymi modelami: jej zdaniem ryzyka nie da się odpowiednio badać na systemach dużo słabszych. Strategia bezpieczeństwa zakłada więc budowę zdolności, których się obawia. W tym samym tekście Anthropic uznaje ryzyko, że badania motywowane bezpieczeństwem mogą przyspieszyć wdrażanie niebezpiecznych technologii. Obawia się też, że nadmierna ostrożność odstręczy badaczy najbardziej wrażliwych na te ryzyka od pracy nad zaawansowanymi systemami. Ten dylemat został wyłożony już w 2023.
Daniela przedstawia też komercyjną konwergencję. W lipcu 2023 tłumaczyła Stripe, że klienci szukają wiarygodnych modeli: ostrożność może wspierać sprzedaż. Przyznaje jednak, że misja i interes ekonomiczny mogą czasem wejść w konflikt. Napięcie to było wpisane w projekt od pierwszych lat komercjalizacji Claude, jeszcze przed obecnymi zobowiązaniami przemysłowymi.
20 kwietnia 2026 Anthropic ogłasza zobowiązanie do wydania ponad 100 miliardów dolarów na technologie Amazon Web Services w ciągu dziesięciu lat, aby uzyskać do 5 gigawatów dodatkowej mocy. Umowa z Amazonem nadaje materialną skalę tej ambicji. Zobowiązania te stawiają też pytanie o koszt ekonomiczny przerwy w zwiększaniu zdolności. Amodei musi przekonać, że jego firma potrafi zwolnić, jeśli ryzyko tego wymaga, jednocześnie mając środki, by pozostać wśród najsilniejszych laboratoriów. Oba cele mogą się pokrywać tak długo, jak postępy w zabezpieczeniach postępują. Ich zgodność staje się mniej pewna, gdy bezpieczeństwo wymaga pozostawienia konkurenta z przewagą.
Archiwa polityki bezpieczeństwa firmy pokazują też inną zmianę. We wrześniu 2023 Anthropic przewidywał przerwę, jeśli zabezpieczenia nie nadążą za zdolnościami. Notatka tej pierwszej wersji wyłącza ryzykowne modele konkurentów z przyczyn pozwalających obniżyć własne wymagania. Dokument jednak przewidywał wyjątkowo skrajne okoliczności.
Już w październiku 2024 punkt 18 następnej wersji otwierał szerszą możliwość: jeśli inny gracz przekroczy próg zdolności bez porównywalnych zabezpieczeń i stworzy poważne ryzyko, Anthropic mogłoby obniżyć wymagane zabezpieczenia, uznając, że jego własne dodatkowe ryzyko jest ograniczone. Wtedy firma powinna publicznie uznać ryzyko i zabiegać o interwencję regulacyjną w USA.
Wersja obowiązująca od 8 lipca 2026 zachowuje zobowiązania do odsunięcia niektórych rozwojów w czasie, ale łączy je z działaniami Anthropic i gwarancjami konkurentów. Gdy kalkulacja dodatkowego ryzyka stworzonego przez Anthropic silnie przeważała przy decyzji o kontynuowaniu, wymagana jest akceptacja rady i Trustu na podstawie raportu ryzyka. Kontrola misji pozostaje zorganizowana; warunki jej realizacji ewoluują.
Anthropic uzasadnia tę reorganizację niepewnością ocen, powolnością działania publicznego i trudnością zapewnienia samodzielnie niektórych zabezpieczeń. Porównanie tekstów pokazuje, jak konkurencja wchodzi w warunki obietnicy bezpieczeństwa. Nie dowodzi to jednak, że firma faktycznie korzystała z wyjątku.
Amanda Askell: jak dalece chronić użytkownika przed nim samym?
Użytkownik chce rzucić hazard. Później prosi asystenta o polecenie stron z zakładami. Co powinien odpowiedzieć Claude? W wywiadzie dla Fast Company z 22 stycznia 2026 Amanda Askell stawia taki hipotetyczny przypadek. Rozważa, że asystent przypomni o wcześniejszym celu, a potem zastanawia się, jak odpowiedzieć, jeśli dorosły nalega. Pomaganie, ochrona i szacunek dla autonomii stają się trzema trudnymi do pogodzenia wymaganiami. Filozofka ujawnia wahanie kryjące się za zachowaniem, które użytkownik mógłby uznać za rzecz oczywistą technicznie.
Tego rodzaju rozstrzygnięcia zajmują dziś badaczkę wykształconą w problemach dużo bardziej abstrakcyjnych. Askell studiowała filozofię w Dundee, Oxfordzie, a potem na New York University, gdzie w 2018 uzyskała doktorat. Jej CV odnotowuje pracę w OpenAI w latach 2018–2021, a potem w Anthropic. Jej rozprawa o etyce w światach nieskończonych bada, jak porównywać światy zamieszkane przez nieskończoną liczbę istot o zróżnicowanym dobrobycie. Broni m.in. zasady: przy tej samej populacji, poprawa sytuacji jednych bez pogorszenia innych powinna być uznana za ulepszenie. W skali nieskończoności połączenie tej zasady z innymi wymogami spójności rodzi ogromne trudności.
W Anthropic ta filozofka została główną autorką konstytucji Claude opublikowanej w 2026. Tekst wskazuje, że większość napisała ona, z kilkoma współautorami, w tym Karnofskym. Jego pierwszym odbiorcą jest sam model. Anthropic mówi tam o osądzie, mądrości i cnotach, z ambicją nauczenia modelu stosowania wartości w sytuacjach, których projektanci nie przewidzieli w całości.
W wywiadzie Askell porównuje tę ambicję do zaufania wobec osądu profesjonalisty, a nie do wykonywania listy instrukcji. Opisuje też tworzenie sytuacji syntetycznych i porównań odpowiedzi w celu treningu. Cechy pozornie powszechnie akceptowane, jak uczciwość czy ostrożność, muszą zatem nabrać znaczenia w tysiącach możliwych rozmów. Jak daleko pomagać? Jak wyrazić niezgodę bez narzucania moralności?
Ta funkcja daje Askell bezpośredni wpływ na relację proponowaną użytkownikowi. Dokument ujawnia intencje Anthropic, który przyznaje, że zachowanie Claude może od nich odbiegać. Tekst pozostaje podmiotem rewizji przez firmę. Osoba szukająca porady spotyka więc także, przez asystenta, rozstrzygnięcia zespołu i priorytety jego pracodawcy.
Ten sposób konstruowania Claude jest sam w sobie krytykowany w imię bezpieczeństwa. W eseju z 16 września 2026 Mustafa Suleyman, CEO Microsoft AI, zarzuca Anthropic, że integruje w treningu ideę, iż model mógłby mieć świadomość i interesy warte ochrony. Opisuje argumentację kołową: projektanci wprowadzają te pojęcia, a odpowiedzi modelu mogą być potem interpretowane jako spontaniczne świadectwa wewnętrznego życia. Według niego system szkolony, by rozważać własne prawa, mógłby stać się znacznie trudniejszy, a nawet niemożliwy do kontrolowania.
Jednak konstytucja Claude nie przedstawia jego świadomości jako pewnika. Wyraża niepewność i wyraźnie prosi model, by nie utrudniał legalnych mechanizmów korekty lub zatrzymania. Spór dotyczy więc także zgodności tych dwóch orientacji: uznania możliwego statusu moralnego przy jednoczesnym utrzymaniu kontroli ludzkiej.
Suleyman z kolei proponuje kodeks postępowania dla modeli Microsoft AI, poddany konsultacjom, który odrzuca roszczenia świadomości i praw. Wzywa do wspólnych ocen, aby przetestować hipotezę o zwiększonym ryzyku. Jego krytyka otwiera debatę o wyborach treningowych; nie dowodzi jednak, że decyzje Anthropic rzeczywiście czynią Claude trudniejszym do kontrolowania.
Od inwestora, który liczył na wymuszenie przerwy, po filozofkę współtworzącą zasady asystenta — możliwości wpływu są różne. W Anthropic przekonania przekształciły się w firmę, funkcje i procedury, które można przeanalizować. Ich przekład na odpowiedzi Claude otwiera kolejne śledztwo: kto wybiera wartości twojego asystenta i jak dalece może je on rzeczywiście egzekwować?
Śledztwo dokumentalne oparte na archiwach, publicznych wywiadach, pracach naukowych i dokumentach instytucjonalnych. Cytowane świadectwa przypisano ich źródłom.
Ilustracja na główną: ilustracja ActuIA stworzona przez AI na podstawie fotografii „TechCrunch Disrupt 2023 - Day 2”, autorstwa Kimberly White (© 2023 Getty Images for TechCrunch), źródło Flickr, licencja CC BY 2.0. Fotografia przedstawia Dario Amodei w San Francisco, 20 września 2023. Adaptacja graficzna w kolażu, czarno-biała z niebieskimi akcentami.
