Один із перших інвесторів компанії прагнув спрямувати розвиток ШІ у бік більшої обережності. Через два роки після заснування Anthropic він вважав свою інвестиційну стратегію невдалою. За Claude однак стоять переконання засновників, які сформували підбір персоналу, управління і продукт. Але хто може нав’язати вибір, коли місія стикається з вимогами зростання?
У квітні 2023 року Jaan Tallinn мав дуже конкретну причину для розчарування. Співзасновник Skype фінансував лабораторії зі штучного інтелекту, серед яких Anthropic, сподіваючись вплинути на їхню обережність. Проте компанія не підписала заклик тимчасово, на шість місяців, призупинити навчання найпотужніших систем. Ініціатива походила серед інших від Future of Life Institute, який він сам співзаснував.
«Plan A failed», — зізнається він у розмові з Semafor. План A провалився. Anthropic відповідає, що не підписує петицій за принципом. Tallinn усе ж досі вважає її уважнішою до безпеки, ніж інші лабораторії, які він знає. Ця суперечка, висвітлена 28 квітня 2023 року, вміщується в кількох рядках: поділитися тривогою, фінансувати тих, хто ставиться до неї серйозно, і отримати конкретне рішення — це три різні речі.
Ця складність пронизує історію Anthropic. Компанія надала питанням безпеки місце в дослідженнях, а потім у правилах корпоративного врядування. Вона також наймала співробітників, залучала капітал і укладала промислові зобов’язання, які вбудували її в ту саму конкуренцію, яку вона прагнула зробити менш небезпечною. Щоб зрозуміти її вибори, потрібно прослідкувати людей у той момент, коли їхні переконання стають відповідальністю.
Після OpenAI — будівництво організації навколо ставки
Історія починається в іншій організації. У грудні 2015 року Sam Altman і Elon Musk представили OpenAI як некомерційну дослідницьку організацію. Колективна користь від ШІ вже була в центрі засновницького оголошення, збереженого Internet Archive. Ця амбіція передує Anthropic і конкуренції між двома компаніями. Amodei працювали в OpenAI перед тим, як у 2021 році заснувати власну лабораторію.
Обережність Dario Amodei вже мала конкретне втілення. 14 лютого 2019 року в OpenAI він співпідписав оголошення, яке виправдовувало невідразу публікувати найпотужнішу версію GPT-2 з міркувань ризиків зловживання. Було випущено урізану версію; повна модель стала доступною 5 листопада того ж року, після поетапної публікації. Amodei публічно підтримував колективне рішення про обмежений розповсюдження, майже за два роки до співзаснування Anthropic. Розробляти модель, оцінювати її небезпеки й вирішувати, хто може мати до неї доступ — уже тоді були частинами одного й того ж рішення.
Щоб зібратися, сім засновників Anthropic мали домовлятися з пандемією. Вони зустрічалися на вулиці, іноді в саду, у масках і на дистанції. Daniela Amodei згадувала ці початки в інтерв’ю для Future of Life Institute, опублікованому в березні 2022 року. Група вже знала одне одного й хотіла поєднати дослідження здібностей моделей та дослідження їхньої безпеки в одній організації.
Dario пояснює цю розбіжність так: їхня ставка раніше існувала всередині ширшої структури; тепер вони хотіли створити компанію, яка могла б спрямовувати всі стратегічні рішення навколо цієї ідеї. У розповіді засновників розрив 2021 року полягав у можливості обрати спільний напрям і присвятити йому всю організацію.
Брат і сестра принесли різні компетенції. Dario, генеральний директор, має освіту у фізиці та нейронауках. Daniela, президентка, вивчала літературу з додатковою спеціалізацією з політики в UC Santa Cruz. У інтерв’ю 2022 року вона також описує досвід у НУО та політиці у Вашингтоні. Їхні моральні запитання не починаються з Claude: ще в 2003 році студентська газета Caltech описувала активізм Dario проти війни в Іраку й його занепокоєння відповідальністю вчених.
Така близькість має дуже буденні наслідки. У липні 2023 року, відповідаючи на питання про кількість фізиків у команді, Daniela визнає важливість їхніх мереж. Щоб розвивати групу, потрібно проводити наради, шукати кадри, ухвалювати рішення. Вона розповідає, що намагається зберегти кілька годин для роздумів на початку дня й зустрічатися з новими співробітниками — заняття, що стає складнішим із ростом штату. У інтерв’ю для Stripe, комерційного партнера Anthropic, місія також постає як робота керівниці, яка прагне зберегти спільну культуру під час збільшення штату.
Як філантропія входить у лабораторію
Потрібні гроші, щоб перетворити групу на компанію. Перший оголошений раунд у травні 2021 року приніс 124 мільйони доларів. Jaan Tallinn його очолював; серед інвесторів був Dustin Moskovitz, співзасновник Facebook. Їхні імена фігурують в оголошенні про це фінансування.
Частина цього середовища ділила питання: з обмеженими ресурсами як приносити найбільше добра? Етика ефективного альтруїзму пропонує порівнювати втручання за витратами та ефектом. За різними людьми вона веде до підтримки громадського здоров’я, захисту тварин або запобігання катастрофічним ризикам. Longtermism звертає увагу на долю майбутніх поколінь. Обидві підходи перетинаються, не даючи єдиної відповіді щодо ШІ.
Open Philanthropy явно входила в цей рух. У вересні 2016 року її співзасновник Holden Karnofsky оголосив про свою приналежність до цієї спільноти і описав її як природне коло однодумців для організації. Він також пояснює, що зростаючий інтерес до ризиків ШІ переорієнтував пріоритети організації. Це вилилося у фінансування: звіт за 2021 рік згадує підтримку розвитку спільноти ефективного альтруїзму. Особисті переконання, контакти та розподіл ресурсів тут переплітаються у наративі керівників.
Moskovitz і його дружина Cari Tuna також цікавилися втручаннями з більш негайним ефектом. У оповіді на сайті Good Ventures розмова з Holden Karnofsky про дефіцит йоду ілюструє відкриття маловідомих втручань, здатних значно покращити життя. Tuna, колишня журналістка, присвятила себе такій філантропічній експлорації. Їхні пожертви також підуть на запобігання пандеміям і ризикам, пов’язаним із просунутим ШІ.
Karnofsky — один з тих, хто надає цій пріоритетності амбіційне обґрунтування. У серії «Most Important Century» він уявляє XXI століття, в якому ШІ значно прискорює наукові дослідження та суттєво змінює траєкторію людства. Він розглядає навіть можливість цифрових цивілізацій. Це гіпотези, які він вважає достатньо важливими для мобілізації зусиль, попри невизначеність. Перенесення фокусу є значним: воно підштовхує до зважування сьогоднішніх вимірюваних вигод і майбутніх сценаріїв, ймовірність і форма яких не є предметом консенсусу.
Ця рефлексія зрештою змінює його професійну діяльність. У 2023 році він залишає співкерівництво Open Philanthropy, щоб зосередитися на безпеці ШІ; організація продовжує інші програми. Її річний звіт описує це передання ролей. У 2025 році вона змінить назву на Coefficient Giving.
Karnofsky також чоловік Daniela Amodei, що він сам зазначає в документі для Carnegie. Його робота дозволяє простежити вплив детальніше: він є співавтором звiту Anthropic про ризики саботажу, опублікованого в жовтні 2025 року, а пізніше — одним із співробітників, які долучилися до створення Claude. Рефлексія, розвинена у філантропії, таким чином знаходить відбиття в дослідженнях і текстах, що використовуються лабораторією.
В Anthropic місія також проходить через радників
Tallinn шукaв інший спосіб вплинути. Замість того, щоб сам увійти до ради Anthropic, він запропонував Luke Muehlhauser, дослідника з безпеки ШІ і відповідального за фінансування в Open Philanthropy. Він розповідає про це в інтерв’ю для Semafor.
Проте 28 травня 2024 року Muehlhauser залишає цю раду. Його пояснення конкретне: фінансувати організації, що працюють зокрема над американською політикою у сфері ШІ, важко поєднувати з мандатом у лабораторії, яка безпосередньо зачеплена цією політикою. Він уточнює, що ніколи не був власником акцій Anthropic і заперечує відставку з протесту проти заходів безпеки. Його публічна заява ілюструє межі поєднання функцій у одному й тому ж середовищі.
Тим часом Anthropic встановила механізм, що виходить за межі вибору довіреної особи в раді. Представлений у вересні 2023 року, Long-Term Benefit Trust утримує особливу категорію акцій, які надають права призначення та відкликання членів ради. Механізм передбачає членів без фінансових інтересів у компанії. Рада залишається відповідальною за нагляд за керівниками; Trust призначає частину тих, хто виконує цей нагляд. Він не призначений для втручання в щоденне управління.
Це розрізнення ключове: захист місії тут означає можливість змінювати людей, які контролюють керівництво. У початковому представленні механізм лишається змінним, навіть без згоди членів Trust, якщо достатні супербільшості акціонерів схвалять зміни. Anthropic подає його як експеримент у врядуванні з можливостями корекції.
Ця конструкція тепер має реальну вагу. 14 квітня 2026 року призначення Vas Narasimhan, керівника Novartis, забезпечило більшості в раді число директорів, призначених Trust. Анонс Anthropic прямо це вказує. Отже, Trust може призначати більшість директорів. Внутрішні рішення, голосування та компроміси, натомість, не публічні. Ми знаємо механізм контролю; ми не можемо приписати йому кожне корпоративне рішення.
16 вересня 2026 року в амфітеатрі Émile Boutmy у Sciences Po Yann LeCun різко критикує переконання цього кола. Президент виконавчої ради AMI пов’язує Open Philanthropy з рухом ефективного альтруїзму, який він називає «своєрідною релігійною сектoю», і згадує імена Dustin Moskovitz та Jaan Tallinn. Ці два імена були серед інвесторів першого раунду Anthropic у 2021 році. Його виступ атакує ідею, що невелика група, переконана, що вона повинна врятувати людство, має легітимність вирішувати доступ до ШІ.
LeCun також повертається до прецеденту GPT-2, який він вважає надмірно обережним, і прямо звинувачує Dario Amodei. Він приписує йому бажання «захопити ринок через регулювання»: мовляв, розмови про екзистенційний ризик служать переконанню урядів обмежити відкриті моделі на користь лабораторій, що зберігають контроль над своїми системами. Він пов’язує моральне твердження з передбачуваною комерційною вигодою. Це його звинувачення щодо Anthropic; описані тут особисті та фінансові зв’язки самі по собі не доводять такого наміру.
Контроверсія висвітлює обмеження механізму врядування. Trust організовує внутрішній нагляд компанії; він не дає користувачам права обирати своїх членів. Він має на меті захистити місію, визначену Anthropic, тоді як LeCun ставить під сумнів легітимність приватної групи встановлювати умови доступу до технології, призначеної для всіх. Їхній розбіжність стосується як розподілу влади, так і ймовірності катастрофи.
Розвиток здібностей, які лякають своїми наслідками
Залишається вибір, що ставить Anthropic у серце індустріальної гонки. У березні 2023 року компанія пояснює, чому хоче працювати над найпросунутішими моделями: за її версією, їхні ризики не можна адекватно вивчити на значно слабших системах. Її стратегія безпеки отже передбачає побудову тих самих здібностей, які викликають занепокоєння. Водночас Anthropic визнає ризик того, що дослідження, мотивовані безпекою, пришвидшать розгортання небезпечних технологій. Компанія також остерігається, що надмірна обережність відштовхне дослідників, найбільш уважних до ризиків, від роботи над найпросунутішими системами. Цю дилему вона формулює вже в 2023 році.
Daniela також відстоює комерційну конвергенцію. У липні 2023 року вона пояснювала Stripe, що клієнти шукають надійні моделі: обережність може підтримати продажі. Вона натомість визнає, що місія й економічний інтерес іноді можуть конфліктувати. Ця напруга була закладена в проєкт із перших років комерціалізації Claude, ще до нинішніх промислових зобов’язань.
20 квітня 2026 року Anthropic оголосила про зобов’язання витратити понад 100 мільярдів доларів на технології AWS протягом десяти років, щоб отримати до 5 гігават додаткових потужностей. Угода з Amazon надає матеріальний масштаб її амбіції. Ці зобов’язання також ставлять питання про економічні витрати паузи у нарощуванні потужностей. Amodei має переконати, що компанія зможе уповільнити розробки, якщо ризик того вимагатиме, водночас зберігаючи засоби, щоб залишатися серед найпотужніших лабораторій. Обидві цілі можуть збігатися, поки прогресують механізми захисту. Їхня сумісність стає менш очевидною, якщо безпека вимагає дозволити конкуренту відірватися вперед.
Архіви її політики безпеки показують іншу зміну. У вересні 2023 року Anthropic передбачала паузу, якщо захисти не встигатимуть за можливостями. Нотатка тієї першої версії виключала моделі конкурентів, які вважаються небезпечними, з причин, що дозволяють послабити вимоги. Документ однак робив виняток у випадку надзвичайної екстреної ситуації.
Вже в жовтні 2024 року пункт 18 наступної версії відкриває ширшу можливість: якщо інший учасник досягне порогу можливостей без порівнянного захисту й створить серйозний ризик, Anthropic могла б знизити вимоги до захистів, оцінюючи власний додатковий ризик як обмежений. У такому випадку компанія мала б публічно визнати ризик і просити про регуляторне втручання з боку США.
Версія, що набула чинності 8 липня 2026 року зберігає зобов’язання відкладати певні розробки, але пов’язує їх із діями Anthropic і гарантіями конкурентів. Коли в балансі рішення відіграє значну роль розрахунок додаткового ризику, створюваного Anthropic, компанія вимагає схвалення ради й Trust на базі звіту про ризики. Контроль місії залишається організованим; умови його здійснення змінюються.
Anthropic обґрунтовує цю реорганізацію невизначеністю оцінок, повільністю публічних дій та складністю самостійно забезпечити деякі заходи захисту. Порівняння текстів показує, як конкуренція входить у умови обіцянки безпеки. Це не доводить, що компанія фактично використовувала згадану виняткову норму.
Amanda Askell: наскільки захищати користувача від самого себе?
Користувач хоче кинути азартні ігри. Пізніше він просить помічника порекомендувати сайти для ставок. Що має відповісти Claude? У інтерв’ю Fast Company від 22 січня 2026 року Amanda Askell пропонує такий гіпотетичний випадок. Вона уявляє, що помічник нагадає раніше висловлену мету, а потім замислюється над відповіdю, якщо дорослий наполягатиме. Допомогти, захистити й поважати автономію — три вимоги, які важко поєднати. Філософиня дозволяє побачити вагання за поведінкою, яку користувач може сприймати як технічну очевидність.
Такий тип арбітражів сьогодні займає дослідницю, навчання якої стосується значно абстрактніших проблем. Askell вивчала філософію в Dundee, Oxford і New York University, де захистила докторську дисертацію в 2018 році. Її CV показує, що вона працювала в OpenAI з 2018 до 2021 року, перш ніж приєднатися до Anthropic. Її дисертація про етику в нескінченних світах аналізує, як порівнювати світи, населення яких є нескінченним і чий добробут варіюється. Вона відстоює принцип: при однаковій населеності покращення становища деяких без погіршення становища інших слід зараховувати як покращення. На масштабі нескінченності узгодження цього принципу з іншими вимогами когерентності породжує величезні труднощі.
В Anthropic ця філософиня стає головною авторкою конституції Claude, опублікованої в 2026 році. Текст зазначає, що більшість його написала вона, з кількома співавторами, серед яких Karnofsky. Першим адресатом документа є сам модель. Anthropic говорить у ньому про судження, мудрість і чесноти, прагнучи змусити модель застосовувати цінності в ситуаціях, які розробники не могли повністю передбачити.
У інтерв’ю Askell порівнює цю амбіцію з довірою до судження професіонала, а не з виконанням переліку інструкцій. Вона також описує створення синтетичних ситуацій і порівнянь відповідей для навчання. Якісні міркування, які здаються загальноприйнятними, як-от чесність або обережність, мають набувати сенсу у тисячах можливих розмов. Наскільки допомагати? Як висловити незгоду, не нав’язуючи мораль?
Ця функція дає Askell прямий вплив на пропозицію взаємодії з користувачем. Документ окреслює наміри Anthropic, яка визнає, що поведінка Claude може відхилятися від цих намірів. Текст залишається переглядним компанією. Людина, що звертається за порадою, зустрічає отже через помічника арбітри команди й пріоритети її роботодавця.
Такий підхід до створення Claude також піддають критиці в ім’я безпеки. У есе від 16 вересня 2026 року Mustafa Suleyman, генеральний директор Microsoft AI, звинувачує Anthropic у включенні під час навчання ідеї, що модель може мати свідомість і інтереси, що заслуговують на захист. Він описує циклічне міркування: розробники вводять ці поняття, а відповіді моделі ризикують бути інтерпретовані як спонтанні свідчення внутрішнього життя. За його версією, система, навчена розглядати власні права, може стати значно складнішою або навіть неможливою для контролю.
Проте конституція Claude не стверджує однозначно її свідомість. Вона відображає невизначеність і прямо просить модель не перешкоджати законним механізмам корекції чи зупинки. Розбіжність стосується також сумісності двох орієнтирів: визнати можливий моральний статус і одночасно зберегти людський контроль.
Suleyman натомість просуває кодекс поведінки для моделей Microsoft AI, винесений на консультацію, який відкидає претензії на свідомість і права. Він закликає до спільних оцінювань, щоб перевірити гіпотезу про підвищений ризик. Його критика відкриває суперечку щодо тренувальних виборів; вона не доводить, що рішення Anthropic роблять Claude фактично менш контрольованим.
Від фінансиста, який сподівався домогтися паузи, до філософині, що формує правила помічника — способи впливати різняться. В Anthropic переконання породили компанію, ролі та процедури, які можна дослідити. Їхнє втілення у відповідях Claude відкриває інше розслідування: хто обирає цінності вашого асистента і наскільки він справді може їх забезпечувати?
Розслідування на основі архівів, публічних інтерв’ю, наукових праць і інституційних документів. Наведені свідчення атрибутовано до джерел.
Обкладинка: ілюстрація ActuIA, створена ШІ на основі фотографії «TechCrunch Disrupt 2023 - Day 2», автор Kimberly White (© 2023 Getty Images для TechCrunch), джерело Flickr, ліцензія CC BY 2.0. Фотографія зображує Dario Amodei в Сан-Франциско, 20 вересня 2023 року. Графічна адаптація у вигляді колажу, чорно-біла з блакитними акцентами.
