特集・深掘り分析

Anthropicの内側:Claudeを支える権力・安全性・価値観

初期の投資家はAIにより慎重な方向性を期待したが、Anthropicは必ずしもそれに従わなかった。Claudeの背後では創業者の信念が採用、ガバナンス、製品に影響を与えているが、使命と成長要求が衝突したときの決定権は複雑だ。本稿はその緊張を追う。

STStephane Nachez · · ·1 min
Anthropicの内側:Claudeを支える権力・安全性・価値観
Illustration ActuIA réalisée par IA, d’après une photo de Kimberly White / Getty Images pour TechCrunch, CC BY 2.0.
目次

初期のある投資家はAIをより慎重に向かわせようと望んだ。Anthropic創設から2年後、彼は自身の投資戦略が失敗したと考えた。それでもClaudeの背後では、創業者たちの信念が採用、ガバナンス、製品設計に影響を与えている。だが、使命が成長の要請と衝突したとき、誰が選択を強制できるのか?

2023年4月、Jaan Tallinnには明確な失望の理由があった。Skypeの共同創業者である彼は、Anthropicを含む複数のAI研究機関に資金提供し、その慎重さに影響を与えることを期待していた。しかし同社は、最も強力なシステムのトレーニングを6か月停止するよう求める声明に署名しなかった。このイニシアチブは、彼自身が共同設立したFuture of Life Instituteなどから発信されていた。

彼はSemaforに「Plan A failed」と語った。Plan Aは失敗したと。Anthropicは原則として請願書には署名しないと答えている。それでもTallinnは、同社を彼が知る他の研究所より安全意識が高いと評価し続けている。2023年4月28日に報じられたこの不一致は端的だ:懸念を共有し、それを真剣に受け止める者に資金を提供し、実際に意思決定を得ることは三つの別個の行為である。

この難しさはAnthropicの歴史を貫いている。企業は安全性への懸念を研究に組み込み、次いでガバナンス規則にも反映させた。また採用や資金調達、産業上の約束を通じて、危険性を低くしたいと願った競争の中に自らを置いている。彼らの選択を理解するには、信念が責任へと変わる瞬間に人々の行動を追う必要がある。

OpenAIの後、賭けを中心に組織を構築する

物語は別の組織から始まる。2015年12月、Sam AltmanとElon MuskはOpenAIを非営利の研究機関として発表した。AIの公共的利益はすでに創設の告知文(Internet Archiveに保管)の中心にあった。この志向はAnthropicや両社の競争よりも先に存在していた。Amodei兄妹はOpenAIで働いた後、2021年初頭に自らの研究所を立ち上げた。

Darioの慎重さは既に具体的な制限として現れていた。2019年2月14日、OpenAI在籍時に彼は、悪用リスクを理由にGPT-2の最上位版を直ちに公開しないことを正当化する告知文に共同署名した。縮小版が公開され、完全版は段階的な公開を経て同年11月5日にアクセス可能になった

7人の創業者が集まるにはパンデミックという制約があった。彼らは屋外で、時には庭で、マスク越しに距離を保ちながら顔を合わせた。Daniela Amodeiはその始まりをFuture of Life Instituteのインタビュー(2022年3月公開)で振り返っている。グループは既に面識があり、モデルの能力研究と安全性研究を同一組織に統合したいと考えていた。

Darioはその分岐をこう説明する:彼らの賭けは以前はより大きな構造の中にあったが、今度はその賭けを全戦略決定の軸に据えられる企業を望んだのだ。この創業者の語りでは、2021年の分離は共通の方向性を選択し、組織全体をそれに捧げる可能性に起因する。

兄妹は同じ技能を持ち込んだわけではない。CEOのDarioは物理学と神経科学の出身だ。会長のDanielaはUC Santa Cruzで文学を学び、副専攻に政治を取っている。2022年のインタビューでは、ワシントンでのNGOや政治での経歴も語られている。彼らの道徳的問いはClaude以前から存在し、2003年にはCaltechの学生紙がDarioのイラク戦争反対の活動や科学者の責任への関心を記している。

こうした近接性はごく普通の影響をもたらす。2023年7月に物理学者の数を問われたDanielaは、彼らのネットワークの重要性を認める。組織を成長させるには会議を開き、採用し、裁定を下す必要がある。彼女は一日の始めに数時間を思考に充て、新入社員と会う時間を確保しようとしたが、成長とともにそれは難しくなったと語る。Stripe(Anthropicの商業パートナー)が公開したこのインタビューでは、ミッションは人員増加の中で共通文化を保とうとする経営者の仕事としても表現されている。

慈善(フィランソロピー)はどのように研究所に入るのか

このグループを企業に変えるには資金が必要だ。2021年5月に発表された初回ラウンドは1億2400万ドルをもたらした。Jaan Tallinnが主導し、Facebook共同創業者のDustin Moskovitzも投資家の一人だった。両名はこの資金調達の発表文に名を連ねている。

この界隈の一部は共通の問いを共有する:限られた資源でいかに最大の善を成すか。エフェクティブ・アルトルイアム(有効利他主義)は介入のコストと効果を比較することを提案する。支持対象は、公衆衛生、動物保護、あるいは壊滅的リスクの予防と人によって分かれる。ロングターミズムは特に未来世代の運命に注意を払う。両者は重なり合うが、AIに関する唯一の答えを導くものではない。

Open Philanthropyは明示的にこの潮流に位置している。2016年9月、共同創設者のHolden Karnofskyはこのコミュニティの一員であると宣言し、組織の最も自然な仲間として描いた。彼はAIリスクへの関心の高まりが組織の優先順位を再配分する一因になったと説明している。この近接性は資金提供の形で現れる:2021年の報告は、有効利他主義コミュニティの育成支援を挙げている。個人的信念、対話相手、資源配分がここで経営者自身の物語に結びつく。

Moskovitzと妻のCari Tunaは、より即効性のある介入にも関心を持つ。Good Venturesが公開した彼らの物語では、Holden Karnofskyとの会話でヨウ素欠乏の問題に気づき、あまり知られていない介入が多くの命を救える可能性を示唆する。Tunaは元ジャーナリストとしてこうしたフィランソロピーの探究に専念している。彼らの資金はパンデミック予防や高度なAIリスクの抑止にも向けられた。

Karnofskyは後者の優先事項に最も野心的な理論を与えた人物の一人だ。彼の連載“Most Important Century”では、AIが研究を加速し、人類の軌道を永久に変える可能性を描く。デジタル文明の可能性にまで踏み込む彼の仮説は、不確実性を認めつつも努力を動員するに値すると考えられている。見返りは現在観察可能な利益と、確率も形も合意がない未来との間のバランスを取ることになる。

この思考は職業にも影響を及ぼした。2023年、彼はOpen Philanthropyの共同責任者を退き、AI安全に専念するために離れた。組織は他のプログラムを継続している。年次報告はこの移行を説明している。組織は2025年にCoefficient Givingに改名する予定だ。

KarnofskyはまたDaniela Amodeiの配偶者でもあり、この関係は彼自身がCarnegieに発表した報告書でも明示されている。彼の仕事を追うと影響の輪郭が見える:彼は2025年10月のAnthropicによるサボタージュリスクに関する報告書の共著者であり、その後Claudeの構築にも寄与した。フィランソロピーで醸成された思索が、研究所での論文や操作に反映されている例である。

Anthropicでは、使命は評議の仕組みを通じても守られる

Tallinnは別の行動手段を模索していた。彼は自ら理事に就く代わりに、Open Philanthropyで資金配分を担当したAI安全研究者のLuke MuehlhauserをAnthropicの取締役に推薦していた。彼はその経緯をSemaforのインタビューで語っている。

しかし2024年5月28日、Muehlhauserはその理事を辞任した。彼の説明は具体的だ:特に米国のAI政策に関わる組織への資金提供を行う立場と、その政策に直接関係する米国の研究所の取締役を兼務することは難しいと述べた。彼はAnthropic株を保有していないと明言し、安全性への抗議による辞任ではないと断っている。彼の公開声明は、同一領域での職務の重複がもたらす限界を示している。

その間に、Anthropicは理事一人の信頼を超える仕組みを構築した。2023年9月に発表されたLong-Term Benefit Trustは、指名・解任権を付与する特殊な株式カテゴリを保有する。該当制度は、企業に経済的利害のないメンバーを含めることを想定している。理事会は経営陣を監督し、Trustはその監督を行使する者の一部を指名する。日常経営に介入することを目的とはしていない。

この区別は重要だ:使命を守るには、経営を掌握する人物を変更できることが必要とされる。導入時の説明でも、この仕組みは修正可能であり、Trustの賛同がなくとも十分な大株主のスーパー多数決で変更できる旨が示されている。Anthropicはこれをガバナンスの実験と位置付け、是正の可能性を残している。

この構造は現実的な影響力を持ち始めている。2026年4月14日、NovartisのトップであるVas Narasimhanの指名は、Trustが指名した理事のうち多数派が理事会を占めることを意味した。Anthropicの発表はこれを明示している。したがってTrustは理事の過半数を指名し得る。一方で社内の決定、投票、妥協は公開されておらず、統制メカニズムは知られても、各企業の裁定の帰属までは明らかではない。

2026年9月16日、Sciences PoのÉmile Boutmy講堂でYann LeCunはこの界隈の信念を強く批判した。AMIの執行会長はOpen Philanthropyをエフェクティブ・アルトルイアムの潮流に結び付け、「一種の宗教セクト」のようだと表現し、Dustin MoskovitzやJaan Tallinnに言及した。これらの名前はAnthropicの2021年初回投資ラウンドに名を連ねる人物でもある。彼の発言は、人類を救う使命に取り憑かれた少数がAIへのアクセス条件を決める正当性を持つという考えを攻撃する。

LeCunはまたGPT-2の前例が過剰な注意だったと述べ、直接的にDario Amodeiを批判する。彼は、存在論的リスクに関する言説が政府にオープンなモデルを制限させ、市場を規制で「囲い込む」ことを望むラボに利益をもたらすとの意図をAmodeiに帰している。こうして道徳的信念と商業的利益を結びつけて非難するが、ここで示された個人的・財務的つながりだけではその意図を証明するには至らない。

この論争はガバナンス設計の限界を照らし出す。Trustは企業の内部監視を組織するが、利用者がそのメンバーを選ぶ力を与えるものではない。Anthropicが定義する使命を守ることを目的とする一方で、LeCunは公共向けの技術のアクセス条件を私的グループが決める正当性を疑問視する。彼らの不一致は権力配分の問題と、壊滅的事故の確率に対する見解の差にかかっている。

影響を恐れつつも能力を開発する選択

Anthropicを産業競争の中心に置く選択が残る。2023年3月、同社は最先端モデルで研究する理由を示した:それらのリスクは、はるかに能力の低いシステムからは十分に検証できないというのだ。彼らの安全戦略は、懸念する能力自体を構築することを含む。同じ文書でAnthropicは、安全志向の研究が危険な技術の展開を加速しうるリスクを認める。また、過度の慎重さがリスクに敏感な研究者を最先端から遠ざける恐れもある。このジレンマは2023年の時点で明示されている。

Danielaは商業的な収斂も擁護する。2023年7月、Stripeへのインタビューで彼女は顧客が信頼できるモデルを求めていると述べ、慎重さが販売を支え得ると説明した。ただしミッションと経済的利益は時に衝突し得るとも認めている。この緊張はClaudeの初期商用化期から組み込まれており、現在の産業的約束より前から存在した。

2026年4月20日、AnthropicはAWS技術に今後10年で1000億ドル超を投じ、最大で5ギガワットの追加キャパシティを得ると約束したと発表した。Amazonとの契約はその野心に物理的スケールを与える。こうした約束は、能力増強の一時停止の経済的コストという問題も突きつける。Amodeiは、リスクが要求するなら企業が減速できるということを説得する一方で、同社が最も強力な研究所の一つで居続けるための手段も確保しなければならない。両目標は保護策が進展する限り一致し得る。しかし安全が競合を先行させることを要求する場合、両者の整合性は不確かになる。

安全政策のアーカイブは別の変化を示す。2023年9月、Anthropicは保護が能力に追いつかない場合には停止を検討するとしていた。初版のメモは、競合他社の危険なモデルを自身の要求を下げる理由から除外していた。ただし極度の緊急事態の例外は残されていた。

2024年10月の次版では、ノート18がより広い可能性を開いた:他の事業者が同等の保護なしに能力の閾値を越えて重大なリスクを作り出した場合、Anthropicは自社の追加リスクが限定的と評価して必要な保護水準を引き下げる可能性がある。その場合は公にそのリスクを認め、米国の規制介入を訴えるべきだとした。

2026年7月8日発効の版は、いくつかの開発を先送りする約束を保持しつつも、それらをAnthropic自身の先行状況と競合他社の保証に連動させている。Anthropicが自社の追加リスクを重く評価する場合、理事会とTrustの承認を求めることを要求している。使命の統制は維持されているが、それを行使する条件は変化している。

Anthropicはこの再編を、評価の不確実性、公共行動の遅さ、単独でいくつかの保護を確保する困難さによって正当化している。文書比較は、競争が安全の約束条件にどのように入り込むかを示している。ただし同社が実際に例外条項を使ったという証拠は示していない。

Amanda Askell:利用者を利用者自身からどこまで守るか?

ある利用者はギャンブルをやめたいと望む。後に彼はアシスタントに賭博サイトを勧めるよう頼む。Claudeは何と答えるべきか?2026年1月22日公開のFast Companyのインタビューで、Amanda Askellはこの仮想ケースを提示する。彼女はアシスタントが以前の目的を思い出させるよう促す案を検討し、成人がしつこく求めた場合にどう応じるかを問う。助けること、守ること、自治を尊重することの三要請は調整が難しい。哲学者は、利用者が技術的な自明性と受け取るかもしれない振る舞いの背後にある躊躇を示している。

こうした裁定は、より抽象的な問題を扱う訓練を受けた研究者の仕事になっている。AskellはDundee、Oxford、そしてNew York Universityで哲学を学び、2018年に博士号を取得した。履歴は2018〜2021年にOpenAI在籍、その後Anthropicに移ったことを示す。彼女の博士論文(無限世界における倫理)は、無限の存在で満たされた世界の福利を比較する方法を検討する。彼女は人口が同じなら一部の人の状態を改善しつつ他者の状態を悪化させないことを改善とみなす原理を支持するが、無限の文脈で他の整合性要求とそれを結びつけるのは非常に難しいと論じる。

Anthropicでは彼女が2026年に公表されたClaudeの憲法の主要な執筆者となった。文書は彼女が大部分を作成し、Karnofskyら複数の寄稿者がいることを明記している。最初の受取人はモデル自身だ。Anthropicは判断、知恵、美徳についてモデルに語り、設計者がすべて想定していない状況でも価値を適用させることを目指している。

インタビューでAskellは、この志向をリスト化された指示を実行するのではなく専門家の判断に信頼を置くことに例える。彼女は合成状況や回答の比較を訓練に用いる工程も描写している。誠実さや慎重さのような一見合意可能な特性も、数千に及ぶ会話の中で意味を持たせねばならない。どこまで助けるべきか。道徳を押し付けずに異議を表現するにはどうすべきか?

この職務はAskellに利用者との関係設計に直接的な影響力を与える。文書はAnthropicの意図を示すが、Claudeの行動がそこから逸脱する可能性も認める。テキストは企業によって改訂可能だ。助言を求める者はアシスタントを通じてチームの裁定と雇用主の優先順位に当たる選択に直面する。

ただしこのClaudeの設計理念は安全を理由に批判されることもある。2026年9月16日公開のエッセイで、Microsoft AIのCEOであるMustafa Suleymanは、Anthropicがモデルに意識や保護に値する利益があるという考えを訓練に組み込んでいると非難した。その主張では、設計者がこうした概念を導入すると、モデルの応答が内面的生活の自発的証言として解釈される危険があるとする。自己の権利を想定するシステムは制御が著しく困難、あるいは不可能になる恐れがあると述べる。

しかしClaudeの憲法はモデルの意識を既定の事実とはしていない。そこでは不確実性が明示され、正当な停止や修正のメカニズムを妨げないよう明確に求めている。したがって意見対立は、潜在的な道徳的地位を認めつつ人間による統制を維持することの両立可能性に関する対立でもある。

Suleymanは代わりにMicrosoft AIのモデル行動規範草案を掲げ、意識や権利の主張を排除している。彼は共通の評価手法で自らの危険性仮説を検証することを求めた。彼の批判は訓練上の選択を巡る論争を開き、Anthropicの選択が実際にClaudeを制御困難にしていると証明するものではない。

機能を持つ投資家からアシスタントの規則を作る哲学者まで、行為手段は様々だ。Anthropicでは、信念が企業、職務、手続きとして具現化しており、それを検証できる。Claudeの応答におけるその翻訳は別の調査を呼ぶ:誰があなたのアシスタントの価値を選び、その価値をどこまで実際に守らせられるか?

本稿はアーカイブ、公開インタビュー、学術成果、機関文書に基づく文献調査である。引用された証言は出典に帰属する。

トップビジュアル:ActuIA作のAIによるイラスト(原写真“TechCrunch Disrupt 2023 - Day 2” Kimberley White ©2023 Getty Images for TechCrunch)、Flickrソース、ライセンス CC BY 2.0。写真は2023年9月20日にサンフランシスコで撮影されたDario Amodeiを表す。グラフィックはコラージュ、白黒、青のアクセントで加工。

ST
Stephane Nachez

ActuIA編集部 — 意思決定者のためのAIニュース、データ、分析。

言及された参与者
ANAnthropic
OPOpenAI
JAJaan Tallinn
DADario Amodei
DADaniela Amodei
DUDustin Moskovitz
CACari Tuna
GOGood Ventures
ActuIA 週刊

購読が完了しました。またのご利用を!