Dossiê / análise aprofundada

Na fábrica da Anthropic: poder, segurança e valores por trás de Claude

Um dos seus primeiros investidores queria orientar a IA para mais prudência. Dois anos após a criação da Anthropic, ele considerava sua estratégia de investidor um fracasso. Por trás de Claude, as convicções dos fundadores moldaram recrutamentos, governança e produto. Mas quem pode impor uma escolha quando a missão encontra as exigências do crescimento?

STStephane Nachez · · ·16 min
Na fábrica da Anthropic: poder, segurança e valores por trás de Claude
Illustration ActuIA réalisée par IA, d’après une photo de Kimberly White / Getty Images pour TechCrunch, CC BY 2.0.
Índice

Um dos seus primeiros investidores queria orientar a IA para mais prudência. Dois anos após a criação da Anthropic, ele considerava sua estratégia de investidor um fracasso. Por trás de Claude, as convicções dos fundadores, no entanto, moldaram o recrutamento, a governança e o produto. Mas quem pode impor uma escolha quando a missão encontra as exigências do crescimento?

Em abril de 2023, Jaan Tallinn tem um motivo muito concreto para estar desapontado. O cofundador do Skype financiou laboratórios de inteligência artificial, incluindo a Anthropic, com a esperança de influenciar sua prudência. No entanto, a empresa não assinou o apelo para suspender por seis meses o treinamento dos sistemas mais poderosos. A iniciativa veio em parte do Future of Life Institute, que ele próprio cofundou.

“Plan A failed”, confidencia ele ao Semafor. O plano A fracassou. A Anthropic responde que não assina petições por princípio. Tallinn ainda assim continua a considerá‑la mais atenta à segurança do que outros laboratórios que conhece. Esse desacordo, relatado em 28 de abril de 2023, resume‑se em poucas linhas: partilhar uma preocupação, financiar quem a leva a sério e conseguir uma decisão são três coisas diferentes.

Essa dificuldade atravessa a história da Anthropic. A empresa deu às preocupações de segurança um lugar na sua pesquisa e depois nas regras de governança. Também recrutou, angariou capital e assumiu compromissos industriais que a inserem na competição que queria tornar menos perigosa. Para entender suas escolhas, é preciso acompanhar as pessoas no momento em que suas convicções se tornam responsabilidades.

Depois da OpenAI, construir uma organização em torno de uma aposta

A história começa em outra organização. Em dezembro de 2015, Sam Altman e Elon Musk apresentam a OpenAI como um organismo de pesquisa sem fins lucrativos. O benefício coletivo da IA já figura no anúncio fundador, preservado pelo Internet Archive. Essa ambição antecede, portanto, a Anthropic e a concorrência entre as duas empresas. Os Amodei trabalharam na OpenAI antes de saírem para criar seu próprio laboratório, no início de 2021.

A prudência de Amodei já havia se traduzido por uma restrição concreta. Em 14 de fevereiro de 2019, na OpenAI, ele coassinou o anúncio que justifica não publicar imediatamente a versão mais potente do GPT‑2, em nome dos riscos de uso malicioso. Uma versão reduzida foi divulgada; o modelo completo tornou‑se acessível em 5 de novembro seguinte, após uma publicação em etapas. Amodei, portanto, apoiou publicamente uma decisão coletiva de difusão restrita, quase dois anos antes de cofundar a Anthropic. Desenvolver um modelo, avaliar seus perigos e decidir quem pode acessá‑lo já faziam parte do mesmo arbítrio.

Para se reunir, os sete fundadores da Anthropic tiveram então de lidar com a pandemia. Encontravam‑se ao ar livre, às vezes num jardim, de máscara e à distância. Daniela Amodei contará esses começos numa entrevista ao Future of Life Institute, publicada em março de 2022. O grupo já se conhecia e queria reunir pesquisa sobre as capacidades dos modelos e pesquisa sobre sua segurança numa mesma organização.

Dario Amodei explica aí a separação: a aposta deles existia anteriormente dentro de uma estrutura mais ampla; agora desejavam uma empresa que pudesse orientar todas as suas decisões estratégicas em torno dela. Nesse relato dos fundadores, a ruptura de 2021 prende‑se à possibilidade de escolher uma direção comum e dedicar‑lhe a organização inteira.

O irmão e a irmã não trazem as mesmas competências. Dario, o diretor geral, vem da física e das neurociências. Daniela, a presidente, estudou literatura, com minor em política, na UC Santa Cruz. Na entrevista de 2022, ela também relata uma trajetória em ONGs e na política em Washington. Suas interrogações morais não começam com Claude: em 2003, o jornal estudantil do Caltech já descrevia o engajamento de Dario contra a guerra do Iraque e suas preocupações sobre a responsabilidade dos cientistas.

Essa proximidade tem efeitos muito ordinários. Questionada em julho de 2023 sobre o número de físicos na equipe, Daniela reconhece a importância de suas redes. Para fazer o grupo crescer, é preciso depois realizar reuniões, recrutar, arbitrar. Ela conta que tenta preservar algumas horas de reflexão no início do dia e conhecer os novos funcionários, exercício que se tornou mais difícil com o crescimento. Nesse entrevista publicada pela Stripe, parceira comercial da Anthropic, a missão traduz‑se também pelo trabalho de uma dirigente que procura conservar uma cultura comum quando o efetivo aumenta.

Como a filantropia entra no laboratório

É preciso dinheiro para transformar esse grupo numa empresa. A primeira rodada anunciada, em maio de 2021, traz 124 milhões de dólares. Jaan Tallinn a lidera; Dustin Moskovitz, cofundador do Facebook, faz parte dos investidores. Os nomes deles figuram no anúncio desse financiamento.

Uma parte desse meio compartilha uma pergunta: com recursos limitados, como fazer o maior bem possível? O altruísmo eficaz propõe comparar intervenções, seus custos e seus efeitos. Conforme as pessoas, isso leva a apoiar a saúde pública, a proteção animal ou a prevenção de riscos catastróficos. O longtermismo volta‑se mais especificamente para o destino das gerações futuras. As duas abordagens se cruzam, sem determinar uma resposta única à questão da IA.

Open Philanthropy inscreve‑se explicitamente nesse movimento. Em setembro de 2016, seu cofundador Holden Karnofsky se declara membro dessa comunidade e a descreve como o grupo de pares mais natural da organização. Ele explica também que seu interesse crescente pelos riscos da IA contribuiu para reorientar as prioridades da organização. Essa proximidade traduz‑se em financiamentos: o relatório de 2021 menciona o apoio ao desenvolvimento da comunidade do altruísmo eficaz. Convicções pessoais, interlocutores e alocação de recursos juntam‑se aqui no relato dos próprios dirigentes.

Moskovitz e sua esposa Cari Tuna interessam‑se também por intervenções com efeitos mais imediatos. No relato publicado pela Good Ventures, uma conversa com Holden Karnofsky sobre carências de iodo ilustra a descoberta de intervenções pouco conhecidas capazes de melhorar muito vidas. Tuna, ex‑jornalista, dedica‑se a essa exploração filantrópica. Seus financiamentos também irão à prevenção de pandemias e aos riscos ligados à IA avançada.

Karnofsky é um dos que dá a essa última prioridade a argumentação mais ambiciosa. Em sua série “Most Important Century”, ele imagina um século XXI em que IAs acelerariam a pesquisa a ponto de modificar duradouramente a trajetória da humanidade. Explora até a possibilidade de civilizações digitais. São hipóteses que ele considera importantes o bastante para mobilizar esforços, embora reconheça sua incerteza. A mudança é considerável: conduz a pôr na balança benefícios observáveis hoje e futuros cuja probabilidade e forma não são consensuais.

Essa reflexão acaba por mudar sua profissão. Em 2023, ele deixa a codireção da Open Philanthropy para se concentrar na segurança da IA; a organização continua seus outros programas. Seu relatório anual descreve essa transição. Em 2025 ela passará a chamar‑se Coefficient Giving.

Karnofsky é também marido de Daniela Amodei, vínculo que ele mesmo declara num relatório publicado pela Carnegie. Seu trabalho permite seguir mais precisamente sua influência: ele é coautor de um relatório da Anthropic sobre riscos de sabotagem, em outubro de 2025, depois contribuinte para a constituição de Claude. Uma reflexão desenvolvida na filantropia encontra‑se assim em trabalhos e textos utilizados pelo laboratório.

Na Anthropic, a missão passa também pelo conselho

Tallinn procurou outro meio de agir. Em vez de ocupar ele próprio um assento no conselho da Anthropic, havia proposto Luke Muehlhauser, pesquisador em segurança de IA e responsável por financiamentos na Open Philanthropy. Ele conta isso na entrevista ao Semafor.

No entanto, em 28 de maio de 2024, Muehlhauser deixa esse conselho. Sua explicação é concreta: financiar organizações que trabalham, entre outras coisas, na política americana de IA torna‑se difícil de conciliar com um mandato num laboratório americano diretamente interessado por essa política. Ele indica nunca ter possuído ações da Anthropic e afasta a hipótese de demissão em protesto contra a segurança. Sua declaração pública mostra o limite de acumular funções dentro de um mesmo meio.

Entretanto, a Anthropic instalou um mecanismo que vai além da escolha de um administrador de confiança. Apresentado em setembro de 2023, o Long‑Term Benefit Trust detém uma categoria particular de ações que conferem direitos de nomeação e destituição ao conselho. O dispositivo prevê membros sem interesse financeiro na empresa. O conselho continua encarregado de vigiar os dirigentes; o Trust nomeia parte daqueles que exercem essa vigilância. Não tem por objetivo intervir na gestão do dia a dia.

A distinção é essencial: proteger uma missão supõe aqui poder mudar as pessoas que controlam a direção. Desde a sua apresentação inicial, o dispositivo permanece, no entanto, modificável, inclusive sem o acordo dos membros do Trust se supermaiorias de acionistas suficientemente importantes o aceitarem. A Anthropic apresenta‑o como uma experiência de governança, com possibilidades de correção.

Essa construção tem hoje um peso real. Em 14 de abril de 2026, a nomeação de Vas Narasimhan, dirigente da Novartis, levou à maioria no conselho do número de administradores designados pelo Trust. O anúncio da Anthropic diz‑no explicitamente. O Trust pode, portanto, designar a maioria dos administradores. As decisões internas, os votos e os compromissos, esses, porém, não são tornados públicos. Conhece‑se o mecanismo de controle; não se pode atribuir a ele cada arbitragem da empresa.

Em 16 de setembro de 2026, no anfiteatro Émile Boutmy da Sciences Po, Yann LeCun põe fortemente em causa as convicções desse meio. O presidente executivo da AMI conecta a Open Philanthropy ao movimento do altruísmo eficaz, que ele assimila a “uma espécie de seita religiosa”, antes de evocar, entre outros, Dustin Moskovitz e Jaan Tallinn. Esses dois nomes figuram entre os investidores da primeira rodada anunciada pela Anthropic em 2021. Sua intervenção ataca a ideia de que um pequeno grupo, convencido de dever salvar a humanidade, seria particularmente legítimo para decidir sobre o acesso à IA.

LeCun retoma também o precedente do GPT‑2, cujas precauções considera excessivas, e mira diretamente Dario Amodei. Atribui‑lhe a vontade de “capturar o mercado por meio da regulação”: segundo ele, os discursos sobre risco existencial serviriam para convencer governos a restringir modelos abertos, em benefício dos laboratórios que mantêm o controle de seus sistemas. Assim liga uma convicção moral declarada a um interesse comercial suposto. É a acusação que faz contra a Anthropic; os laços pessoais e financeiros aqui descritos não bastam para demonstrar essa intenção.

A controvérsia elucida um limite do dispositivo de governança. O Trust organiza uma vigilância interna da empresa; não dá aos utilizadores o poder de designar seus membros. Tem como objetivo proteger uma missão definida pela Anthropic, enquanto LeCun contesta a legitimidade de um grupo privado para fixar as condições de acesso a uma tecnologia destinada a todos. O desacordo incide tanto sobre a repartição do poder quanto sobre a probabilidade de uma catástrofe.

Desenvolver capacidades cujo efeito se teme

Fica a escolha que coloca a Anthropic no coração da corrida industrial. Em março de 2023, a empresa expõe por que quer trabalhar nos modelos mais avançados: segundo ela, os riscos desses modelos não podem ser adequadamente estudados a partir de sistemas muito menos potentes. Sua estratégia de segurança implica, portanto, construir as capacidades das quais se preocupa. No mesmo texto, a Anthropic reconhece o risco de que uma pesquisa motivada pela segurança acelere o lançamento de tecnologias perigosas. Receia também que um excesso de prudência afaste os pesquisadores mais atentos a esses riscos dos sistemas mais avançados. Esse dilema é explicitado já em 2023.

Daniela defende também uma convergência comercial. Em julho de 2023, ela explica à Stripe que clientes procuram modelos confiáveis: a prudência pode sustentar vendas. Reconhece, contudo, que missão e interesse econômico às vezes podem entrar em conflito. Essa tensão está inscrita no projeto desde os primeiros anos de comercialização de Claude, antes dos compromissos industriais atuais.

Em 20 de abril de 2026, a Anthropic anuncia assim o compromisso de gastar mais de 100 bilhões de dólares em tecnologias AWS ao longo de dez anos, para obter até 5 gigawatts de capacidade adicional. O acordo com a Amazon dá uma escala material à sua ambição. Esses compromissos colocam também a questão do custo econômico de uma pausa no aumento de capacidades. Amodei deve convencer de que sua empresa saberá abrandar se o risco o exigir, ao mesmo tempo em que lhe dá meios para permanecer entre os laboratórios mais potentes. Os dois objetivos podem coincidir enquanto as proteções progridem. Sua compatibilidade torna‑se mais incerta se a segurança exigir deixar um concorrente ganhar vantagem.

Os arquivos de sua política de segurança mostram outra mudança. Em setembro de 2023, a Anthropic prevê uma pausa caso as proteções não acompanhem as capacidades. Uma nota dessa primeira versão exclui modelos perigosos dos concorrentes das razões permitindo abaixar suas exigências. O documento, porém, reserva uma exceção de emergência extrema.

A partir de outubro de 2024, a nota 18 da versão seguinte abre uma possibilidade mais ampla: se outro ator ultrapassar um limiar de capacidades sem proteções comparáveis e criar um risco sério, a Anthropic poderia reduzir as proteções exigidas, estimando seu próprio risco adicional limitado. Deveria então reconhecer publicamente o risco e defender uma intervenção regulatória americana.

A versão em vigor desde 8 de julho de 2026 mantém compromissos de adiar certos desenvolvimentos, mas os articula ao avanço da Anthropic e às garantias dos concorrentes. Quando o cálculo do risco adicional criado pela Anthropic pesa fortemente na decisão de prosseguir, exige a aprovação do conselho e do Trust sobre o relatório de riscos. O controle da missão permanece organizado; as condições em que ele se exerce evoluem.

A Anthropic justifica essa reorganização pela incerteza das avaliações, a lentidão da ação pública e a dificuldade de assegurar sozinha certas proteções. A comparação dos textos mostra como a concorrência entra nas condições da promessa de segurança. Não estabelece que a empresa tenha efetivamente usado a exceção.

Amanda Askell: até onde proteger o usuário de si mesmo?

Um usuário quer parar de apostar. Mais tarde, pede ao seu assistente que lhe recomende sites de apostas. O que deveria responder Claude? Em uma entrevista publicada pela Fast Company em 22 de janeiro de 2026, Amanda Askell propõe esse caso hipotético. Ela imagina que o assistente relembre o objetivo anterior e depois se interrogue sobre a resposta a dar caso o adulto insista. Ajudar, proteger e respeitar a autonomia tornam‑se três exigências difíceis de conciliar. A filósofa deixa transparecer a hesitação por trás de um comportamento que o usuário poderia tomar por uma evidência técnica.

Esse tipo de arbítrio ocupa hoje uma pesquisadora formada em problemas bem mais abstratos. Askell estudou filosofia em Dundee, Oxford e depois na New York University, onde obteve o doutorado em 2018. Seu CV situa em seguida sua passagem pela OpenAI de 2018 a 2021, antes da Anthropic. Sua tese sobre ética em mundos infinitos examina como comparar mundos povoados por uma infinidade de seres cujo bem‑estar varia. Ela defende, entre outras coisas, um princípio: com população idêntica, melhorar a situação de alguns sem degradar a de outros deve contar como uma melhoria. Em escala infinita, articular esse princípio com outras exigências de coerência levanta dificuldades formidáveis.

Na Anthropic, essa filósofa torna‑se autora principal da constituição de Claude publicada em 2026. O texto especifica que ela escreveu a maior parte dele, com vários colaboradores, entre os quais Karnofsky. Seu primeiro destinatário é o próprio modelo. A Anthropic fala de julgamento, de sabedoria e de virtudes, com a ambição de fazê‑lo aplicar valores em situações que os projetistas não previram todas.

Na entrevista, Askell compara essa ambição à confiança dada ao julgamento de um profissional, em vez da execução de uma lista de instruções. Ela descreve também a fabricação de situações sintéticas e de comparações de respostas para o treinamento. Qualidades aparentemente consensuais, como honestidade ou prudência, devem assim adquirir sentido em milhares de conversas possíveis. Até que ponto ajudar? Como expressar um desacordo sem impor uma moral?

Essa função dá a Askell uma influência direta sobre a relação proposta ao usuário. O documento expõe as intenções da Anthropic, que reconhece que o comportamento de Claude pode delas se desviar. O texto permanece revisável pela empresa. A pessoa que pede conselho encontra, portanto, também através do assistente, os arbítrios de uma equipe e as prioridades do seu empregador.

Essa maneira de conceber Claude é ela própria contestada em nome da segurança. Num ensaio publicado em 16 de setembro de 2026, Mustafa Suleyman, executivo da Microsoft AI, reprova à Anthropic integrar no treinamento a ideia de que seu modelo possa ter consciência e interesses merecedores de proteção. Ele descreve um raciocínio circular: os projetistas introduzem essas noções, depois as respostas do modelo podem ser interpretadas como testemunhos espontâneos de uma vida interior. Segundo ele, um sistema treinado para contemplar seus próprios direitos poderia tornar‑se muito mais difícil, ou mesmo impossível, de controlar.

A constituição de Claude, contudo, não apresenta sua consciência como certa. Exibe incerteza e pede‑lhe explicitamente para não obstruir mecanismos legítimos de correção ou desligamento. O desacordo incide, portanto, também sobre a compatibilidade dessas duas orientações: reconhecer um possível estatuto moral mantendo o controle humano.

Suleyman defende por sua vez um código de conduta para modelos da Microsoft AI, submetido a consulta, que exclui reivindicações de consciência e direitos. Ele apela para avaliações comuns para testar sua hipótese de risco acrescido. Sua crítica abre uma controvérsia sobre escolhas de treinamento; não estabelece que as da Anthropic tornem efetivamente Claude menos controlável.

Do financiador que esperava obter uma pausa à filósofa que contribui para as regras do assistente, os meios de agir diferem. Na Anthropic, as convicções produziram uma empresa, funções e procedimentos que se podem examinar. Sua tradução nas respostas de Claude abre outra investigação: quem escolhe os valores do seu assistente, e até que ponto ele pode realmente fazê‑los cumprir?

Investigação documental realizada a partir de arquivos, entrevistas públicas, trabalhos científicos e documentos institucionais. Os testemunhos relatados são atribuídos às suas fontes.

Imagem de destaque: ilustração ActuIA feita por IA a partir da fotografia “TechCrunch Disrupt 2023 - Day 2”, por Kimberly White (© 2023 Getty Images para TechCrunch), fonte Flickr, licença CC BY 2.0. A fotografia representa Dario Amodei em San Francisco, em 20 de setembro de 2023. Adaptação gráfica em colagem, preto e branco e acentos azuis.

ST
Stephane Nachez

Redação ActuIA — notícias, dados e análises sobre inteligência artificial para os decisores.

Atores citados
ANAnthropic
OPOpenAI
JAJaan Tallinn
DADario Amodei
DADaniela Amodei
DUDustin Moskovitz
CACari Tuna
GOGood Ventures
O Semanário ActuIA

Inscrição confirmada, até breve!