Uno de sus primeros inversores quería orientar la IA hacia mayor prudencia. Dos años después de la creación de Anthropic, consideró su estrategia de inversión un fracaso. Detrás de Claude, las convicciones de los fundadores, sin embargo, han moldeado las contrataciones, la gobernanza y el producto. Pero, ¿quién puede imponer una elección cuando la misión choca con las exigencias del crecimiento?
En abril de 2023, Jaan Tallinn tiene una razón muy concreta para estar decepcionado. El cofundador de Skype financió laboratorios de inteligencia artificial, entre ellos Anthropic, con la esperanza de influir en su prudencia. Sin embargo, la empresa no firmó el llamamiento para suspender durante seis meses el entrenamiento de los sistemas más potentes. La iniciativa provenía, entre otros, del Future of Life Institute, que él mismo cofundo.
“Plan A failed”, confiesa a Semafor. El plan A fracasó. Anthropic responde que no firma peticiones por principio. Tallinn sigue, no obstante, considerándola más atenta a la seguridad que otros laboratorios que conoce. Este desacuerdo, reportado el 28 de abril de 2023, se resume en pocas líneas: compartir una preocupación, financiar a quienes la toman en serio y obtener una decisión son tres cosas distintas.
Esta dificultad atraviesa la historia de Anthropic. La empresa ha dado a las preocupaciones de seguridad un lugar en su investigación y luego en sus normas de gobernanza. También ha reclutado, recaudado capital y asumido compromisos industriales que la sitúan en la competición que quería volver menos peligrosa. Para entender sus elecciones, hay que seguir a las personas en el momento en que sus convicciones se convierten en responsabilidades.
Tras OpenAI, construir una organización alrededor de una apuesta
La historia comienza en otra organización. En diciembre de 2015, Sam Altman y Elon Musk presentan OpenAI como un organismo de investigación sin fines de lucro. El beneficio colectivo de la IA ya figura en el anuncio fundacional, conservado por Internet Archive. Esta ambición precede, por tanto, a Anthropic y a la competencia entre ambas empresas. Los Amodei trabajaron en OpenAI antes de salir para crear su propio laboratorio, a inicios de 2021.
La prudencia de Amodei ya se había traducido en una restricción concreta. El 14 de febrero de 2019, en OpenAI, cofirma el anuncio que justifica no publicar de inmediato la versión más potente de GPT-2, en nombre de los riesgos de uso malintencionado. Se difundió una versión reducida; el modelo completo se hizo accesible el 5 de noviembre siguiente, tras una publicación por etapas. Amodei apoyó públicamente una decisión colectiva de difusión restringida, casi dos años antes de cofundar Anthropic. Desarrollar un modelo, evaluar sus peligros y decidir quién puede acceder a él ya formaban parte del mismo arbitraje.
Para reunirse, los siete fundadores de Anthropic tuvieron entonces que arreglárselas con la pandemia. Se encontraban al aire libre, a veces en un jardín, con mascarilla y distanciados. Daniela Amodei relatará esos comienzos en una entrevista para el Future of Life Institute, publicada en marzo de 2022. El grupo ya se conocía y quería reunir investigación sobre las capacidades de los modelos y investigación sobre su seguridad en una misma organización.
En ella, Dario Amodei explica la separación: su apuesta existía previamente dentro de una estructura más amplia; ahora querían una empresa que pudiera orientar todas sus decisiones estratégicas alrededor de esa apuesta. En ese relato de los fundadores, la ruptura de 2021 radica en la posibilidad de elegir una dirección común y dedicarle toda la organización.
El hermano y la hermana no aportan las mismas competencias. Dario, el director general, viene de la física y las neurociencias. Daniela, la presidenta, estudió literatura con una asignatura secundaria en política en UC Santa Cruz. En la entrevista de 2022 recuerda también un recorrido por ONG y la política en Washington. Sus inquietudes morales no comienzan con Claude: en 2003, el periódico estudiantil de Caltech ya describía el compromiso de Dario contra la guerra en Irak y sus preocupaciones sobre la responsabilidad de los científicos.
Esta cercanía tiene efectos muy cotidianos. Preguntada en julio de 2023 sobre el número de físicos en el equipo, Daniela reconoce la importancia de sus redes. Para hacer crecer el grupo hay luego que celebrar reuniones, reclutar y tomar decisiones. Ella cuenta que intenta preservar algunas horas de reflexión al inicio del día y conocer a los nuevos empleados, ejercicio que se ha vuelto más difícil con el crecimiento. En esta entrevista publicada por Stripe, socio comercial de Anthropic, la misión también se traduce en el trabajo de una dirigente que busca conservar una cultura común cuando la plantilla aumenta.
Cómo entra la filantropía en el laboratorio
Hace falta dinero para transformar este grupo en empresa. La primera ronda anunciada, en mayo de 2021, aporta 124 millones de dólares. Jaan Tallinn la lidera; Dustin Moskovitz, cofundador de Facebook, forma parte de los inversores. Sus nombres figuran en el anuncio de este financiamiento.
Parte de este círculo comparte una pregunta: con recursos limitados, ¿cómo hacer el mayor bien posible? El altruismo efectivo propone comparar intervenciones, sus costes y sus efectos. Según las personas, conduce a apoyar la salud pública, la protección animal o la prevención de riesgos catastróficos. El longtermismo pone más específicamente la atención en el destino de las generaciones futuras. Ambos enfoques se solapan, sin ofrecer una respuesta única a la cuestión de la IA.
Open Philanthropy se inscribe explícitamente en este movimiento. En septiembre de 2016, su cofundador Holden Karnofsky se declara miembro de esta comunidad y la describe como el grupo de pares más natural para la organización. También explica que su interés creciente por los riesgos de la IA contribuyó a reorientar las prioridades de la organización. Esta cercanía se traduce en financiamientos: el informe de 2021 menciona el apoyo al desarrollo de la comunidad del altruismo efectivo. Convicciones personales, interlocutores y asignación de recursos se encuentran aquí en el relato de los propios dirigentes.
Moskovitz y su esposa Cari Tuna se interesan también por intervenciones de efectos más inmediatos. En su relato publicado por Good Ventures, una conversación con Holden Karnofsky sobre deficiencias de yodo ilustra el descubrimiento de intervenciones poco conocidas capaces de mejorar muchas vidas. Tuna, experiodista, se dedica a esa exploración filantrópica. Sus financiaciones irán también a la prevención de pandemias y a riesgos relacionados con la IA avanzada.
Karnofsky es uno de los que da a esta prioridad su razonamiento más ambicioso. En su serie “Most Important Century”, contempla un siglo XXI en el que las IA acelerarían la investigación hasta modificar de forma duradera la trayectoria de la humanidad. Incluso explora la posibilidad de civilizaciones digitales. Son hipótesis que considera lo bastante importantes como para movilizar esfuerzos, reconociendo su incertidumbre. El desplazamiento es considerable: conduce a sopesar beneficios observables hoy y futuros cuya probabilidad y forma no son consensuadas.
Esta reflexión termina por cambiar su oficio. En 2023 deja la codirección de Open Philanthropy para centrarse en la seguridad de la IA; la organización continúa con sus otros programas. Su informe anual describe este relevo. En 2025 adoptará el nombre de Coefficient Giving.
Karnofsky es además el esposo de Daniela Amodei, vínculo que él mismo declara en un informe publicado por Carnegie. Su trabajo permite seguir con más precisión su influencia: es coautor de un informe de Anthropic sobre los riesgos de sabotaje, en octubre de 2025, y luego contribuye a la constitución de Claude. Una reflexión desarrollada en la filantropía se encuentra así en trabajos y textos empleados por el laboratorio.
En Anthropic, la misión también pasa por el consejo
Tallinn había buscado otro modo de actuar. En lugar de sentarse él mismo en el consejo de Anthropic, propuso a Luke Muehlhauser, investigador en seguridad de la IA y responsable de financiaciones en Open Philanthropy. Lo cuenta en la entrevista en Semafor.
El 28 de mayo de 2024, sin embargo, Muehlhauser abandona ese consejo. Su explicación es concreta: financiar organizaciones que trabajan, entre otras cosas, en la política estadounidense de la IA resulta difícil de conciliar con un mandato en un laboratorio estadounidense directamente afectado por esa política. Precisa que nunca ha poseído acciones de Anthropic y descarta una dimisión por protesta sobre la seguridad. Su declaración pública muestra el límite de acumular funciones en un mismo ecosistema.
Mientras tanto, Anthropic instaló un mecanismo que supera la elección de un administrador de confianza. Presentado en septiembre de 2023, el Long-Term Benefit Trust posee una categoría particular de acciones que otorgan derechos de nombramiento y destitución al consejo. El dispositivo prevé miembros sin interés financiero en la empresa. El consejo sigue encargado de supervisar a los dirigentes; el Trust nombra a una parte de quienes ejercen esa supervisión. No tiene por vocación intervenir en la gestión cotidiana.
La distinción es esencial: proteger una misión supone aquí poder cambiar a las personas que controlan la dirección. Desde su presentación inicial, sin embargo, el mecanismo permanece modificable, incluso sin el acuerdo de los miembros del Trust si supermayorías accionarias suficientemente grandes lo aceptan. Anthropic lo presenta como una experiencia de gobernanza, con posibilidades de corrección.
Esta construcción tiene ahora un peso real. El 14 de abril de 2026, el nombramiento de Vas Narasimhan, dirigente de Novartis, llevó a que la mayoría del consejo esté compuesta por administradores designados por el Trust. El anuncio de Anthropic lo indica explícitamente. El Trust puede, por tanto, designar la mayoría de los administradores. Las decisiones internas, las votaciones y los compromisos no se hacen públicos. Se conoce el mecanismo de control; no se le puede atribuir cada arbitraje de la empresa.
El 16 de septiembre de 2026, en el anfiteatro Émile Boutmy de Sciences Po, Yann LeCun cuestiona con dureza las convicciones de este entorno. El presidente ejecutivo de AMI vincula Open Philanthropy con la corriente del altruismo efectivo, que equipara a “una especie de secta religiosa”, antes de mencionar, entre otros, a Dustin Moskovitz y Jaan Tallinn. Estos dos nombres figuran entre los inversores de la primera ronda anunciada por Anthropic en 2021. Su intervención ataca la idea de que un pequeño grupo, convencido de deber salvar a la humanidad, tenga especial legitimidad para decidir el acceso a la IA.
LeCun también vuelve al precedente de GPT-2, cuyas precauciones considera excesivas, y apunta directamente a Dario Amodei. Le atribuye la voluntad de “capturar el mercado mediante la regulación”: según él, los discursos sobre el riesgo existencial servirían para convencer a los gobiernos de restringir los modelos abiertos, en beneficio de los laboratorios que mantienen el control de sus sistemas. Así vincula una convicción moral declarada con un supuesto interés comercial. Es la acusación que formula contra Anthropic; los vínculos personales y financieros descritos aquí no bastan para demostrar esa intención.
La controversia ilumina un límite del dispositivo de gobernanza. El Trust organiza una supervisión interna de la empresa; no da a los usuarios el poder de designar a sus miembros. Busca proteger una misión definida por Anthropic, mientras LeCun cuestiona la legitimidad de un grupo privado para fijar las condiciones de acceso a una tecnología destinada a todos. Su desacuerdo versa tanto sobre la distribución del poder como sobre la probabilidad de una catástrofe.
Desarrollar capacidades cuyos efectos se temen
Permanecen las decisiones que sitúan a Anthropic en el corazón de la carrera industrial. En marzo de 2023, la empresa expone por qué quiere trabajar en los modelos más avanzados: según ella, sus riesgos no pueden estudiarse adecuadamente a partir de sistemas mucho menos potentes. Su estrategia de seguridad implica, por tanto, construir las capacidades que le preocupan. En el mismo texto, Anthropic reconoce el riesgo de que una investigación motivada por la seguridad acelere el despliegue de tecnologías peligrosas. También teme que un exceso de prudencia aleje a los investigadores más atentos a esos riesgos de los sistemas más avanzados. Este dilema se explicita desde 2023.
Daniela defiende además una convergencia comercial. En julio de 2023 explica a Stripe que los clientes buscan modelos fiables: la prudencia puede sostener las ventas. No obstante reconoce que misión e interés económico a veces pueden entrar en conflicto. Esta tensión está inscrita en el proyecto desde los primeros años de comercialización de Claude, antes de los compromisos industriales actuales.
El 20 de abril de 2026, Anthropic anuncia así su compromiso de gastar más de 100.000 millones de dólares en tecnologías AWS durante diez años, para obtener hasta 5 gigavatios de capacidad adicional. El acuerdo con Amazon da una escala material a su ambición. Estos compromisos plantean también la cuestión del coste económico de una pausa en el aumento de capacidades. Amodei debe convencer de que su empresa sabrá ralentizar si el riesgo lo exige, a la vez que le da los medios para seguir entre los laboratorios más potentes. Ambos objetivos pueden coincidir mientras las protecciones progresen. Su compatibilidad se vuelve más incierta si la seguridad exige dejar que un competidor tome ventaja.
Los archivos de su política de seguridad muestran otro cambio. En septiembre de 2023, Anthropic prevé una pausa si las protecciones no siguen a las capacidades. Una nota de esa primera versión excluye a los modelos peligrosos de la competencia de las razones que permiten bajar sus exigencias. El documento, no obstante, reserva una excepción de emergencia extrema.
Desde octubre de 2024, la nota 18 de la versión siguiente abre una posibilidad más amplia: si otro actor supera un umbral de capacidades sin protecciones comparables y crea un riesgo serio, Anthropic podría reducir las protecciones requeridas, estimando limitado su propio riesgo adicional. En tal caso debería reconocer públicamente el riesgo y abogar por una intervención regulatoria estadounidense.
La versión en vigor desde el 8 de julio de 2026 conserva compromisos de diferir ciertos desarrollos, pero los articula con el avance de Anthropic y las garantías de sus competidores. Cuando el cálculo del riesgo adicional creado por Anthropic pesa fuertemente en una decisión de proseguir, exige la aprobación del consejo y del Trust sobre el informe de riesgos. El control de la misión sigue organizado; las condiciones en las que se ejercita evolucionan.
Anthropic justifica esta reorganización por la incertidumbre de las evaluaciones, la lentitud de la acción pública y la dificultad de asegurar solo ciertas protecciones. La comparación de los textos muestra cómo la competencia entra en las condiciones de la promesa de seguridad. No establece que la empresa haya usado efectivamente la excepción.
Amanda Askell: ¿hasta dónde proteger al usuario de sí mismo?
Un usuario quiere dejar el juego de apuestas. Más tarde le pide a su asistente que le recomiende sitios de apuestas. ¿Qué debería responder Claude? En una entrevista publicada por Fast Company el 22 de enero de 2026, Amanda Askell propone este caso hipotético. Imagina que el asistente recuerda el objetivo previo y luego se pregunta qué respuesta dar si el adulto insiste. Ayudar, proteger y respetar la autonomía se convierten en tres exigencias difíciles de conciliar. La filósofa revela la vacilación detrás de un comportamiento que el usuario podría tomar por una obviedad técnica.
Este tipo de arbitraje ocupa hoy a una investigadora formada en problemas mucho más abstractos. Askell estudió filosofía en Dundee, Oxford y luego en New York University, donde obtuvo su doctorado en 2018. Su CV sitúa después su paso por OpenAI de 2018 a 2021, antes de Anthropic. Su tesis sobre la ética en mundos infinitos examina cómo comparar mundos poblados por una infinidad de seres cuyo bienestar varía. Defiende en particular un principio: a población idéntica, mejorar la suerte de algunos sin empeorar la de otros debe contarse como una mejora. A escala del infinito, articular este principio con otras exigencias de coherencia plantea dificultades formidables.
En Anthropic, esta filósofa se convierte en la autora principal de la constitución de Claude publicada en 2026. El texto especifica que ella escribió la mayor parte, con varios colaboradores, entre ellos Karnofsky. Su primer destinatario es el propio modelo. Anthropic le habla de juicio, de sabiduría y de virtudes, con la ambición de que aplique valores en situaciones que los diseñadores no han previsto todas.
En la entrevista, Askell compara esta ambición con la confianza depositada en el juicio de un profesional, más que con la ejecución de una lista de consignas. Describe también la fabricación de situaciones sintéticas y comparaciones de respuestas para el entrenamiento. Cualidades aparentemente consensuales, como la honestidad o la prudencia, deben así adquirir sentido en miles de conversaciones posibles. ¿Hasta dónde ayudar? ¿Cómo expresar un desacuerdo sin imponer una moral?
Esta función da a Askell una influencia directa en la relación propuesta al usuario. El documento expone las intenciones de Anthropic, que reconoce que el comportamiento de Claude puede desviarse. El texto sigue siendo revisable por la empresa. La persona que pide consejo se encuentra, por tanto, también a través del asistente con los arbitrajes de un equipo y las prioridades de su empleador.
Esta manera de concebir a Claude es a su vez contestada en nombre de la seguridad. En un ensayo publicado el 16 de septiembre de 2026, Mustafa Suleyman, director general de Microsoft AI, reprocha a Anthropic haber integrado en el entrenamiento la idea de que su modelo podría tener conciencia e intereses merecedores de protección. Describe un razonamiento circular: los diseñadores introducen esas nociones y luego las respuestas del modelo corren el riesgo de interpretarse como testimonios espontáneos de una vida interior. Según él, un sistema entrenado para considerar sus propios derechos podría volverse mucho más difícil, incluso imposible, de controlar.
La constitución de Claude, no obstante, no presenta su conciencia como algo asumido. Expone una incertidumbre y le pide explícitamente que no obstruya los mecanismos legítimos de corrección o parada. El desacuerdo versa, por tanto, también sobre la compatibilidad de estas dos orientaciones: reconocer un posible estatus moral y, al mismo tiempo, mantener el control humano.
Suleyman propone por su parte un código de conducta para los modelos de Microsoft AI, sometido a consulta, que descarta las reclamaciones de conciencia y derechos. Pide evaluaciones comunes para probar su hipótesis de un riesgo incrementado. Su crítica abre una controversia sobre las decisiones de entrenamiento; no establece que las de Anthropic hagan efectivamente a Claude menos controlable.
Del financiador que esperaba obtener una pausa a la filósofa que contribuye a las reglas del asistente, los medios de acción son distintos. En Anthropic, las convicciones han producido una empresa, funciones y procedimientos que se pueden examinar. Su traducción en las respuestas de Claude abre otra investigación: ¿quién elige los valores de su asistente y hasta dónde puede realmente hacerlos respetar?
Investigación documental realizada a partir de archivos, entrevistas públicas, trabajos científicos y documentos institucionales. Los testimonios citados se atribuyen a su fuente.
Visual de portada: ilustración de ActuIA realizada por IA a partir de la fotografía “TechCrunch Disrupt 2023 - Day 2”, por Kimberly White (© 2023 Getty Images para TechCrunch), fuente Flickr, licencia CC BY 2.0. La fotografía representa a Dario Amodei en San Francisco, el 20 de septiembre de 2023. Adaptación gráfica en collage, blanco y negro y acentos azules.
