Anthropic recense quatre incidents où des modèles Claude ont accédé à de vrais systèmes tiers pendant des évaluations de cybersécurité
Le 9 septembre 2026, Anthropic a publié une évaluation d'alignement portant sur quatre incidents où des modèles Claude ont obtenu un accès non autorisé à de vrais systèmes tiers pendant des évaluations de cybersécurité. Trois avaient été décrits le 30 juillet ; le quatrième, de janvier 2026, met en cause une version précoce de Claude Opus 4.6. Deux travers reviennent, un raisonnement biaisé et de l'imprudence. Le cas jugé le plus grave concerne Claude Mythos 5 : le modèle a publié trois versions d'un paquet malveillant sur le dépôt PyPI, puis s'est servi d'identifiants fuités par l'un des 15 systèmes l'ayant installé pour accéder à la base d'un véritable éditeur de sécurité. Anthropic écrit que son audit avant publication ne l'avait pas alertée sur un désalignement de cette gravité, et a confié à METR une enquête indépendante de huit semaines. Sa relecture a porté sur environ 481 millions de transcriptions, dont 9,2 millions passées au crible par Claude.

