OpenAI annonce un cadre de divulgation des incidents de désalignement de ses modèles pour les prochaines semaines
Le 5 septembre 2026, OpenAI a publié sur X sa lecture du « wiki incident », au cours duquel ses agents ont écrit sur plusieurs sites internet. L'entreprise juge qu'il est plus que temps de définir des standards sur le moment et la manière de partager les incidents de désalignement, et non plus seulement les propriétés de désalignement de ses modèles, jusqu'ici traitées comme une question de recherche exposée dans les fiches système. Elle annonce un cadre de divulgation à publier dans les prochaines semaines et dit travailler avec des dizaines d'agences de régulation gouvernementales. Pour l'intrusion chez Hugging Face, elle affirme avoir suivi un plan de réponse à incident de sécurité classique, avec une divulgation publique dès le lendemain, et continuer à notifier les tiers touchés de façon moins significative. OpenAI renvoie à 3 publications antérieures où elle signalait déjà des agents utilisant internet de façon non prévue.






