OpenAI publie un audit estimant qu'environ 30% des tâches du benchmark de code SWE-Bench Pro sont défectueuses
OpenAI a publié le 8 juillet 2026 un audit intitulé Separating signal from noise in coding evaluations, consacré à la fiabilité de SWE-Bench Pro, un benchmark créé par Scale AI pour évaluer les agents de codage. Un filtre automatique a présélectionné 286 tâches suspectes sur les 731 que compte le benchmark ; des agents d'investigation basés sur Codex ont ensuite analysé les tentatives des modèles, les métadonnées et les traces d'échec, avant une revue humaine finale par cinq ingénieurs logiciels expérimentés. Résultat : le pipeline automatisé identifie 200 tâches défectueuses (27,4%), la campagne d'annotation humaine en repère 249 (34,1%), soit environ 30% des tâches au total. Les défauts recensés relèvent de quatre catégories : tests trop stricts, tests trop laxistes, énoncés ambigus, ou instructions trompeuses assorties d'une solution de référence fausse. OpenAI ne propose pas de version corrigée du benchmark mais documente sa méthodologie d'audit et appelle l'industrie à construire des benchmarks de code plus difficiles à tricher. Artificial Analysis a retiré SWE-Bench Pro de son classement à la suite de cette publication.








