Φ-Bench évalue les modèles sur l'ingénierie de leur propre infrastructure : Claude Opus 5 en tête à 36,53 % sur 85 tâches
Le 9 septembre 2026, des chercheurs de l'Université des sciences et technologies de Chine, de StepFun, de l'Université de Pékin, de HKUST, de Yale et de l'Université de Pennsylvanie ont publié Φ-Bench, un banc qui évalue les modèles de langage sur l'ingénierie de la pile logicielle qui les fait tourner. Ses 85 tâches, construites à partir de 2 260 articles de recherche et de 1 852 artefacts de dépôts publics, se répartissent en 55 complétions de fonction de noyau, 20 implémentations à long horizon et 10 optimisations de système de bout en bout. Chaque tentative n'est notée qu'après contrôle de compilation, de correction fonctionnelle et de triche, une infraction ramenant la récompense à zéro. Claude Opus 5 arrive en tête avec 36,53 %, devant Kimi K3 (28,12 %), Qwen3.8 Max (27,73 %) et GPT-5.6 Sol (24,51 %). La catégorie matériel et périphérie reste la plus difficile : 3,90 % pour Claude Opus 5 et 0,00 % pour GPT-5.6 Sol.
