τ^τ-bench de Sierra et Princeton : Claude Opus 5 sous Claude Code réussit 23,9 % des simulations en construisant un agent de service client
Le 4 septembre 2026, quatre chercheurs de Sierra et de l'université de Princeton ont publié sur arXiv τ^τ-bench, un banc d'essai qui fait de la construction d'un agent la tâche évaluée. L'agent développeur reçoit les dossiers réels d'une entreprise, un client porteur des exigences, une API de production, une base de code à reprendre et des limites de coût de service, puis doit livrer un agent de service client complet, noté face à des utilisateurs simulés inédits. Les auteurs relèvent des requêtes superficielles, une communication presque nulle avec le client et peu d'essais d'architecture ; ils ont réécrit les domaines aérien et commerce de détail hérités de τ-bench pour limiter la contamination. Sur 53 tâches réparties dans quatre domaines, la meilleure configuration mesurée, Claude Opus 5 sous Claude Code, réussit 23,9 % des simulations, contre 82,2 % pour une implémentation de référence écrite par des experts.




