Entreprise

ARC Prize

2 actualités

Dernières brèves

Benchmark / évaluation

ARC Prize mesure GPT-6 Astra à 62,7 % sur ARC-AGI-3 en harnais standard, et à 99,9 % avec l'adaptateur du fournisseur

Le 3 septembre 2026, ARC Prize a publié son évaluation de GPT-6 Astra sur le jeu semi-privé d'ARC-AGI-3. Le modèle obtient 62,7 % en réglage de raisonnement maximal avec le harnais standard, pour un coût total d'évaluation de 26 000 dollars, et 99,9 % avec le harnais dit « Provider Adapter », pour 19 000 dollars. L'écart tient au harnais et non au modèle : le harnais standard ne laisse au modèle que les notes qu'il choisit lui-même de conserver, tandis que l'adaptateur du fournisseur préserve entre deux requêtes un état de raisonnement opaque et compacte les conversations longues. Sur l'efficacité des actions, Astra en a utilisé moins que la référence humaine, établie à partir du nombre médian d'actions des joueurs ayant terminé un niveau, sur 96,0 % des niveaux. ARC Prize y voit « un changement notable, en marche d'escalier, des capacités des modèles de frontière », tout en précisant que saturer ce banc d'essai « ne constituerait pas une preuve d'atteinte de l'AGI ». Le billet ne publie aucune comparaison chiffrée avec d'autres modèles.

Source : ARC Prize
Ranger dans…
Enregistré. Ajouter une note ?
Lire le profil complet Mis à jour le 4 septembre 2026

compétition pour mesurer l'efficience d'un modèle IA

Articles liés

1 au total