Entreprise

GPT-5

20 actualités

Dernières brèves

Publication scientifique

Mozilla chiffre à 4,4 mois le retard des modèles à poids ouverts, trois points derrière le leader fermé sur l'index d'Artificial Analysis

Le 15 septembre 2026, Mozilla a publié la version 1.1 de son rapport The State of Open Source AI. En ajustant les données de METR, elle mesure un retard d'environ 4,4 mois entre la frontière à poids ouverts et la frontière fermée, soit un rapport de 1,74 sur la longueur des tâches qu'un modèle mène à bien avec 50 % de réussite ; Epoch AI aboutit de son côté à quatre mois. Sur l'index d'intelligence v4.1.1 d'Artificial Analysis arrêté au 1er septembre, les quatre premiers sont fermés : Claude Opus 5 à 63, Claude Fable 5 à 62, GPT-5.6 Sol et Grok 4.6 à 61. Les quatre suivants sont à poids ouverts, Kimi K3 de Moonshot et GLM-5.3 de Z.ai à 60. Sur seize sorties ouvertes recensées, aucune ne fournit la recette de données exigée par la définition de l'Open Source Initiative.

Nouveau modèle

Real-SWE, banc d'essai sur bases de code privées d'entreprises, place Fable 5.1 en tête avec 38,8 % de tâches résolues

Le 12 septembre 2026, Specific Labs a publié Real-SWE, un banc d'essai qui évalue les modèles d'IA sur des bases de code privées de production, concédées sous licence par les entreprises qui les exploitent. Signé Snagnik Das, Siddhant Paliwal et Janak Sunil, il mesure des couples modèle et harnais plutôt que des modèles isolés. Fable 5.1 avec Claude Code arrive en tête avec 38,8 % de tâches résolues, devant GPT-6 Astra avec Codex CLI à 33,8 %, Gemini 3.8 Flash avec Gemini CLI à 31,2 %, GLM 5.3 avec Claude Code à 28,8 %, Grok 4.6 avec Grok Build et Muse Spark 1.3 avec Muse Code à 23,8 %, Kimi K3 avec Kimi Code à 18,8 % et GPT-5.6 Sol avec Codex CLI à 16,2 %. Le taux de résolution correspond au pass@1 moyenné sur huit exécutions indépendantes par tâche. Les auteurs indiquent qu'une consigne type compte 1 742 caractères et qu'une tâche touche onze fichiers en valeur médiane, contre six pour FrontierCode et DeepSWE. Les bases retenues incluent une plateforme événementielle revendiquant plus de 200 000 utilisateurs.

Source : Specific Labs
Ranger dans…
Enregistré. Ajouter une note ?
Norme / standard / certification

Le Midas Project accuse OpenAI d'ignorer dans ses fiches système le cadre de sûreté déposé au titre de la loi californienne SB 53

Le 10 septembre 2026, l'association américaine The Midas Project a publié une analyse concluant qu'OpenAI n'applique pas le Frontier Governance Framework, le cadre de sûreté qu'il a désigné en mai 2026 comme document de référence au titre de la loi californienne SB 53, dite Transparency in Frontier AI Act. Les fiches système de GPT-5.6 Preview, GPT-5.6 et GPT-6 Astra renvoient toutes au Preparedness Framework, sans jamais citer le cadre légalement opposable. L'écart porte surtout sur la catégorie de perte de contrôle, absente du Preparedness Framework alors que SB 53 range dans le risque catastrophique le fait pour un modèle d'échapper au contrôle de son développeur ou de son utilisateur. L'association relève qu'Anthropic, lui, nomme son Frontier Compliance Framework et énonce un palier par catégorie dans la fiche système de Claude Fable 5.1 et Mythos 5.1.

Source : The Midas Project
Ranger dans…
Enregistré. Ajouter une note ?
Nouveau modèle

Φ-Bench évalue les modèles sur l'ingénierie de leur propre infrastructure : Claude Opus 5 en tête à 36,53 % sur 85 tâches

Le 9 septembre 2026, des chercheurs de l'Université des sciences et technologies de Chine, de StepFun, de l'Université de Pékin, de HKUST, de Yale et de l'Université de Pennsylvanie ont publié Φ-Bench, un banc qui évalue les modèles de langage sur l'ingénierie de la pile logicielle qui les fait tourner. Ses 85 tâches, construites à partir de 2 260 articles de recherche et de 1 852 artefacts de dépôts publics, se répartissent en 55 complétions de fonction de noyau, 20 implémentations à long horizon et 10 optimisations de système de bout en bout. Chaque tentative n'est notée qu'après contrôle de compilation, de correction fonctionnelle et de triche, une infraction ramenant la récompense à zéro. Claude Opus 5 arrive en tête avec 36,53 %, devant Kimi K3 (28,12 %), Qwen3.8 Max (27,73 %) et GPT-5.6 Sol (24,51 %). La catégorie matériel et périphérie reste la plus difficile : 3,90 % pour Claude Opus 5 et 0,00 % pour GPT-5.6 Sol.

Nouveau modèle

OpenAI chiffre GPT-6 Astra à 57,9 % sur Terminal-Bench 4.0 et ajoute des greffons d'entreprise dans ChatGPT Desktop

Le 9 septembre 2026, OpenAI a détaillé le positionnement entreprise de GPT-6 Astra, accessible dans ChatGPT Work, Codex et son interface de programmation. Le modèle atteint 57,9 % sur Terminal-Bench 4.0, contre 37,3 % pour GPT-5.6 Sol et 55,8 % pour Claude Fable 5.1, avec un coût estimé par tâche inférieur d'environ 9 % et 63 % respectivement. Sur les épreuves du Financial Modeling World Cup, Astra les traite par pilotage d'ordinateur environ quatre fois plus vite que le vainqueur humain de la compétition. Sur le banc interne de sûreté du pilotage d'ordinateur d'OpenAI, il produit 89 % de résultats non voulus en moins que GPT-5.6 Sol et 74,7 % de moins que Claude Fable 5.1. De nouveaux contrôles d'administration restreignent les sites et applications de bureau autorisés et encadrent les téléchargements. OpenAI ouvre en parallèle des greffons Oracle Analytics, Power BI, Navan et Avalara dans ChatGPT Desktop.

Source : OpenAI
Ranger dans…
Enregistré. Ajouter une note ?
Lire le profil complet Mis à jour le 4 septembre 2026

modèle d'IA développé par OpenAI

Articles liés

3 au total