Dernières brèves

Mise à jour de modèle

lm-evaluation-harness 0.4.13 corrige une fuite des documents évalués dans leurs propres exemples few-shot et prévient que des résultats publiés peuvent bouger

Le 31 août 2026, EleutherAI a publié la version 0.4.13 de lm-evaluation-harness, son harnais d'évaluation de modèles de langage, en avertissant que plusieurs correctifs peuvent déplacer des chiffres déjà publiés. Le tirage des exemples few-shot pouvait retenir le document en cours d'évaluation, et le préfixe de génération était résolu sur ce document plutôt que sur les démonstrations, ce qui insérait la question évaluée dans chaque exemple pour RULER niah_single_1 et deux variantes de HumanEval. Un filtre à choix multiples comptait fausses des réponses correctes lorsqu'un choix en préfixait un plus long, sur BBH movie_recommendation. Les barres d'erreur des groupes non pondérés par la taille étaient jusqu'à trois fois trop étroites. La version ajoute deux backends ONNX Runtime et huit suites de tests, dont LegalBench et ses 19 tâches.

Articles liés

16 au total
Nouveau modèle · Pleias

Pleias : des modèles de langages ouverts pour une IA éthique et transparente

06/12
Droit d'auteur · Google

Recherche sur les LLMs : AI2 présente OLMo 2, sa dernière famille de LLMs totalement open source

05/12
Dataset / ressource ouverte · Open Source Initiative

OSAID : l'OSI publie sa définition de l'IA open source

31/10
Droit d'auteur · Stability AI

Droit d'auteur vs. GenAI : une première victoire pour les artistes contre Stability AI, Midjourney et DeviantArt

22/08
Projet de loi / consultation · Parlement européen

L'avenir de l'AI Act en suspens : divergences au sein de l'UE sur la régulation des modèles de fondation

05/12
Partenariat commercial / distribution · FraudGPT

FraudGPT : comment les cybercriminels s'emparent de l'IA générative

04/08
Nouveau modèle · Stability AI

Stability AI annonce le lancement de SDXL 1.0 en open source

02/08
Tribune / opinion · Hugging Face

L'open source à l'épreuve de l'AI ACT : les principaux acteurs de l'open source appellent à plus de soutien des législateurs

31/07
Résultats financiers · Stability AI

Près de 25 millions de dollars en billets convertibles pour la licorne Stability AI

03/07
Nouveau modèle · Stability AI

Stability AI lance StableLM, un nouveau modèle de langage open source

25/04
Nouveau modèle · Stability AI

Stability AI annonce SDXL, le dernier modèle de la suite Stable Diffusion

19/04
Nouveau modèle · Creative Commons

IA générative : Databricks publie la seconde version de son LLM Dolly en open source

14/04