lm-evaluation-harness 0.4.13 corrige une fuite des documents évalués dans leurs propres exemples few-shot et prévient que des résultats publiés peuvent bouger
Le 31 août 2026, EleutherAI a publié la version 0.4.13 de lm-evaluation-harness, son harnais d'évaluation de modèles de langage, en avertissant que plusieurs correctifs peuvent déplacer des chiffres déjà publiés. Le tirage des exemples few-shot pouvait retenir le document en cours d'évaluation, et le préfixe de génération était résolu sur ce document plutôt que sur les démonstrations, ce qui insérait la question évaluée dans chaque exemple pour RULER niah_single_1 et deux variantes de HumanEval. Un filtre à choix multiples comptait fausses des réponses correctes lorsqu'un choix en préfixait un plus long, sur BBH movie_recommendation. Les barres d'erreur des groupes non pondérés par la taille étaient jusqu'à trois fois trop étroites. La version ajoute deux backends ONNX Runtime et huit suites de tests, dont LegalBench et ses 19 tâches.









