MIT : les juges LLM classent bien les réponses mais en jugent acceptables de 3 % à 98 %, contre 61 % chez les travailleurs
Le 1er octobre 2026, Harry Lyu et Neil Thompson, du Massachusetts Institute of Technology, ont déposé sur arXiv « Right Order, Wrong Scale », un audit des LLM utilisés comme juges pour dire si des… Lire la brève