Un banc d'essai de Together AI montre que les meilleurs modèles peinent à écrire des noyaux de calcul multi-GPU
Le 23 juin 2026, Together AI a publié ParallelKernelBench, un banc d'essai conçu avec des chercheurs de Stanford, Caltech et UC San Diego pour mesurer la capacité des grands modèles de langage à écrire des noyaux de calcul (kernels) CUDA rapides et corrects pour le multi-GPU, à travers 87 charges de travail réelles. Les résultats sont décevants : en une seule tentative, le meilleur modèle ne produit que 28 solutions correctes sur 87, soit environ 32 %, dont seulement 22 plus rapides que la référence. Avec trois tentatives, le taux de noyaux à la fois corrects et plus rapides plafonne à 31 %. Les modèles testés, dont GPT-5.5, Claude Opus 4.7, Gemini 3 Pro et DeepSeek V4 Pro, produisent fréquemment des noyaux qui compilent mais renvoient des résultats erronés. Ces noyaux étant au coeur de la performance de l'entraînement et de l'inférence, l'étude pointe une limite persistante des modèles sur le code de bas niveau.

