ICML 2026 récompense deux papiers sur les modèles de diffusion, dont un qui remet en cause leur atout central
Le 5 juillet 2026, en ouverture d'ICML 2026 à Seoul, le comité de sélection de la conférence a annoncé ses Outstanding Paper Awards. Le premier, "The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models" (Zanlin Ni, Gao Huang et coauteurs, Tsinghua University), montre que la génération en ordre arbitraire des modèles de diffusion (dLLMs) - leur principal atout revendiqué face aux LLM autorégressifs classiques - peut en réalité brider leur potentiel de raisonnement sur des tâches de mathématiques et de code : les modèles exploitent cette flexibilité pour contourner les tokens les plus incertains, provoquant un effondrement prématuré de l'exploration des solutions. Les auteurs proposent JustGRPO, une méthode d'entraînement par renforcement qui entraîne les dLLMs de façon quasi autorégressive tout en conservant une inférence parallèle efficace. Le second prix récompense "High-Accuracy Sampling for Diffusion Models and Log-Concave Distributions" (Fan Chen, Sinho Chewi, Constantinos Daskalakis, Alexander Rakhlin). Le Test of Time Award est revenu à "Asynchronous Methods for Deep Reinforcement Learning" (Volodymyr Mnih, David Silver, Koray Kavukcuoglu et coauteurs, DeepMind, 2016).

