slime 0.4.0, cadre d'apprentissage par renforcement derrière les modèles GLM, distribue ses rollouts sur la grappe et relance l'entraînement sans arrêter SGLang
Le 9 octobre 2026, l'équipe de slime, cadre de post-entraînement par apprentissage par renforcement qui combine Megatron et SGLang et a servi aux modèles GLM de Z.ai, a publié la version 0.4.0. Les modes synchrone et entièrement asynchrone passent par un même script, train.py. Avec la nouvelle bibliothèque straw, qui fournit des files persistantes et un stockage de tenseurs sur système de fichiers partagé, l'orchestration des rollouts tourne avec un worker par nœud Ray, et les tâches, rollouts partiels et lots convertis survivent à une panne. Après un échec, l'entraînement Megatron peut être relancé sur la même grappe Ray sans couper les moteurs SGLang en service. L'équipe cite en préambule l'effort Navier-Stokes d'OpenAI, environ 10 000 agents simultanés et 130 milliards de tokens de sortie. La version intègre aussi les accélérateurs Biren et Ascend.