AWS mesure 40 % de débit de génération en plus sur l'apprentissage par renforcement d'un MoE en portant DeepEP sur EFA
Le 25 septembre 2026, AWS a publié l'architecture qu'il emploie pour le post-entraînement par renforcement des modèles à mélange d'experts sur Amazon EKS, et chiffre à 40 % le gain de débit agrégé de génération des déroulés. La mesure porte sur 48 instances P5en, 16 dédiées à l'entraînement de la politique et 32 à l'inférence, avec un même modèle MoE dit très clairsemé dont ni le nom ni la taille ne sont donnés ; l'architecture est décrite comme montée jusqu'à environ un millier d'accélérateurs. La pile comparée passe d'un socle Slime 0.2.4 sans parallélisme d'experts accéléré par EFA (CUDA 12.9, PyTorch 2.9.1, NCCL 2.27, SGLang 0.5.9) à DeepEP 2.0 sur EFA 1.49 (CUDA 13.0, PyTorch 2.12, NCCL 2.31, SGLang 0.5.17, Miles 0.1.0). Amazon dit avoir porté en amont les primitives de communication de DeepEP sur libfabric, ce qui donne à DeepEP v2 un support EFA natif, quand NCCL 2.31 reprend les dernières optimisations EFA pour les collectifs denses.









