SGLang 0.5.19 ajoute la recherche en faisceau et mesure jusqu'à 1,52 fois plus de débit sur les GPU AMD MI355X
Le 5 septembre 2026, le projet SGLang a publié la version 0.5.19 de son moteur de service d'inférence, qui rassemble 786 propositions de fusion de 214 contributeurs. Le moteur accepte désormais un paramètre beam_width et renvoie les n meilleures séquences au lieu d'un seul échantillon, sans compatibilité pour l'instant avec le décodage spéculatif ni la désagrégation. Un noyau d'attention persistant pour MI300X et MI355X est crédité d'un débit jusqu'à 1,52 fois supérieur et d'une latence entre tokens jusqu'à 3,62 fois inférieure sur MI355X. Le parallélisme de séquence sur la normalisation retire 3,5 % du temps de préremplissage de Qwen3-8B sur H100 et 5,6 % sur B200, et la quantification en FP8 des activations des experts MXFP4 sur Hopper apporte environ 12 % de débit de sortie sur DeepSeek-V4-Flash sans perte sur GSM8K.