Z.ai attribue à un agent GLM-5.3 l'essentiel de la construction de sa pile d'inférence, portée en production en moins de deux semaines
Le 17 septembre 2026, Z.ai a publié un billet technique décrivant comment son propre modèle GLM-5.3 a pris en charge une large part de la construction du service d'inférence qui fait tourner GLM-5.3-Flash. Ce service s'appuie sur un cluster de plus de 100 000 accélérateurs d'IA de conception chinoise, une échelle que l'entreprise présente comme inédite. Z.ai énumère les optimisations retenues : quantification W8A8, cache en précision mixte INT8/FP8/BF16, parallélisme tensoriel intra-noeud, découpage de couches et architecture désagrégée Encode-Prefill-Decode. L'essentiel du travail a été mené par un « Infra Agent » adossé à GLM-5.3. L'entreprise chiffre à environ trois fois le gain de performance de bout en bout, et à moins de deux semaines le délai entre le premier lancement réussi et la mise en production. Testé anonymement sous le nom Ox-Alpha, GLM-5.3-Flash a traité plus de 62 000 milliards de jetons en six jours sur OpenCode et OpenRouter.



