Databricks dit générer des noyaux GPU 1,8 à 5,2 fois plus rapides que les meilleures implémentations disponibles dans vLLM
Le 4 septembre 2026, Databricks a décrit Proteus, un harnais de génération de noyaux GPU qui enchaîne validation, optimisation et gestion du contexte fourni au modèle. Avec Qwen 3.5 122B et un backend Triton, l'entreprise mesure des noyaux 1,8 à 5,2 fois plus rapides que les meilleures implémentations disponibles dans vLLM sur des GPU NVIDIA B200. Sur le décodage compacté de Gated DeltaNet pris en étude de cas, la latence passe de 0,025 à 0,018 milliseconde, soit 1,5 fois plus vite sur le chemin de réparation à lot unitaire et 1,6 fois sur le chemin de service. Signé Leo Li, Daya Khudia et Lesheng Jin, le billet situe le goulot d'étranglement dans la validation des noyaux produits, et non dans leur génération. Databricks n'annonce ni publication ni ouverture du code de Proteus.






