llama.cpp lève un verrou de son attention flash sur processeur et encode jusqu'à 8,28 fois plus vite les images de Qwen3-VL
Le 28 septembre 2026, le projet llama.cpp a fusionné une modification de son noyau d'attention flash pour processeur, qui n'acceptait jusqu'ici que des têtes dont la dimension est un multiple de la… Lire la brève