llama.cpp publie sa version 0.6.0 : décodage spéculatif MTP pour Qwen4Exp, environ 1,5 fois plus rapide sur DGX Spark, et nouvelle API de lots
Le 5 octobre 2026, le projet llama.cpp a publié sa version stable 0.6.0. Elle introduit une API de lots étendue, llama_batch_ext, qui mêle jetons et embeddings dans un même lot et transporte les… Lire la brève