La startup française ZML lance un serveur d'inférence gratuit pour affranchir les LLM open source du verrou Nvidia
La startup parisienne ZML, soutenue par Yann LeCun, a lancé le 8 juillet 2026 ZML/LLMD, un serveur d'inférence gratuit, mais non open source, permettant de faire tourner des modèles de langage open source comme LLaMa, Gemma, Qwen ou Mistral sur des puces Nvidia CUDA, AMD ROCm, Google TPU, Intel oneAPI et Apple Metal. L'objectif affiché est de casser le verrouillage matériel sur Nvidia pour l'inférence. ZML compte une équipe resserrée d'une vingtaine de personnes et des investisseurs notables, dont Solomon Hykes ainsi que les fondateurs de Hugging Face Clément Delangue et Julien Chaumond.