Netflix teste un moteur de classement fondé sur un LLM et ramène son budget de contexte au tiers pour contenir le coût de service
Le 30 juillet 2026, Netflix a décrit GenRec, un moteur de classement de recommandations bâti sur un grand modèle de langage adapté en interne, servi par vLLM en mode prefill-only sur sa pile d'inférence maison. L'entreprise indique avoir ramené le nombre de jetons de contexte à environ un tiers du budget initial sans dégradation notable des métriques de classement hors ligne. Le coût de service étant approximativement proportionnel à la longueur du contexte, elle observe une réduction comparable de ce coût. Les invites sont structurées pour maximiser les préfixes partagés et améliorer la réutilisation du cache. Avec environ quarante fois moins d'exemples étiquetés pour la seconde phase d'apprentissage, GenRec dépasse d'environ 1,6 % le modèle de classement de production sur le rang réciproque moyen. Un test A/B en ligne a couvert environ 10 % du trafic de Netflix pendant près de quatre semaines, sur des surfaces de recommandation calculées par lots.






