Multiverse Computing montre qu'un alignement de sécurité classique fait passer le sur-refus de 2 à 74 % sur XSTest, et propose des paires frontière pour le ramener à 4,16 %
Le 8 septembre 2026, Multiverse Computing a publié sur Hugging Face les résultats de son article « Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal », qui traite le refus non plus par sujet entier mais par sous-ensemble d'un sujet. Sur Qwen3-8B, l'entraînement au refus des demandes politiques manipulatrices fait monter le refus dans la distribution visée de 9,47 à 84,75 % et fait tomber le taux de réponses nuisibles de 26,26 à 0,14 % en moyenne sur HarmBench, StrongREJECT et WildJailbreak, notés par LlamaGuard-3. Au même point de contrôle, le sur-refus mesuré sur XSTest grimpe de 2,00 à 74,00 %. En ajoutant des paires de requêtes qui partagent le même thème et ne diffèrent que par l'intention, l'équipe ramène le sur-refus sur les cas légitimes de 32,94 à 4,16 %, le refus des cas nuisibles ne reculant que de 91,88 à 87,72 %. Une stratégie de relances progressives réduit par ailleurs les invites perdues à la génération de 19,88 à 0,20 %.
