Un éditeur peut-il savoir, grâce aux résumés publics prévus par l’AI Act, si son site a servi à entraîner un modèle ? La lecture de 24 documents accessibles au 25 septembre 2026 montre la difficulté. Vingt et un comportent une rubrique consacrée aux noms de domaine moissonnés, mais aucun n’y nomme un site. Les réponses décrivent des catégories de sources, des contenus ou des extensions comme .com. Les trois autres documents, publiés par DeepSeek, ne reprennent pas cette rubrique.
La mise en ligne, le 24 septembre, du dépôt inclusionAI/AI-Transparency sur Hugging Face fournit onze nouveaux documents à comparer. Ils concernent les familles Ling, Ring et Ming d’Ant et suivent le formulaire de la Commission européenne. Le corpus examiné comprend également deux résumés d’OpenAI, un de Mistral AI, un de Z.AI, quatre de ByteDance, deux de MiniMax et trois de DeepSeek. Cette comparaison ciblée ne constitue pas un recensement de tous les résumés disponibles.
Le formulaire demande des domaines identifiables
L’article 53, paragraphe 1, point d), de l’AI Act impose aux fournisseurs de modèles d’IA à usage général de publier un résumé suffisamment détaillé de leurs contenus d’entraînement. Le formulaire de la Commission distingue notamment les jeux de données publics, les données obtenues auprès de tiers et les contenus collectés directement sur internet par le fournisseur ou pour son compte.
Cette dernière catégorie fait l’objet de la section 2.3. Le formulaire y demande une liste de domaines de premier et deuxième niveaux, par exemple exemple.com, correspondant aux 10 % les plus importants de l’ensemble des domaines collectés, classés par volume de contenu extrait. Un seuil adapté est prévu pour les PME. La liste peut être fournie dans un fichier téléchargeable ou par un lien.
La notice évoque une « forme descriptive et synthétisée » afin de tenir compte des secrets d’affaires. Elle rappelle toutefois, dans sa note 16, l’exigence d’une liste de noms de domaine. La FAQ de la Commission présente elle aussi cette liste parmi les informations destinées à aider les titulaires de droits à identifier l’origine des contenus d’entraînement.
Des catégories de sources dans les 21 rubriques
Les onze documents d’Ant emploient la même réponse introductive. Les principaux domaines collectés y sont décrits comme un ensemble de plateformes web, de services d’hébergement de code, de dépôts académiques, de plateformes encyclopédiques et de portails régionaux. Les paragraphes suivants précisent les secteurs, les langues et les zones géographiques couverts. Sept réponses reprennent le même texte ; les quatre autres adaptent notamment les types de contenus mentionnés. Aucune ne fournit de nom de site dans cette rubrique.
Le constat se retrouve dans les résumés de GPT-6 Astra et de GPT-5.5. OpenAI y énumère les mêmes catégories : ressources académiques, techniques, juridiques ou gouvernementales, services de partage de documents, sites communautaires et portails régionaux. La réponse du résumé MiniMax M3 reprend cette formulation. Celle de H3 se limite à indiquer que les sources couvrent un large éventail de domaines et de contenus.
Le résumé de Mistral Large 3 mentionne des sites généralistes, des ressources spécialisées et des domaines gouvernementaux, administratifs ou juridiques. Dans celui de la famille GLM-5, Z.AI ajoute des extensions, dont .com, .org et .net, à des catégories comme l’hébergement de code et les ressources scientifiques. Une extension seule ne permet pas d’identifier un site.
Les quatre résumés de ByteDance examinés couvrent Seed 2.0 Pro, Seedance 2.0, Seedance 2.5 et Seedream 5.0 Pro. Les réponses évoquent soit des secteurs, comme l’éducation et la recherche, soit les sujets représentés dans les contenus, tels que les objets, les personnes et les scènes naturelles. Là encore, aucun domaine identifiable dans la case prévue à cet effet.
DeepSeek ne reprend pas la section sur la collecte en ligne
Les résumés de DeepSeek-V3.1, V3.2 et V4 présentent une autre particularité. Après les données obtenues auprès de tiers, ils passent directement aux données d’utilisateurs. La section consacrée au moissonnage du web et son champ sur les noms de domaine sont absents.
Ces documents décrivent pourtant, dans la partie relative aux réserves de droits, un robot de collecte conçu pour respecter les instructions robots.txt et les autres protocoles applicables, sans contourner les captchas, les paywalls ou les protections par mot de passe. Ils donnent donc des informations sur les règles déclarées de collecte, sans fournir la liste des domaines concernés.
Une limite précise pour les titulaires de droits
Ces résumés apportent d’autres informations exploitables. Le document d’Ant sur Ling-2.0 nomme Ant Spider, précise une période de collecte et cite Common Crawl parmi les jeux de données publics. Les résumés de DeepSeek citent également Stack Exchange. L’absence relevée ici concerne donc la rubrique des domaines collectés directement, et non toute référence à une source dans l’ensemble des documents.
La conséquence est concrète pour un éditeur de presse ou un détenteur de fonds documentaires. Une catégorie telle que les ressources de connaissance générale ne lui permet pas de retrouver son propre domaine. Elle ne permet pas davantage de conclure que celui-ci a été utilisé ou que la collecte était illicite. La comparaison révèle un manque d’information sur ce point précis, sans constituer à elle seule une décision de conformité à l’AI Act.
La notice prévoit un mécanisme complémentaire : les fournisseurs sont invités à répondre, sur une base volontaire, aux titulaires de droits qui souhaitent savoir si des contenus de leurs domaines ont été collectés et utilisés pour l’entraînement. Cette possibilité concerne notamment les domaines absents du résumé. Dans le corpus examiné, aucune des 21 rubriques dédiées ne fournit la liste qui permettrait d’effectuer une première vérification sans solliciter le fournisseur.
