Dernières brèves

Nouveau modèle

Upstage publie Solar Open 2, un modèle coréen de 250 milliards de paramètres à attention hybride

Le 22 juillet 2026, la société sud-coréenne Upstage a publié Solar Open 2, un modèle à mélange d'experts de 250 milliards de paramètres dont 15 milliards activés par jeton, que l'éditeur présente comme un modèle de fondation souverain coréen. L'architecture combine 321 experts, dont un partagé, et une attention hybride alternant une couche à softmax et trois couches d'attention linéaire, sans encodage positionnel. La fenêtre de contexte atteint un million de jetons. Upstage revendique 86,2 sur MMLU-Pro et 92,4 sur LiveCodeBench v6, devant DeepSeek-V4-Flash, ainsi qu'une moyenne de 85,4 sur les évaluations en langue coréenne contre 84,9 pour ce dernier. Le rapport technique a été déposé sur arXiv le même jour. La licence Solar impose le préfixe Solar aux modèles dérivés et la mention « Built with Solar ».

Avancée méthodologique

Un modèle de transcription contrôlable fait passer la détection des disfluences de 10 % à 79 % de F1 en zero-shot

Le 21 juillet 2026, des chercheurs de nyra labs ont publié sur arXiv une méthode de reconnaissance vocale à style de transcription contrôlable, qui traite la politique de transcription comme une variable latente et fournit un horodatage au niveau du mot. Selon l'article, l'approche fait passer le score F1 de détection des disfluences en allemand de 10 % à 79 % en zero-shot, alors que l'entraînement n'a porté que sur l'anglais. Les auteurs estiment par ailleurs que jusqu'à 60 % du taux d'erreur de mots rapporté dans les évaluations provient d'un désaccord de style plutôt que d'erreurs réelles.

Source : arXiv
Ranger dans…
Enregistré. Ajouter une note ?
Nouveau modèle

Mage-Flow, modèle d'image de 4 milliards de paramètres de Microsoft, génère une image 1024x1024 en 0,59 seconde

Le 21 juillet 2026, des chercheurs de Microsoft ont publié sur arXiv Mage-Flow, un modèle génératif de 4 milliards de paramètres pour la génération et l'édition d'images à résolution native. L'architecture associe un tokeniseur Mage-VAE à un transformeur de diffusion multimodal entraîné par appariement de flux rectifié. D'après l'article, la variante Mage-Flow-Turbo produit une image en 1024x1024 en 0,59 seconde sur un GPU A100 en quatre étapes de diffusion, et la variante d'édition en 1,02 seconde. Les auteurs rapportent un coût de tokenisation divisé par plus d'un ordre de grandeur et un débit d'entraînement multiplié par environ 2,5.

Source : arXiv
Ranger dans…
Enregistré. Ajouter une note ?
Nouveau modèle

ABot-World-0 fait tourner un modèle de monde interactif en 720p à 16 images par seconde sur un seul GPU de bureau

Le 21 juillet 2026, l'équipe AMAP CV Lab d'Alibaba a publié sur arXiv ABot-World-0, un modèle de monde vidéo conditionné par l'action. Selon l'article, le système diffuse de la vidéo en 720p à 16 images par seconde sur un seul GPU de bureau NVIDIA RTX 5090, avec une latence de 1,2 seconde entre l'action et la première image et environ 19 Gio de mémoire vidéo utilisée au pic. La méthode repose sur la distillation progressive d'un professeur bidirectionnel vers un élève causal et une technique baptisée LongForcing pour aligner les déroulés à long horizon.

Source : arXiv
Ranger dans…
Enregistré. Ajouter une note ?
Nouveau modèle

Relay-Bench, un banc de raisonnement multi-domaines où le meilleur modèle plafonne à 43,3 %

Le 20 juillet 2026, Liam Swayne a mis en ligne sur arXiv Relay-Bench, un banc d'évaluation textuel qui enchaîne dans une seule consigne des problèmes tirés de sept domaines : raisonnement visuel, code, mathématiques, extraction d'information, résolution de problèmes, connaissances générales et analyse de données. Chaque problème composite regroupe de deux à treize sous-problèmes à traiter en chaîne. D'après l'article, le modèle le mieux classé du banc, GPT-5.5 (xHigh), atteint 43,3 %. Le banc est conçu pour rester non saturé face aux modèles de pointe.

Source : arXiv
Ranger dans…
Enregistré. Ajouter une note ?

Dans l'univers dynamique de la recherche scientifique, arXiv se distingue comme une plateforme incontournable pour la diffusion rapide et libre des connaissances. Créée en 1991 par Paul Ginsparg, arXiv est une archive en ligne de prépublications scientifiques, couvrant une multitude de disciplines allant de la physique et des mathématiques à l'informatique et aux sciences sociales. Hébergée par l'Université Cornell, cette plateforme contribue de manière significative à l'évolution de la recherche en permettant aux chercheurs du monde entier de partager leurs avancées avant même la publication dans des revues à comité de lecture.

Lire la suite du profil Mis à jour le 21 juillet 2026
Domaines d'expertise et réalisations principales

ArXiv joue un rôle crucial dans la promotion de la science ouverte en facilitant l'accès libre et immédiat aux résultats de recherche. Elle couvre un large éventail de domaines scientifiques, avec une prépondérance dans les sciences physiques et mathématiques. Cette plateforme est particulièrement prisée pour sa capacité à accueillir des prépublications de haute qualité, ce qui en fait une ressource essentielle pour les chercheurs et les institutions académiques. Au fil des ans, arXiv a accumulé des millions de documents, constituant ainsi une base de données riche et variée pour la communauté scientifique mondiale.

Contributions récentes et projets notables

ArXiv continue d'évoluer pour répondre aux besoins changeants de la communauté scientifique. Parmi ses contributions récentes, on note l'intégration de nouvelles catégories de recherche, telles que l'IA générative et les modèles de langage, reflétant ainsi les tendances émergentes dans le domaine de la technologie. En tant que référentiel de choix pour les chercheurs travaillant sur des projets innovants, arXiv a vu la publication de travaux majeurs sur des sujets tels que la cybersécurité, l'apprentissage automatique et la vision par ordinateur, démontrant son importance dans l'écosystème de la recherche technologique.

Position dans l'écosystème technologique

ArXiv occupe une place centrale dans l'écosystème technologique, servant de passerelle entre les chercheurs et le public. Sa fonction de prépublication permet aux scientifiques de partager rapidement leurs résultats, favorisant ainsi la collaboration et l'innovation à un rythme accéléré. De plus, arXiv joue un rôle de catalyseur dans le développement de nouvelles technologies en fournissant un accès anticipé aux recherches avant leur validation formelle. Cette dynamique accélère le transfert de connaissances entre le milieu académique et l'industrie, stimulant ainsi l'innovation technologique à l'échelle mondiale.

Développements et actualités récentes

Récemment, arXiv a renforcé ses infrastructures techniques pour mieux gérer l'afflux croissant de soumissions et s'assurer de la pérennité de ses services. Elle a également mis en place des mesures pour améliorer la qualité et la pertinence des publications, en introduisant des outils de vérification automatique et des critères de soumission plus stricts. Ces efforts visent à maintenir la crédibilité et la fiabilité de la plateforme en tant que source de connaissances scientifiques. En parallèle, arXiv explore des partenariats avec d'autres plateformes de recherche pour étendre sa portée et intégrer des technologies avancées, telles que l'IA, pour améliorer ses services.

En conclusion, arXiv reste une plateforme pionnière et essentielle dans le panorama de la recherche scientifique. Sa capacité à s'adapter aux besoins émergents et à intégrer les dernières avancées technologiques garantit sa pertinence continue dans la promotion d'une science ouverte et accessible à tous.

arXiv est une archive ouverte de prépublications électroniques d'articles scientifiques dans les domaines de la physique, des mathématiques, de l'informatique, de la biologie quantitative, de la finance quantitative, de la statistique, de l'ingénierie électrique et des systèmes, et de l'économie1, et qui est accessible gratuitement par Internet.

Articles liés

95 au total
Avancée méthodologique · Anthropic

Le préprint ExpGraph propose une mémoire en graphe auto-évolutif pour agents LLM

02/06
Nouveau modèle · Nvidia

Nvidia annonce Alpamayo 2 Super 32B pour robotaxis, métriques embarquées non publiées

01/06
Dossier / analyse de fond · Shanghai Jiao Tong University

Skills agentiques : quatre cadres de compétences pour LLM publiés en mai 2026, sans protocole commun

01/06
Rapport de marché / adoption · AWS

Cigref : 140 Md€ de surcoûts cloud en Europe, l'IA en bundle en deuxième cause

29/05
Nouveau modèle · Anthropic

Claude Mythos : l'UE exclue du briefing qu'ont reçu la Fed et la Banque d'Angleterre

28/05
Benchmark / évaluation · arXiv

GPT plus confiant sur les tâches difficiles où il se trompe le plus, selon un preprint USC/Berkeley

26/05
Benchmark / évaluation · arXiv

ContextEcho : la compaction ne corrige pas la dérive de persona, benchmark sur 23 modèles

26/05
Datacenter / supercalculateur · Anthropic

Anthropic loue Colossus 1 à 1,25 Md$/mois sur un parc xAI qui plafonne à 11% de capacité

21/05
Avancée méthodologique · Google Research

Google présente MLE-STAR : une nouvelle approche pour l’ingénierie du Machine Learning

11/08
Tribune / opinion · arXiv

Quand l’IA devient bouclier : ce que les LLMs changent concrètement à la cybersécurité

15/05
Nouveau produit / service · Meta AI

ML Drift : faciliter l'inférence locale

14/05
Nouvelle fonctionnalité · LightOn

LightOn annonce l'intégration de "Visual RAG" à sa plateforme

03/03