Les modèles text-to-audio ont fait parler d’eux avant que les modèles de génération d'image, de video ou de texte ne leur volent dernièrement la vedette. Meta s'est appuyé sur ses récentes recherches pour la génération audio pour publier en open source AudioCraft, un framework générant de la musique et de l'audio à partir d'invites textuelles.
Selon Meta, la famille de modèles AudioCraft se distingue par sa capacité à produire un son de haute qualité avec une cohérence à long terme, tout en restant facile à utiliser et simplifiera la conception globale des modèles génératifs pour l'audio.
Différents modèles d’IA générant des échantillons audio conditionnés sur des entrées de texte ont précédemment été développés : Diffsound, Jukebox par Open AI, et en début d'année, MusicLM de Google Research. Leurs concepteurs se sont tous heurtés à la rareté des annotations textuelles, limitant la possibilité de mettre les modèles à l’échelle et au fait que la modélisation audio haute fidélité nécessite d’encoder l’audio à un taux d’échantillonnage élevé, ce qui conduit à des séquences extrêmement longues.
D'après les chercheurs de Meta, la musique est sans doute le type d’audio le plus difficile à générer car il est composé de motifs locaux et à longue portée, d’une suite de notes à une structure musicale globale avec plusieurs instruments.
Nouveau modèle
Audiocraft, la famille de modèles d'IA de génération d'audio et de musique open source de Meta

Acteurs cités
Sur le même sujet
L'Hebdo ActuIA
Inscription confirmée, à très vite !