MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rouard, Simon, Roman, Robin San, Adi, Yossi, Roebel, Axel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio Conditioning for Music Generation via Discrete Bottleneck Features
par: Rouard, Simon, et autres
Publié: (2024)
par: Rouard, Simon, et autres
Publié: (2024)
Continuous Audio Language Models
par: Rouard, Simon, et autres
Publié: (2025)
par: Rouard, Simon, et autres
Publié: (2025)
An Independence-promoting Loss for Music Generation with Language Models
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
Latent Watermarking of Audio Generative Models
par: Roman, Robin San, et autres
Publié: (2024)
par: Roman, Robin San, et autres
Publié: (2024)
StemGen: A music generation model that listens
par: Parker, Julian D., et autres
Publié: (2023)
par: Parker, Julian D., et autres
Publié: (2023)
MusicGen-Chord: Advancing Music Generation through Chord Progressions and Interactive Web-UI
par: Jung, Jongmin, et autres
Publié: (2024)
par: Jung, Jongmin, et autres
Publié: (2024)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2024)
par: Tal, Or, et autres
Publié: (2024)
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning
par: Zhang, Yixiao, et autres
Publié: (2024)
par: Zhang, Yixiao, et autres
Publié: (2024)
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024)
par: Messica, Shoval, et autres
Publié: (2024)
Enhancing TTS Stability in Hebrew using Discrete Semantic Units
par: Zeldes, Ella, et autres
Publié: (2024)
par: Zeldes, Ella, et autres
Publié: (2024)
Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
par: Abrassart, Mathilde, et autres
Publié: (2025)
par: Abrassart, Mathilde, et autres
Publié: (2025)
Small-E: Small Language Model with Linear Attention for Efficient Speech Synthesis
par: Lemerle, Théodor, et autres
Publié: (2024)
par: Lemerle, Théodor, et autres
Publié: (2024)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
par: Lemerle, Théodor, et autres
Publié: (2024)
par: Lemerle, Théodor, et autres
Publié: (2024)
Audio Enhancement from Multiple Crowdsourced Recordings: A Simple and Effective Baseline
par: Aziz, Shiran, et autres
Publié: (2024)
par: Aziz, Shiran, et autres
Publié: (2024)
LAST: Language Model Aware Speech Tokenization
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2025)
par: Tal, Or, et autres
Publié: (2025)
CAFA: a Controllable Automatic Foley Artist
par: Benita, Roi, et autres
Publié: (2025)
par: Benita, Roi, et autres
Publié: (2025)
Linear RNNs for autoregressive generation of long music samples
par: Szewczyk, Konrad, et autres
Publié: (2025)
par: Szewczyk, Konrad, et autres
Publié: (2025)
ACMID: Automatic Curation of Musical Instrument Dataset for 7-Stem Music Source Separation
par: Yu, Ji, et autres
Publié: (2025)
par: Yu, Ji, et autres
Publié: (2025)
Regularized autoregressive modeling and its application to audio signal reconstruction
par: Mokrý, Ondřej, et autres
Publié: (2024)
par: Mokrý, Ondřej, et autres
Publié: (2024)
Salmon: A Suite for Acoustic Language Model Evaluation
par: Maimon, Gallil, et autres
Publié: (2024)
par: Maimon, Gallil, et autres
Publié: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024)
par: Roth, Amit, et autres
Publié: (2024)
WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
par: Yosha, Iddo, et autres
Publié: (2025)
par: Yosha, Iddo, et autres
Publié: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
par: Yosha, Iddo, et autres
Publié: (2025)
par: Yosha, Iddo, et autres
Publié: (2025)
Tweaking autoregressive methods for inpainting of gaps in audio signals
par: Mokrý, Ondřej, et autres
Publié: (2024)
par: Mokrý, Ondřej, et autres
Publié: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
par: Chi, Tutti, et autres
Publié: (2025)
par: Chi, Tutti, et autres
Publié: (2025)
Modeling the Difficulty of Saxophone Music
par: Libřický, Šimon, et autres
Publié: (2025)
par: Libřický, Šimon, et autres
Publié: (2025)
YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation
par: Chang, Sungkyun, et autres
Publié: (2024)
par: Chang, Sungkyun, et autres
Publié: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
Enhanced Automatic Drum Transcription via Drum Stem Source Separation
par: Riley, Xavier, et autres
Publié: (2025)
par: Riley, Xavier, et autres
Publié: (2025)
STAGE: Stemmed Accompaniment Generation through Prefix-Based Conditioning
par: Strano, Giorgio, et autres
Publié: (2025)
par: Strano, Giorgio, et autres
Publié: (2025)
Beyond Genre: Diagnosing Bias in Music Embeddings Using Concept Activation Vectors
par: Gebhardt, Roman B., et autres
Publié: (2025)
par: Gebhardt, Roman B., et autres
Publié: (2025)
Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding
par: Xi, Yu, et autres
Publié: (2025)
par: Xi, Yu, et autres
Publié: (2025)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
par: An, Keyu, et autres
Publié: (2024)
par: An, Keyu, et autres
Publié: (2024)
The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
par: Chang, Xuankai, et autres
Publié: (2024)
par: Chang, Xuankai, et autres
Publié: (2024)
PiCoGen2: Piano cover generation with transfer learning approach and weakly aligned data
par: Tan, Chih-Pin, et autres
Publié: (2024)
par: Tan, Chih-Pin, et autres
Publié: (2024)
Simple and Controllable Music Generation
par: Copet, Jade, et autres
Publié: (2023)
par: Copet, Jade, et autres
Publié: (2023)
Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation
par: Riou, Alain, et autres
Publié: (2024)
par: Riou, Alain, et autres
Publié: (2024)
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
par: Li, Yupei, et autres
Publié: (2024)
par: Li, Yupei, et autres
Publié: (2024)
TEAdapter: Supply abundant guidance for controllable text-to-music generation
par: Zou, Jialing, et autres
Publié: (2024)
par: Zou, Jialing, et autres
Publié: (2024)
Documents similaires
-
Audio Conditioning for Music Generation via Discrete Bottleneck Features
par: Rouard, Simon, et autres
Publié: (2024) -
Continuous Audio Language Models
par: Rouard, Simon, et autres
Publié: (2025) -
An Independence-promoting Loss for Music Generation with Language Models
par: Lemercier, Jean-Marie, et autres
Publié: (2024) -
Latent Watermarking of Audio Generative Models
par: Roman, Robin San, et autres
Publié: (2024) -
StemGen: A music generation model that listens
par: Parker, Julian D., et autres
Publié: (2023)