Audio Conditioning for Music Generation via Discrete Bottleneck Features
Fuente:
arXiv
Salvato in:
| Autori principali: | Rouard, Simon, Adi, Yossi, Copet, Jade, Roebel, Axel, Défossez, Alexandre |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An Independence-promoting Loss for Music Generation with Language Models
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Simple and Controllable Music Generation
di: Copet, Jade, et al.
Pubblicazione: (2023)
di: Copet, Jade, et al.
Pubblicazione: (2023)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2024)
di: Tal, Or, et al.
Pubblicazione: (2024)
Masked Audio Generation using a Single Non-Autoregressive Transformer
di: Ziv, Alon, et al.
Pubblicazione: (2024)
di: Ziv, Alon, et al.
Pubblicazione: (2024)
Enhancing TTS Stability in Hebrew using Discrete Semantic Units
di: Zeldes, Ella, et al.
Pubblicazione: (2024)
di: Zeldes, Ella, et al.
Pubblicazione: (2024)
Audio Enhancement from Multiple Crowdsourced Recordings: A Simple and Effective Baseline
di: Aziz, Shiran, et al.
Pubblicazione: (2024)
di: Aziz, Shiran, et al.
Pubblicazione: (2024)
Latent Watermarking of Audio Generative Models
di: Roman, Robin San, et al.
Pubblicazione: (2024)
di: Roman, Robin San, et al.
Pubblicazione: (2024)
Low-Resource Self-Supervised Learning with SSL-Enhanced TTS
di: Hsu, Po-chun, et al.
Pubblicazione: (2023)
di: Hsu, Po-chun, et al.
Pubblicazione: (2023)
NAST: Noise Aware Speech Tokenization for Speech Language Models
di: Messica, Shoval, et al.
Pubblicazione: (2024)
di: Messica, Shoval, et al.
Pubblicazione: (2024)
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)
di: Hassid, Michael, et al.
Pubblicazione: (2023)
Small-E: Small Language Model with Linear Attention for Efficient Speech Synthesis
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2025)
di: Tal, Or, et al.
Pubblicazione: (2025)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
MoodLoopGP: Generating Emotion-Conditioned Loop Tablature Music with Multi-Granular Features
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
CAFA: a Controllable Automatic Foley Artist
di: Benita, Roi, et al.
Pubblicazione: (2025)
di: Benita, Roi, et al.
Pubblicazione: (2025)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Audio-Visual Speech Separation via Bottleneck Iterative Network
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
OMAR-RQ: Open Music Audio Representation Model Trained with Multi-Feature Masked Token Prediction
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2025)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2025)
Enhancing Neural Audio Fingerprint Robustness to Audio Degradation for Music Identification
di: Araz, R. Oguz, et al.
Pubblicazione: (2025)
di: Araz, R. Oguz, et al.
Pubblicazione: (2025)
VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features
di: Li, Sifei, et al.
Pubblicazione: (2024)
di: Li, Sifei, et al.
Pubblicazione: (2024)
Perceptual Musical Features for Interpretable Audio Tagging
di: Lyberatos, Vassilis, et al.
Pubblicazione: (2023)
di: Lyberatos, Vassilis, et al.
Pubblicazione: (2023)
Salmon: A Suite for Acoustic Language Model Evaluation
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
di: Roth, Amit, et al.
Pubblicazione: (2024)
di: Roth, Amit, et al.
Pubblicazione: (2024)
From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview
di: Li, Yupei, et al.
Pubblicazione: (2024)
di: Li, Yupei, et al.
Pubblicazione: (2024)
WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
Network Modulation Synthesis: New Algorithms for Generating Musical Audio Using Autoencoder Networks
di: Hyrkas, Jeremy
Pubblicazione: (2021)
di: Hyrkas, Jeremy
Pubblicazione: (2021)
MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
di: Chen, Jiatao, et al.
Pubblicazione: (2024)
di: Chen, Jiatao, et al.
Pubblicazione: (2024)
Intelligent Text-Conditioned Music Generation
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
di: Song, Jiahao, et al.
Pubblicazione: (2025)
di: Song, Jiahao, et al.
Pubblicazione: (2025)
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
A Noval Feature via Color Quantisation for Fake Audio Detection
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
An Independence-promoting Loss for Music Generation with Language Models
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024) -
MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
di: Rouard, Simon, et al.
Pubblicazione: (2025) -
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025) -
Simple and Controllable Music Generation
di: Copet, Jade, et al.
Pubblicazione: (2023) -
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2024)