Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jiafeng, Dong, Yuanliang, Liu, Hongjia, Cheng, Yuqing, Guo, Zhancheng, Liang, Huijing, Zhan, Wenbo, Sun, Yuming, Li, Xiaobing, Yu, Feng, Sun, Maosong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
par: Wu, Shangda, et autres
Publié: (2024)
par: Wu, Shangda, et autres
Publié: (2024)
CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages
par: Wu, Shangda, et autres
Publié: (2025)
par: Wu, Shangda, et autres
Publié: (2025)
MelodyT5: A Unified Score-to-Score Transformer for Symbolic Music Processing
par: Wu, Shangda, et autres
Publié: (2024)
par: Wu, Shangda, et autres
Publié: (2024)
Exploring Tokenization Methods for Multitrack Sheet Music Generation
par: Wang, Yashan, et autres
Publié: (2024)
par: Wang, Yashan, et autres
Publié: (2024)
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
par: Cheng, Yuqing, et autres
Publié: (2026)
par: Cheng, Yuqing, et autres
Publié: (2026)
NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
par: Wang, Yashan, et autres
Publié: (2025)
par: Wang, Yashan, et autres
Publié: (2025)
Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores
par: Dai, Congren, et autres
Publié: (2025)
par: Dai, Congren, et autres
Publié: (2025)
MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition
par: Li, Haoxun, et autres
Publié: (2025)
par: Li, Haoxun, et autres
Publié: (2025)
Multimodal Sentiment Analysis with Missing Modality: A Knowledge-Transfer Approach
par: Liu, Weide, et autres
Publié: (2023)
par: Liu, Weide, et autres
Publié: (2023)
ASCMamba: Multimodal Time-Frequency Mamba for Acoustic Scene Classification
par: Sun, Bochao, et autres
Publié: (2025)
par: Sun, Bochao, et autres
Publié: (2025)
TISDiSS: A Training-Time and Inference-Time Scalable Framework for Discriminative Source Separation
par: Feng, Yongsheng, et autres
Publié: (2025)
par: Feng, Yongsheng, et autres
Publié: (2025)
Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
par: Manakul, Potsawee, et autres
Publié: (2026)
par: Manakul, Potsawee, et autres
Publié: (2026)
Analyzable Chain-of-Musical-Thought Prompting for High-Fidelity Music Generation
par: Lam, Max W. Y., et autres
Publié: (2025)
par: Lam, Max W. Y., et autres
Publié: (2025)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
par: Liu, Cheng, et autres
Publié: (2025)
par: Liu, Cheng, et autres
Publié: (2025)
Acoustic Overspecification in Electronic Dance Music Taxonomy
par: Xu, Weilun, et autres
Publié: (2025)
par: Xu, Weilun, et autres
Publié: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025)
par: Tong, Xinyi, et autres
Publié: (2025)
Personalized Dynamic Music Emotion Recognition with Dual-Scale Attention-Based Meta-Learning
par: Zhang, Dengming, et autres
Publié: (2024)
par: Zhang, Dengming, et autres
Publié: (2024)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
par: Li, Haowen, et autres
Publié: (2026)
par: Li, Haowen, et autres
Publié: (2026)
Back to Ear: Perceptually Driven High Fidelity Music Reconstruction
par: Wang, Kangdi, et autres
Publié: (2025)
par: Wang, Kangdi, et autres
Publié: (2025)
High-Fidelity Music Vocoder using Neural Audio Codecs
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
par: Guo, Xiaoxuan, et autres
Publié: (2026)
par: Guo, Xiaoxuan, et autres
Publié: (2026)
Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval
par: Kong, Yuexuan, et autres
Publié: (2025)
par: Kong, Yuexuan, et autres
Publié: (2025)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
par: Li, Haoxun, et autres
Publié: (2025)
par: Li, Haoxun, et autres
Publié: (2025)
Towards Practical Real-Time Low-Latency Music Source Separation
par: Wu, Junyu, et autres
Publié: (2025)
par: Wu, Junyu, et autres
Publié: (2025)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
EMelodyGen: Emotion-Conditioned Melody Generation in ABC Notation with the Musical Feature Template
par: Zhou, Monan, et autres
Publié: (2023)
par: Zhou, Monan, et autres
Publié: (2023)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
par: Gong, Yitian, et autres
Publié: (2025)
par: Gong, Yitian, et autres
Publié: (2025)
CoPlay: Audio-agnostic Cognitive Scaling for Acoustic Sensing
par: Li, Yin, et autres
Publié: (2024)
par: Li, Yin, et autres
Publié: (2024)
Hankel-FNO: Fast Underwater Acoustic Charting Via Physics-Encoded Fourier Neural Operator
par: Sun, Yifan, et autres
Publié: (2025)
par: Sun, Yifan, et autres
Publié: (2025)
Versatile Symbolic Music-for-Music Modeling via Function Alignment
par: Jiang, Junyan, et autres
Publié: (2025)
par: Jiang, Junyan, et autres
Publié: (2025)
Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations
par: Sun, Yujia, et autres
Publié: (2024)
par: Sun, Yujia, et autres
Publié: (2024)
The Sound Demixing Challenge 2023 $\unicode{x2013}$ Music Demixing Track
par: Fabbro, Giorgio, et autres
Publié: (2023)
par: Fabbro, Giorgio, et autres
Publié: (2023)
Improving DF-Conformer Using Hydra For High-Fidelity Generative Speech Enhancement on Discrete Codec Token
par: Seki, Shogo, et autres
Publié: (2025)
par: Seki, Shogo, et autres
Publié: (2025)
AccentBox: Towards High-Fidelity Zero-Shot Accent Generation
par: Zhong, Jinzuomu, et autres
Publié: (2024)
par: Zhong, Jinzuomu, et autres
Publié: (2024)
HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling
par: Wang, Chunhui, et autres
Publié: (2024)
par: Wang, Chunhui, et autres
Publié: (2024)
Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models
par: Wang, Yanyun, et autres
Publié: (2026)
par: Wang, Yanyun, et autres
Publié: (2026)
ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation
par: Liu, Yakun, et autres
Publié: (2026)
par: Liu, Yakun, et autres
Publié: (2026)
MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training
par: Li, Yizhi, et autres
Publié: (2023)
par: Li, Yizhi, et autres
Publié: (2023)
Nested Music Transformer: Sequentially Decoding Compound Tokens in Symbolic Music and Audio Generation
par: Yoo, HaeJun, et autres
Publié: (2024)
par: Yoo, HaeJun, et autres
Publié: (2024)
Benchmarking Representations for Speech, Music, and Acoustic Events
par: La Quatra, Moreno, et autres
Publié: (2024)
par: La Quatra, Moreno, et autres
Publié: (2024)
Documents similaires
-
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
par: Wu, Shangda, et autres
Publié: (2024) -
CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages
par: Wu, Shangda, et autres
Publié: (2025) -
MelodyT5: A Unified Score-to-Score Transformer for Symbolic Music Processing
par: Wu, Shangda, et autres
Publié: (2024) -
Exploring Tokenization Methods for Multitrack Sheet Music Generation
par: Wang, Yashan, et autres
Publié: (2024) -
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
par: Cheng, Yuqing, et autres
Publié: (2026)