Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Manakul, Potsawee, Gan, Woody Haosheng, Bartelds, Martijn, Sun, Guangzhi, Held, William, Yang, Diyi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
par: Manakul, Potsawee, et autres
Publié: (2025)
par: Manakul, Potsawee, et autres
Publié: (2025)
Mind the Gap! Static and Interactive Evaluations of Large Audio Models
par: Li, Minzhi, et autres
Publié: (2025)
par: Li, Minzhi, et autres
Publié: (2025)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
par: Manakul, Potsawee, et autres
Publié: (2024)
par: Manakul, Potsawee, et autres
Publié: (2024)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
par: Chaichana, Yuatyong, et autres
Publié: (2025)
par: Chaichana, Yuatyong, et autres
Publié: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling
par: Wang, Chunhui, et autres
Publié: (2024)
par: Wang, Chunhui, et autres
Publié: (2024)
CoPlay: Audio-agnostic Cognitive Scaling for Acoustic Sensing
par: Li, Yin, et autres
Publié: (2024)
par: Li, Yin, et autres
Publié: (2024)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
par: Liu, Wenrui, et autres
Publié: (2024)
par: Liu, Wenrui, et autres
Publié: (2024)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
par: Dekel, Avihu, et autres
Publié: (2024)
par: Dekel, Avihu, et autres
Publié: (2024)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
par: Zhang, Zhisheng, et autres
Publié: (2026)
par: Zhang, Zhisheng, et autres
Publié: (2026)
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
UniSep: Universal Target Audio Separation with Language Models at Scale
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
par: Zeng, Aohan, et autres
Publié: (2024)
par: Zeng, Aohan, et autres
Publié: (2024)
OMAR-RQ: Open Music Audio Representation Model Trained with Multi-Feature Masked Token Prediction
par: Alonso-Jiménez, Pablo, et autres
Publié: (2025)
par: Alonso-Jiménez, Pablo, et autres
Publié: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
par: Xing, Jingyuan, et autres
Publié: (2025)
par: Xing, Jingyuan, et autres
Publié: (2025)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
par: Wang, Siyang, et autres
Publié: (2024)
par: Wang, Siyang, et autres
Publié: (2024)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
par: Zhang, Zixing, et autres
Publié: (2024)
par: Zhang, Zixing, et autres
Publié: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
par: Ngo, Huong, et autres
Publié: (2025)
par: Ngo, Huong, et autres
Publié: (2025)
Semantic and Semiotic Interplays in Text-to-Audio AI: Exploring Cognitive Dynamics and Musical Interactions
par: Coelho, Guilherme
Publié: (2025)
par: Coelho, Guilherme
Publié: (2025)
Past, Present, and Future of Spatial Audio and Room Acoustics
par: Koyama, Shoichi, et autres
Publié: (2025)
par: Koyama, Shoichi, et autres
Publié: (2025)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Can Large Language Models Understand Spatial Audio?
par: Tang, Changli, et autres
Publié: (2024)
par: Tang, Changli, et autres
Publié: (2024)
A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation
par: Wang, Pingjie, et autres
Publié: (2024)
par: Wang, Pingjie, et autres
Publié: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
par: Takeuchi, Daiki, et autres
Publié: (2025)
par: Takeuchi, Daiki, et autres
Publié: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification
par: Ritu, Jarin, et autres
Publié: (2025)
par: Ritu, Jarin, et autres
Publié: (2025)
Semantic Proximity Alignment: Towards Human Perception-consistent Audio Tagging by Aligning with Label Text Description
par: Liu, Wuyang, et autres
Publié: (2023)
par: Liu, Wuyang, et autres
Publié: (2023)
DSA-Tokenizer: Disentangled Semantic-Acoustic Tokenization via Flow Matching-based Hierarchical Fusion
par: Zhang, Hanlin, et autres
Publié: (2026)
par: Zhang, Hanlin, et autres
Publié: (2026)
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
par: Lei, Shun, et autres
Publié: (2023)
par: Lei, Shun, et autres
Publié: (2023)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement
par: Hussein, Amir, et autres
Publié: (2025)
par: Hussein, Amir, et autres
Publié: (2025)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
Documents similaires
-
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
par: Manakul, Potsawee, et autres
Publié: (2025) -
Mind the Gap! Static and Interactive Evaluations of Large Audio Models
par: Li, Minzhi, et autres
Publié: (2025) -
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
par: Manakul, Potsawee, et autres
Publié: (2024) -
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
par: Chaichana, Yuatyong, et autres
Publié: (2025) -
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)