MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gong, Yitian, Chen, Kuangwei, Fei, Zhaoye, Yang, Xiaogui, Chen, Ke, Wang, Yang, Huang, Kexin, Chen, Mingshu, Li, Ruixiao, Cheng, Qingyuan, Li, Shimin, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
par: Gong, Yitian, et autres
Publié: (2025)
par: Gong, Yitian, et autres
Publié: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
MOSS Transcribe Diarize Technical Report
par: AI, MOSI., et autres
Publié: (2026)
par: AI, MOSI., et autres
Publié: (2026)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
par: Deng, Ruifan, et autres
Publié: (2025)
par: Deng, Ruifan, et autres
Publié: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
par: Li, Jingyi, et autres
Publié: (2025)
par: Li, Jingyi, et autres
Publié: (2025)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
par: Lin, Jingru, et autres
Publié: (2026)
par: Lin, Jingru, et autres
Publié: (2026)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
par: Wang, Yuanyuan, et autres
Publié: (2024)
par: Wang, Yuanyuan, et autres
Publié: (2024)
Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
par: Manakul, Potsawee, et autres
Publié: (2026)
par: Manakul, Potsawee, et autres
Publié: (2026)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
par: Takeuchi, Daiki, et autres
Publié: (2025)
par: Takeuchi, Daiki, et autres
Publié: (2025)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
MOSS-Audio Technical Report
par: Yang, Chen, et autres
Publié: (2026)
par: Yang, Chen, et autres
Publié: (2026)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
par: Liu, Wenrui, et autres
Publié: (2024)
par: Liu, Wenrui, et autres
Publié: (2024)
QuarkAudio Technical Report
par: Liu, Chengwei, et autres
Publié: (2025)
par: Liu, Chengwei, et autres
Publié: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
par: Jia, Yuhang, et autres
Publié: (2025)
par: Jia, Yuhang, et autres
Publié: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization
par: Zhang, Xiangyu, et autres
Publié: (2026)
par: Zhang, Xiangyu, et autres
Publié: (2026)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
par: Yang, Wanqi, et autres
Publié: (2024)
par: Yang, Wanqi, et autres
Publié: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
par: Wang, Yucheng, et autres
Publié: (2026)
par: Wang, Yucheng, et autres
Publié: (2026)
Improving Audio Question Answering with Variational Inference
par: Chen, Haolin
Publié: (2026)
par: Chen, Haolin
Publié: (2026)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
par: Chen, Yushen, et autres
Publié: (2025)
par: Chen, Yushen, et autres
Publié: (2025)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Unified Audio Event Detection
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
UniSep: Universal Target Audio Separation with Language Models at Scale
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
Discrete Audio Tokens: More Than a Survey!
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
FLAM: Frame-Wise Language-Audio Modeling
par: Wu, Yusong, et autres
Publié: (2025)
par: Wu, Yusong, et autres
Publié: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Documents similaires
-
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
par: Gong, Yitian, et autres
Publié: (2025) -
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025) -
MOSS Transcribe Diarize Technical Report
par: AI, MOSI., et autres
Publié: (2026) -
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
par: Deng, Ruifan, et autres
Publié: (2025) -
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)