AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yushen, Hu, Kai, Zhou, Long, Feng, Shulin, Yang, Xusheng, Chen, Hangting, Chen, Xie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
par: Niu, Zhikang, et autres
Publié: (2024)
par: Niu, Zhikang, et autres
Publié: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
par: Wang, Yuanyuan, et autres
Publié: (2024)
par: Wang, Yuanyuan, et autres
Publié: (2024)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
par: Jiang, Yidi, et autres
Publié: (2025)
par: Jiang, Yidi, et autres
Publié: (2025)
UniSep: Universal Target Audio Separation with Language Models at Scale
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
par: Li, Jingyi, et autres
Publié: (2025)
par: Li, Jingyi, et autres
Publié: (2025)
WAKE: Watermarking Audio with Key Enrichment
par: Xu, Yaoxun, et autres
Publié: (2025)
par: Xu, Yaoxun, et autres
Publié: (2025)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
par: Chen, Wenxi, et autres
Publié: (2025)
par: Chen, Wenxi, et autres
Publié: (2025)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
par: Zheng, Qixi, et autres
Publié: (2025)
par: Zheng, Qixi, et autres
Publié: (2025)
Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
Continuous Target Speech Extraction: Enhancing Personalized Diarization and Extraction on Complex Recordings
par: Zhao, He, et autres
Publié: (2024)
par: Zhao, He, et autres
Publié: (2024)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
par: Chen, Yushen, et autres
Publié: (2024)
par: Chen, Yushen, et autres
Publié: (2024)
Layer-wise Investigation of Large-Scale Self-Supervised Music Representation Models
par: Zhou, Yizhi, et autres
Publié: (2025)
par: Zhou, Yizhi, et autres
Publié: (2025)
Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
par: Xin, Yifei, et autres
Publié: (2024)
par: Xin, Yifei, et autres
Publié: (2024)
Autoregressive Speech Synthesis without Vector Quantization
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
par: Chen, Wenxi, et autres
Publié: (2024)
par: Chen, Wenxi, et autres
Publié: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
Variable Bitrate Residual Vector Quantization for Audio Coding
par: Chae, Yunkee, et autres
Publié: (2024)
par: Chae, Yunkee, et autres
Publié: (2024)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization
par: Zhu, Haina, et autres
Publié: (2025)
par: Zhu, Haina, et autres
Publié: (2025)
Post-Training Quantization for Audio Diffusion Transformers
par: Khandelwal, Tanmay, et autres
Publié: (2025)
par: Khandelwal, Tanmay, et autres
Publié: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
par: Xu, Kai-Tuo, et autres
Publié: (2025)
par: Xu, Kai-Tuo, et autres
Publié: (2025)
3S-TSE: Efficient Three-Stage Target Speaker Extraction for Real-Time and Low-Resource Applications
par: He, Shulin, et autres
Publié: (2023)
par: He, Shulin, et autres
Publié: (2023)
Improving Audio Question Answering with Variational Inference
par: Chen, Haolin
Publié: (2026)
par: Chen, Haolin
Publié: (2026)
SongEditor: Adapting Zero-Shot Song Generation Language Model as a Multi-Task Editor
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals
par: Chen, Zhang, et autres
Publié: (2026)
par: Chen, Zhang, et autres
Publié: (2026)
Deep Learning for Personalized Binaural Audio Reproduction
par: Lu, Xikun, et autres
Publié: (2025)
par: Lu, Xikun, et autres
Publié: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
par: Fang, Yuan, et autres
Publié: (2024)
par: Fang, Yuan, et autres
Publié: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
par: Xie, Zeyu, et autres
Publié: (2023)
par: Xie, Zeyu, et autres
Publié: (2023)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
par: Jia, Yuhang, et autres
Publié: (2025)
par: Jia, Yuhang, et autres
Publié: (2025)
MuCodec: Ultra Low-Bitrate Music Codec
par: Xu, Yaoxun, et autres
Publié: (2024)
par: Xu, Yaoxun, et autres
Publié: (2024)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
par: Lin, Jingru, et autres
Publié: (2026)
par: Lin, Jingru, et autres
Publié: (2026)
Advances in Speech Separation: Techniques, Challenges, and Future Trends
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
par: Xu, Kaituo, et autres
Publié: (2026)
par: Xu, Kaituo, et autres
Publié: (2026)
Universal Spatial Audio Transcoder
par: Sagasti, Amaia, et autres
Publié: (2024)
par: Sagasti, Amaia, et autres
Publié: (2024)
Documents similaires
-
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
par: Niu, Zhikang, et autres
Publié: (2024) -
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
par: Wang, Yuanyuan, et autres
Publié: (2024) -
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
par: Jiang, Yidi, et autres
Publié: (2025) -
UniSep: Universal Target Audio Separation with Language Models at Scale
par: Wang, Yuanyuan, et autres
Publié: (2025) -
MelTok: 2D Tokenization for Single-Codebook Audio Compression
par: Li, Jingyi, et autres
Publié: (2025)