Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shan, Weiqiao, Li, Yuang, Zhang, Yuhao, Luo, Yingfeng, Xu, Chen, Zhao, Xiaofeng, Meng, Long, Lu, Yunfei, Zhang, Min, Yang, Hao, Xiao, Tong, Zhu, Jingbo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimizing Speech Multi-View Feature Fusion through Conditional Computation
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
par: Li, Yangze, et autres
Publié: (2024)
par: Li, Yangze, et autres
Publié: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
par: Yeh, Yen-Tung, et autres
Publié: (2025)
par: Yeh, Yen-Tung, et autres
Publié: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Cross-Domain Audio Deepfake Detection: Dataset and Analysis
par: Li, Yuang, et autres
Publié: (2024)
par: Li, Yuang, et autres
Publié: (2024)
Asymmetric Encoder-Decoder Based on Time-Frequency Correlation for Speech Separation
par: Shin, Ui-Hyeop, et autres
Publié: (2026)
par: Shin, Ui-Hyeop, et autres
Publié: (2026)
Enhancing Crowdsourced Audio for Text-to-Speech Models
par: Giraldo, José, et autres
Publié: (2024)
par: Giraldo, José, et autres
Publié: (2024)
Speech-Aware Neural Diarization with Encoder-Decoder Attractor Guided by Attention Constraints
par: Lee, PeiYing, et autres
Publié: (2024)
par: Lee, PeiYing, et autres
Publié: (2024)
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
par: Li, Hanzhao, et autres
Publié: (2025)
par: Li, Hanzhao, et autres
Publié: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Recent Advances in End-to-End Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
LEMAS: Large A 150K-Hour Large-scale Extensible Multilingual Audio Suite with Generative Speech Models
par: Zhao, Zhiyuan, et autres
Publié: (2026)
par: Zhao, Zhiyuan, et autres
Publié: (2026)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
par: Zhang, Fengrun, et autres
Publié: (2024)
par: Zhang, Fengrun, et autres
Publié: (2024)
SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation
par: Huang, Ziling, et autres
Publié: (2025)
par: Huang, Ziling, et autres
Publié: (2025)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
par: Zhang, Wenyu, et autres
Publié: (2024)
par: Zhang, Wenyu, et autres
Publié: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
par: Jeong, Wonwoo
Publié: (2026)
par: Jeong, Wonwoo
Publié: (2026)
Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
par: Li, Yuang, et autres
Publié: (2024)
par: Li, Yuang, et autres
Publié: (2024)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
PromptSep: Generative Audio Separation via Multimodal Prompting
par: Wen, Yutong, et autres
Publié: (2025)
par: Wen, Yutong, et autres
Publié: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
Electrolaryngeal Speech Intelligibility Enhancement Through Robust Linguistic Encoders
par: Violeta, Lester Phillip, et autres
Publié: (2023)
par: Violeta, Lester Phillip, et autres
Publié: (2023)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
par: Xu, Kai-Tuo, et autres
Publié: (2025)
par: Xu, Kai-Tuo, et autres
Publié: (2025)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
par: Zhang, Daning, et autres
Publié: (2025)
par: Zhang, Daning, et autres
Publié: (2025)
Documents similaires
-
Optimizing Speech Multi-View Feature Fusion through Conditional Computation
par: Shan, Weiqiao, et autres
Publié: (2025) -
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
par: Zhang, Yuhao, et autres
Publié: (2025) -
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025) -
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
par: Li, Yangze, et autres
Publié: (2024) -
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
par: Yang, Xiaoyu, et autres
Publié: (2024)