AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Junqi, Li, Chenxing, Zhao, Jinzheng, Chen, Rilin, Yu, Dong, Plumbley, Mark D., Wang, Wenwu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
par: Lin, Jingru, et autres
Publié: (2026)
par: Lin, Jingru, et autres
Publié: (2026)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
par: Zhao, Junqi, et autres
Publié: (2024)
par: Zhao, Junqi, et autres
Publié: (2024)
Region-Specific Audio Tagging for Spatial Sound
par: Zhao, Jinzheng, et autres
Publié: (2025)
par: Zhao, Jinzheng, et autres
Publié: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Retrieval-Augmented Text-to-Audio Generation
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
par: Yuan, Yi, et autres
Publié: (2025)
par: Yuan, Yi, et autres
Publié: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
par: Chen, Yifu, et autres
Publié: (2025)
par: Chen, Yifu, et autres
Publié: (2025)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
Towards Generating Diverse Audio Captions via Adversarial Training
par: Mei, Xinhao, et autres
Publié: (2022)
par: Mei, Xinhao, et autres
Publié: (2022)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
Gen-SER: When the generative model meets speech emotion recognition
par: Wang, Taihui, et autres
Publié: (2026)
par: Wang, Taihui, et autres
Publié: (2026)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
par: Mei, Xinhao, et autres
Publié: (2023)
par: Mei, Xinhao, et autres
Publié: (2023)
Learning Temporal Resolution in Spectrogram for Audio Classification
par: Liu, Haohe, et autres
Publié: (2022)
par: Liu, Haohe, et autres
Publié: (2022)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
par: Liu, Haohe, et autres
Publié: (2023)
par: Liu, Haohe, et autres
Publié: (2023)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
par: Yuan, Yi, et autres
Publié: (2024)
par: Yuan, Yi, et autres
Publié: (2024)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
par: Atito, Sara, et autres
Publié: (2022)
par: Atito, Sara, et autres
Publié: (2022)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
par: Liu, Haohe, et autres
Publié: (2024)
par: Liu, Haohe, et autres
Publié: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
par: He, Xiang, et autres
Publié: (2026)
par: He, Xiang, et autres
Publié: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
par: Yuan, Yi, et autres
Publié: (2024)
par: Yuan, Yi, et autres
Publié: (2024)
Compressing Quaternion Convolutional Neural Networks for Audio Classification
par: Singh, Arshdeep, et autres
Publié: (2025)
par: Singh, Arshdeep, et autres
Publié: (2025)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026)
par: Xie, Zeyu, et autres
Publié: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)
par: Zhao, Feiyu, et autres
Publié: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
par: Xu, Jilan, et autres
Publié: (2026)
par: Xu, Jilan, et autres
Publié: (2026)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
par: Chen, Wei-Chih, et autres
Publié: (2026)
par: Chen, Wei-Chih, et autres
Publié: (2026)
Documents similaires
-
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
par: Zhao, Junqi, et autres
Publié: (2025) -
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
par: Lin, Jingru, et autres
Publié: (2026) -
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
par: Zhao, Junqi, et autres
Publié: (2024) -
Region-Specific Audio Tagging for Spatial Sound
par: Zhao, Jinzheng, et autres
Publié: (2025) -
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)