Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiquan, Liu, Junxi, Chen, Wenxi, Zhu, Haina, Ma, Ziyang, Chen, Xie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
par: Li, Xiquan, et autres
Publié: (2025)
par: Li, Xiquan, et autres
Publié: (2025)
Audio ControlNet for Fine-Grained Audio Generation and Editing
par: Zhu, Haina, et autres
Publié: (2026)
par: Zhu, Haina, et autres
Publié: (2026)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
Towards Reliable Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
par: Li, Xiquan, et autres
Publié: (2024)
par: Li, Xiquan, et autres
Publié: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
par: Chen, Wenxi, et autres
Publié: (2024)
par: Chen, Wenxi, et autres
Publié: (2024)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
TinyMU: A Compact Audio-Language Model for Music Understanding
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
par: Chen, Wenxi, et autres
Publié: (2024)
par: Chen, Wenxi, et autres
Publié: (2024)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
par: Chen, Wei-Chih, et autres
Publié: (2026)
par: Chen, Wei-Chih, et autres
Publié: (2026)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
par: Li, Chen-An, et autres
Publié: (2025)
par: Li, Chen-An, et autres
Publié: (2025)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
par: Xu, Jilan, et autres
Publié: (2026)
par: Xu, Jilan, et autres
Publié: (2026)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
par: Li, Hongyi, et autres
Publié: (2025)
par: Li, Hongyi, et autres
Publié: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
par: Li, Bohan, et autres
Publié: (2025)
par: Li, Bohan, et autres
Publié: (2025)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
par: Xie, Hao-Hui, et autres
Publié: (2026)
par: Xie, Hao-Hui, et autres
Publié: (2026)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
par: Yang, Dongchao, et autres
Publié: (2026)
par: Yang, Dongchao, et autres
Publié: (2026)
Towards Weakly Supervised Text-to-Audio Grounding
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
par: Yuan, Yi, et autres
Publié: (2025)
par: Yuan, Yi, et autres
Publié: (2025)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
par: Mei, Jiahao, et autres
Publié: (2026)
par: Mei, Jiahao, et autres
Publié: (2026)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
par: Niu, Zhikang, et autres
Publié: (2024)
par: Niu, Zhikang, et autres
Publié: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
par: Fang, Linghan, et autres
Publié: (2026)
par: Fang, Linghan, et autres
Publié: (2026)
Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models
par: Wang, Hualei, et autres
Publié: (2025)
par: Wang, Hualei, et autres
Publié: (2025)
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
par: Taheri, Termeh, et autres
Publié: (2025)
par: Taheri, Termeh, et autres
Publié: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
par: He, Xiang, et autres
Publié: (2026)
par: He, Xiang, et autres
Publié: (2026)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)
par: Zhao, Feiyu, et autres
Publié: (2026)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
Documents similaires
-
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
par: Li, Xiquan, et autres
Publié: (2025) -
Audio ControlNet for Fine-Grained Audio Generation and Editing
par: Zhu, Haina, et autres
Publié: (2026) -
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
par: Li, Xiquan, et autres
Publié: (2026) -
Towards Reliable Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025) -
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
par: Li, Xiquan, et autres
Publié: (2024)