AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
Fuente:
arXiv
Salvato in:
| Autori principali: | Ren, Yiming, Xu, Xuenan, Zhang, Ziyang, Wu, Wen, Li, Baoxiang, Zhang, Chao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Audio Large Language Models Verify Speaker Identity?
di: Ren, Yiming, et al.
Pubblicazione: (2025)
di: Ren, Yiming, et al.
Pubblicazione: (2025)
HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing
di: Xu, Xuenan, et al.
Pubblicazione: (2026)
di: Xu, Xuenan, et al.
Pubblicazione: (2026)
Bayesian Speech Synthesizers Can Learn from Multiple Teachers
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
di: Tao, Ye, et al.
Pubblicazione: (2025)
di: Tao, Ye, et al.
Pubblicazione: (2025)
Towards Weakly Supervised Text-to-Audio Grounding
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
di: Zhang, Yaoyun, et al.
Pubblicazione: (2024)
di: Zhang, Yaoyun, et al.
Pubblicazione: (2024)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
di: Chen, William, et al.
Pubblicazione: (2026)
di: Chen, William, et al.
Pubblicazione: (2026)
Enhancing Audio Generation Diversity with Visual Information
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
di: Li, Baihan, et al.
Pubblicazione: (2024)
di: Li, Baihan, et al.
Pubblicazione: (2024)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
di: Li, Xiquan, et al.
Pubblicazione: (2024)
di: Li, Xiquan, et al.
Pubblicazione: (2024)
STAR: Speech-to-Audio Generation via Representation Learning
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
di: Tong, Siqian, et al.
Pubblicazione: (2026)
di: Tong, Siqian, et al.
Pubblicazione: (2026)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
di: Xie, Zeyu, et al.
Pubblicazione: (2026)
di: Xie, Zeyu, et al.
Pubblicazione: (2026)
FakeSound: Deepfake General Audio Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
HRTFformer: A Spatially-Aware Transformer for Individual HRTF Upsampling in Immersive Audio Rendering
di: Hu, Xuyi, et al.
Pubblicazione: (2025)
di: Hu, Xuyi, et al.
Pubblicazione: (2025)
When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
TTSOps: A Closed-Loop Corpus Optimization Framework for Training Multi-Speaker TTS Models from Dark Data
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention
di: Zhang, Yimeng, et al.
Pubblicazione: (2026)
di: Zhang, Yimeng, et al.
Pubblicazione: (2026)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
di: Xie, Siyi, et al.
Pubblicazione: (2025)
di: Xie, Siyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Can Audio Large Language Models Verify Speaker Identity?
di: Ren, Yiming, et al.
Pubblicazione: (2025) -
HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing
di: Xu, Xuenan, et al.
Pubblicazione: (2026) -
Bayesian Speech Synthesizers Can Learn from Multiple Teachers
di: Zhang, Ziyang, et al.
Pubblicazione: (2025) -
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
di: Tao, Ye, et al.
Pubblicazione: (2025) -
Towards Weakly Supervised Text-to-Audio Grounding
di: Xu, Xuenan, et al.
Pubblicazione: (2024)