Towards Diverse and Efficient Audio Captioning via Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Manjie, Li, Chenxing, Tu, Xinyi, Ren, Yong, Fu, Ruibo, Liang, Wei, Yu, Dong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video-to-Audio Generation with Hidden Alignment
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025)
di: Xu, Le, et al.
Pubblicazione: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
di: Li, Chenxing, et al.
Pubblicazione: (2024)
di: Li, Chenxing, et al.
Pubblicazione: (2024)
Prompt-guided Precise Audio Editing with Diffusion Models
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
Code over Words: Overcoming Semantic Inertia via Code-Grounded Reasoning
di: Xu, Manjie, et al.
Pubblicazione: (2026)
di: Xu, Manjie, et al.
Pubblicazione: (2026)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
di: Ren, Yong, et al.
Pubblicazione: (2025)
di: Ren, Yong, et al.
Pubblicazione: (2025)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Information-Theoretic Complementary Prompts for Improved Continual Text Classification
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
di: He, Xiang, et al.
Pubblicazione: (2026)
di: He, Xiang, et al.
Pubblicazione: (2026)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
Diffusion-RSCC: Diffusion Probabilistic Model for Change Captioning in Remote Sensing Images
di: Yu, Xiaofei, et al.
Pubblicazione: (2024)
di: Yu, Xiaofei, et al.
Pubblicazione: (2024)
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
di: Tang, Changli, et al.
Pubblicazione: (2025)
di: Tang, Changli, et al.
Pubblicazione: (2025)
Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization
di: Xiao, Cihan, et al.
Pubblicazione: (2026)
di: Xiao, Cihan, et al.
Pubblicazione: (2026)
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
di: Tian, Jinchuan, et al.
Pubblicazione: (2026)
di: Tian, Jinchuan, et al.
Pubblicazione: (2026)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
di: Liu, Zheng, et al.
Pubblicazione: (2024)
di: Liu, Zheng, et al.
Pubblicazione: (2024)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
Federated Incremental Named Entity Recognition
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
MM-LLMs: Recent Advances in MultiModal Large Language Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
MAGIC-Enhanced Keyword Prompting for Zero-Shot Audio Captioning with CLIP Models
di: Govindarajan, Vijay, et al.
Pubblicazione: (2025)
di: Govindarajan, Vijay, et al.
Pubblicazione: (2025)
Exploring Stability-Plasticity Trade-offs for Continual Named Entity Recognition
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Improving Text-To-Audio Models with Synthetic Captions
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation
di: Chen, Jizheng, et al.
Pubblicazione: (2026)
di: Chen, Jizheng, et al.
Pubblicazione: (2026)
DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models
di: He, Shaokai, et al.
Pubblicazione: (2026)
di: He, Shaokai, et al.
Pubblicazione: (2026)
Enhancing Multimodal Continual Instruction Tuning with BranchLoRA
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning
di: Yan, Kaiying, et al.
Pubblicazione: (2025)
di: Yan, Kaiying, et al.
Pubblicazione: (2025)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
RECAP: Retrieval-Augmented Audio Captioning
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
HyLaT: Efficient Multi-Agent Communication via Hybrid Latent-Text Protocol
di: Mou, Xinyi, et al.
Pubblicazione: (2026)
di: Mou, Xinyi, et al.
Pubblicazione: (2026)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
di: Sun, Linzhuang, et al.
Pubblicazione: (2024)
di: Sun, Linzhuang, et al.
Pubblicazione: (2024)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
di: Munakata, Hokuto, et al.
Pubblicazione: (2025)
di: Munakata, Hokuto, et al.
Pubblicazione: (2025)
Flexora: Flexible Low Rank Adaptation for Large Language Models
di: Wei, Chenxing, et al.
Pubblicazione: (2024)
di: Wei, Chenxing, et al.
Pubblicazione: (2024)
Reinforced Efficient Reasoning via Semantically Diverse Exploration
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
Documenti analoghi
-
Video-to-Audio Generation with Hidden Alignment
di: Xu, Manjie, et al.
Pubblicazione: (2024) -
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025) -
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
di: Li, Chenxing, et al.
Pubblicazione: (2024) -
Prompt-guided Precise Audio Editing with Diffusion Models
di: Xu, Manjie, et al.
Pubblicazione: (2024) -
Code over Words: Overcoming Semantic Inertia via Code-Grounded Reasoning
di: Xu, Manjie, et al.
Pubblicazione: (2026)