Towards Diverse and Efficient Audio Captioning via Diffusion Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Manjie, Li, Chenxing, Tu, Xinyi, Ren, Yong, Fu, Ruibo, Liang, Wei, Yu, Dong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Video-to-Audio Generation with Hidden Alignment
von: Xu, Manjie, et al.
Veröffentlicht: (2024)
von: Xu, Manjie, et al.
Veröffentlicht: (2024)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
von: Xu, Le, et al.
Veröffentlicht: (2025)
von: Xu, Le, et al.
Veröffentlicht: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
von: Li, Chenxing, et al.
Veröffentlicht: (2024)
von: Li, Chenxing, et al.
Veröffentlicht: (2024)
Prompt-guided Precise Audio Editing with Diffusion Models
von: Xu, Manjie, et al.
Veröffentlicht: (2024)
von: Xu, Manjie, et al.
Veröffentlicht: (2024)
Code over Words: Overcoming Semantic Inertia via Code-Grounded Reasoning
von: Xu, Manjie, et al.
Veröffentlicht: (2026)
von: Xu, Manjie, et al.
Veröffentlicht: (2026)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
von: Ren, Yong, et al.
Veröffentlicht: (2025)
von: Ren, Yong, et al.
Veröffentlicht: (2025)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
von: Ren, Yong, et al.
Veröffentlicht: (2024)
von: Ren, Yong, et al.
Veröffentlicht: (2024)
Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning
von: Tu, Yunbin, et al.
Veröffentlicht: (2024)
von: Tu, Yunbin, et al.
Veröffentlicht: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
von: Wu, Shu, et al.
Veröffentlicht: (2025)
von: Wu, Shu, et al.
Veröffentlicht: (2025)
Information-Theoretic Complementary Prompts for Improved Continual Text Classification
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
von: He, Xiang, et al.
Veröffentlicht: (2026)
von: He, Xiang, et al.
Veröffentlicht: (2026)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
Diffusion-RSCC: Diffusion Probabilistic Model for Change Captioning in Remote Sensing Images
von: Yu, Xiaofei, et al.
Veröffentlicht: (2024)
von: Yu, Xiaofei, et al.
Veröffentlicht: (2024)
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
von: Tang, Changli, et al.
Veröffentlicht: (2025)
von: Tang, Changli, et al.
Veröffentlicht: (2025)
Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization
von: Xiao, Cihan, et al.
Veröffentlicht: (2026)
von: Xiao, Cihan, et al.
Veröffentlicht: (2026)
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
von: Tian, Jinchuan, et al.
Veröffentlicht: (2026)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2026)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
von: Liu, Zheng, et al.
Veröffentlicht: (2024)
von: Liu, Zheng, et al.
Veröffentlicht: (2024)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
von: Guo, Tianyu, et al.
Veröffentlicht: (2025)
von: Guo, Tianyu, et al.
Veröffentlicht: (2025)
Federated Incremental Named Entity Recognition
von: Zhang, Duzhen, et al.
Veröffentlicht: (2024)
von: Zhang, Duzhen, et al.
Veröffentlicht: (2024)
MM-LLMs: Recent Advances in MultiModal Large Language Models
von: Zhang, Duzhen, et al.
Veröffentlicht: (2024)
von: Zhang, Duzhen, et al.
Veröffentlicht: (2024)
MAGIC-Enhanced Keyword Prompting for Zero-Shot Audio Captioning with CLIP Models
von: Govindarajan, Vijay, et al.
Veröffentlicht: (2025)
von: Govindarajan, Vijay, et al.
Veröffentlicht: (2025)
Exploring Stability-Plasticity Trade-offs for Continual Named Entity Recognition
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
Improving Text-To-Audio Models with Synthetic Captions
von: Kong, Zhifeng, et al.
Veröffentlicht: (2024)
von: Kong, Zhifeng, et al.
Veröffentlicht: (2024)
LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation
von: Chen, Jizheng, et al.
Veröffentlicht: (2026)
von: Chen, Jizheng, et al.
Veröffentlicht: (2026)
DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models
von: He, Shaokai, et al.
Veröffentlicht: (2026)
von: He, Shaokai, et al.
Veröffentlicht: (2026)
Enhancing Multimodal Continual Instruction Tuning with BranchLoRA
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning
von: Yan, Kaiying, et al.
Veröffentlicht: (2025)
von: Yan, Kaiying, et al.
Veröffentlicht: (2025)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
von: Wu, Tsung-Han, et al.
Veröffentlicht: (2024)
von: Wu, Tsung-Han, et al.
Veröffentlicht: (2024)
RECAP: Retrieval-Augmented Audio Captioning
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
von: Lavoie, Samuel, et al.
Veröffentlicht: (2024)
von: Lavoie, Samuel, et al.
Veröffentlicht: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
von: Hai, Jiarui, et al.
Veröffentlicht: (2024)
von: Hai, Jiarui, et al.
Veröffentlicht: (2024)
HyLaT: Efficient Multi-Agent Communication via Hybrid Latent-Text Protocol
von: Mou, Xinyi, et al.
Veröffentlicht: (2026)
von: Mou, Xinyi, et al.
Veröffentlicht: (2026)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
von: Su, Yi, et al.
Veröffentlicht: (2025)
von: Su, Yi, et al.
Veröffentlicht: (2025)
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024)
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
Flexora: Flexible Low Rank Adaptation for Large Language Models
von: Wei, Chenxing, et al.
Veröffentlicht: (2024)
von: Wei, Chenxing, et al.
Veröffentlicht: (2024)
Reinforced Efficient Reasoning via Semantically Diverse Exploration
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
Video Summarization: Towards Entity-Aware Captions
von: Ayyubi, Hammad A., et al.
Veröffentlicht: (2023)
von: Ayyubi, Hammad A., et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Video-to-Audio Generation with Hidden Alignment
von: Xu, Manjie, et al.
Veröffentlicht: (2024) -
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
von: Xu, Le, et al.
Veröffentlicht: (2025) -
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
von: Li, Chenxing, et al.
Veröffentlicht: (2024) -
Prompt-guided Precise Audio Editing with Diffusion Models
von: Xu, Manjie, et al.
Veröffentlicht: (2024) -
Code over Words: Overcoming Semantic Inertia via Code-Grounded Reasoning
von: Xu, Manjie, et al.
Veröffentlicht: (2026)