AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Peize, Wen, Zichen, Wang, Yubo, Wang, Yuxuan, Liu, Xiaoqian, Huang, Jiajie, Lei, Zehui, Gu, Zhuangcheng, Jin, Xiangqi, Yang, Jiabing, Li, Kai, Liu, Zhifei, Li, Weijia, Wang, Cunxiang, He, Conghui, Zhang, Linfeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
von: He, Peize, et al.
Veröffentlicht: (2026)
von: He, Peize, et al.
Veröffentlicht: (2026)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
von: Xiong, Minhao, et al.
Veröffentlicht: (2025)
von: Xiong, Minhao, et al.
Veröffentlicht: (2025)
OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning
von: Kang, Hengrui, et al.
Veröffentlicht: (2025)
von: Kang, Hengrui, et al.
Veröffentlicht: (2025)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026)
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
von: Ke, Junlong, et al.
Veröffentlicht: (2026)
von: Ke, Junlong, et al.
Veröffentlicht: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
von: Yuan, Yi, et al.
Veröffentlicht: (2025)
von: Yuan, Yi, et al.
Veröffentlicht: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
von: Luo, Kaiwen, et al.
Veröffentlicht: (2026)
von: Luo, Kaiwen, et al.
Veröffentlicht: (2026)
Reconfigurable Structural Audio Based on an Anisotropic Stretchable Metasurface
von: Jiajie He, et al.
Veröffentlicht: (2025)
von: Jiajie He, et al.
Veröffentlicht: (2025)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
von: Liu, Haohe, et al.
Veröffentlicht: (2023)
von: Liu, Haohe, et al.
Veröffentlicht: (2023)
Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
von: Wang, Shaobo, et al.
Veröffentlicht: (2025)
von: Wang, Shaobo, et al.
Veröffentlicht: (2025)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
von: Wang, Junyou, et al.
Veröffentlicht: (2025)
von: Wang, Junyou, et al.
Veröffentlicht: (2025)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
von: Shi, Qundong, et al.
Veröffentlicht: (2026)
von: Shi, Qundong, et al.
Veröffentlicht: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
von: Wang, Lu, et al.
Veröffentlicht: (2025)
von: Wang, Lu, et al.
Veröffentlicht: (2025)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
von: Song, Zirui, et al.
Veröffentlicht: (2025)
von: Song, Zirui, et al.
Veröffentlicht: (2025)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
von: He, Haolin, et al.
Veröffentlicht: (2025)
von: He, Haolin, et al.
Veröffentlicht: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
von: He, Xiang, et al.
Veröffentlicht: (2026)
von: He, Xiang, et al.
Veröffentlicht: (2026)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
von: Liu, Chen, et al.
Veröffentlicht: (2025)
von: Liu, Chen, et al.
Veröffentlicht: (2025)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
In-Context Audio Control of Video Diffusion Transformers
von: Liu, Wenze, et al.
Veröffentlicht: (2025)
von: Liu, Wenze, et al.
Veröffentlicht: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
von: Zhu, Xinfa, et al.
Veröffentlicht: (2025)
von: Zhu, Xinfa, et al.
Veröffentlicht: (2025)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
von: Liu, Chen, et al.
Veröffentlicht: (2025)
von: Liu, Chen, et al.
Veröffentlicht: (2025)
Fish Audio S2 Technical Report
von: Liao, Shijia, et al.
Veröffentlicht: (2026)
von: Liao, Shijia, et al.
Veröffentlicht: (2026)
SemanticAudio: Audio Generation and Editing in Semantic Space
von: Dai, Zheqi, et al.
Veröffentlicht: (2026)
von: Dai, Zheqi, et al.
Veröffentlicht: (2026)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
von: Wang, Yucheng, et al.
Veröffentlicht: (2026)
von: Wang, Yucheng, et al.
Veröffentlicht: (2026)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
Streaming Audio Transformers for Online Audio Tagging
von: Dinkel, Heinrich, et al.
Veröffentlicht: (2023)
von: Dinkel, Heinrich, et al.
Veröffentlicht: (2023)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models
von: He, Yingxu, et al.
Veröffentlicht: (2024)
von: He, Yingxu, et al.
Veröffentlicht: (2024)
AudioMarkBench: Benchmarking Robustness of Audio Watermarking
von: Liu, Hongbin, et al.
Veröffentlicht: (2024)
von: Liu, Hongbin, et al.
Veröffentlicht: (2024)
The Impact of Audio Watermarking on Audio Anti-Spoofing Countermeasures
von: Zhang, Zhenshan, et al.
Veröffentlicht: (2025)
von: Zhang, Zhenshan, et al.
Veröffentlicht: (2025)
A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation
von: Wang, Pingjie, et al.
Veröffentlicht: (2024)
von: Wang, Pingjie, et al.
Veröffentlicht: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
von: Wu, Daiqing, et al.
Veröffentlicht: (2026)
von: Wu, Daiqing, et al.
Veröffentlicht: (2026)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
von: Zhao, Junqi, et al.
Veröffentlicht: (2025)
von: Zhao, Junqi, et al.
Veröffentlicht: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026) -
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
von: He, Peize, et al.
Veröffentlicht: (2026) -
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
von: Xiong, Minhao, et al.
Veröffentlicht: (2025) -
OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning
von: Kang, Hengrui, et al.
Veröffentlicht: (2025) -
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026)