Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Hualei, Li, Yiming, Ma, Shuo, Liu, Hong, Wang, Xiangdong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Leveraging Language Model Capabilities for Sound Event Detection
par: Wang, Hualei, et autres
Publié: (2023)
par: Wang, Hualei, et autres
Publié: (2023)
Bridging Language Gaps in Audio-Text Retrieval
par: Yan, Zhiyong, et autres
Publié: (2024)
par: Yan, Zhiyong, et autres
Publié: (2024)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
par: Yin, Han, et autres
Publié: (2026)
par: Yin, Han, et autres
Publié: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026)
par: Glazer, Neta, et autres
Publié: (2026)
Can Audio Large Language Models Verify Speaker Identity?
par: Ren, Yiming, et autres
Publié: (2025)
par: Ren, Yiming, et autres
Publié: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
Aligned Better, Listen Better for Audio-Visual Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
DIFFA: Large Language Diffusion Models Can Listen and Understand
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
Learning When to Think While Listening in Large Audio-Language Models
par: Song, Zhiyuan, et autres
Publié: (2026)
par: Song, Zhiyuan, et autres
Publié: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
par: Li, Yanda, et autres
Publié: (2026)
par: Li, Yanda, et autres
Publié: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)
par: Zhao, Feiyu, et autres
Publié: (2026)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
FLAM: Frame-Wise Language-Audio Modeling
par: Wu, Yusong, et autres
Publié: (2025)
par: Wu, Yusong, et autres
Publié: (2025)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
par: Taheri, Termeh, et autres
Publié: (2025)
par: Taheri, Termeh, et autres
Publié: (2025)
Audio Super-Resolution with Latent Bridge Models
par: Li, Chang, et autres
Publié: (2025)
par: Li, Chang, et autres
Publié: (2025)
Direct Simultaneous Translation Activation for Large Audio-Language Models
par: Zhang, Pei, et autres
Publié: (2025)
par: Zhang, Pei, et autres
Publié: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
par: Wang, Jieyi, et autres
Publié: (2026)
par: Wang, Jieyi, et autres
Publié: (2026)
Unlocking Large Audio-Language Models for Interactive Language Learning
par: Liu, Hongfu, et autres
Publié: (2026)
par: Liu, Hongfu, et autres
Publié: (2026)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
par: Shi, Yanfeng, et autres
Publié: (2026)
par: Shi, Yanfeng, et autres
Publié: (2026)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
par: Li, Hongyi, et autres
Publié: (2025)
par: Li, Hongyi, et autres
Publié: (2025)
SEA-Spoof: Bridging The Gap in Multilingual Audio Deepfake Detection for South-East Asian
par: Wu, Jinyang, et autres
Publié: (2025)
par: Wu, Jinyang, et autres
Publié: (2025)
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
par: Chung, Ho-Lam, et autres
Publié: (2026)
par: Chung, Ho-Lam, et autres
Publié: (2026)
Frame-Level Internal Tool Use for Temporal Grounding in Audio LMs
par: An, Joesph, et autres
Publié: (2026)
par: An, Joesph, et autres
Publié: (2026)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
Can Large Language Models Understand Spatial Audio?
par: Tang, Changli, et autres
Publié: (2024)
par: Tang, Changli, et autres
Publié: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
par: Liu, Jizhong, et autres
Publié: (2024)
par: Liu, Jizhong, et autres
Publié: (2024)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
par: Sridhar, Arvind Krishna, et autres
Publié: (2024)
par: Sridhar, Arvind Krishna, et autres
Publié: (2024)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
par: Yang, Dongchao, et autres
Publié: (2026)
par: Yang, Dongchao, et autres
Publié: (2026)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
par: Yang, Dongchao, et autres
Publié: (2025)
par: Yang, Dongchao, et autres
Publié: (2025)
Documents similaires
-
Leveraging Language Model Capabilities for Sound Event Detection
par: Wang, Hualei, et autres
Publié: (2023) -
Bridging Language Gaps in Audio-Text Retrieval
par: Yan, Zhiyong, et autres
Publié: (2024) -
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
par: Yin, Han, et autres
Publié: (2026) -
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026) -
Can Audio Large Language Models Verify Speaker Identity?
par: Ren, Yiming, et autres
Publié: (2025)