The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ruixing, Liu, Zihan, Sun, Leilei, Zhu, Tongyu, Lv, Weifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
par: Zhang, Dan, et autres
Publié: (2026)
par: Zhang, Dan, et autres
Publié: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)
par: Zhao, Feiyu, et autres
Publié: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026)
par: Glazer, Neta, et autres
Publié: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
par: Lee, Kuan-Yi, et autres
Publié: (2025)
par: Lee, Kuan-Yi, et autres
Publié: (2025)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
par: Wang, Lu, et autres
Publié: (2025)
par: Wang, Lu, et autres
Publié: (2025)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
par: Zhang, Qian, et autres
Publié: (2026)
par: Zhang, Qian, et autres
Publié: (2026)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
par: Yang, Wanqi, et autres
Publié: (2024)
par: Yang, Wanqi, et autres
Publié: (2024)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
par: Shi, Yanfeng, et autres
Publié: (2026)
par: Shi, Yanfeng, et autres
Publié: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
par: Sun, Zhe, et autres
Publié: (2025)
par: Sun, Zhe, et autres
Publié: (2025)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
par: Wang, Junyou, et autres
Publié: (2025)
par: Wang, Junyou, et autres
Publié: (2025)
JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models
par: Peng, Zifan, et autres
Publié: (2025)
par: Peng, Zifan, et autres
Publié: (2025)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
par: Xie, Xinyuan, et autres
Publié: (2026)
par: Xie, Xinyuan, et autres
Publié: (2026)
Evaluation of Audio Language Models for Fairness, Safety, and Security
par: Aloufi, Ranya, et autres
Publié: (2026)
par: Aloufi, Ranya, et autres
Publié: (2026)
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
par: Xiong, Jiaqi, et autres
Publié: (2026)
par: Xiong, Jiaqi, et autres
Publié: (2026)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
par: Aparin, Georgii, et autres
Publié: (2026)
par: Aparin, Georgii, et autres
Publié: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
par: Li, Xiquan, et autres
Publié: (2025)
par: Li, Xiquan, et autres
Publié: (2025)
PitchBench: Measuring Pitch Hearing in Audio-Language Models
par: Dujardin, Milan Liessens, et autres
Publié: (2026)
par: Dujardin, Milan Liessens, et autres
Publié: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
par: Kang, Mintong, et autres
Publié: (2026)
par: Kang, Mintong, et autres
Publié: (2026)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
par: Zhao, Tong, et autres
Publié: (2026)
par: Zhao, Tong, et autres
Publié: (2026)
A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models
par: Christop, Iwona, et autres
Publié: (2026)
par: Christop, Iwona, et autres
Publié: (2026)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
par: Chen, Liangyu, et autres
Publié: (2024)
par: Chen, Liangyu, et autres
Publié: (2024)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
par: Feng, Bo-Han, et autres
Publié: (2026)
par: Feng, Bo-Han, et autres
Publié: (2026)
MOSS-Audio Technical Report
par: Yang, Chen, et autres
Publié: (2026)
par: Yang, Chen, et autres
Publié: (2026)
The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
par: You, Yuhuan, et autres
Publié: (2026)
par: You, Yuhuan, et autres
Publié: (2026)
Do Audio-Visual Large Language Models Really See and Hear?
par: Selvakumar, Ramaneswaran, et autres
Publié: (2026)
par: Selvakumar, Ramaneswaran, et autres
Publié: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
par: Li, Yanda, et autres
Publié: (2026)
par: Li, Yanda, et autres
Publié: (2026)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
par: Biswas, Subrata, et autres
Publié: (2025)
par: Biswas, Subrata, et autres
Publié: (2025)
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
par: Iyer, Laya, et autres
Publié: (2026)
par: Iyer, Laya, et autres
Publié: (2026)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
par: He, Peize, et autres
Publié: (2025)
par: He, Peize, et autres
Publié: (2025)
Guiding Audio Editing with Audio Language Model
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
par: Mehta, Videet, et autres
Publié: (2026)
par: Mehta, Videet, et autres
Publié: (2026)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
par: Wang, Tsai-Ning, et autres
Publié: (2025)
par: Wang, Tsai-Ning, et autres
Publié: (2025)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
Documents similaires
-
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
par: Zhang, Dan, et autres
Publié: (2026) -
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026) -
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026) -
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025) -
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)