SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Yirong, Chen, Yanjun, Qiu, Xin, Zhang, Gang, Chen, Hongyu, Wu, Daokuan, Li, Chengming, Yang, Min, Zhu, Dawei, Zhang, Wei, Shen, Xiaoyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
von: Ji, Xiaozhong, et al.
Veröffentlicht: (2024)
von: Ji, Xiaozhong, et al.
Veröffentlicht: (2024)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
von: Xie, Siyi, et al.
Veröffentlicht: (2025)
von: Xie, Siyi, et al.
Veröffentlicht: (2025)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
von: Sun, Yirong, et al.
Veröffentlicht: (2025)
von: Sun, Yirong, et al.
Veröffentlicht: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
von: Zhang, Yibo, et al.
Veröffentlicht: (2026)
von: Zhang, Yibo, et al.
Veröffentlicht: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
SonicSense: Object Perception from In-Hand Acoustic Vibration
von: Liu, Jiaxun, et al.
Veröffentlicht: (2024)
von: Liu, Jiaxun, et al.
Veröffentlicht: (2024)
AudioBench: A Universal Benchmark for Audio Large Language Models
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
von: Zhang, Qian, et al.
Veröffentlicht: (2026)
von: Zhang, Qian, et al.
Veröffentlicht: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
von: Wang, Lu, et al.
Veröffentlicht: (2025)
von: Wang, Lu, et al.
Veröffentlicht: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
von: Pian, Weiguo, et al.
Veröffentlicht: (2026)
von: Pian, Weiguo, et al.
Veröffentlicht: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
von: Li, Bohan, et al.
Veröffentlicht: (2025)
von: Li, Bohan, et al.
Veröffentlicht: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch
von: Imamura, Kanami, et al.
Veröffentlicht: (2026)
von: Imamura, Kanami, et al.
Veröffentlicht: (2026)
Audio-Visual Speech Separation via Bottleneck Iterative Network
von: Zhang, Sidong, et al.
Veröffentlicht: (2025)
von: Zhang, Sidong, et al.
Veröffentlicht: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
von: Zhang, Linhao, et al.
Veröffentlicht: (2026)
von: Zhang, Linhao, et al.
Veröffentlicht: (2026)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
von: Xu, Qisheng, et al.
Veröffentlicht: (2024)
von: Xu, Qisheng, et al.
Veröffentlicht: (2024)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
von: Luo, Kaiwen, et al.
Veröffentlicht: (2026)
von: Luo, Kaiwen, et al.
Veröffentlicht: (2026)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
von: García, Hugo Flores, et al.
Veröffentlicht: (2024)
von: García, Hugo Flores, et al.
Veröffentlicht: (2024)
From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation
von: Xue, Ke, et al.
Veröffentlicht: (2025)
von: Xue, Ke, et al.
Veröffentlicht: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
von: Zhao, Xiaohan, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaohan, et al.
Veröffentlicht: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
von: Zhao, Junqi, et al.
Veröffentlicht: (2025)
von: Zhao, Junqi, et al.
Veröffentlicht: (2025)
VoiceAgentRAG: Solving the RAG Latency Bottleneck in Real-Time Voice Agents Using Dual-Agent Architectures
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
von: Wei, Xiangyi, et al.
Veröffentlicht: (2025)
von: Wei, Xiangyi, et al.
Veröffentlicht: (2025)
MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations
von: Guo, Wenxiang, et al.
Veröffentlicht: (2025)
von: Guo, Wenxiang, et al.
Veröffentlicht: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
von: Rai, Aashish, et al.
Veröffentlicht: (2024)
von: Rai, Aashish, et al.
Veröffentlicht: (2024)
SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations
von: Wang, Chunshi, et al.
Veröffentlicht: (2025)
von: Wang, Chunshi, et al.
Veröffentlicht: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
von: Shan, Weiqiao, et al.
Veröffentlicht: (2025)
von: Shan, Weiqiao, et al.
Veröffentlicht: (2025)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
von: Chen, Yuanjian, et al.
Veröffentlicht: (2026)
von: Chen, Yuanjian, et al.
Veröffentlicht: (2026)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
von: Sun, Jiahui, et al.
Veröffentlicht: (2025)
von: Sun, Jiahui, et al.
Veröffentlicht: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
von: Rouard, Simon, et al.
Veröffentlicht: (2024)
von: Rouard, Simon, et al.
Veröffentlicht: (2024)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
von: Guo, Tianyu, et al.
Veröffentlicht: (2025)
von: Guo, Tianyu, et al.
Veröffentlicht: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
von: Cheng, Bo, et al.
Veröffentlicht: (2026)
von: Cheng, Bo, et al.
Veröffentlicht: (2026)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
von: Zhao, Lei, et al.
Veröffentlicht: (2025)
von: Zhao, Lei, et al.
Veröffentlicht: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
von: Luo, Kaiwen, et al.
Veröffentlicht: (2026)
von: Luo, Kaiwen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
von: Ji, Xiaozhong, et al.
Veröffentlicht: (2024) -
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
von: Xie, Siyi, et al.
Veröffentlicht: (2025) -
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
von: Sun, Yirong, et al.
Veröffentlicht: (2025) -
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
von: Qiu, Jielin, et al.
Veröffentlicht: (2026) -
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
von: Zhang, Yibo, et al.
Veröffentlicht: (2026)