SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Yirong, Chen, Yanjun, Qiu, Xin, Zhang, Gang, Chen, Hongyu, Wu, Daokuan, Li, Chengming, Yang, Min, Zhu, Dawei, Zhang, Wei, Shen, Xiaoyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
por: Ji, Xiaozhong, et al.
Publicado: (2024)
por: Ji, Xiaozhong, et al.
Publicado: (2024)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
por: Xie, Siyi, et al.
Publicado: (2025)
por: Xie, Siyi, et al.
Publicado: (2025)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
por: Sun, Yirong, et al.
Publicado: (2025)
por: Sun, Yirong, et al.
Publicado: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)
por: Zhang, Yibo, et al.
Publicado: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
SonicSense: Object Perception from In-Hand Acoustic Vibration
por: Liu, Jiaxun, et al.
Publicado: (2024)
por: Liu, Jiaxun, et al.
Publicado: (2024)
AudioBench: A Universal Benchmark for Audio Large Language Models
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
por: Zhang, Qian, et al.
Publicado: (2026)
por: Zhang, Qian, et al.
Publicado: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
por: Wang, Lu, et al.
Publicado: (2025)
por: Wang, Lu, et al.
Publicado: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
por: Pian, Weiguo, et al.
Publicado: (2026)
por: Pian, Weiguo, et al.
Publicado: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
por: Li, Bohan, et al.
Publicado: (2025)
por: Li, Bohan, et al.
Publicado: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
por: Hu, Jiliang, et al.
Publicado: (2025)
por: Hu, Jiliang, et al.
Publicado: (2025)
Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch
por: Imamura, Kanami, et al.
Publicado: (2026)
por: Imamura, Kanami, et al.
Publicado: (2026)
Audio-Visual Speech Separation via Bottleneck Iterative Network
por: Zhang, Sidong, et al.
Publicado: (2025)
por: Zhang, Sidong, et al.
Publicado: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026)
por: Zhang, Linhao, et al.
Publicado: (2026)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
por: Xu, Qisheng, et al.
Publicado: (2024)
por: Xu, Qisheng, et al.
Publicado: (2024)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
por: García, Hugo Flores, et al.
Publicado: (2024)
por: García, Hugo Flores, et al.
Publicado: (2024)
From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation
por: Xue, Ke, et al.
Publicado: (2025)
por: Xue, Ke, et al.
Publicado: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
VoiceAgentRAG: Solving the RAG Latency Bottleneck in Real-Time Voice Agents Using Dual-Agent Architectures
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
por: Zhao, Feiyu, et al.
Publicado: (2026)
por: Zhao, Feiyu, et al.
Publicado: (2026)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
por: Wei, Xiangyi, et al.
Publicado: (2025)
por: Wei, Xiangyi, et al.
Publicado: (2025)
MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations
por: Guo, Wenxiang, et al.
Publicado: (2025)
por: Guo, Wenxiang, et al.
Publicado: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
por: Rai, Aashish, et al.
Publicado: (2024)
por: Rai, Aashish, et al.
Publicado: (2024)
SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations
por: Wang, Chunshi, et al.
Publicado: (2025)
por: Wang, Chunshi, et al.
Publicado: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
por: Shan, Weiqiao, et al.
Publicado: (2025)
por: Shan, Weiqiao, et al.
Publicado: (2025)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
por: Chen, Yuanjian, et al.
Publicado: (2026)
por: Chen, Yuanjian, et al.
Publicado: (2026)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
por: Sun, Jiahui, et al.
Publicado: (2025)
por: Sun, Jiahui, et al.
Publicado: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
por: Rouard, Simon, et al.
Publicado: (2024)
por: Rouard, Simon, et al.
Publicado: (2024)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
por: Guo, Tianyu, et al.
Publicado: (2025)
por: Guo, Tianyu, et al.
Publicado: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
por: Wang, Yuxuan, et al.
Publicado: (2026)
por: Wang, Yuxuan, et al.
Publicado: (2026)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
por: Cheng, Bo, et al.
Publicado: (2026)
por: Cheng, Bo, et al.
Publicado: (2026)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
por: Zhao, Lei, et al.
Publicado: (2025)
por: Zhao, Lei, et al.
Publicado: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
por: Chen, Wei-Chih, et al.
Publicado: (2026)
por: Chen, Wei-Chih, et al.
Publicado: (2026)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
Ejemplares similares
-
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
por: Ji, Xiaozhong, et al.
Publicado: (2024) -
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
por: Xie, Siyi, et al.
Publicado: (2025) -
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
por: Sun, Yirong, et al.
Publicado: (2025) -
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026) -
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)