DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiong, Jiaqi, Qi, Yunjia, Cao, Qi, Zheng, Yu, Zhang, Yutong, Wang, Ziteng, Liao, Ruofan, Xu, Weisheng, Liu, Sichen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
di: Li, Haowen, et al.
Pubblicazione: (2026)
di: Li, Haowen, et al.
Pubblicazione: (2026)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
di: Deng, Ruifan, et al.
Pubblicazione: (2025)
di: Deng, Ruifan, et al.
Pubblicazione: (2025)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
Past, Present, and Future of Spatial Audio and Room Acoustics
di: Koyama, Shoichi, et al.
Pubblicazione: (2025)
di: Koyama, Shoichi, et al.
Pubblicazione: (2025)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
di: Li, Yangze, et al.
Pubblicazione: (2024)
di: Li, Yangze, et al.
Pubblicazione: (2024)
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025)
di: Wen, Yutong, et al.
Pubblicazione: (2025)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
di: Ivry, Amir, et al.
Pubblicazione: (2026)
di: Ivry, Amir, et al.
Pubblicazione: (2026)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification
di: Ritu, Jarin, et al.
Pubblicazione: (2025)
di: Ritu, Jarin, et al.
Pubblicazione: (2025)
CoPlay: Audio-agnostic Cognitive Scaling for Acoustic Sensing
di: Li, Yin, et al.
Pubblicazione: (2024)
di: Li, Yin, et al.
Pubblicazione: (2024)
Audio Generation Through Score-Based Generative Modeling: Design Principles and Implementation
di: Zhu, Ge, et al.
Pubblicazione: (2025)
di: Zhu, Ge, et al.
Pubblicazione: (2025)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
Evaluation of Virtual Acoustic Environments with Different Acoustic Level of Detail
di: Fichna, Stefan, et al.
Pubblicazione: (2023)
di: Fichna, Stefan, et al.
Pubblicazione: (2023)
MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
di: Cai, Yiqiang, et al.
Pubblicazione: (2024)
di: Cai, Yiqiang, et al.
Pubblicazione: (2024)
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
di: Wang, Shuiyuan, et al.
Pubblicazione: (2026)
di: Wang, Shuiyuan, et al.
Pubblicazione: (2026)
Toward Faithful Explanations in Acoustic Anomaly Detection
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
The Arrow of Time in Music -- Revisiting the Temporal Structure of Music with Distinguishability and Unique Orientability as the Anchor Point
di: Xu, Qi
Pubblicazione: (2023)
di: Xu, Qi
Pubblicazione: (2023)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
DARAS: Dynamic Audio-Room Acoustic Synthesis for Blind Room Impulse Response Estimation
di: Wang, Chunxi, et al.
Pubblicazione: (2025)
di: Wang, Chunxi, et al.
Pubblicazione: (2025)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
di: Hu, Jinbo, et al.
Pubblicazione: (2025)
di: Hu, Jinbo, et al.
Pubblicazione: (2025)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
Voices of Civilizations: A Multilingual QA Benchmark for Global Music Understanding
di: Wu, Shangda, et al.
Pubblicazione: (2026)
di: Wu, Shangda, et al.
Pubblicazione: (2026)
Benchmarking Time-localized Explanations for Audio Classification Models
di: Bolaños, Cecilia, et al.
Pubblicazione: (2025)
di: Bolaños, Cecilia, et al.
Pubblicazione: (2025)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
Code Drift: Towards Idempotent Neural Audio Codecs
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
di: Daeglau, Mareike, et al.
Pubblicazione: (2025)
di: Daeglau, Mareike, et al.
Pubblicazione: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Acoustic Volume Rendering for Neural Impulse Response Fields
di: Lan, Zitong, et al.
Pubblicazione: (2024)
di: Lan, Zitong, et al.
Pubblicazione: (2024)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Can Audio Large Language Models Verify Speaker Identity?
di: Ren, Yiming, et al.
Pubblicazione: (2025)
di: Ren, Yiming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
di: Li, Haowen, et al.
Pubblicazione: (2026) -
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
di: Deng, Ruifan, et al.
Pubblicazione: (2025) -
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024) -
OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024) -
Past, Present, and Future of Spatial Audio and Room Acoustics
di: Koyama, Shoichi, et al.
Pubblicazione: (2025)