EvA: An Evidence-First Audio Understanding Paradigm for LALMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Xinyuan, Chen, Shunian, Liu, Zhiheng, Zhang, Yuhao, Lv, Zhiqiang, Liang, Liyin, Wang, Benyou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation
di: Lee, Insung, et al.
Pubblicazione: (2026)
di: Lee, Insung, et al.
Pubblicazione: (2026)
Soundwave: Less is More for Speech-Text Alignment in LLMs
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
di: Mao, Ruixiang, et al.
Pubblicazione: (2026)
di: Mao, Ruixiang, et al.
Pubblicazione: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
di: Li, Xiquan, et al.
Pubblicazione: (2025)
di: Li, Xiquan, et al.
Pubblicazione: (2025)
Roadmap towards Superhuman Speech Understanding using Large Language Models
di: Bu, Fan, et al.
Pubblicazione: (2024)
di: Bu, Fan, et al.
Pubblicazione: (2024)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
di: Wang, Tsai-Ning, et al.
Pubblicazione: (2025)
di: Wang, Tsai-Ning, et al.
Pubblicazione: (2025)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
di: Aparin, Georgii, et al.
Pubblicazione: (2026)
di: Aparin, Georgii, et al.
Pubblicazione: (2026)
Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion
di: Ovanger, Oscar, et al.
Pubblicazione: (2026)
di: Ovanger, Oscar, et al.
Pubblicazione: (2026)
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
di: Iyer, Laya, et al.
Pubblicazione: (2026)
di: Iyer, Laya, et al.
Pubblicazione: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
ERIS: Evolutionary Real-world Interference Scheme for Jailbreaking Audio Large Models
di: Zhang, Yibo, et al.
Pubblicazione: (2025)
di: Zhang, Yibo, et al.
Pubblicazione: (2025)
EvMic: Event-based Non-contact sound recovery from effective spatial-temporal modeling
di: Yin, Hao, et al.
Pubblicazione: (2025)
di: Yin, Hao, et al.
Pubblicazione: (2025)
MOSS-Audio Technical Report
di: Yang, Chen, et al.
Pubblicazione: (2026)
di: Yang, Chen, et al.
Pubblicazione: (2026)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
di: Chen, Liyang, et al.
Pubblicazione: (2026)
di: Chen, Liyang, et al.
Pubblicazione: (2026)
The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
di: You, Yuhuan, et al.
Pubblicazione: (2026)
di: You, Yuhuan, et al.
Pubblicazione: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
di: Wang, Junyou, et al.
Pubblicazione: (2025)
di: Wang, Junyou, et al.
Pubblicazione: (2025)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
di: Zhang, Dan, et al.
Pubblicazione: (2026)
di: Zhang, Dan, et al.
Pubblicazione: (2026)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Audio Enhancement for Computer Audition -- An Iterative Training Paradigm Using Sample Importance
di: Milling, Manuel, et al.
Pubblicazione: (2024)
di: Milling, Manuel, et al.
Pubblicazione: (2024)
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
di: Li, Xuanchen, et al.
Pubblicazione: (2026)
di: Li, Xuanchen, et al.
Pubblicazione: (2026)
Analytic Incremental Learning For Sound Source Localization With Imbalance Rectification
di: Fan, Zexia, et al.
Pubblicazione: (2026)
di: Fan, Zexia, et al.
Pubblicazione: (2026)
Spatial Audio Motion Understanding and Reasoning
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2025)
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2025)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
di: Kang, Mintong, et al.
Pubblicazione: (2026)
di: Kang, Mintong, et al.
Pubblicazione: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
di: Sun, Zhe, et al.
Pubblicazione: (2025)
di: Sun, Zhe, et al.
Pubblicazione: (2025)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
AudioMosaic: Contrastive Masked Audio Representation Learning
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
di: Glazer, Neta, et al.
Pubblicazione: (2026)
di: Glazer, Neta, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
di: Chen, Shunian, et al.
Pubblicazione: (2025) -
CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation
di: Lee, Insung, et al.
Pubblicazione: (2026) -
Soundwave: Less is More for Speech-Text Alignment in LLMs
di: Zhang, Yuhao, et al.
Pubblicazione: (2025) -
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
di: Mao, Ruixiang, et al.
Pubblicazione: (2026) -
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
di: Li, Xiquan, et al.
Pubblicazione: (2025)