SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yuanhe, Tian, Jiayu, Zhang, Yibo, Yan, Shilinlu, Lin, Liang, Zhou, Zhenhong, Sun, Li, Su, Sen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
par: Zhang, Yibo, et autres
Publié: (2026)
par: Zhang, Yibo, et autres
Publié: (2026)
ERIS: Evolutionary Real-world Interference Scheme for Jailbreaking Audio Large Models
par: Zhang, Yibo, et autres
Publié: (2025)
par: Zhang, Yibo, et autres
Publié: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
par: Lin, Liang, et autres
Publié: (2025)
par: Lin, Liang, et autres
Publié: (2025)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
DemonAgent: Dynamically Encrypted Multi-Backdoor Implantation Attack on LLM-based Agent
par: Zhu, Pengyu, et autres
Publié: (2025)
par: Zhu, Pengyu, et autres
Publié: (2025)
EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
par: Lin, Liang, et autres
Publié: (2026)
par: Lin, Liang, et autres
Publié: (2026)
GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks
par: Dai, Lingling, et autres
Publié: (2026)
par: Dai, Lingling, et autres
Publié: (2026)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
par: Yin, Han, et autres
Publié: (2026)
par: Yin, Han, et autres
Publié: (2026)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
Can Large Language Models Understand Spatial Audio?
par: Tang, Changli, et autres
Publié: (2024)
par: Tang, Changli, et autres
Publié: (2024)
Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models
par: Wang, Yanyun, et autres
Publié: (2026)
par: Wang, Yanyun, et autres
Publié: (2026)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
par: Li, Hongyi, et autres
Publié: (2025)
par: Li, Hongyi, et autres
Publié: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
par: Sun, Zhe, et autres
Publié: (2025)
par: Sun, Zhe, et autres
Publié: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
Toward Noise-Aware Audio Deepfake Detection: Survey, SNR-Benchmarks, and Practical Recipes
par: Sen, Udayon, et autres
Publié: (2025)
par: Sen, Udayon, et autres
Publié: (2025)
AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition
par: Xiong, Jiayu, et autres
Publié: (2025)
par: Xiong, Jiayu, et autres
Publié: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
par: Lee, Kuan-Yi, et autres
Publié: (2025)
par: Lee, Kuan-Yi, et autres
Publié: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
par: Zhang, Ruixing, et autres
Publié: (2026)
par: Zhang, Ruixing, et autres
Publié: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)
par: Zhao, Feiyu, et autres
Publié: (2026)
SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
par: Sun, Yirong, et autres
Publié: (2026)
par: Sun, Yirong, et autres
Publié: (2026)
Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
par: Li, Chen-An, et autres
Publié: (2025)
par: Li, Chen-An, et autres
Publié: (2025)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025)
par: Sun, Chunyu, et autres
Publié: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
par: Liu, Jizhong, et autres
Publié: (2024)
par: Liu, Jizhong, et autres
Publié: (2024)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
par: Liu, Chengwei, et autres
Publié: (2025)
par: Liu, Chengwei, et autres
Publié: (2025)
Quantifying Spatial Audio Quality Impairment
par: Watcharasupat, Karn N., et autres
Publié: (2023)
par: Watcharasupat, Karn N., et autres
Publié: (2023)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
par: Xu, Jilan, et autres
Publié: (2026)
par: Xu, Jilan, et autres
Publié: (2026)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
par: Taheri, Termeh, et autres
Publié: (2025)
par: Taheri, Termeh, et autres
Publié: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
par: Tao, Ye, et autres
Publié: (2025)
par: Tao, Ye, et autres
Publié: (2025)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
par: Meng, Hanyu, et autres
Publié: (2025)
par: Meng, Hanyu, et autres
Publié: (2025)
Documents similaires
-
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
par: Zhang, Yibo, et autres
Publié: (2026) -
ERIS: Evolutionary Real-world Interference Scheme for Jailbreaking Audio Large Models
par: Zhang, Yibo, et autres
Publié: (2025) -
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026) -
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
par: Lin, Liang, et autres
Publié: (2025) -
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
par: Luo, Kaiwen, et autres
Publié: (2026)