CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mehta, Videet, Wang, Liming, Kuehne, Hilde, Feris, Rogerio, Glass, James R., Mirza, M. Jehanzeb |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards Audio Token Compression in Large Audio Language Models
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2025)
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
von: Araujo, Edson, et al.
Veröffentlicht: (2026)
von: Araujo, Edson, et al.
Veröffentlicht: (2026)
State-Space Large Audio Language Models
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2024)
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2024)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
von: Araujo, Edson, et al.
Veröffentlicht: (2025)
von: Araujo, Edson, et al.
Veröffentlicht: (2025)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
von: Aparin, Georgii, et al.
Veröffentlicht: (2026)
von: Aparin, Georgii, et al.
Veröffentlicht: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
von: You, Yuhuan, et al.
Veröffentlicht: (2026)
von: You, Yuhuan, et al.
Veröffentlicht: (2026)
Do Audio-Visual Large Language Models Really See and Hear?
von: Selvakumar, Ramaneswaran, et al.
Veröffentlicht: (2026)
von: Selvakumar, Ramaneswaran, et al.
Veröffentlicht: (2026)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
von: Biswas, Subrata, et al.
Veröffentlicht: (2025)
von: Biswas, Subrata, et al.
Veröffentlicht: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
von: Li, Yanda, et al.
Veröffentlicht: (2026)
von: Li, Yanda, et al.
Veröffentlicht: (2026)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
von: Li, Jia, et al.
Veröffentlicht: (2025)
von: Li, Jia, et al.
Veröffentlicht: (2025)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
von: Chen, Yukun, et al.
Veröffentlicht: (2026)
von: Chen, Yukun, et al.
Veröffentlicht: (2026)
Evaluation of Audio Language Models for Fairness, Safety, and Security
von: Aloufi, Ranya, et al.
Veröffentlicht: (2026)
von: Aloufi, Ranya, et al.
Veröffentlicht: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
von: Song, Zirui, et al.
Veröffentlicht: (2025)
von: Song, Zirui, et al.
Veröffentlicht: (2025)
PitchBench: Measuring Pitch Hearing in Audio-Language Models
von: Dujardin, Milan Liessens, et al.
Veröffentlicht: (2026)
von: Dujardin, Milan Liessens, et al.
Veröffentlicht: (2026)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
ERIS: Evolutionary Real-world Interference Scheme for Jailbreaking Audio Large Models
von: Zhang, Yibo, et al.
Veröffentlicht: (2025)
von: Zhang, Yibo, et al.
Veröffentlicht: (2025)
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
von: Luo, Jiehui, et al.
Veröffentlicht: (2025)
von: Luo, Jiehui, et al.
Veröffentlicht: (2025)
Reliable Audio Deepfake Detection in Variable Conditions via Quantum-Kernel SVMs
von: Amin, Lisan Al, et al.
Veröffentlicht: (2025)
von: Amin, Lisan Al, et al.
Veröffentlicht: (2025)
Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack
von: Ziv, Roee, et al.
Veröffentlicht: (2025)
von: Ziv, Roee, et al.
Veröffentlicht: (2025)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2025)
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2025)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
von: Yang, Wanqi, et al.
Veröffentlicht: (2024)
von: Yang, Wanqi, et al.
Veröffentlicht: (2024)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
Tadabur: A Large-Scale Quran Audio Dataset
von: Alherran, Faisal
Veröffentlicht: (2026)
von: Alherran, Faisal
Veröffentlicht: (2026)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
von: Li, Wenyu, et al.
Veröffentlicht: (2025)
von: Li, Wenyu, et al.
Veröffentlicht: (2025)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
von: Hu, Xiaolin, et al.
Veröffentlicht: (2026)
von: Hu, Xiaolin, et al.
Veröffentlicht: (2026)
A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models
von: Christop, Iwona, et al.
Veröffentlicht: (2026)
von: Christop, Iwona, et al.
Veröffentlicht: (2026)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
von: Yu, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Yu, Xiaofeng, et al.
Veröffentlicht: (2026)
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
von: Shi, Jiacheng, et al.
Veröffentlicht: (2025)
von: Shi, Jiacheng, et al.
Veröffentlicht: (2025)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
von: Kang, Mintong, et al.
Veröffentlicht: (2026)
von: Kang, Mintong, et al.
Veröffentlicht: (2026)
Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
von: Chen, Meng, et al.
Veröffentlicht: (2026)
von: Chen, Meng, et al.
Veröffentlicht: (2026)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Towards Audio Token Compression in Large Audio Language Models
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2025) -
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
von: Araujo, Edson, et al.
Veröffentlicht: (2026) -
State-Space Large Audio Language Models
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024) -
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025) -
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)