Causal Tracing of Audio-Text Fusion in Large Audio Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Wei-Chih, Huang, Chien-yu, Lee, Hung-yi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
par: Li, Chen-An, et autres
Publié: (2025)
par: Li, Chen-An, et autres
Publié: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
par: Huang, Hsiao-Ying, et autres
Publié: (2025)
par: Huang, Hsiao-Ying, et autres
Publié: (2025)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Hearing the Order: Investigating Position Bias in Large Audio-Language Models
par: Lin, Yu-Xiang, et autres
Publié: (2025)
par: Lin, Yu-Xiang, et autres
Publié: (2025)
How Contrastive Decoding Enhances Large Audio Language Models?
par: Lin, Tzu-Quan, et autres
Publié: (2026)
par: Lin, Tzu-Quan, et autres
Publié: (2026)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
par: Ieong, Lok-Lam, et autres
Publié: (2026)
par: Ieong, Lok-Lam, et autres
Publié: (2026)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
par: Lu, Ke-Han, et autres
Publié: (2025)
par: Lu, Ke-Han, et autres
Publié: (2025)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
par: Lin, Yi-Cheng, et autres
Publié: (2026)
par: Lin, Yi-Cheng, et autres
Publié: (2026)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
par: Tseng, Liang-Hsuan, et autres
Publié: (2026)
par: Tseng, Liang-Hsuan, et autres
Publié: (2026)
A Preliminary Exploration with GPT-4o Voice Mode
par: Lin, Yu-Xiang, et autres
Publié: (2025)
par: Lin, Yu-Xiang, et autres
Publié: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2026)
par: Yang, Chih-Kai, et autres
Publié: (2026)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
par: Feng, Bo-Han, et autres
Publié: (2025)
par: Feng, Bo-Han, et autres
Publié: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
par: Feng, Bo-Han, et autres
Publié: (2026)
par: Feng, Bo-Han, et autres
Publié: (2026)
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
par: Yoo, HaeJun, et autres
Publié: (2026)
par: Yoo, HaeJun, et autres
Publié: (2026)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
par: Sun, Yirong, et autres
Publié: (2026)
par: Sun, Yirong, et autres
Publié: (2026)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
Revealing the Role of Audio Channels in ASR Performance Degradation
par: Huang, Kuan-Tang, et autres
Publié: (2025)
par: Huang, Kuan-Tang, et autres
Publié: (2025)
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
par: He, Peize, et autres
Publié: (2026)
par: He, Peize, et autres
Publié: (2026)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
par: Lu, Ke-Han, et autres
Publié: (2026)
par: Lu, Ke-Han, et autres
Publié: (2026)
ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality
par: Luo, Yu-Xiang, et autres
Publié: (2025)
par: Luo, Yu-Xiang, et autres
Publié: (2025)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
par: Lin, Yu-Xiang, et autres
Publié: (2025)
par: Lin, Yu-Xiang, et autres
Publié: (2025)
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
par: Chung, Ho-Lam, et autres
Publié: (2026)
par: Chung, Ho-Lam, et autres
Publié: (2026)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
par: Tian, Jinchuan, et autres
Publié: (2026)
par: Tian, Jinchuan, et autres
Publié: (2026)
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
par: Yang, Chih-Kai, et autres
Publié: (2024)
par: Yang, Chih-Kai, et autres
Publié: (2024)
Documents similaires
-
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
par: Li, Chen-An, et autres
Publié: (2025) -
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
par: Yang, Chih-Kai, et autres
Publié: (2025) -
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025) -
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
par: Huang, Hsiao-Ying, et autres
Publié: (2025) -
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)