When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Billa, Jayadev |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
par: Billa, Jayadev
Publié: (2026)
par: Billa, Jayadev
Publié: (2026)
Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection
par: Feng, Yangguang
Publié: (2024)
par: Feng, Yangguang
Publié: (2024)
Bias in the Ear of the Listener: Assessing Sensitivity in Audio Language Models Across Linguistic, Demographic, and Positional Variations
par: Wei, Sheng-Lun, et autres
Publié: (2026)
par: Wei, Sheng-Lun, et autres
Publié: (2026)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
par: Lu, Ke-Han, et autres
Publié: (2025)
par: Lu, Ke-Han, et autres
Publié: (2025)
Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
par: Ali, Abdelrahman A., et autres
Publié: (2024)
par: Ali, Abdelrahman A., et autres
Publié: (2024)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Investigating Causal Cues: Strengthening Spoofed Audio Detection with Human-Discernible Linguistic Features
par: Khanjani, Zahra, et autres
Publié: (2024)
par: Khanjani, Zahra, et autres
Publié: (2024)
Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio
par: Zhang, Lin, et autres
Publié: (2024)
par: Zhang, Lin, et autres
Publié: (2024)
Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition
par: Zhao, Ruoyu, et autres
Publié: (2025)
par: Zhao, Ruoyu, et autres
Publié: (2025)
Cascaded Cross-Modal Transformer for Audio-Textual Classification
par: Ristea, Nicolae-Catalin, et autres
Publié: (2024)
par: Ristea, Nicolae-Catalin, et autres
Publié: (2024)
Listening for Expert Identified Linguistic Features: Assessment of Audio Deepfake Discernment among Undergraduate Students
par: Bhalli, Noshaba N., et autres
Publié: (2024)
par: Bhalli, Noshaba N., et autres
Publié: (2024)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
par: Zhang, Wenyu, et autres
Publié: (2025)
par: Zhang, Wenyu, et autres
Publié: (2025)
Deep CLAS: Deep Contextual Listen, Attend and Spell
par: Wang, Mengzhi, et autres
Publié: (2024)
par: Wang, Mengzhi, et autres
Publié: (2024)
OCR-Enhanced Multimodal ASR Can Read While Listening
par: Chen, Junli, et autres
Publié: (2026)
par: Chen, Junli, et autres
Publié: (2026)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
par: Wei, Kun, et autres
Publié: (2023)
par: Wei, Kun, et autres
Publié: (2023)
Learn and Don't Forget: Adding a New Language to ASR Foundation Models
par: Qian, Mengjie, et autres
Publié: (2024)
par: Qian, Mengjie, et autres
Publié: (2024)
Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval
par: Zhou, Lifeng, et autres
Publié: (2024)
par: Zhou, Lifeng, et autres
Publié: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
par: Lin, Liang, et autres
Publié: (2025)
par: Lin, Liang, et autres
Publié: (2025)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
par: Wang, Xuechen, et autres
Publié: (2024)
par: Wang, Xuechen, et autres
Publié: (2024)
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
par: Jiang, Xilin, et autres
Publié: (2024)
par: Jiang, Xilin, et autres
Publié: (2024)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Decoding Linguistic Representations of Human Brain
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
par: Han, HyoJung, et autres
Publié: (2024)
par: Han, HyoJung, et autres
Publié: (2024)
MiMo-Audio: Audio Language Models are Few-Shot Learners
par: Core Team, et autres
Publié: (2025)
par: Core Team, et autres
Publié: (2025)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
par: Zhong, Yi, et autres
Publié: (2023)
par: Zhong, Yi, et autres
Publié: (2023)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025)
par: Alex, Tony, et autres
Publié: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
par: Sridhar, Arvind Krishna, et autres
Publié: (2024)
par: Sridhar, Arvind Krishna, et autres
Publié: (2024)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
par: Wang, Qiaolin, et autres
Publié: (2025)
par: Wang, Qiaolin, et autres
Publié: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
par: Liu, Jizhong, et autres
Publié: (2024)
par: Liu, Jizhong, et autres
Publié: (2024)
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
par: Manakul, Potsawee, et autres
Publié: (2025)
par: Manakul, Potsawee, et autres
Publié: (2025)
LUCY: Linguistic Understanding and Control Yielding Early Stage of Her
par: Gao, Heting, et autres
Publié: (2025)
par: Gao, Heting, et autres
Publié: (2025)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
par: He, Peize, et autres
Publié: (2025)
par: He, Peize, et autres
Publié: (2025)
Covo-Audio Technical Report
par: Wang, Wenfu, et autres
Publié: (2026)
par: Wang, Wenfu, et autres
Publié: (2026)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
par: Gu, Hao, et autres
Publié: (2025)
par: Gu, Hao, et autres
Publié: (2025)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
The NeurIPS 2023 Machine Learning for Audio Workshop: Affective Audio Benchmarks and Novel Data
par: Baird, Alice, et autres
Publié: (2024)
par: Baird, Alice, et autres
Publié: (2024)
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
par: Park, Joonyong, et autres
Publié: (2024)
par: Park, Joonyong, et autres
Publié: (2024)
Documents similaires
-
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
par: Billa, Jayadev
Publié: (2026) -
Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection
par: Feng, Yangguang
Publié: (2024) -
Bias in the Ear of the Listener: Assessing Sensitivity in Audio Language Models Across Linguistic, Demographic, and Positional Variations
par: Wei, Sheng-Lun, et autres
Publié: (2026) -
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
par: Lu, Ke-Han, et autres
Publié: (2025) -
Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
par: Ali, Abdelrahman A., et autres
Publié: (2024)