Learning When to Think While Listening in Large Audio-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Song, Zhiyuan, Zhao, Weici, Xiao, Yang, Yu, Suhao, Zhu, Cheng, Gu, Jiatao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Language Model Can Listen While Speaking
von: Ma, Ziyang, et al.
Veröffentlicht: (2024)
von: Ma, Ziyang, et al.
Veröffentlicht: (2024)
Thinking While Listening: Simple Test Time Scaling For Audio Classification
von: Verma, Prateek, et al.
Veröffentlicht: (2025)
von: Verma, Prateek, et al.
Veröffentlicht: (2025)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
Audio ControlNet for Fine-Grained Audio Generation and Editing
von: Zhu, Haina, et al.
Veröffentlicht: (2026)
von: Zhu, Haina, et al.
Veröffentlicht: (2026)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
von: Chen, Yanxi, et al.
Veröffentlicht: (2025)
von: Chen, Yanxi, et al.
Veröffentlicht: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
von: Goel, Arushi, et al.
Veröffentlicht: (2025)
von: Goel, Arushi, et al.
Veröffentlicht: (2025)
Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition
von: Ginjala, Srishti, et al.
Veröffentlicht: (2026)
von: Ginjala, Srishti, et al.
Veröffentlicht: (2026)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
von: Chaichana, Yuatyong, et al.
Veröffentlicht: (2025)
von: Chaichana, Yuatyong, et al.
Veröffentlicht: (2025)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
von: Feng, Bo-Han, et al.
Veröffentlicht: (2025)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2026)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
von: Xie, Zhifei, et al.
Veröffentlicht: (2024)
von: Xie, Zhifei, et al.
Veröffentlicht: (2024)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
von: Wang, Yuhao, et al.
Veröffentlicht: (2025)
von: Wang, Yuhao, et al.
Veröffentlicht: (2025)
ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability
von: Piao, Yen-Ting, et al.
Veröffentlicht: (2026)
von: Piao, Yen-Ting, et al.
Veröffentlicht: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
Harmonic Reasoning in Large Language Models
von: Kruspe, Anna
Veröffentlicht: (2024)
von: Kruspe, Anna
Veröffentlicht: (2024)
AudioBERT: Audio Knowledge Augmented Language Model
von: Ok, Hyunjong, et al.
Veröffentlicht: (2024)
von: Ok, Hyunjong, et al.
Veröffentlicht: (2024)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
von: Rajgarhia, Harshit, et al.
Veröffentlicht: (2026)
von: Rajgarhia, Harshit, et al.
Veröffentlicht: (2026)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
Fish Audio S2 Technical Report
von: Liao, Shijia, et al.
Veröffentlicht: (2026)
von: Liao, Shijia, et al.
Veröffentlicht: (2026)
Exploring Machine Learning and Language Models for Multimodal Depression Detection
von: Hong, Javier Si Zhao, et al.
Veröffentlicht: (2025)
von: Hong, Javier Si Zhao, et al.
Veröffentlicht: (2025)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2026)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2026)
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
von: Weng, Yuzhe, et al.
Veröffentlicht: (2026)
von: Weng, Yuzhe, et al.
Veröffentlicht: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
von: Wu, Shu, et al.
Veröffentlicht: (2025)
von: Wu, Shu, et al.
Veröffentlicht: (2025)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
von: Kim, Jinyoung, et al.
Veröffentlicht: (2026)
von: Kim, Jinyoung, et al.
Veröffentlicht: (2026)
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
von: Huang, Kexin, et al.
Veröffentlicht: (2026)
von: Huang, Kexin, et al.
Veröffentlicht: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
von: Li, Yanda, et al.
Veröffentlicht: (2026)
von: Li, Yanda, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Language Model Can Listen While Speaking
von: Ma, Ziyang, et al.
Veröffentlicht: (2024) -
Thinking While Listening: Simple Test Time Scaling For Audio Classification
von: Verma, Prateek, et al.
Veröffentlicht: (2025) -
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026) -
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
von: Glazer, Neta, et al.
Veröffentlicht: (2026) -
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)