ALARM: Audio-Language Alignment for Reasoning Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Grinberg, Petr, Shahmohammadi, Hassan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
JudgeMeNot: Personalizing Large Language Models to Emulate Judicial Reasoning in Hebrew
von: Razumenko, Itay, et al.
Veröffentlicht: (2026)
von: Razumenko, Itay, et al.
Veröffentlicht: (2026)
ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning
von: Masry, Ahmed, et al.
Veröffentlicht: (2024)
von: Masry, Ahmed, et al.
Veröffentlicht: (2024)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian
von: Abbasi, Mohammad Amin, et al.
Veröffentlicht: (2025)
von: Abbasi, Mohammad Amin, et al.
Veröffentlicht: (2025)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models
von: Zhao, Xueliang, et al.
Veröffentlicht: (2024)
von: Zhao, Xueliang, et al.
Veröffentlicht: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
Deliberative Alignment: Reasoning Enables Safer Language Models
von: Guan, Melody Y., et al.
Veröffentlicht: (2024)
von: Guan, Melody Y., et al.
Veröffentlicht: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2025)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
von: He, Xiang, et al.
Veröffentlicht: (2026)
von: He, Xiang, et al.
Veröffentlicht: (2026)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
von: Yang, Wanqi, et al.
Veröffentlicht: (2025)
von: Yang, Wanqi, et al.
Veröffentlicht: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
von: Zhou, Ziwei, et al.
Veröffentlicht: (2025)
von: Zhou, Ziwei, et al.
Veröffentlicht: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
von: Futami, Hayato, et al.
Veröffentlicht: (2025)
von: Futami, Hayato, et al.
Veröffentlicht: (2025)
Locality Matters for Training-Free Audio Token Compression in Audio-Language Models
von: Luo, Jiale, et al.
Veröffentlicht: (2026)
von: Luo, Jiale, et al.
Veröffentlicht: (2026)
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
von: Hou, Guanyu, et al.
Veröffentlicht: (2025)
von: Hou, Guanyu, et al.
Veröffentlicht: (2025)
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
von: Wang, Xinming, et al.
Veröffentlicht: (2025)
von: Wang, Xinming, et al.
Veröffentlicht: (2025)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
von: Wang, Jiahao, et al.
Veröffentlicht: (2025)
von: Wang, Jiahao, et al.
Veröffentlicht: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
von: Gao, Yiming, et al.
Veröffentlicht: (2025)
von: Gao, Yiming, et al.
Veröffentlicht: (2025)
MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models
von: He, Yingxu, et al.
Veröffentlicht: (2024)
von: He, Yingxu, et al.
Veröffentlicht: (2024)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
von: Diao, Xingjian, et al.
Veröffentlicht: (2025)
von: Diao, Xingjian, et al.
Veröffentlicht: (2025)
Can Large Language Models do Analytical Reasoning?
von: Hu, Yebowen, et al.
Veröffentlicht: (2024)
von: Hu, Yebowen, et al.
Veröffentlicht: (2024)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
von: Khorrami, Khazar, et al.
Veröffentlicht: (2021)
von: Khorrami, Khazar, et al.
Veröffentlicht: (2021)
Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks
von: Kim, Sungkyung, et al.
Veröffentlicht: (2024)
von: Kim, Sungkyung, et al.
Veröffentlicht: (2024)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
Adding Alignment Control to Language Models
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
Personality Alignment of Large Language Models
von: Zhu, Minjun, et al.
Veröffentlicht: (2024)
von: Zhu, Minjun, et al.
Veröffentlicht: (2024)
Pedagogical Alignment of Large Language Models
von: Sonkar, Shashank, et al.
Veröffentlicht: (2024)
von: Sonkar, Shashank, et al.
Veröffentlicht: (2024)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia
von: Liu, Chaoqun, et al.
Veröffentlicht: (2025)
von: Liu, Chaoqun, et al.
Veröffentlicht: (2025)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
JudgeMeNot: Personalizing Large Language Models to Emulate Judicial Reasoning in Hebrew
von: Razumenko, Itay, et al.
Veröffentlicht: (2026) -
ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning
von: Masry, Ahmed, et al.
Veröffentlicht: (2024) -
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
von: Xiong, Zhen, et al.
Veröffentlicht: (2025) -
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
von: Li, Chen-An, et al.
Veröffentlicht: (2025) -
PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian
von: Abbasi, Mohammad Amin, et al.
Veröffentlicht: (2025)