ALARM: Audio-Language Alignment for Reasoning Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Grinberg, Petr, Shahmohammadi, Hassan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JudgeMeNot: Personalizing Large Language Models to Emulate Judicial Reasoning in Hebrew
par: Razumenko, Itay, et autres
Publié: (2026)
par: Razumenko, Itay, et autres
Publié: (2026)
ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning
par: Masry, Ahmed, et autres
Publié: (2024)
par: Masry, Ahmed, et autres
Publié: (2024)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
par: Li, Chen-An, et autres
Publié: (2025)
par: Li, Chen-An, et autres
Publié: (2025)
PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian
par: Abbasi, Mohammad Amin, et autres
Publié: (2025)
par: Abbasi, Mohammad Amin, et autres
Publié: (2025)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
par: Xie, Zhifei, et autres
Publié: (2025)
par: Xie, Zhifei, et autres
Publié: (2025)
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models
par: Zhao, Xueliang, et autres
Publié: (2024)
par: Zhao, Xueliang, et autres
Publié: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
Deliberative Alignment: Reasoning Enables Safer Language Models
par: Guan, Melody Y., et autres
Publié: (2024)
par: Guan, Melody Y., et autres
Publié: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2025)
par: Ghosh, Sreyan, et autres
Publié: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
par: He, Xiang, et autres
Publié: (2026)
par: He, Xiang, et autres
Publié: (2026)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
par: Yang, Wanqi, et autres
Publié: (2025)
par: Yang, Wanqi, et autres
Publié: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
par: Zhou, Ziwei, et autres
Publié: (2025)
par: Zhou, Ziwei, et autres
Publié: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Locality Matters for Training-Free Audio Token Compression in Audio-Language Models
par: Luo, Jiale, et autres
Publié: (2026)
par: Luo, Jiale, et autres
Publié: (2026)
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
par: Hou, Guanyu, et autres
Publié: (2025)
par: Hou, Guanyu, et autres
Publié: (2025)
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
par: Wang, Xinming, et autres
Publié: (2025)
par: Wang, Xinming, et autres
Publié: (2025)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
par: Chen, Wei-Chih, et autres
Publié: (2026)
par: Chen, Wei-Chih, et autres
Publié: (2026)
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
par: Gao, Yiming, et autres
Publié: (2025)
par: Gao, Yiming, et autres
Publié: (2025)
MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models
par: He, Yingxu, et autres
Publié: (2024)
par: He, Yingxu, et autres
Publié: (2024)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
Can Large Language Models do Analytical Reasoning?
par: Hu, Yebowen, et autres
Publié: (2024)
par: Hu, Yebowen, et autres
Publié: (2024)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
par: Yong, Zheng-Xin, et autres
Publié: (2025)
par: Yong, Zheng-Xin, et autres
Publié: (2025)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
par: Lu, Ke-Han, et autres
Publié: (2025)
par: Lu, Ke-Han, et autres
Publié: (2025)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
par: Khorrami, Khazar, et autres
Publié: (2021)
par: Khorrami, Khazar, et autres
Publié: (2021)
Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks
par: Kim, Sungkyung, et autres
Publié: (2024)
par: Kim, Sungkyung, et autres
Publié: (2024)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Adding Alignment Control to Language Models
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
Personality Alignment of Large Language Models
par: Zhu, Minjun, et autres
Publié: (2024)
par: Zhu, Minjun, et autres
Publié: (2024)
Pedagogical Alignment of Large Language Models
par: Sonkar, Shashank, et autres
Publié: (2024)
par: Sonkar, Shashank, et autres
Publié: (2024)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia
par: Liu, Chaoqun, et autres
Publié: (2025)
par: Liu, Chaoqun, et autres
Publié: (2025)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
Documents similaires
-
JudgeMeNot: Personalizing Large Language Models to Emulate Judicial Reasoning in Hebrew
par: Razumenko, Itay, et autres
Publié: (2026) -
ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning
par: Masry, Ahmed, et autres
Publié: (2024) -
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
par: Xiong, Zhen, et autres
Publié: (2025) -
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
par: Li, Chen-An, et autres
Publié: (2025) -
PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian
par: Abbasi, Mohammad Amin, et autres
Publié: (2025)