Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Tiansheng, Shejwalkar, Virat, Chang, Oscar, Nasr, Milad, Liu, Ling |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multilingual and Multi-Accent Jailbreaking of Audio LLMs
von: Roh, Jaechul, et al.
Veröffentlicht: (2025)
von: Roh, Jaechul, et al.
Veröffentlicht: (2025)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
von: Biswas, Subrata, et al.
Veröffentlicht: (2025)
von: Biswas, Subrata, et al.
Veröffentlicht: (2025)
Spatial Audio Question Answering and Reasoning on Dynamic Source Movements
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2026)
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2026)
AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
von: Tong, Siqian, et al.
Veröffentlicht: (2026)
von: Tong, Siqian, et al.
Veröffentlicht: (2026)
Spatial Audio Motion Understanding and Reasoning
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2025)
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2025)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026)
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
von: Li, Xuanchen, et al.
Veröffentlicht: (2026)
von: Li, Xuanchen, et al.
Veröffentlicht: (2026)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
von: Li, Yanda, et al.
Veröffentlicht: (2026)
von: Li, Yanda, et al.
Veröffentlicht: (2026)
Robust Neural Audio Fingerprinting using Music Foundation Models
von: Singh, Shubhr, et al.
Veröffentlicht: (2025)
von: Singh, Shubhr, et al.
Veröffentlicht: (2025)
Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning
von: Dvirniak, Artem, et al.
Veröffentlicht: (2026)
von: Dvirniak, Artem, et al.
Veröffentlicht: (2026)
A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models
von: Christop, Iwona, et al.
Veröffentlicht: (2026)
von: Christop, Iwona, et al.
Veröffentlicht: (2026)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
von: Yu, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Yu, Xiaofeng, et al.
Veröffentlicht: (2026)
Structured-Noise Masked Modeling for Video, Audio and Beyond
von: Bhowmik, Aritra, et al.
Veröffentlicht: (2025)
von: Bhowmik, Aritra, et al.
Veröffentlicht: (2025)
Codec-Robust Attacks on Audio LLMs
von: Roh, Jaechul, et al.
Veröffentlicht: (2026)
von: Roh, Jaechul, et al.
Veröffentlicht: (2026)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2025)
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2025)
DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models
von: Wilkinghoff, Kevin, et al.
Veröffentlicht: (2025)
von: Wilkinghoff, Kevin, et al.
Veröffentlicht: (2025)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
Toward Noise-Aware Audio Deepfake Detection: Survey, SNR-Benchmarks, and Practical Recipes
von: Sen, Udayon, et al.
Veröffentlicht: (2025)
von: Sen, Udayon, et al.
Veröffentlicht: (2025)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion
von: Ovanger, Oscar, et al.
Veröffentlicht: (2026)
von: Ovanger, Oscar, et al.
Veröffentlicht: (2026)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
von: Chen, Yen-Shan, et al.
Veröffentlicht: (2026)
von: Chen, Yen-Shan, et al.
Veröffentlicht: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
von: Wang, Junyou, et al.
Veröffentlicht: (2025)
von: Wang, Junyou, et al.
Veröffentlicht: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
von: Chen, Yanxi, et al.
Veröffentlicht: (2025)
von: Chen, Yanxi, et al.
Veröffentlicht: (2025)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
von: Mao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Mao, Ruixiang, et al.
Veröffentlicht: (2026)
Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track
von: Huang, Jiawen, et al.
Veröffentlicht: (2026)
von: Huang, Jiawen, et al.
Veröffentlicht: (2026)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS
von: Carone, Brandon James, et al.
Veröffentlicht: (2025)
von: Carone, Brandon James, et al.
Veröffentlicht: (2025)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
von: Aparin, Georgii, et al.
Veröffentlicht: (2026)
von: Aparin, Georgii, et al.
Veröffentlicht: (2026)
RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering
von: Bertolino, Gaia A., et al.
Veröffentlicht: (2026)
von: Bertolino, Gaia A., et al.
Veröffentlicht: (2026)
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
von: Yang, Dongchao, et al.
Veröffentlicht: (2025)
von: Yang, Dongchao, et al.
Veröffentlicht: (2025)
I Can Hear You: Selective Robust Training for Deepfake Audio Detection
von: Zhang, Zirui, et al.
Veröffentlicht: (2024)
von: Zhang, Zirui, et al.
Veröffentlicht: (2024)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
von: Kang, Mintong, et al.
Veröffentlicht: (2026)
von: Kang, Mintong, et al.
Veröffentlicht: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Multilingual and Multi-Accent Jailbreaking of Audio LLMs
von: Roh, Jaechul, et al.
Veröffentlicht: (2025) -
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025) -
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
von: Biswas, Subrata, et al.
Veröffentlicht: (2025) -
Spatial Audio Question Answering and Reasoning on Dynamic Source Movements
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2026) -
AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
von: Tong, Siqian, et al.
Veröffentlicht: (2026)