AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tong, Siqian, Li, Xuan, Wang, Yiwei, Bi, Baolong, Cai, Yujun, Liu, Shenghua, He, Yuchen, Hao, Chengpeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Not in Sync: Unveiling Temporal Bias in Audio Chat Models
von: Yao, Jiayu, et al.
Veröffentlicht: (2025)
von: Yao, Jiayu, et al.
Veröffentlicht: (2025)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
von: Chen, Liyang, et al.
Veröffentlicht: (2025)
von: Chen, Liyang, et al.
Veröffentlicht: (2025)
AudioToolAgent: An Agentic Framework for Audio-Language Models
von: Wijngaard, Gijs, et al.
Veröffentlicht: (2025)
von: Wijngaard, Gijs, et al.
Veröffentlicht: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
von: He, Xiang, et al.
Veröffentlicht: (2026)
von: He, Xiang, et al.
Veröffentlicht: (2026)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
von: Zhu, Cheng, et al.
Veröffentlicht: (2025)
von: Zhu, Cheng, et al.
Veröffentlicht: (2025)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
von: Wu, Daiqing, et al.
Veröffentlicht: (2026)
von: Wu, Daiqing, et al.
Veröffentlicht: (2026)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
von: Rong, Yan, et al.
Veröffentlicht: (2025)
von: Rong, Yan, et al.
Veröffentlicht: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
von: Dai, Yusheng, et al.
Veröffentlicht: (2026)
von: Dai, Yusheng, et al.
Veröffentlicht: (2026)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
von: Bi, Chunhao, et al.
Veröffentlicht: (2026)
von: Bi, Chunhao, et al.
Veröffentlicht: (2026)
Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
von: Bi, Baolong, et al.
Veröffentlicht: (2025)
von: Bi, Baolong, et al.
Veröffentlicht: (2025)
Streaming Audio Transformers for Online Audio Tagging
von: Dinkel, Heinrich, et al.
Veröffentlicht: (2023)
von: Dinkel, Heinrich, et al.
Veröffentlicht: (2023)
PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding
von: Bi, Baolong, et al.
Veröffentlicht: (2026)
von: Bi, Baolong, et al.
Veröffentlicht: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
von: Xie, Yuankun, et al.
Veröffentlicht: (2026)
von: Xie, Yuankun, et al.
Veröffentlicht: (2026)
Zero-Day Audio DeepFake Detection via Retrieval Augmentation and Profile Matching
von: Liu, Xuechen, et al.
Veröffentlicht: (2025)
von: Liu, Xuechen, et al.
Veröffentlicht: (2025)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
von: Wu, Yusong, et al.
Veröffentlicht: (2022)
von: Wu, Yusong, et al.
Veröffentlicht: (2022)
Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
von: Liu, Chengwei, et al.
Veröffentlicht: (2025)
von: Liu, Chengwei, et al.
Veröffentlicht: (2025)
Building Audio-Visual Digital Twins with Smartphones
von: Lan, Zitong, et al.
Veröffentlicht: (2025)
von: Lan, Zitong, et al.
Veröffentlicht: (2025)
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
von: Wang, Dingdong, et al.
Veröffentlicht: (2026)
von: Wang, Dingdong, et al.
Veröffentlicht: (2026)
Wav2DF-TSL: Two-stage Learning with Efficient Pre-training and Hierarchical Experts Fusion for Robust Audio Deepfake Detection
von: Hao, Yunqi, et al.
Veröffentlicht: (2025)
von: Hao, Yunqi, et al.
Veröffentlicht: (2025)
Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information
von: Wang, Shih-Heng, et al.
Veröffentlicht: (2026)
von: Wang, Shih-Heng, et al.
Veröffentlicht: (2026)
TART: A Comprehensive Tool for Technique-Aware Audio-to-Tab Guitar Transcription
von: Gupta, Akshaj, et al.
Veröffentlicht: (2025)
von: Gupta, Akshaj, et al.
Veröffentlicht: (2025)
C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification
von: Ma, Ziqi, et al.
Veröffentlicht: (2026)
von: Ma, Ziqi, et al.
Veröffentlicht: (2026)
Retrieval-Augmented Audio Deepfake Detection
von: Kang, Zuheng, et al.
Veröffentlicht: (2024)
von: Kang, Zuheng, et al.
Veröffentlicht: (2024)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
von: Khanjani, Zahra, et al.
Veröffentlicht: (2024)
von: Khanjani, Zahra, et al.
Veröffentlicht: (2024)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
von: Taheri, Termeh, et al.
Veröffentlicht: (2025)
von: Taheri, Termeh, et al.
Veröffentlicht: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
von: Wu, Shu, et al.
Veröffentlicht: (2025)
von: Wu, Shu, et al.
Veröffentlicht: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
von: Tao, Ye, et al.
Veröffentlicht: (2025)
von: Tao, Ye, et al.
Veröffentlicht: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
von: Deshmukh, Soham, et al.
Veröffentlicht: (2024)
von: Deshmukh, Soham, et al.
Veröffentlicht: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
von: Wang, Jieyi, et al.
Veröffentlicht: (2026)
von: Wang, Jieyi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Not in Sync: Unveiling Temporal Bias in Audio Chat Models
von: Yao, Jiayu, et al.
Veröffentlicht: (2025) -
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
von: Xiong, Zhen, et al.
Veröffentlicht: (2025) -
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
von: Sun, Zhe, et al.
Veröffentlicht: (2025) -
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
von: Chen, Liyang, et al.
Veröffentlicht: (2026) -
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)