AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Tong, Siqian, Li, Xuan, Wang, Yiwei, Bi, Baolong, Cai, Yujun, Liu, Shenghua, He, Yuchen, Hao, Chengpeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Not in Sync: Unveiling Temporal Bias in Audio Chat Models
di: Yao, Jiayu, et al.
Pubblicazione: (2025)
di: Yao, Jiayu, et al.
Pubblicazione: (2025)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
di: Sun, Zhe, et al.
Pubblicazione: (2025)
di: Sun, Zhe, et al.
Pubblicazione: (2025)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
di: Chen, Liyang, et al.
Pubblicazione: (2026)
di: Chen, Liyang, et al.
Pubblicazione: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
AudioToolAgent: An Agentic Framework for Audio-Language Models
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
di: He, Xiang, et al.
Pubblicazione: (2026)
di: He, Xiang, et al.
Pubblicazione: (2026)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
di: Wu, Daiqing, et al.
Pubblicazione: (2026)
di: Wu, Daiqing, et al.
Pubblicazione: (2026)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
di: Rong, Yan, et al.
Pubblicazione: (2025)
di: Rong, Yan, et al.
Pubblicazione: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
di: Bi, Baolong, et al.
Pubblicazione: (2025)
di: Bi, Baolong, et al.
Pubblicazione: (2025)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding
di: Bi, Baolong, et al.
Pubblicazione: (2026)
di: Bi, Baolong, et al.
Pubblicazione: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
Zero-Day Audio DeepFake Detection via Retrieval Augmentation and Profile Matching
di: Liu, Xuechen, et al.
Pubblicazione: (2025)
di: Liu, Xuechen, et al.
Pubblicazione: (2025)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
di: Wu, Yusong, et al.
Pubblicazione: (2022)
di: Wu, Yusong, et al.
Pubblicazione: (2022)
Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
Building Audio-Visual Digital Twins with Smartphones
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
di: Wang, Dingdong, et al.
Pubblicazione: (2026)
di: Wang, Dingdong, et al.
Pubblicazione: (2026)
Wav2DF-TSL: Two-stage Learning with Efficient Pre-training and Hierarchical Experts Fusion for Robust Audio Deepfake Detection
di: Hao, Yunqi, et al.
Pubblicazione: (2025)
di: Hao, Yunqi, et al.
Pubblicazione: (2025)
Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
TART: A Comprehensive Tool for Technique-Aware Audio-to-Tab Guitar Transcription
di: Gupta, Akshaj, et al.
Pubblicazione: (2025)
di: Gupta, Akshaj, et al.
Pubblicazione: (2025)
C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification
di: Ma, Ziqi, et al.
Pubblicazione: (2026)
di: Ma, Ziqi, et al.
Pubblicazione: (2026)
Retrieval-Augmented Audio Deepfake Detection
di: Kang, Zuheng, et al.
Pubblicazione: (2024)
di: Kang, Zuheng, et al.
Pubblicazione: (2024)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
di: Taheri, Termeh, et al.
Pubblicazione: (2025)
di: Taheri, Termeh, et al.
Pubblicazione: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
di: Tao, Ye, et al.
Pubblicazione: (2025)
di: Tao, Ye, et al.
Pubblicazione: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Not in Sync: Unveiling Temporal Bias in Audio Chat Models
di: Yao, Jiayu, et al.
Pubblicazione: (2025) -
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
di: Xiong, Zhen, et al.
Pubblicazione: (2025) -
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
di: Sun, Zhe, et al.
Pubblicazione: (2025) -
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
di: Chen, Liyang, et al.
Pubblicazione: (2026) -
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)