AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Tong, Siqian, Li, Xuan, Wang, Yiwei, Bi, Baolong, Cai, Yujun, Liu, Shenghua, He, Yuchen, Hao, Chengpeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Not in Sync: Unveiling Temporal Bias in Audio Chat Models
por: Yao, Jiayu, et al.
Publicado: (2025)
por: Yao, Jiayu, et al.
Publicado: (2025)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
por: Xiong, Zhen, et al.
Publicado: (2025)
por: Xiong, Zhen, et al.
Publicado: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
por: Chen, Liyang, et al.
Publicado: (2026)
por: Chen, Liyang, et al.
Publicado: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
por: Chen, Liyang, et al.
Publicado: (2025)
por: Chen, Liyang, et al.
Publicado: (2025)
AudioToolAgent: An Agentic Framework for Audio-Language Models
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
por: He, Xiang, et al.
Publicado: (2026)
por: He, Xiang, et al.
Publicado: (2026)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
por: Zhu, Cheng, et al.
Publicado: (2025)
por: Zhu, Cheng, et al.
Publicado: (2025)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
por: Wu, Daiqing, et al.
Publicado: (2026)
por: Wu, Daiqing, et al.
Publicado: (2026)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
por: Dai, Yusheng, et al.
Publicado: (2026)
por: Dai, Yusheng, et al.
Publicado: (2026)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
por: Bi, Chunhao, et al.
Publicado: (2026)
por: Bi, Chunhao, et al.
Publicado: (2026)
Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
por: Bi, Baolong, et al.
Publicado: (2025)
por: Bi, Baolong, et al.
Publicado: (2025)
Streaming Audio Transformers for Online Audio Tagging
por: Dinkel, Heinrich, et al.
Publicado: (2023)
por: Dinkel, Heinrich, et al.
Publicado: (2023)
PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding
por: Bi, Baolong, et al.
Publicado: (2026)
por: Bi, Baolong, et al.
Publicado: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
por: Wang, Yuxuan, et al.
Publicado: (2026)
por: Wang, Yuxuan, et al.
Publicado: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
por: Xie, Yuankun, et al.
Publicado: (2026)
por: Xie, Yuankun, et al.
Publicado: (2026)
Zero-Day Audio DeepFake Detection via Retrieval Augmentation and Profile Matching
por: Liu, Xuechen, et al.
Publicado: (2025)
por: Liu, Xuechen, et al.
Publicado: (2025)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
por: Wu, Yusong, et al.
Publicado: (2022)
por: Wu, Yusong, et al.
Publicado: (2022)
Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
por: Huang, Tiansheng, et al.
Publicado: (2025)
por: Huang, Tiansheng, et al.
Publicado: (2025)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
por: Liu, Chengwei, et al.
Publicado: (2025)
por: Liu, Chengwei, et al.
Publicado: (2025)
Building Audio-Visual Digital Twins with Smartphones
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
por: Wang, Dingdong, et al.
Publicado: (2026)
por: Wang, Dingdong, et al.
Publicado: (2026)
Wav2DF-TSL: Two-stage Learning with Efficient Pre-training and Hierarchical Experts Fusion for Robust Audio Deepfake Detection
por: Hao, Yunqi, et al.
Publicado: (2025)
por: Hao, Yunqi, et al.
Publicado: (2025)
Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information
por: Wang, Shih-Heng, et al.
Publicado: (2026)
por: Wang, Shih-Heng, et al.
Publicado: (2026)
TART: A Comprehensive Tool for Technique-Aware Audio-to-Tab Guitar Transcription
por: Gupta, Akshaj, et al.
Publicado: (2025)
por: Gupta, Akshaj, et al.
Publicado: (2025)
C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification
por: Ma, Ziqi, et al.
Publicado: (2026)
por: Ma, Ziqi, et al.
Publicado: (2026)
Retrieval-Augmented Audio Deepfake Detection
por: Kang, Zuheng, et al.
Publicado: (2024)
por: Kang, Zuheng, et al.
Publicado: (2024)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
por: Khanjani, Zahra, et al.
Publicado: (2024)
por: Khanjani, Zahra, et al.
Publicado: (2024)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
por: Taheri, Termeh, et al.
Publicado: (2025)
por: Taheri, Termeh, et al.
Publicado: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
por: Wu, Shu, et al.
Publicado: (2025)
por: Wu, Shu, et al.
Publicado: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
por: Ma, Ziyang, et al.
Publicado: (2026)
por: Ma, Ziyang, et al.
Publicado: (2026)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
por: Tao, Ye, et al.
Publicado: (2025)
por: Tao, Ye, et al.
Publicado: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026)
por: Wang, Jieyi, et al.
Publicado: (2026)
Ejemplares similares
-
Not in Sync: Unveiling Temporal Bias in Audio Chat Models
por: Yao, Jiayu, et al.
Publicado: (2025) -
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
por: Xiong, Zhen, et al.
Publicado: (2025) -
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025) -
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
por: Chen, Liyang, et al.
Publicado: (2026) -
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
por: Lee, Kuan-Yi, et al.
Publicado: (2025)