Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Dayu, Yang, Jiaye, Li, Weikang, Liang, Jiahui, Li, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization
di: Wang, Dayu, et al.
Pubblicazione: (2026)
di: Wang, Dayu, et al.
Pubblicazione: (2026)
InjectFlow: Weak Guides Strong via Orthogonal Injection for Flow Matching
di: Wang, Dayu, et al.
Pubblicazione: (2026)
di: Wang, Dayu, et al.
Pubblicazione: (2026)
Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration
di: Wang, Dayu, et al.
Pubblicazione: (2026)
di: Wang, Dayu, et al.
Pubblicazione: (2026)
CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Robust and Efficient Communication in Multi-Agent Reinforcement Learning
di: Liu, Zejiao, et al.
Pubblicazione: (2025)
di: Liu, Zejiao, et al.
Pubblicazione: (2025)
MMedAgent: Learning to Use Medical Tools with Multi-modal Agent
di: Li, Binxu, et al.
Pubblicazione: (2024)
di: Li, Binxu, et al.
Pubblicazione: (2024)
MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use
di: Zhao, Weikang, et al.
Pubblicazione: (2025)
di: Zhao, Weikang, et al.
Pubblicazione: (2025)
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning
di: Wu, Wenxun, et al.
Pubblicazione: (2025)
di: Wu, Wenxun, et al.
Pubblicazione: (2025)
Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
di: Liu, Shulin, et al.
Pubblicazione: (2025)
di: Liu, Shulin, et al.
Pubblicazione: (2025)
Evolutionary Enhanced Multi-Agent Reinforcement Learning for Cooperative Air Combat
di: Li, Chengwei, et al.
Pubblicazione: (2026)
di: Li, Chengwei, et al.
Pubblicazione: (2026)
VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
di: Wu, Mingyuan, et al.
Pubblicazione: (2025)
di: Wu, Mingyuan, et al.
Pubblicazione: (2025)
Interference-Aware K-Step Reachable Communication in Multi-Agent Reinforcement Learning
di: Cheng, Ziyu, et al.
Pubblicazione: (2026)
di: Cheng, Ziyu, et al.
Pubblicazione: (2026)
Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
di: Xu, Siyuan, et al.
Pubblicazione: (2026)
di: Xu, Siyuan, et al.
Pubblicazione: (2026)
Learning to Plan & Schedule with Reinforcement-Learned Bimanual Robot Skills
di: Wan, Weikang, et al.
Pubblicazione: (2025)
di: Wan, Weikang, et al.
Pubblicazione: (2025)
Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
Reducing Belief Deviation in Reinforcement Learning for Active Reasoning
di: Zou, Deyu, et al.
Pubblicazione: (2025)
di: Zou, Deyu, et al.
Pubblicazione: (2025)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
di: Wu, Jiaqi, et al.
Pubblicazione: (2025)
di: Wu, Jiaqi, et al.
Pubblicazione: (2025)
Innate-Values-driven Reinforcement Learning based Cooperative Multi-Agent Cognitive Modeling
di: Yang, Qin
Pubblicazione: (2024)
di: Yang, Qin
Pubblicazione: (2024)
When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?
di: Li, Xinzhe, et al.
Pubblicazione: (2026)
di: Li, Xinzhe, et al.
Pubblicazione: (2026)
AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol
di: Zhang, Wentao, et al.
Pubblicazione: (2025)
di: Zhang, Wentao, et al.
Pubblicazione: (2025)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
di: Choi, ChangSu, et al.
Pubblicazione: (2025)
di: Choi, ChangSu, et al.
Pubblicazione: (2025)
EvoTool: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
di: Yang, Shuo, et al.
Pubblicazione: (2026)
di: Yang, Shuo, et al.
Pubblicazione: (2026)
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
di: Yang, Chenglin
Pubblicazione: (2026)
di: Yang, Chenglin
Pubblicazione: (2026)
Collaborative Text-to-Image Generation via Multi-Agent Reinforcement Learning and Semantic Fusion
di: Shi, Jiabao, et al.
Pubblicazione: (2025)
di: Shi, Jiabao, et al.
Pubblicazione: (2025)
Budget-Aware Tool-Use Enables Effective Agent Scaling
di: Liu, Tengxiao, et al.
Pubblicazione: (2025)
di: Liu, Tengxiao, et al.
Pubblicazione: (2025)
DuCCAE: A Hybrid Engine for Immersive Conversation via Collaboration, Augmentation, and Evolution
di: Shen, Xin, et al.
Pubblicazione: (2026)
di: Shen, Xin, et al.
Pubblicazione: (2026)
TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
di: Chen, Yongchao, et al.
Pubblicazione: (2025)
di: Chen, Yongchao, et al.
Pubblicazione: (2025)
Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use
di: Guo, Ruocheng, et al.
Pubblicazione: (2026)
di: Guo, Ruocheng, et al.
Pubblicazione: (2026)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration
di: Modecrua, Wachiravit, et al.
Pubblicazione: (2026)
di: Modecrua, Wachiravit, et al.
Pubblicazione: (2026)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
di: Yang, Pei, et al.
Pubblicazione: (2025)
di: Yang, Pei, et al.
Pubblicazione: (2025)
Adaptive Robust Estimator for Multi-Agent Reinforcement Learning
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
di: Tan, Weiting, et al.
Pubblicazione: (2025)
di: Tan, Weiting, et al.
Pubblicazione: (2025)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
Reinforcement Learning for Machine Learning Engineering Agents
di: Yang, Sherry, et al.
Pubblicazione: (2025)
di: Yang, Sherry, et al.
Pubblicazione: (2025)
Multi-Agent Reinforcement Learning with Communication-Constrained Priors
di: Yang, Guang, et al.
Pubblicazione: (2025)
di: Yang, Guang, et al.
Pubblicazione: (2025)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
di: Lu, Jiaxuan, et al.
Pubblicazione: (2026)
di: Lu, Jiaxuan, et al.
Pubblicazione: (2026)
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
di: Li, Sijia, et al.
Pubblicazione: (2025)
di: Li, Sijia, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization
di: Wang, Dayu, et al.
Pubblicazione: (2026) -
InjectFlow: Weak Guides Strong via Orthogonal Injection for Flow Matching
di: Wang, Dayu, et al.
Pubblicazione: (2026) -
Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration
di: Wang, Dayu, et al.
Pubblicazione: (2026) -
CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering
di: Yang, Hao, et al.
Pubblicazione: (2026) -
Robust and Efficient Communication in Multi-Agent Reinforcement Learning
di: Liu, Zejiao, et al.
Pubblicazione: (2025)