Multi-Agent Tool-Integrated Policy Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mo, Zhanfeng, Li, Xingxuan, Chen, Yuntao, Bing, Lidong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization
von: Li, Xingxuan, et al.
Veröffentlicht: (2025)
von: Li, Xingxuan, et al.
Veröffentlicht: (2025)
ParaICL: Towards Parallel In-Context Learning
von: Li, Xingxuan, et al.
Veröffentlicht: (2024)
von: Li, Xingxuan, et al.
Veröffentlicht: (2024)
100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models
von: Zhang, Chong, et al.
Veröffentlicht: (2025)
von: Zhang, Chong, et al.
Veröffentlicht: (2025)
Evaluating Psychological Safety of Large Language Models
von: Li, Xingxuan, et al.
Veröffentlicht: (2022)
von: Li, Xingxuan, et al.
Veröffentlicht: (2022)
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
von: Li, Xingxuan, et al.
Veröffentlicht: (2024)
von: Li, Xingxuan, et al.
Veröffentlicht: (2024)
Unlocking Temporal Question Answering for Large Language Models with Tailor-Made Reasoning Logic
von: Li, Xingxuan, et al.
Veröffentlicht: (2023)
von: Li, Xingxuan, et al.
Veröffentlicht: (2023)
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
von: Li, Xingxuan, et al.
Veröffentlicht: (2023)
von: Li, Xingxuan, et al.
Veröffentlicht: (2023)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
von: Wu, Feijie, et al.
Veröffentlicht: (2025)
von: Wu, Feijie, et al.
Veröffentlicht: (2025)
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
von: Zhang, Kaichen, et al.
Veröffentlicht: (2025)
von: Zhang, Kaichen, et al.
Veröffentlicht: (2025)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
von: Chen, Guanzheng, et al.
Veröffentlicht: (2025)
von: Chen, Guanzheng, et al.
Veröffentlicht: (2025)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
von: Ding, Keyan, et al.
Veröffentlicht: (2025)
von: Ding, Keyan, et al.
Veröffentlicht: (2025)
Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning
von: Tan, Qingyu, et al.
Veröffentlicht: (2023)
von: Tan, Qingyu, et al.
Veröffentlicht: (2023)
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
von: Li, Long, et al.
Veröffentlicht: (2024)
von: Li, Long, et al.
Veröffentlicht: (2024)
Neuro-Symbolic Integration Brings Causal and Reliable Reasoning Proofs
von: Yang, Sen, et al.
Veröffentlicht: (2023)
von: Yang, Sen, et al.
Veröffentlicht: (2023)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
von: Chen, Guanzheng, et al.
Veröffentlicht: (2026)
von: Chen, Guanzheng, et al.
Veröffentlicht: (2026)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier
von: Yang, Zonglin, et al.
Veröffentlicht: (2026)
von: Yang, Zonglin, et al.
Veröffentlicht: (2026)
VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generation
von: Wang, Yaoxiang, et al.
Veröffentlicht: (2026)
von: Wang, Yaoxiang, et al.
Veröffentlicht: (2026)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
von: Zhong, Haitian, et al.
Veröffentlicht: (2026)
von: Zhong, Haitian, et al.
Veröffentlicht: (2026)
AdaTIR: Adaptive Tool-Integrated Reasoning via Difficulty-Aware Policy Optimization
von: Fang, Zhaiyu, et al.
Veröffentlicht: (2026)
von: Fang, Zhaiyu, et al.
Veröffentlicht: (2026)
Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
von: Liang, Qiao, et al.
Veröffentlicht: (2026)
von: Liang, Qiao, et al.
Veröffentlicht: (2026)
Revisiting Self-Play Preference Optimization: On the Role of Prompt Difficulty
von: Xiao, Yao, et al.
Veröffentlicht: (2025)
von: Xiao, Yao, et al.
Veröffentlicht: (2025)
CLEX: Continuous Length Extrapolation for Large Language Models
von: Chen, Guanzheng, et al.
Veröffentlicht: (2023)
von: Chen, Guanzheng, et al.
Veröffentlicht: (2023)
The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration
von: Xu, Haoyuan, et al.
Veröffentlicht: (2026)
von: Xu, Haoyuan, et al.
Veröffentlicht: (2026)
Tool-to-Agent Retrieval: Bridging Tools and Agents for Scalable LLM Multi-Agent Systems
von: Lumer, Elias, et al.
Veröffentlicht: (2025)
von: Lumer, Elias, et al.
Veröffentlicht: (2025)
Exploring the Potential of Large Language Models in Computational Argumentation
von: Chen, Guizhen, et al.
Veröffentlicht: (2023)
von: Chen, Guizhen, et al.
Veröffentlicht: (2023)
Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
von: Zhao, Ruochen, et al.
Veröffentlicht: (2024)
von: Zhao, Ruochen, et al.
Veröffentlicht: (2024)
Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization
von: Xiao, Yao, et al.
Veröffentlicht: (2025)
von: Xiao, Yao, et al.
Veröffentlicht: (2025)
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
von: Cang, Yueyang, et al.
Veröffentlicht: (2026)
von: Cang, Yueyang, et al.
Veröffentlicht: (2026)
From Failure to Mastery: Generating Hard Samples for Tool-use Agents
von: Hao, Bingguang, et al.
Veröffentlicht: (2026)
von: Hao, Bingguang, et al.
Veröffentlicht: (2026)
MemTool: Optimizing Short-Term Memory Management for Dynamic Tool Calling in LLM Agent Multi-Turn Conversations
von: Lumer, Elias, et al.
Veröffentlicht: (2025)
von: Lumer, Elias, et al.
Veröffentlicht: (2025)
Multilingual Jailbreak Challenges in Large Language Models
von: Deng, Yue, et al.
Veröffentlicht: (2023)
von: Deng, Yue, et al.
Veröffentlicht: (2023)
Infant Agent: A Tool-Integrated, Logic-Driven Agent with Cost-Effective API Usage
von: Lei, Bin, et al.
Veröffentlicht: (2024)
von: Lei, Bin, et al.
Veröffentlicht: (2024)
Large Language Models can Contrastively Refine their Generation for Better Sentence Representation Learning
von: Wang, Huiming, et al.
Veröffentlicht: (2023)
von: Wang, Huiming, et al.
Veröffentlicht: (2023)
Smurfs: Multi-Agent System using Context-Efficient DFSDT for Tool Planning
von: Chen, Junzhi, et al.
Veröffentlicht: (2024)
von: Chen, Junzhi, et al.
Veröffentlicht: (2024)
LLM-R2: A Large Language Model Enhanced Rule-based Rewrite System for Boosting Query Efficiency
von: Li, Zhaodonghui, et al.
Veröffentlicht: (2024)
von: Li, Zhaodonghui, et al.
Veröffentlicht: (2024)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
von: Xu, Ruotao, et al.
Veröffentlicht: (2026)
von: Xu, Ruotao, et al.
Veröffentlicht: (2026)
Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
von: Shen, Weizhou, et al.
Veröffentlicht: (2024)
von: Shen, Weizhou, et al.
Veröffentlicht: (2024)
What Affects the Stability of Tool Learning? An Empirical Study on the Robustness of Tool Learning Frameworks
von: Huang, Chengrui, et al.
Veröffentlicht: (2024)
von: Huang, Chengrui, et al.
Veröffentlicht: (2024)
TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
von: Chen, Yongchao, et al.
Veröffentlicht: (2025)
von: Chen, Yongchao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization
von: Li, Xingxuan, et al.
Veröffentlicht: (2025) -
ParaICL: Towards Parallel In-Context Learning
von: Li, Xingxuan, et al.
Veröffentlicht: (2024) -
100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models
von: Zhang, Chong, et al.
Veröffentlicht: (2025) -
Evaluating Psychological Safety of Large Language Models
von: Li, Xingxuan, et al.
Veröffentlicht: (2022) -
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
von: Li, Xingxuan, et al.
Veröffentlicht: (2024)