PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Qihao, Lu, Mingzhe, Wu, Jiayue, Hu, Yue, Liu, Yanbing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Beyond Accuracy: A Cognitive Load Framework for Mapping the Capability Boundaries of Tool-use Agents
von: Wang, Qihao, et al.
Veröffentlicht: (2026)
von: Wang, Qihao, et al.
Veröffentlicht: (2026)
S^2tory: Story Spine Distillation for Movie Script Summarization
von: Lu, Mingzhe, et al.
Veröffentlicht: (2026)
von: Lu, Mingzhe, et al.
Veröffentlicht: (2026)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
von: Liu, Tianyu, et al.
Veröffentlicht: (2024)
von: Liu, Tianyu, et al.
Veröffentlicht: (2024)
PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning
von: Chang, Qikai, et al.
Veröffentlicht: (2026)
von: Chang, Qikai, et al.
Veröffentlicht: (2026)
PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning
von: Li, Bingxuan, et al.
Veröffentlicht: (2026)
von: Li, Bingxuan, et al.
Veröffentlicht: (2026)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
von: Wu, Jiaqi, et al.
Veröffentlicht: (2025)
von: Wu, Jiaqi, et al.
Veröffentlicht: (2025)
Adaptive Tool Generation with Models as Tools and Reinforcement Learning
von: Wang, Chenpeng, et al.
Veröffentlicht: (2025)
von: Wang, Chenpeng, et al.
Veröffentlicht: (2025)
PEARL: Prototype-Enhanced Alignment for Label-Efficient Representation Learning with Deployment-Driven Insights from Digital Governance Communication Systems
von: Zhang, Ruiyu, et al.
Veröffentlicht: (2026)
von: Zhang, Ruiyu, et al.
Veröffentlicht: (2026)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
von: Jiang, Dongfu, et al.
Veröffentlicht: (2025)
von: Jiang, Dongfu, et al.
Veröffentlicht: (2025)
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
von: Tan, Weiting, et al.
Veröffentlicht: (2025)
von: Tan, Weiting, et al.
Veröffentlicht: (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
von: Feng, Jiazhan, et al.
Veröffentlicht: (2025)
von: Feng, Jiazhan, et al.
Veröffentlicht: (2025)
Modeling Contextual Passage Utility for Multihop Question Answering
von: Jain, Akriti, et al.
Veröffentlicht: (2025)
von: Jain, Akriti, et al.
Veröffentlicht: (2025)
PEARL: Towards Permutation-Resilient LLMs
von: Chen, Liang, et al.
Veröffentlicht: (2025)
von: Chen, Liang, et al.
Veröffentlicht: (2025)
Advancing SLM Tool-Use Capability using Reinforcement Learning
von: Paprunia, Dhruvi, et al.
Veröffentlicht: (2025)
von: Paprunia, Dhruvi, et al.
Veröffentlicht: (2025)
MMInA: Benchmarking Multihop Multimodal Internet Agents
von: Tian, Shulin, et al.
Veröffentlicht: (2024)
von: Tian, Shulin, et al.
Veröffentlicht: (2024)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
von: Hu, Jian, et al.
Veröffentlicht: (2025)
von: Hu, Jian, et al.
Veröffentlicht: (2025)
LitVISTA: A Benchmark for Narrative Orchestration in Literary Text
von: Lu, Mingzhe, et al.
Veröffentlicht: (2026)
von: Lu, Mingzhe, et al.
Veröffentlicht: (2026)
Demonstration Selection for In-Context Learning via Reinforcement Learning
von: Wang, Xubin, et al.
Veröffentlicht: (2024)
von: Wang, Xubin, et al.
Veröffentlicht: (2024)
Multimodal Multihop Source Retrieval for Web Question Answering
von: Yarrabelly, Navya, et al.
Veröffentlicht: (2025)
von: Yarrabelly, Navya, et al.
Veröffentlicht: (2025)
SiReRAG: Indexing Similar and Related Information for Multihop Reasoning
von: Zhang, Nan, et al.
Veröffentlicht: (2024)
von: Zhang, Nan, et al.
Veröffentlicht: (2024)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
von: Wu, Tianyi, et al.
Veröffentlicht: (2026)
von: Wu, Tianyi, et al.
Veröffentlicht: (2026)
Enhancing Efficiency and Exploration in Reinforcement Learning for LLMs
von: Liao, Mengqi, et al.
Veröffentlicht: (2025)
von: Liao, Mengqi, et al.
Veröffentlicht: (2025)
Learning to Use Tools via Cooperative and Interactive Agents
von: Shi, Zhengliang, et al.
Veröffentlicht: (2024)
von: Shi, Zhengliang, et al.
Veröffentlicht: (2024)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
von: Li, Wenjun, et al.
Veröffentlicht: (2025)
von: Li, Wenjun, et al.
Veröffentlicht: (2025)
Rethinking Stateful Tool Use in Multi-Turn Dialogues: Benchmarks and Challenges
von: Wang, Hongru, et al.
Veröffentlicht: (2025)
von: Wang, Hongru, et al.
Veröffentlicht: (2025)
StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning
von: Yu, Yuanqing, et al.
Veröffentlicht: (2024)
von: Yu, Yuanqing, et al.
Veröffentlicht: (2024)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
von: Huang, Yue, et al.
Veröffentlicht: (2023)
von: Huang, Yue, et al.
Veröffentlicht: (2023)
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
von: Li, Zhuofeng, et al.
Veröffentlicht: (2025)
von: Li, Zhuofeng, et al.
Veröffentlicht: (2025)
Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning
von: Xu, Zhikun, et al.
Veröffentlicht: (2026)
von: Xu, Zhikun, et al.
Veröffentlicht: (2026)
ToolPlanner: A Tool Augmented LLM for Multi Granularity Instructions with Path Planning and Feedback
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2024)
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2024)
Reinforced Context Order Recovery for Adaptive Reasoning and Planning
von: Ma, Long, et al.
Veröffentlicht: (2025)
von: Ma, Long, et al.
Veröffentlicht: (2025)
Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use
von: Pang, Renning, et al.
Veröffentlicht: (2026)
von: Pang, Renning, et al.
Veröffentlicht: (2026)
The Tool Illusion: Rethinking Tool Use in Web Agents
von: Lou, Renze, et al.
Veröffentlicht: (2026)
von: Lou, Renze, et al.
Veröffentlicht: (2026)
Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning
von: Ma, Qinghe, et al.
Veröffentlicht: (2026)
von: Ma, Qinghe, et al.
Veröffentlicht: (2026)
D-CORE: Incentivizing Task Decomposition in Large Reasoning Models for Complex Tool Use
von: Xu, Bowen, et al.
Veröffentlicht: (2026)
von: Xu, Bowen, et al.
Veröffentlicht: (2026)
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
von: Lu, Keer, et al.
Veröffentlicht: (2025)
von: Lu, Keer, et al.
Veröffentlicht: (2025)
Agentic Tool Use in Large Language Models
von: Hu, Jinchao, et al.
Veröffentlicht: (2026)
von: Hu, Jinchao, et al.
Veröffentlicht: (2026)
FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval
von: Huang, Caishuang, et al.
Veröffentlicht: (2026)
von: Huang, Caishuang, et al.
Veröffentlicht: (2026)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
von: Lu, Meng, et al.
Veröffentlicht: (2025)
von: Lu, Meng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Beyond Accuracy: A Cognitive Load Framework for Mapping the Capability Boundaries of Tool-use Agents
von: Wang, Qihao, et al.
Veröffentlicht: (2026) -
S^2tory: Story Spine Distillation for Movie Script Summarization
von: Lu, Mingzhe, et al.
Veröffentlicht: (2026) -
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
von: Liu, Tianyu, et al.
Veröffentlicht: (2024) -
PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning
von: Chang, Qikai, et al.
Veröffentlicht: (2026) -
PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning
von: Li, Bingxuan, et al.
Veröffentlicht: (2026)