In-Context Reinforcement Learning for Tool Use in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Yaoqi, Zhao, Yiran, Duan, Keyu, Zheng, Zeyu, Kawaguchi, Kenji, Xie, Cihang, Shieh, Michael Qizhe |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning
par: Zhao, Yiran, et autres
Publié: (2026)
par: Zhao, Yiran, et autres
Publié: (2026)
The Emergence of Abstract Thought in Large Language Models Beyond Any Language
par: Chen, Yuxin, et autres
Publié: (2025)
par: Chen, Yuxin, et autres
Publié: (2025)
Unnatural Languages Are Not Bugs but Features for LLMs
par: Duan, Keyu, et autres
Publié: (2025)
par: Duan, Keyu, et autres
Publié: (2025)
Efficient Process Reward Model Training via Active Learning
par: Duan, Keyu, et autres
Publié: (2025)
par: Duan, Keyu, et autres
Publié: (2025)
How do Large Language Models Handle Multilingualism?
par: Zhao, Yiran, et autres
Publié: (2024)
par: Zhao, Yiran, et autres
Publié: (2024)
AdaMergeX: Cross-Lingual Transfer with Large Language Models via Adaptive Adapter Merging
par: Zhao, Yiran, et autres
Publié: (2024)
par: Zhao, Yiran, et autres
Publié: (2024)
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
par: Wu, Zijian, et autres
Publié: (2025)
par: Wu, Zijian, et autres
Publié: (2025)
Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
Training Optimal Large Diffusion Language Models
par: Ni, Jinjie, et autres
Publié: (2025)
par: Ni, Jinjie, et autres
Publié: (2025)
Reasoning Robustness of LLMs to Adversarial Typographical Errors
par: Gan, Esther, et autres
Publié: (2024)
par: Gan, Esther, et autres
Publié: (2024)
Pruning General Large Language Models into Customized Expert Models
par: Zhao, Yirao, et autres
Publié: (2025)
par: Zhao, Yirao, et autres
Publié: (2025)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
par: Chen, Guanzheng, et autres
Publié: (2026)
par: Chen, Guanzheng, et autres
Publié: (2026)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
On the Adversarial Robustness of Camera-based 3D Object Detection
par: Xie, Shaoyuan, et autres
Publié: (2023)
par: Xie, Shaoyuan, et autres
Publié: (2023)
Factored Agents: Decoupling In-Context Learning and Memorization for Robust Tool Use
par: Roth, Nicholas, et autres
Publié: (2025)
par: Roth, Nicholas, et autres
Publié: (2025)
EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents
par: Liu, Jiaqi, et autres
Publié: (2026)
par: Liu, Jiaqi, et autres
Publié: (2026)
Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
par: Li, Zeping, et autres
Publié: (2026)
par: Li, Zeping, et autres
Publié: (2026)
ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models
par: Fang, Bowen, et autres
Publié: (2026)
par: Fang, Bowen, et autres
Publié: (2026)
MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models
par: Gao, Xuanqi, et autres
Publié: (2025)
par: Gao, Xuanqi, et autres
Publié: (2025)
Language Models Struggle to Use Representations Learned In-Context
par: Lepori, Michael A., et autres
Publié: (2026)
par: Lepori, Michael A., et autres
Publié: (2026)
In-Context Autonomous Network Incident Response: An End-to-End Large Language Model Agent Approach
par: Gao, Yiran, et autres
Publié: (2026)
par: Gao, Yiran, et autres
Publié: (2026)
Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
par: Xu, Siyuan, et autres
Publié: (2026)
par: Xu, Siyuan, et autres
Publié: (2026)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
par: Feng, Jiazhan, et autres
Publié: (2025)
par: Feng, Jiazhan, et autres
Publié: (2025)
Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog
par: Zhao, Yiran, et autres
Publié: (2026)
par: Zhao, Yiran, et autres
Publié: (2026)
Can GPT tell us why these images are synthesized? Empowering Multimodal Large Language Models for Forensics
par: He, Yiran, et autres
Publié: (2025)
par: He, Yiran, et autres
Publié: (2025)
Personality-Guided Code Generation Using Large Language Models
par: Guo, Yaoqi, et autres
Publié: (2024)
par: Guo, Yaoqi, et autres
Publié: (2024)
Meta-Reasoning Improves Tool Use in Large Language Models
par: Alazraki, Lisa, et autres
Publié: (2024)
par: Alazraki, Lisa, et autres
Publié: (2024)
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning
par: Wu, Wenxun, et autres
Publié: (2025)
par: Wu, Wenxun, et autres
Publié: (2025)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
par: Wu, Jiaqi, et autres
Publié: (2025)
par: Wu, Jiaqi, et autres
Publié: (2025)
Fortify the Shortest Stave in Attention: Enhancing Context Awareness of Large Language Models for Effective Tool Use
par: Chen, Yuhan, et autres
Publié: (2023)
par: Chen, Yuhan, et autres
Publié: (2023)
Human-Aware Robot Navigation via Reinforcement Learning with Hindsight Experience Replay and Curriculum Learning
par: Li, Keyu, et autres
Publié: (2021)
par: Li, Keyu, et autres
Publié: (2021)
MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark
par: Fan, Shiqing, et autres
Publié: (2025)
par: Fan, Shiqing, et autres
Publié: (2025)
SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From
par: Tong, Yao, et autres
Publié: (2025)
par: Tong, Yao, et autres
Publié: (2025)
SimpleMem: Efficient Lifelong Memory for LLM Agents
par: Liu, Jiaqi, et autres
Publié: (2026)
par: Liu, Jiaqi, et autres
Publié: (2026)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Enabling Large Language Models to Perform Power System Simulations with Previously Unseen Tools: A Case of Daline
par: Jia, Mengshuo, et autres
Publié: (2024)
par: Jia, Mengshuo, et autres
Publié: (2024)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
par: Li, Wenjun, et autres
Publié: (2025)
par: Li, Wenjun, et autres
Publié: (2025)
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
par: Chen, Xuyang, et autres
Publié: (2025)
par: Chen, Xuyang, et autres
Publié: (2025)
Documents similaires
-
ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning
par: Zhao, Yiran, et autres
Publié: (2026) -
The Emergence of Abstract Thought in Large Language Models Beyond Any Language
par: Chen, Yuxin, et autres
Publié: (2025) -
Unnatural Languages Are Not Bugs but Features for LLMs
par: Duan, Keyu, et autres
Publié: (2025) -
Efficient Process Reward Model Training via Active Learning
par: Duan, Keyu, et autres
Publié: (2025) -
How do Large Language Models Handle Multilingualism?
par: Zhao, Yiran, et autres
Publié: (2024)