Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience
Fuente:
arXiv
Saved in:
| Main Authors: | Sayana, Krishna, Todi, Ketan, Jash, Ambarish |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs
by: Estornell, Andrew, et al.
Published: (2025)
by: Estornell, Andrew, et al.
Published: (2025)
Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation
by: Wu, Xiangfan
Published: (2025)
by: Wu, Xiangfan
Published: (2025)
User Embedding Model for Personalized Language Prompting
by: Doddapaneni, Sumanth, et al.
Published: (2024)
by: Doddapaneni, Sumanth, et al.
Published: (2024)
KERAP: A Knowledge-Enhanced Reasoning Approach for Accurate Zero-shot Diagnosis Prediction Using Multi-agent LLMs
by: Xie, Yuzhang, et al.
Published: (2025)
by: Xie, Yuzhang, et al.
Published: (2025)
Sample-Efficient Policy Space Response Oracles with Joint Experience Best Response
by: Bighashdel, Ariyan, et al.
Published: (2026)
by: Bighashdel, Ariyan, et al.
Published: (2026)
PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning
by: Chen, Yiqun, et al.
Published: (2022)
by: Chen, Yiqun, et al.
Published: (2022)
Robust Multi-Agent LLMs under Byzantine Faults
by: Lee, Haejoon, et al.
Published: (2026)
by: Lee, Haejoon, et al.
Published: (2026)
Network-Constrained Policy Optimization for Adaptive Multi-agent Vehicle Routing
by: Arasteh, Fazel, et al.
Published: (2025)
by: Arasteh, Fazel, et al.
Published: (2025)
Centralized Permutation Equivariant Policy for Cooperative Multi-Agent Reinforcement Learning
by: Xu, Zhuofan, et al.
Published: (2025)
by: Xu, Zhuofan, et al.
Published: (2025)
Descent-Guided Policy Gradient for Scalable Cooperative Multi-Agent Learning
by: Yang, Shan, et al.
Published: (2026)
by: Yang, Shan, et al.
Published: (2026)
HDDLGym: A Tool for Studying Multi-Agent Hierarchical Problems Defined in HDDL with OpenAI Gym
by: La, Ngoc, et al.
Published: (2025)
by: La, Ngoc, et al.
Published: (2025)
A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning
by: Jiang, Haozhe, et al.
Published: (2023)
by: Jiang, Haozhe, et al.
Published: (2023)
Learn as Individuals, Evolve as a Team: Multi-agent LLMs Adaptation in Embodied Environments
by: Li, Xinran, et al.
Published: (2025)
by: Li, Xinran, et al.
Published: (2025)
PIANIST: Learning Partially Observable World Models with LLMs for Multi-Agent Decision Making
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems
by: Shindo, Hikaru, et al.
Published: (2026)
by: Shindo, Hikaru, et al.
Published: (2026)
PeerGuard: Defending Multi-Agent Systems Against Backdoor Attacks Through Mutual Reasoning
by: Fan, Falong, et al.
Published: (2025)
by: Fan, Falong, et al.
Published: (2025)
Selectively Sharing Experiences Improves Multi-Agent Reinforcement Learning
by: Gerstgrasser, Matthias, et al.
Published: (2023)
by: Gerstgrasser, Matthias, et al.
Published: (2023)
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
by: Li, Zhuofeng, et al.
Published: (2025)
by: Li, Zhuofeng, et al.
Published: (2025)
Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model Reasoning
by: Radha, Santosh Kumar, et al.
Published: (2024)
by: Radha, Santosh Kumar, et al.
Published: (2024)
Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework
by: Ye, Jianing, et al.
Published: (2022)
by: Ye, Jianing, et al.
Published: (2022)
In-Context Curiosity: Distilling Exploration for Decision-Pretrained Transformers on Bandit Tasks
by: Yang, Huitao, et al.
Published: (2025)
by: Yang, Huitao, et al.
Published: (2025)
Ensembling Prioritized Hybrid Policies for Multi-agent Pathfinding
by: Tang, Huijie, et al.
Published: (2024)
by: Tang, Huijie, et al.
Published: (2024)
Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents
by: Ta, Anh, et al.
Published: (2026)
by: Ta, Anh, et al.
Published: (2026)
Using Analytics on Student Created Data to Content Validate Pedagogical Tools
by: Kos, John, et al.
Published: (2023)
by: Kos, John, et al.
Published: (2023)
Hierarchical Policy-Gradient Reinforcement Learning for Multi-Agent Shepherding Control of Non-Cohesive Targets
by: Covone, Stefano, et al.
Published: (2025)
by: Covone, Stefano, et al.
Published: (2025)
RiskAgent: Synergizing Language Models with Validated Tools for Evidence-Based Risk Prediction
by: Liu, Fenglin, et al.
Published: (2025)
by: Liu, Fenglin, et al.
Published: (2025)
Value-Based Rationales Improve Social Experience: A Multiagent Simulation Study
by: Tzeng, Sz-Ting, et al.
Published: (2024)
by: Tzeng, Sz-Ting, et al.
Published: (2024)
Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective
by: Raj, Ritik, et al.
Published: (2025)
by: Raj, Ritik, et al.
Published: (2025)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
by: Kapoor, Aditya, et al.
Published: (2024)
by: Kapoor, Aditya, et al.
Published: (2024)
Dipper: Diversity in Prompts for Producing Large Language Model Ensembles in Reasoning tasks
by: Lau, Gregory Kang Ruey, et al.
Published: (2024)
by: Lau, Gregory Kang Ruey, et al.
Published: (2024)
Hypergraph-based Motion Generation with Multi-modal Interaction Relational Reasoning
by: Wu, Keshu, et al.
Published: (2024)
by: Wu, Keshu, et al.
Published: (2024)
DeepFusion: Accelerating MoE Training via Federated Knowledge Distillation from Heterogeneous Edge Devices
by: Li, Songyuan, et al.
Published: (2026)
by: Li, Songyuan, et al.
Published: (2026)
Scalable Submodular Policy Optimization via Pruned Submodularity Graph
by: Anand, Aditi, et al.
Published: (2025)
by: Anand, Aditi, et al.
Published: (2025)
Ranking Joint Policies in Dynamic Games using Evolutionary Dynamics
by: Koliou, Natalia, et al.
Published: (2025)
by: Koliou, Natalia, et al.
Published: (2025)
HiMAP: Learning Heuristics-Informed Policies for Large-Scale Multi-Agent Pathfinding
by: Tang, Huijie, et al.
Published: (2024)
by: Tang, Huijie, et al.
Published: (2024)
Low-Rank Agent-Specific Adaptation (LoRASA) for Multi-Agent Policy Learning
by: Zhang, Beining, et al.
Published: (2025)
by: Zhang, Beining, et al.
Published: (2025)
Iterative Graph Alignment
by: Yu, Fangyuan, et al.
Published: (2024)
by: Yu, Fangyuan, et al.
Published: (2024)
MedRAX: Medical Reasoning Agent for Chest X-ray
by: Fallahpour, Adibvafa, et al.
Published: (2025)
by: Fallahpour, Adibvafa, et al.
Published: (2025)
Deep Reinforcement Learning Agents for Strategic Production Policies in Microeconomic Market Simulations
by: Garrido-Merchán, Eduardo C., et al.
Published: (2024)
by: Garrido-Merchán, Eduardo C., et al.
Published: (2024)
Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies
by: Zhou, Han, et al.
Published: (2025)
by: Zhou, Han, et al.
Published: (2025)
Similar Items
-
How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs
by: Estornell, Andrew, et al.
Published: (2025) -
Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation
by: Wu, Xiangfan
Published: (2025) -
User Embedding Model for Personalized Language Prompting
by: Doddapaneni, Sumanth, et al.
Published: (2024) -
KERAP: A Knowledge-Enhanced Reasoning Approach for Accurate Zero-shot Diagnosis Prediction Using Multi-agent LLMs
by: Xie, Yuzhang, et al.
Published: (2025) -
Sample-Efficient Policy Space Response Oracles with Joint Experience Best Response
by: Bighashdel, Ariyan, et al.
Published: (2026)