Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Qin, Yulei, Tan, Xiaoyu, He, Zhengbao, Li, Gang, Lin, Haojia, Li, Zongyi, Xu, Zihan, Shi, Yuchen, Cai, Siqi, Rui, Renting, Cai, Shaofei, Cai, Yuzheng, Zhang, Xuan, Ye, Sheng, Li, Ke, Sun, Xing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
by: Cai, Shaofei, et al.
Published: (2025)
by: Cai, Shaofei, et al.
Published: (2025)
CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent
by: Lin, Haojia, et al.
Published: (2025)
by: Lin, Haojia, et al.
Published: (2025)
Training-Free Group Relative Policy Optimization
by: Cai, Yuzheng, et al.
Published: (2025)
by: Cai, Yuzheng, et al.
Published: (2025)
Insured Agents: A Decentralized Trust Insurance Mechanism for Agentic Economy
by: Hu, Botao 'Amber', et al.
Published: (2025)
by: Hu, Botao 'Amber', et al.
Published: (2025)
GNNs as Predictors of Agentic Workflow Performances
by: Zhang, Yuanshuo, et al.
Published: (2025)
by: Zhang, Yuanshuo, et al.
Published: (2025)
Scaling Behavior of Single LLM-Driven Multi-Agent Systems
by: Li, Jialing, et al.
Published: (2026)
by: Li, Jialing, et al.
Published: (2026)
AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
by: Yang, Yingxuan, et al.
Published: (2025)
by: Yang, Yingxuan, et al.
Published: (2025)
A-MapReduce: Executing Wide Search via Agentic MapReduce
by: Chen, Mingju, et al.
Published: (2026)
by: Chen, Mingju, et al.
Published: (2026)
Nested Browser-Use Learning for Agentic Information Seeking
by: Li, Baixuan, et al.
Published: (2025)
by: Li, Baixuan, et al.
Published: (2025)
Win Fast or Lose Slow: Balancing Speed and Accuracy in Latency-Sensitive Decisions of LLMs
by: Kang, Hao, et al.
Published: (2025)
by: Kang, Hao, et al.
Published: (2025)
PhotoFlow: Agentic 3D Virtual Photography Missions
by: Guo, Jiarui, et al.
Published: (2026)
by: Guo, Jiarui, et al.
Published: (2026)
MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
by: Li, Yixuan, et al.
Published: (2026)
by: Li, Yixuan, et al.
Published: (2026)
Synergy: A Next-Generation General-Purpose Agent for Open Agentic Web
by: Nie, Xiaohang, et al.
Published: (2026)
by: Nie, Xiaohang, et al.
Published: (2026)
StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning
by: Li, Shiyang, et al.
Published: (2026)
by: Li, Shiyang, et al.
Published: (2026)
Origin-Destination Pattern Effects on Large-Scale Mixed Traffic Control via Multi-Agent Reinforcement Learning
by: Fan, Muyang, et al.
Published: (2025)
by: Fan, Muyang, et al.
Published: (2025)
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning
by: Qiu, Yilun, et al.
Published: (2026)
by: Qiu, Yilun, et al.
Published: (2026)
RubikSQL: Lifelong Learning Agentic Knowledge Base as an Industrial NL2SQL System
by: Chen, Zui, et al.
Published: (2025)
by: Chen, Zui, et al.
Published: (2025)
Zero-Trust Agentic Federated Learning for Secure IIoT Defense Systems
by: Singh, Samaresh Kumar, et al.
Published: (2025)
by: Singh, Samaresh Kumar, et al.
Published: (2025)
When Agents Control Robots: A Zero Trust Policy Model for Agentic Cyber-Physical Systems
by: Ranathunga, Tharindu, et al.
Published: (2026)
by: Ranathunga, Tharindu, et al.
Published: (2026)
Social Theory Should Be a Structural Prior for Agentic AI: A Formal Framework for Multi-Agent Social Systems
by: Ng, Lynnette Hui Xian, et al.
Published: (2026)
by: Ng, Lynnette Hui Xian, et al.
Published: (2026)
TrustTrade: Human-Inspired Selective Consensus Reduces Decision Uncertainty in LLM Trading Agents
by: Li, Minghan, et al.
Published: (2026)
by: Li, Minghan, et al.
Published: (2026)
Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems
by: Zhou, Ruiwen, et al.
Published: (2026)
by: Zhou, Ruiwen, et al.
Published: (2026)
Modal Logic for Distributed Trust
by: Voorneveld, Niels, et al.
Published: (2026)
by: Voorneveld, Niels, et al.
Published: (2026)
CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation
by: Sinha, Aarush, et al.
Published: (2026)
by: Sinha, Aarush, et al.
Published: (2026)
AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
by: Zhang, Guibin, et al.
Published: (2025)
by: Zhang, Guibin, et al.
Published: (2025)
Know the Ropes: A Heuristic Strategy for LLM-based Multi-Agent System Design
by: Li, Zhenkun, et al.
Published: (2025)
by: Li, Zhenkun, et al.
Published: (2025)
How Brittle is Agent Safety? Rethinking Agent Risk under Intent Concealment and Task Complexity
by: Ma, Zihan, et al.
Published: (2025)
by: Ma, Zihan, et al.
Published: (2025)
Socio-technical aspects of Agentic AI
by: Donta, Praveen Kumar, et al.
Published: (2025)
by: Donta, Praveen Kumar, et al.
Published: (2025)
A Meta-Game Evaluation Framework for Deep Multiagent Reinforcement Learning
by: Li, Zun, et al.
Published: (2024)
by: Li, Zun, et al.
Published: (2024)
Ev-Trust: An Evolutionarily Stable Trust Mechanism for Decentralized LLM-Based Multi-Agent Service Economies
by: Wang, Jiye, et al.
Published: (2025)
by: Wang, Jiye, et al.
Published: (2025)
See it. Say it. Sorted: Agentic System for Compositional Diagram Generation
by: Zhang, Hantao, et al.
Published: (2025)
by: Zhang, Hantao, et al.
Published: (2025)
Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersonal Closeness
by: Sakamoto, Yuki, et al.
Published: (2025)
by: Sakamoto, Yuki, et al.
Published: (2025)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
by: Wan, Ziyu, et al.
Published: (2025)
by: Wan, Ziyu, et al.
Published: (2025)
Steve: LLM Powered ChatBot for Career Progression
by: Renji, Naveen Mathews, et al.
Published: (2025)
by: Renji, Naveen Mathews, et al.
Published: (2025)
ColorEcosystem: Powering Personalized, Standardized, and Trustworthy Agentic Service in massive-agent Ecosystem
by: Wu, Fangwen, et al.
Published: (2025)
by: Wu, Fangwen, et al.
Published: (2025)
Agentic AI-Enabled Framework for Thermal Comfort and Building Energy Assessment in Tropical Urban Neighborhoods
by: Lai, Po-Yen, et al.
Published: (2026)
by: Lai, Po-Yen, et al.
Published: (2026)
LLMs Can Simulate Standardized Patients via Agent Coevolution
by: Du, Zhuoyun, et al.
Published: (2024)
by: Du, Zhuoyun, et al.
Published: (2024)
Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
by: Yan, Sikuan, et al.
Published: (2025)
by: Yan, Sikuan, et al.
Published: (2025)
Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning
by: Liang, Yongheng, et al.
Published: (2024)
by: Liang, Yongheng, et al.
Published: (2024)
Language Evolution with Deep Learning
by: Rita, Mathieu, et al.
Published: (2024)
by: Rita, Mathieu, et al.
Published: (2024)
Similar Items
-
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
by: Cai, Shaofei, et al.
Published: (2025) -
CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent
by: Lin, Haojia, et al.
Published: (2025) -
Training-Free Group Relative Policy Optimization
by: Cai, Yuzheng, et al.
Published: (2025) -
Insured Agents: A Decentralized Trust Insurance Mechanism for Agentic Economy
by: Hu, Botao 'Amber', et al.
Published: (2025) -
GNNs as Predictors of Agentic Workflow Performances
by: Zhang, Yuanshuo, et al.
Published: (2025)