Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Qifan, Ma, Dongyang, Fang, Tianqing, Li, Jia, Tang, Jing, Chen, Nuo, Mi, Haitao, Wang, Yan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
by: Fang, Tianqing, et al.
Published: (2025)
by: Fang, Tianqing, et al.
Published: (2025)
Verified Critical Step Optimization for LLM Agents
by: Li, Mukai, et al.
Published: (2026)
by: Li, Mukai, et al.
Published: (2026)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
by: Zhang, Zhisong, et al.
Published: (2025)
by: Zhang, Zhisong, et al.
Published: (2025)
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
by: Wan, Yuxuan, et al.
Published: (2026)
by: Wan, Yuxuan, et al.
Published: (2026)
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
by: He, Hongliang, et al.
Published: (2024)
by: He, Hongliang, et al.
Published: (2024)
Free(): Learning to Forget in Malloc-Only Reasoning Models
by: Zheng, Yilun, et al.
Published: (2026)
by: Zheng, Yilun, et al.
Published: (2026)
Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration
by: Chen, Weile, et al.
Published: (2026)
by: Chen, Weile, et al.
Published: (2026)
Improving LLMs' Generalized Reasoning Abilities by Graph Problems
by: Zhang, Qifan, et al.
Published: (2025)
by: Zhang, Qifan, et al.
Published: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
by: Yu, Wenhao, et al.
Published: (2025)
by: Yu, Wenhao, et al.
Published: (2025)
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
by: Ma, Junyu, et al.
Published: (2025)
by: Ma, Junyu, et al.
Published: (2025)
GraphArena: Evaluating and Exploring Large Language Models on Graph Computation
by: Tang, Jianheng, et al.
Published: (2024)
by: Tang, Jianheng, et al.
Published: (2024)
Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution
by: Mi, Hongze, et al.
Published: (2026)
by: Mi, Hongze, et al.
Published: (2026)
Exposing Weaknesses of Large Reasoning Models through Graph Algorithm Problems
by: Zhang, Qifan, et al.
Published: (2026)
by: Zhang, Qifan, et al.
Published: (2026)
Boosting LLM Reasoning via Spontaneous Self-Correction
by: Zhao, Xutong, et al.
Published: (2025)
by: Zhao, Xutong, et al.
Published: (2025)
Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories
by: Lu, Sidi, et al.
Published: (2026)
by: Lu, Sidi, et al.
Published: (2026)
CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
by: Yang, Shidong, et al.
Published: (2026)
by: Yang, Shidong, et al.
Published: (2026)
The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration
by: Barnea, Idan, et al.
Published: (2026)
by: Barnea, Idan, et al.
Published: (2026)
GCoder: Improving Large Language Model for Generalized Graph Problem Solving
by: Zhang, Qifan, et al.
Published: (2024)
by: Zhang, Qifan, et al.
Published: (2024)
Reward-Free Curricula for Training Robust World Models
by: Rigter, Marc, et al.
Published: (2023)
by: Rigter, Marc, et al.
Published: (2023)
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
by: Zhang, Dan, et al.
Published: (2024)
by: Zhang, Dan, et al.
Published: (2024)
A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
by: Li, Mengqi, et al.
Published: (2025)
by: Li, Mengqi, et al.
Published: (2025)
WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback
by: Hu, Minda, et al.
Published: (2025)
by: Hu, Minda, et al.
Published: (2025)
Acquiring and Modelling Abstract Commonsense Knowledge via Conceptualization
by: He, Mutian, et al.
Published: (2022)
by: He, Mutian, et al.
Published: (2022)
Spontaneous Reward Hacking in Iterative Self-Refinement
by: Pan, Jane, et al.
Published: (2024)
by: Pan, Jane, et al.
Published: (2024)
Improved Bounds for Reward-Agnostic and Reward-Free Exploration
by: Ridel, Oran, et al.
Published: (2026)
by: Ridel, Oran, et al.
Published: (2026)
SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards
by: Zhang, Dengjia, et al.
Published: (2026)
by: Zhang, Dengjia, et al.
Published: (2026)
The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context
by: Liu, Xiaoyuan, et al.
Published: (2026)
by: Liu, Xiaoyuan, et al.
Published: (2026)
Towards Effective Data-Free Knowledge Distillation via Diverse Diffusion Augmentation
by: Li, Muquan, et al.
Published: (2024)
by: Li, Muquan, et al.
Published: (2024)
Self-Rewarding Vision-Language Model via Reasoning Decomposition
by: Li, Zongxia, et al.
Published: (2025)
by: Li, Zongxia, et al.
Published: (2025)
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
by: Wang, Wenkai, et al.
Published: (2026)
by: Wang, Wenkai, et al.
Published: (2026)
Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training
by: Fang, Tianqing, et al.
Published: (2025)
by: Fang, Tianqing, et al.
Published: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
by: Peng, Miao, et al.
Published: (2025)
by: Peng, Miao, et al.
Published: (2025)
Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
Adaptive RAN Slicing Control via Reward-Free Self-Finetuning Agents
by: Li, Yuanhao, et al.
Published: (2026)
by: Li, Yuanhao, et al.
Published: (2026)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
by: Zhang, Ce, et al.
Published: (2025)
by: Zhang, Ce, et al.
Published: (2025)
Online Knowledge Distillation with Reward Guidance
by: Jia, Chen
Published: (2025)
by: Jia, Chen
Published: (2025)
World-Model-Augmented Web Agents with Action Correction
by: Shen, Zhouzhou, et al.
Published: (2026)
by: Shen, Zhouzhou, et al.
Published: (2026)
Sparse Rewards Can Self-Train Dialogue Agents
by: Lattimer, Barrett Martin, et al.
Published: (2024)
by: Lattimer, Barrett Martin, et al.
Published: (2024)
Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards
by: Da, Jeff, et al.
Published: (2025)
by: Da, Jeff, et al.
Published: (2025)
The End of Manual Decoding: Towards Truly End-to-End Language Models
by: Wang, Zhichao, et al.
Published: (2025)
by: Wang, Zhichao, et al.
Published: (2025)
Similar Items
-
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
by: Fang, Tianqing, et al.
Published: (2025) -
Verified Critical Step Optimization for LLM Agents
by: Li, Mukai, et al.
Published: (2026) -
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
by: Zhang, Zhisong, et al.
Published: (2025) -
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
by: Wan, Yuxuan, et al.
Published: (2026) -
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
by: He, Hongliang, et al.
Published: (2024)