PolicyEvol-Agent: Evolving Policy via Environment Perception and Self-Awareness with Theory of Mind
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Yajie, Feng, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
por: Feng, Xinshun, et al.
Publicado: (2026)
por: Feng, Xinshun, et al.
Publicado: (2026)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
por: Li, Yibo, et al.
Publicado: (2026)
por: Li, Yibo, et al.
Publicado: (2026)
ToMCAT: Theory-of-Mind for Cooperative Agents in Teams via Multiagent Diffusion Policies
por: Sequeira, Pedro, et al.
Publicado: (2025)
por: Sequeira, Pedro, et al.
Publicado: (2025)
PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training
por: Lv, Mingrui, et al.
Publicado: (2025)
por: Lv, Mingrui, et al.
Publicado: (2025)
One-Way Policy Optimization for Self-Evolving LLMs
por: Yang, Shuo, et al.
Publicado: (2026)
por: Yang, Shuo, et al.
Publicado: (2026)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
por: Zhou, Huilin, et al.
Publicado: (2026)
por: Zhou, Huilin, et al.
Publicado: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
por: Wang, Junzhe, et al.
Publicado: (2026)
por: Wang, Junzhe, et al.
Publicado: (2026)
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
por: Zhang, Haozhen, et al.
Publicado: (2026)
por: Zhang, Haozhen, et al.
Publicado: (2026)
InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees
por: Huang, Chenyu, et al.
Publicado: (2026)
por: Huang, Chenyu, et al.
Publicado: (2026)
EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents
por: Liu, Jiaqi, et al.
Publicado: (2026)
por: Liu, Jiaqi, et al.
Publicado: (2026)
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
Group-in-Group Policy Optimization for LLM Agent Training
por: Feng, Lang, et al.
Publicado: (2025)
por: Feng, Lang, et al.
Publicado: (2025)
PolicyLong: Towards On-Policy Context Extension
por: Jia, Junlong, et al.
Publicado: (2026)
por: Jia, Junlong, et al.
Publicado: (2026)
Policy Dispersion in Non-Markovian Environment
por: Qu, Bohao, et al.
Publicado: (2023)
por: Qu, Bohao, et al.
Publicado: (2023)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
por: Liu, Zongkai, et al.
Publicado: (2024)
por: Liu, Zongkai, et al.
Publicado: (2024)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
UCPO: Uncertainty-Aware Policy Optimization
por: Zeng, Xianzhou, et al.
Publicado: (2026)
por: Zeng, Xianzhou, et al.
Publicado: (2026)
Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing
por: Khan, Azal Ahmad, et al.
Publicado: (2026)
por: Khan, Azal Ahmad, et al.
Publicado: (2026)
AgentEvolver: Towards Efficient Self-Evolving Agent System
por: Zhai, Yunpeng, et al.
Publicado: (2025)
por: Zhai, Yunpeng, et al.
Publicado: (2025)
HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
por: Ding, Ken
Publicado: (2026)
por: Ding, Ken
Publicado: (2026)
Provable and Practical In-Context Policy Optimization for Self-Improvement
por: Yu, Tianrun, et al.
Publicado: (2026)
por: Yu, Tianrun, et al.
Publicado: (2026)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
por: Cho, Minjae, et al.
Publicado: (2026)
por: Cho, Minjae, et al.
Publicado: (2026)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2024)
por: Zhang, Han, et al.
Publicado: (2024)
Fine-tuning Pocket-Aware Diffusion Models via Denoising Policy Optimization
por: Xue, Yuan, et al.
Publicado: (2026)
por: Xue, Yuan, et al.
Publicado: (2026)
POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles
por: Menet, Nicolas, et al.
Publicado: (2026)
por: Menet, Nicolas, et al.
Publicado: (2026)
Calibration-Aware Policy Optimization for Reasoning LLMs
por: Wang, Ziqi, et al.
Publicado: (2026)
por: Wang, Ziqi, et al.
Publicado: (2026)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
por: Luo, Haipeng, et al.
Publicado: (2023)
por: Luo, Haipeng, et al.
Publicado: (2023)
PA3: Policy-Aware Agent Alignment through Chain-of-Thought
por: Dipta, Shubhashis Roy, et al.
Publicado: (2026)
por: Dipta, Shubhashis Roy, et al.
Publicado: (2026)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
por: Liu, Zeyuan, et al.
Publicado: (2026)
por: Liu, Zeyuan, et al.
Publicado: (2026)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
por: Li, Gengsheng, et al.
Publicado: (2026)
por: Li, Gengsheng, et al.
Publicado: (2026)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
por: Wang, Jiaxuan, et al.
Publicado: (2026)
por: Wang, Jiaxuan, et al.
Publicado: (2026)
IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck
por: Deng, Huilin, et al.
Publicado: (2026)
por: Deng, Huilin, et al.
Publicado: (2026)
Self-Evolving LLMs via Continual Instruction Tuning
por: Kang, Jiazheng, et al.
Publicado: (2025)
por: Kang, Jiazheng, et al.
Publicado: (2025)
Decision Making in Non-Stationary Environments with Policy-Augmented Search
por: Pettet, Ava, et al.
Publicado: (2024)
por: Pettet, Ava, et al.
Publicado: (2024)
Symbolic Learning Enables Self-Evolving Agents
por: Zhou, Wangchunshu, et al.
Publicado: (2024)
por: Zhou, Wangchunshu, et al.
Publicado: (2024)
Towards Flash Thinking via Decoupled Advantage Policy Optimization
por: Tan, Zezhong, et al.
Publicado: (2025)
por: Tan, Zezhong, et al.
Publicado: (2025)
Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning
por: Lepel, Olivier, et al.
Publicado: (2024)
por: Lepel, Olivier, et al.
Publicado: (2024)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
por: Jiang, Bingqing, et al.
Publicado: (2026)
por: Jiang, Bingqing, et al.
Publicado: (2026)
ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
por: Liang, Kun, et al.
Publicado: (2026)
por: Liang, Kun, et al.
Publicado: (2026)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
por: Ji, Haonian, et al.
Publicado: (2026)
por: Ji, Haonian, et al.
Publicado: (2026)
Ejemplares similares
-
SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
por: Feng, Xinshun, et al.
Publicado: (2026) -
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
por: Li, Yibo, et al.
Publicado: (2026) -
ToMCAT: Theory-of-Mind for Cooperative Agents in Teams via Multiagent Diffusion Policies
por: Sequeira, Pedro, et al.
Publicado: (2025) -
PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training
por: Lv, Mingrui, et al.
Publicado: (2025) -
One-Way Policy Optimization for Self-Evolving LLMs
por: Yang, Shuo, et al.
Publicado: (2026)