Salvato in:
| Autori principali: | Yu, Yajie, Feng, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2504.15313 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
di: Feng, Xinshun, et al.
Pubblicazione: (2026)
di: Feng, Xinshun, et al.
Pubblicazione: (2026)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
di: Li, Yibo, et al.
Pubblicazione: (2026)
di: Li, Yibo, et al.
Pubblicazione: (2026)
ToMCAT: Theory-of-Mind for Cooperative Agents in Teams via Multiagent Diffusion Policies
di: Sequeira, Pedro, et al.
Pubblicazione: (2025)
di: Sequeira, Pedro, et al.
Pubblicazione: (2025)
PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training
di: Lv, Mingrui, et al.
Pubblicazione: (2025)
di: Lv, Mingrui, et al.
Pubblicazione: (2025)
One-Way Policy Optimization for Self-Evolving LLMs
di: Yang, Shuo, et al.
Pubblicazione: (2026)
di: Yang, Shuo, et al.
Pubblicazione: (2026)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
di: Zhou, Huilin, et al.
Pubblicazione: (2026)
di: Zhou, Huilin, et al.
Pubblicazione: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
di: Zhang, Haozhen, et al.
Pubblicazione: (2026)
di: Zhang, Haozhen, et al.
Pubblicazione: (2026)
InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees
di: Huang, Chenyu, et al.
Pubblicazione: (2026)
di: Huang, Chenyu, et al.
Pubblicazione: (2026)
EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents
di: Liu, Jiaqi, et al.
Pubblicazione: (2026)
di: Liu, Jiaqi, et al.
Pubblicazione: (2026)
Group-in-Group Policy Optimization for LLM Agent Training
di: Feng, Lang, et al.
Pubblicazione: (2025)
di: Feng, Lang, et al.
Pubblicazione: (2025)
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
PolicyLong: Towards On-Policy Context Extension
di: Jia, Junlong, et al.
Pubblicazione: (2026)
di: Jia, Junlong, et al.
Pubblicazione: (2026)
Policy Dispersion in Non-Markovian Environment
di: Qu, Bohao, et al.
Pubblicazione: (2023)
di: Qu, Bohao, et al.
Pubblicazione: (2023)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
AgentEvolver: Towards Efficient Self-Evolving Agent System
di: Zhai, Yunpeng, et al.
Pubblicazione: (2025)
di: Zhai, Yunpeng, et al.
Pubblicazione: (2025)
UCPO: Uncertainty-Aware Policy Optimization
di: Zeng, Xianzhou, et al.
Pubblicazione: (2026)
di: Zeng, Xianzhou, et al.
Pubblicazione: (2026)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
di: Luo, Haipeng, et al.
Pubblicazione: (2023)
di: Luo, Haipeng, et al.
Pubblicazione: (2023)
Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing
di: Khan, Azal Ahmad, et al.
Pubblicazione: (2026)
di: Khan, Azal Ahmad, et al.
Pubblicazione: (2026)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
di: Zhang, Han, et al.
Pubblicazione: (2024)
di: Zhang, Han, et al.
Pubblicazione: (2024)
Provable and Practical In-Context Policy Optimization for Self-Improvement
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
di: Cho, Minjae, et al.
Pubblicazione: (2026)
di: Cho, Minjae, et al.
Pubblicazione: (2026)
PA3: Policy-Aware Agent Alignment through Chain-of-Thought
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2026)
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2026)
HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
di: Ding, Ken
Pubblicazione: (2026)
di: Ding, Ken
Pubblicazione: (2026)
Calibration-Aware Policy Optimization for Reasoning LLMs
di: Wang, Ziqi, et al.
Pubblicazione: (2026)
di: Wang, Ziqi, et al.
Pubblicazione: (2026)
Fine-tuning Pocket-Aware Diffusion Models via Denoising Policy Optimization
di: Xue, Yuan, et al.
Pubblicazione: (2026)
di: Xue, Yuan, et al.
Pubblicazione: (2026)
POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles
di: Menet, Nicolas, et al.
Pubblicazione: (2026)
di: Menet, Nicolas, et al.
Pubblicazione: (2026)
Symbolic Learning Enables Self-Evolving Agents
di: Zhou, Wangchunshu, et al.
Pubblicazione: (2024)
di: Zhou, Wangchunshu, et al.
Pubblicazione: (2024)
IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck
di: Deng, Huilin, et al.
Pubblicazione: (2026)
di: Deng, Huilin, et al.
Pubblicazione: (2026)
Adaptive Social Learning via Mode Policy Optimization for Language Agents
di: Wang, Minzheng, et al.
Pubblicazione: (2025)
di: Wang, Minzheng, et al.
Pubblicazione: (2025)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
di: Ji, Haonian, et al.
Pubblicazione: (2026)
di: Ji, Haonian, et al.
Pubblicazione: (2026)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
di: Liu, Zeyuan, et al.
Pubblicazione: (2026)
di: Liu, Zeyuan, et al.
Pubblicazione: (2026)
Decision Making in Non-Stationary Environments with Policy-Augmented Search
di: Pettet, Ava, et al.
Pubblicazione: (2024)
di: Pettet, Ava, et al.
Pubblicazione: (2024)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
di: Wang, Jiaxuan, et al.
Pubblicazione: (2026)
di: Wang, Jiaxuan, et al.
Pubblicazione: (2026)
Towards Flash Thinking via Decoupled Advantage Policy Optimization
di: Tan, Zezhong, et al.
Pubblicazione: (2025)
di: Tan, Zezhong, et al.
Pubblicazione: (2025)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning
di: Lepel, Olivier, et al.
Pubblicazione: (2024)
di: Lepel, Olivier, et al.
Pubblicazione: (2024)
Self-Evolving LLMs via Continual Instruction Tuning
di: Kang, Jiazheng, et al.
Pubblicazione: (2025)
di: Kang, Jiazheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
di: Feng, Xinshun, et al.
Pubblicazione: (2026) -
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
di: Li, Yibo, et al.
Pubblicazione: (2026) -
ToMCAT: Theory-of-Mind for Cooperative Agents in Teams via Multiagent Diffusion Policies
di: Sequeira, Pedro, et al.
Pubblicazione: (2025) -
PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training
di: Lv, Mingrui, et al.
Pubblicazione: (2025) -
One-Way Policy Optimization for Self-Evolving LLMs
di: Yang, Shuo, et al.
Pubblicazione: (2026)