Graph-Enhanced Policy Optimization in LLM Agent Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Jiazhen, Gong, Zhike, Hang, Jinquan, Bai, Zhengbiao, Zhao, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Group-in-Group Policy Optimization for LLM Agent Training
par: Feng, Lang, et autres
Publié: (2025)
par: Feng, Lang, et autres
Publié: (2025)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
par: Shen, Guobin, et autres
Publié: (2026)
par: Shen, Guobin, et autres
Publié: (2026)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
par: Fang, Yangyi, et autres
Publié: (2026)
par: Fang, Yangyi, et autres
Publié: (2026)
Policy-Invisible Violations in LLM-Based Agents
par: Wu, Jie, et autres
Publié: (2026)
par: Wu, Jie, et autres
Publié: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
par: Wang, Junzhe, et autres
Publié: (2026)
par: Wang, Junzhe, et autres
Publié: (2026)
Exploring Large Language Models for Knowledge Graph Completion
par: Yao, Liang, et autres
Publié: (2023)
par: Yao, Liang, et autres
Publié: (2023)
SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning
par: Li, Chenyi, et autres
Publié: (2026)
par: Li, Chenyi, et autres
Publié: (2026)
RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy Optimization
par: Zhang, Siwei, et autres
Publié: (2026)
par: Zhang, Siwei, et autres
Publié: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
par: Cao, Shiyi, et autres
Publié: (2025)
par: Cao, Shiyi, et autres
Publié: (2025)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
par: Si, Wenwen, et autres
Publié: (2025)
par: Si, Wenwen, et autres
Publié: (2025)
From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents
par: Ran, Dezhi, et autres
Publié: (2025)
par: Ran, Dezhi, et autres
Publié: (2025)
Swarm Intelligence Enhanced Reasoning: A Density-Driven Framework for LLM-Based Multi-Agent Optimization
par: Zhu, Ying, et autres
Publié: (2025)
par: Zhu, Ying, et autres
Publié: (2025)
Conditioning Matters: Training Diffusion Policies is Faster Than You Think
par: Dong, Zibin, et autres
Publié: (2025)
par: Dong, Zibin, et autres
Publié: (2025)
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
par: Lin, Zhihang, et autres
Publié: (2025)
par: Lin, Zhihang, et autres
Publié: (2025)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
par: Zhou, Hang, et autres
Publié: (2024)
par: Zhou, Hang, et autres
Publié: (2024)
Supply Chain Optimization via Generative Simulation and Iterative Decision Policies
par: Bai, Haoyue, et autres
Publié: (2025)
par: Bai, Haoyue, et autres
Publié: (2025)
A Versatile Graph Learning Approach through LLM-based Agent
par: Wei, Lanning, et autres
Publié: (2023)
par: Wei, Lanning, et autres
Publié: (2023)
Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents
par: Zhou, Zihao, et autres
Publié: (2023)
par: Zhou, Zihao, et autres
Publié: (2023)
PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization
par: Huang, Renhong, et autres
Publié: (2026)
par: Huang, Renhong, et autres
Publié: (2026)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
par: Ren, Tao, et autres
Publié: (2025)
par: Ren, Tao, et autres
Publié: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2025)
par: Zhu, Dingwei, et autres
Publié: (2025)
Plan-over-Graph: Towards Parallelable LLM Agent Schedule
par: Zhang, Shiqi, et autres
Publié: (2025)
par: Zhang, Shiqi, et autres
Publié: (2025)
Scalable and Accurate Graph Reasoning with LLM-based Multi-Agents
par: Hu, Yuwei, et autres
Publié: (2024)
par: Hu, Yuwei, et autres
Publié: (2024)
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
par: Cao, Xiaoyang, et autres
Publié: (2025)
par: Cao, Xiaoyang, et autres
Publié: (2025)
Leveraging LLM Agents for Automated Optimization Modeling for SASP Problems: A Graph-RAG based Approach
par: Pan, Tianpeng, et autres
Publié: (2025)
par: Pan, Tianpeng, et autres
Publié: (2025)
Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration
par: Yun, Sukwon, et autres
Publié: (2026)
par: Yun, Sukwon, et autres
Publié: (2026)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
par: Liu, Zeyuan, et autres
Publié: (2026)
par: Liu, Zeyuan, et autres
Publié: (2026)
Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models
par: Bai, Yunfei, et autres
Publié: (2026)
par: Bai, Yunfei, et autres
Publié: (2026)
SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
par: Feng, Xinshun, et autres
Publié: (2026)
par: Feng, Xinshun, et autres
Publié: (2026)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
par: Chen, Sirui, et autres
Publié: (2025)
par: Chen, Sirui, et autres
Publié: (2025)
Simulating Human-Like Learning Dynamics with LLM-Empowered Agents
par: Yuan, Yu, et autres
Publié: (2025)
par: Yuan, Yu, et autres
Publié: (2025)
From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution
par: Wei, Hu
Publié: (2026)
par: Wei, Hu
Publié: (2026)
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
par: Wei, Chenxing, et autres
Publié: (2026)
par: Wei, Chenxing, et autres
Publié: (2026)
PolicyBank: Evolving Policy Understanding for LLM Agents
par: Choi, Jihye, et autres
Publié: (2026)
par: Choi, Jihye, et autres
Publié: (2026)
Policy and World Modeling Co-Training for Language Agents
par: Lu, Ning, et autres
Publié: (2026)
par: Lu, Ning, et autres
Publié: (2026)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
par: Li, Yibo, et autres
Publié: (2026)
par: Li, Yibo, et autres
Publié: (2026)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
par: Sun, Yiliu, et autres
Publié: (2025)
par: Sun, Yiliu, et autres
Publié: (2025)
SimuAgent: An LLM-Based Simulink Modeling Assistant Enhanced with Reinforcement Learning
par: Liang, Yanchang, et autres
Publié: (2026)
par: Liang, Yanchang, et autres
Publié: (2026)
Analyzing and Internalizing Complex Policy Documents for LLM Agents
par: Liu, Jiateng, et autres
Publié: (2025)
par: Liu, Jiateng, et autres
Publié: (2025)
Style-Preserving Policy Optimization for Game Agents
par: Li, Lingfeng, et autres
Publié: (2025)
par: Li, Lingfeng, et autres
Publié: (2025)
Documents similaires
-
Group-in-Group Policy Optimization for LLM Agent Training
par: Feng, Lang, et autres
Publié: (2025) -
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
par: Shen, Guobin, et autres
Publié: (2026) -
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
par: Fang, Yangyi, et autres
Publié: (2026) -
Policy-Invisible Violations in LLM-Based Agents
par: Wu, Jie, et autres
Publié: (2026) -
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
par: Wang, Junzhe, et autres
Publié: (2026)