Graph-Enhanced Policy Optimization in LLM Agent Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuan, Jiazhen, Gong, Zhike, Hang, Jinquan, Bai, Zhengbiao, Zhao, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Group-in-Group Policy Optimization for LLM Agent Training
por: Feng, Lang, et al.
Publicado: (2025)
por: Feng, Lang, et al.
Publicado: (2025)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
por: Fang, Yangyi, et al.
Publicado: (2026)
por: Fang, Yangyi, et al.
Publicado: (2026)
Policy-Invisible Violations in LLM-Based Agents
por: Wu, Jie, et al.
Publicado: (2026)
por: Wu, Jie, et al.
Publicado: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
por: Wang, Junzhe, et al.
Publicado: (2026)
por: Wang, Junzhe, et al.
Publicado: (2026)
Exploring Large Language Models for Knowledge Graph Completion
por: Yao, Liang, et al.
Publicado: (2023)
por: Yao, Liang, et al.
Publicado: (2023)
SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning
por: Li, Chenyi, et al.
Publicado: (2026)
por: Li, Chenyi, et al.
Publicado: (2026)
RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy Optimization
por: Zhang, Siwei, et al.
Publicado: (2026)
por: Zhang, Siwei, et al.
Publicado: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
por: Cao, Shiyi, et al.
Publicado: (2025)
por: Cao, Shiyi, et al.
Publicado: (2025)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
por: Si, Wenwen, et al.
Publicado: (2025)
por: Si, Wenwen, et al.
Publicado: (2025)
From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents
por: Ran, Dezhi, et al.
Publicado: (2025)
por: Ran, Dezhi, et al.
Publicado: (2025)
Swarm Intelligence Enhanced Reasoning: A Density-Driven Framework for LLM-Based Multi-Agent Optimization
por: Zhu, Ying, et al.
Publicado: (2025)
por: Zhu, Ying, et al.
Publicado: (2025)
Conditioning Matters: Training Diffusion Policies is Faster Than You Think
por: Dong, Zibin, et al.
Publicado: (2025)
por: Dong, Zibin, et al.
Publicado: (2025)
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
por: Lin, Zhihang, et al.
Publicado: (2025)
por: Lin, Zhihang, et al.
Publicado: (2025)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
por: Zhou, Hang, et al.
Publicado: (2024)
por: Zhou, Hang, et al.
Publicado: (2024)
Supply Chain Optimization via Generative Simulation and Iterative Decision Policies
por: Bai, Haoyue, et al.
Publicado: (2025)
por: Bai, Haoyue, et al.
Publicado: (2025)
A Versatile Graph Learning Approach through LLM-based Agent
por: Wei, Lanning, et al.
Publicado: (2023)
por: Wei, Lanning, et al.
Publicado: (2023)
Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents
por: Zhou, Zihao, et al.
Publicado: (2023)
por: Zhou, Zihao, et al.
Publicado: (2023)
PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization
por: Huang, Renhong, et al.
Publicado: (2026)
por: Huang, Renhong, et al.
Publicado: (2026)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
por: Ren, Tao, et al.
Publicado: (2025)
por: Ren, Tao, et al.
Publicado: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
por: Zhu, Dingwei, et al.
Publicado: (2025)
por: Zhu, Dingwei, et al.
Publicado: (2025)
Plan-over-Graph: Towards Parallelable LLM Agent Schedule
por: Zhang, Shiqi, et al.
Publicado: (2025)
por: Zhang, Shiqi, et al.
Publicado: (2025)
Scalable and Accurate Graph Reasoning with LLM-based Multi-Agents
por: Hu, Yuwei, et al.
Publicado: (2024)
por: Hu, Yuwei, et al.
Publicado: (2024)
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
por: Cao, Xiaoyang, et al.
Publicado: (2025)
por: Cao, Xiaoyang, et al.
Publicado: (2025)
Leveraging LLM Agents for Automated Optimization Modeling for SASP Problems: A Graph-RAG based Approach
por: Pan, Tianpeng, et al.
Publicado: (2025)
por: Pan, Tianpeng, et al.
Publicado: (2025)
Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration
por: Yun, Sukwon, et al.
Publicado: (2026)
por: Yun, Sukwon, et al.
Publicado: (2026)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
por: Liu, Zeyuan, et al.
Publicado: (2026)
por: Liu, Zeyuan, et al.
Publicado: (2026)
Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models
por: Bai, Yunfei, et al.
Publicado: (2026)
por: Bai, Yunfei, et al.
Publicado: (2026)
SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
por: Feng, Xinshun, et al.
Publicado: (2026)
por: Feng, Xinshun, et al.
Publicado: (2026)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
por: Chen, Sirui, et al.
Publicado: (2025)
por: Chen, Sirui, et al.
Publicado: (2025)
Simulating Human-Like Learning Dynamics with LLM-Empowered Agents
por: Yuan, Yu, et al.
Publicado: (2025)
por: Yuan, Yu, et al.
Publicado: (2025)
From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution
por: Wei, Hu
Publicado: (2026)
por: Wei, Hu
Publicado: (2026)
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
por: Wei, Chenxing, et al.
Publicado: (2026)
por: Wei, Chenxing, et al.
Publicado: (2026)
PolicyBank: Evolving Policy Understanding for LLM Agents
por: Choi, Jihye, et al.
Publicado: (2026)
por: Choi, Jihye, et al.
Publicado: (2026)
Policy and World Modeling Co-Training for Language Agents
por: Lu, Ning, et al.
Publicado: (2026)
por: Lu, Ning, et al.
Publicado: (2026)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
por: Li, Yibo, et al.
Publicado: (2026)
por: Li, Yibo, et al.
Publicado: (2026)
SimuAgent: An LLM-Based Simulink Modeling Assistant Enhanced with Reinforcement Learning
por: Liang, Yanchang, et al.
Publicado: (2026)
por: Liang, Yanchang, et al.
Publicado: (2026)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
por: Sun, Yiliu, et al.
Publicado: (2025)
por: Sun, Yiliu, et al.
Publicado: (2025)
Analyzing and Internalizing Complex Policy Documents for LLM Agents
por: Liu, Jiateng, et al.
Publicado: (2025)
por: Liu, Jiateng, et al.
Publicado: (2025)
Style-Preserving Policy Optimization for Game Agents
por: Li, Lingfeng, et al.
Publicado: (2025)
por: Li, Lingfeng, et al.
Publicado: (2025)
Ejemplares similares
-
Group-in-Group Policy Optimization for LLM Agent Training
por: Feng, Lang, et al.
Publicado: (2025) -
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
por: Shen, Guobin, et al.
Publicado: (2026) -
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
por: Fang, Yangyi, et al.
Publicado: (2026) -
Policy-Invisible Violations in LLM-Based Agents
por: Wu, Jie, et al.
Publicado: (2026) -
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
por: Wang, Junzhe, et al.
Publicado: (2026)