ESPO: Early-Stopping Proximal Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zihang, Zhou, Rui, Shi, Yingcheng, Yu, Wenhan, Tan, Zhewen, Liu, Zixiang, Li, Zeming, Li, Binhua, Li, Yongbin, Yang, Tong, Ye, Jieping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ESPO: Entropy Importance Sampling Policy Optimization
por: Sheng, Yuepeng, et al.
Publicado: (2025)
por: Sheng, Yuepeng, et al.
Publicado: (2025)
Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration
por: Ma, Yingwei, et al.
Publicado: (2024)
por: Ma, Yingwei, et al.
Publicado: (2024)
Reparameterization Proximal Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2025)
por: Zhong, Hai, et al.
Publicado: (2025)
Iterative Forward Tuning Boosts In-Context Learning in Language Models
por: Yang, Jiaxi, et al.
Publicado: (2023)
por: Yang, Jiaxi, et al.
Publicado: (2023)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
por: Cheng, Jie, et al.
Publicado: (2024)
por: Cheng, Jie, et al.
Publicado: (2024)
Wasserstein Proximal Policy Gradient
por: Zhu, Zhaoyu, et al.
Publicado: (2026)
por: Zhu, Zhaoyu, et al.
Publicado: (2026)
Do Code LLMs Understand Design Patterns?
por: Pan, Zhenyu, et al.
Publicado: (2025)
por: Pan, Zhenyu, et al.
Publicado: (2025)
CPO: Addressing Reward Ambiguity in Role-playing Dialogue via Comparative Policy Optimization
por: Ye, Xinge, et al.
Publicado: (2025)
por: Ye, Xinge, et al.
Publicado: (2025)
To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing
por: Cheng, Wei, et al.
Publicado: (2026)
por: Cheng, Wei, et al.
Publicado: (2026)
LLMs as Continuous Learners: Improving the Reproduction of Defective Code in Software Issues
por: Lin, Yalan, et al.
Publicado: (2024)
por: Lin, Yalan, et al.
Publicado: (2024)
DCentNet: Decentralized Multistage Biomedical Signal Classification using Early Exits
por: Li, Xiaolin, et al.
Publicado: (2025)
por: Li, Xiaolin, et al.
Publicado: (2025)
Truncated Proximal Policy Optimization
por: Fan, Tiantian, et al.
Publicado: (2025)
por: Fan, Tiantian, et al.
Publicado: (2025)
Advancing vision-language models in front-end development via data synthesis
por: Ge, Tong, et al.
Publicado: (2025)
por: Ge, Tong, et al.
Publicado: (2025)
InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration
por: Wang, Yunkun, et al.
Publicado: (2025)
por: Wang, Yunkun, et al.
Publicado: (2025)
Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion?
por: Pan, Zhenyu, et al.
Publicado: (2024)
por: Pan, Zhenyu, et al.
Publicado: (2024)
Preconditioned Regularized Wasserstein Proximal Sampling
por: Tan, Hong Ye, et al.
Publicado: (2025)
por: Tan, Hong Ye, et al.
Publicado: (2025)
Diffusion Policy through Conditional Proximal Policy Optimization
por: Liu, Ben, et al.
Publicado: (2026)
por: Liu, Ben, et al.
Publicado: (2026)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
por: Sun, Renliang, et al.
Publicado: (2025)
por: Sun, Renliang, et al.
Publicado: (2025)
Accelerated Regularized Wasserstein Proximal Sampling Algorithms
por: Tan, Hong Ye, et al.
Publicado: (2026)
por: Tan, Hong Ye, et al.
Publicado: (2026)
Comparative effectiveness and cost‐effectiveness of endoscopic nasopharyngectomy versus intensity‐modulated radiotherapy in the treatment of recurrent nasopharyngeal carcinoma: A microsimulation analysis
por: Mingjun Rui, et al.
Publicado: (2024)
por: Mingjun Rui, et al.
Publicado: (2024)
lybCNU/xol1RI: Datasets for Aberrant X chromosome dosage compensation causes hybrid male inviability in Caenorhabditis
por: Li Yongbin
Publicado: (2025)
por: Li Yongbin
Publicado: (2025)
Lung Nodule Detection Using a Multi-Scale Convolutional Neural Network and Global Channel Spatial Attention Mechanisms
por: Li, Yongbin
Publicado: (2025)
por: Li, Yongbin
Publicado: (2025)
Lung Nodule Detection Using a Multi-Scale Convolutional Neural Network and Global Channel Spatial Attention Mechanisms
por: Li, Yongbin
Publicado: (2025)
por: Li, Yongbin
Publicado: (2025)
Beyond the Boundaries of Proximal Policy Optimization
por: Tan, Charlie B., et al.
Publicado: (2024)
por: Tan, Charlie B., et al.
Publicado: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
por: Yao, Yilun, et al.
Publicado: (2026)
por: Yao, Yilun, et al.
Publicado: (2026)
ClothPPO: A Proximal Policy Optimization Enhancing Framework for Robotic Cloth Manipulation with Observation-Aligned Action Spaces
por: Yang, Libing, et al.
Publicado: (2024)
por: Yang, Libing, et al.
Publicado: (2024)
ExploraCoder: Advancing code generation for multiple unseen APIs via planning and chained exploration
por: Wang, Yunkun, et al.
Publicado: (2024)
por: Wang, Yunkun, et al.
Publicado: (2024)
Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
por: Ma, Yingwei, et al.
Publicado: (2025)
por: Ma, Yingwei, et al.
Publicado: (2025)
Transductive Off-policy Proximal Policy Optimization
por: Gan, Yaozhong, et al.
Publicado: (2024)
por: Gan, Yaozhong, et al.
Publicado: (2024)
Inpatient Overflow Management with Proximal Policy Optimization
por: Sun, Jingjing, et al.
Publicado: (2024)
por: Sun, Jingjing, et al.
Publicado: (2024)
MemPO: Self-Memory Policy Optimization for Long-Horizon Agents
por: Li, Ruoran, et al.
Publicado: (2026)
por: Li, Ruoran, et al.
Publicado: (2026)
On Random Sampling of Diffused Graph Signals with Sparse Inputs on Vertex Domain
por: Lai, Yingcheng, et al.
Publicado: (2024)
por: Lai, Yingcheng, et al.
Publicado: (2024)
PPO-ACT: Proximal Policy Optimization with Adversarial Curriculum Transfer for Spatial Public Goods Games
por: Yang, Zhaoqilin, et al.
Publicado: (2025)
por: Yang, Zhaoqilin, et al.
Publicado: (2025)
DTPPO: Dual-Transformer Encoder-based Proximal Policy Optimization for Multi-UAV Navigation in Unseen Complex Environments
por: Wei, Anning, et al.
Publicado: (2024)
por: Wei, Anning, et al.
Publicado: (2024)
EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation
por: Li, Zihang, et al.
Publicado: (2026)
por: Li, Zihang, et al.
Publicado: (2026)
From I/O to Code with Discovery Agent
por: Dong, Yihong, et al.
Publicado: (2026)
por: Dong, Yihong, et al.
Publicado: (2026)
Solving bound-state equations in $\text{QCD}_2$ with bosonic and fermionic quarks
por: Li, Xiaolin, et al.
Publicado: (2024)
por: Li, Xiaolin, et al.
Publicado: (2024)
Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search
por: Li, Guochang, et al.
Publicado: (2025)
por: Li, Guochang, et al.
Publicado: (2025)
Ejemplares similares
-
ESPO: Entropy Importance Sampling Policy Optimization
por: Sheng, Yuepeng, et al.
Publicado: (2025) -
Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration
por: Ma, Yingwei, et al.
Publicado: (2024) -
Reparameterization Proximal Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2025) -
Iterative Forward Tuning Boosts In-Context Learning in Language Models
por: Yang, Jiaxi, et al.
Publicado: (2023) -
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
por: Cheng, Jie, et al.
Publicado: (2024)