Reflective Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Gan, Yaozhong, Yan, Renye, Wu, Zhe, Xing, Junliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Transductive Off-policy Proximal Policy Optimization
por: Gan, Yaozhong, et al.
Publicado: (2024)
por: Gan, Yaozhong, et al.
Publicado: (2024)
AdaMemento: Adaptive Memory-Assisted Policy Optimization for Reinforcement Learning
por: Yan, Renye, et al.
Publicado: (2024)
por: Yan, Renye, et al.
Publicado: (2024)
The Exploration-Exploitation Dilemma Revisited: An Entropy Perspective
por: Yan, Renye, et al.
Publicado: (2024)
por: Yan, Renye, et al.
Publicado: (2024)
BiBLDR: Bidirectional Behavior Learning for Drug Repositioning
por: Zhang, Renye, et al.
Publicado: (2025)
por: Zhang, Renye, et al.
Publicado: (2025)
Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection
por: Zhao, Zihui, et al.
Publicado: (2025)
por: Zhao, Zihui, et al.
Publicado: (2025)
Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance
por: He, Jinmin, et al.
Publicado: (2025)
por: He, Jinmin, et al.
Publicado: (2025)
MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning
por: Wu, Cuiling, et al.
Publicado: (2025)
por: Wu, Cuiling, et al.
Publicado: (2025)
Information-Theoretic Greedy Layer-wise Training for Traffic Sign Recognition
por: Lyu, Shuyan, et al.
Publicado: (2025)
por: Lyu, Shuyan, et al.
Publicado: (2025)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
Variational Delayed Policy Optimization
por: Wu, Qingyuan, et al.
Publicado: (2024)
por: Wu, Qingyuan, et al.
Publicado: (2024)
PolicyLong: Towards On-Policy Context Extension
por: Jia, Junlong, et al.
Publicado: (2026)
por: Jia, Junlong, et al.
Publicado: (2026)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
por: Li, Gang, et al.
Publicado: (2025)
por: Li, Gang, et al.
Publicado: (2025)
Calibration-Aware Policy Optimization for Reasoning LLMs
por: Wang, Ziqi, et al.
Publicado: (2026)
por: Wang, Ziqi, et al.
Publicado: (2026)
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
por: Zixian, Wang
Publicado: (2026)
por: Zixian, Wang
Publicado: (2026)
Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment
por: Pustejovsky, James, et al.
Publicado: (2026)
por: Pustejovsky, James, et al.
Publicado: (2026)
Wasserstein Policy Optimization
por: Pfau, David, et al.
Publicado: (2025)
por: Pfau, David, et al.
Publicado: (2025)
What Makes Reasoning Invalid: Echo Reflection Mitigation for Large Language Models
por: He, Chen, et al.
Publicado: (2025)
por: He, Chen, et al.
Publicado: (2025)
Experiential Reflective Learning for Self-Improving LLM Agents
por: Allard, Marc-Antoine, et al.
Publicado: (2026)
por: Allard, Marc-Antoine, et al.
Publicado: (2026)
Relative Policy-Transition Optimization for Fast Policy Transfer
por: Xu, Jiawei, et al.
Publicado: (2022)
por: Xu, Jiawei, et al.
Publicado: (2022)
Diverse Policies Recovering via Pointwise Mutual Information Weighted Imitation Learning
por: Yang, Hanlin, et al.
Publicado: (2024)
por: Yang, Hanlin, et al.
Publicado: (2024)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
por: Zixian, Wang
Publicado: (2026)
por: Zixian, Wang
Publicado: (2026)
LatentAudit: Real-Time White-Box Faithfulness Monitoring for Retrieval-Augmented Generation with Verifiable Deployment
por: Yu, Zhe, et al.
Publicado: (2026)
por: Yu, Zhe, et al.
Publicado: (2026)
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
por: Wang, Guoqing, et al.
Publicado: (2025)
por: Wang, Guoqing, et al.
Publicado: (2025)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
por: Xu, Huimin, et al.
Publicado: (2026)
por: Xu, Huimin, et al.
Publicado: (2026)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
por: Gao, Chen-Xiao, et al.
Publicado: (2025)
por: Gao, Chen-Xiao, et al.
Publicado: (2025)
Soft Sequence Policy Optimization
por: Glazyrina, Svetlana, et al.
Publicado: (2026)
por: Glazyrina, Svetlana, et al.
Publicado: (2026)
Single-stream Policy Optimization
por: Xu, Zhongwen, et al.
Publicado: (2025)
por: Xu, Zhongwen, et al.
Publicado: (2025)
Reparameterization Proximal Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2025)
por: Zhong, Hai, et al.
Publicado: (2025)
Divergence-Augmented Policy Optimization
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Decision Flow Policy Optimization
por: Hu, Jifeng, et al.
Publicado: (2025)
por: Hu, Jifeng, et al.
Publicado: (2025)
Reparameterization Flow Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2026)
por: Zhong, Hai, et al.
Publicado: (2026)
Fractal Landscapes in Policy Optimization
por: Wang, Tao, et al.
Publicado: (2023)
por: Wang, Tao, et al.
Publicado: (2023)
Goal-Oriented Skill Abstraction for Offline Multi-Task Reinforcement Learning
por: He, Jinmin, et al.
Publicado: (2025)
por: He, Jinmin, et al.
Publicado: (2025)
Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization
por: Sane, Soham
Publicado: (2025)
por: Sane, Soham
Publicado: (2025)
Policy Optimization Algorithms in a Unified Framework
por: Wu, Shuang
Publicado: (2025)
por: Wu, Shuang
Publicado: (2025)
Reflective Context Learning: Studying the Optimization Primitives of Context Space
por: Vassilyev, Nikita, et al.
Publicado: (2026)
por: Vassilyev, Nikita, et al.
Publicado: (2026)
Optimize Wider, Not Deeper: Consensus Aggregation for Policy Optimization
por: Su, Zelal, et al.
Publicado: (2026)
por: Su, Zelal, et al.
Publicado: (2026)
Capabilities and Fundamental Limits of Latent Chain-of-Thought
por: Zou, Jiaxuan, et al.
Publicado: (2026)
por: Zou, Jiaxuan, et al.
Publicado: (2026)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025)
por: Cohen, Taco, et al.
Publicado: (2025)
Ejemplares similares
-
Transductive Off-policy Proximal Policy Optimization
por: Gan, Yaozhong, et al.
Publicado: (2024) -
AdaMemento: Adaptive Memory-Assisted Policy Optimization for Reinforcement Learning
por: Yan, Renye, et al.
Publicado: (2024) -
The Exploration-Exploitation Dilemma Revisited: An Entropy Perspective
por: Yan, Renye, et al.
Publicado: (2024) -
BiBLDR: Bidirectional Behavior Learning for Drug Repositioning
por: Zhang, Renye, et al.
Publicado: (2025) -
Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection
por: Zhao, Zihui, et al.
Publicado: (2025)