Breaking the Curse of Repulsion: Optimistic Distributionally Robust Policy Optimization for Off-Policy Generative Recommendation
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Jie, Huo, Yusen, Zhan, Xiangxin, Wang, Changping, Zhang, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Spend Search Where It Pays: Value-Guided Structured Sampling and Optimization for Generative Recommendation
por: Jiang, Jie, et al.
Publicado: (2026)
por: Jiang, Jie, et al.
Publicado: (2026)
Optimistic Policy Regularization
por: Pham, Mai, et al.
Publicado: (2026)
por: Pham, Mai, et al.
Publicado: (2026)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025)
por: Cohen, Taco, et al.
Publicado: (2025)
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
por: Zhang, Yuheng, et al.
Publicado: (2024)
por: Zhang, Yuheng, et al.
Publicado: (2024)
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
por: Nishimori, Soichiro, et al.
Publicado: (2025)
por: Nishimori, Soichiro, et al.
Publicado: (2025)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
por: Fakoor, Rasool, et al.
Publicado: (2026)
por: Fakoor, Rasool, et al.
Publicado: (2026)
Optimistic Policy Learning under Pessimistic Adversaries with Regret and Violation Guarantees
por: Ganguly, Sourav, et al.
Publicado: (2026)
por: Ganguly, Sourav, et al.
Publicado: (2026)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
por: Bennett, Andrew, et al.
Publicado: (2024)
por: Bennett, Andrew, et al.
Publicado: (2024)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
por: Zhan, Simon Sinong, et al.
Publicado: (2025)
por: Zhan, Simon Sinong, et al.
Publicado: (2025)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
por: Goodall, Alexander W., et al.
Publicado: (2025)
por: Goodall, Alexander W., et al.
Publicado: (2025)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
por: Meng, Wenjia, et al.
Publicado: (2024)
por: Meng, Wenjia, et al.
Publicado: (2024)
ExO-PPO: an Extended Off-policy Proximal Policy Optimization Algorithm
por: Wang, Hanyong, et al.
Publicado: (2026)
por: Wang, Hanyong, et al.
Publicado: (2026)
Pessimistic Off-Policy Optimization for Learning to Rank
por: Cief, Matej, et al.
Publicado: (2022)
por: Cief, Matej, et al.
Publicado: (2022)
Variational Delayed Policy Optimization
por: Wu, Qingyuan, et al.
Publicado: (2024)
por: Wu, Qingyuan, et al.
Publicado: (2024)
ANO: A Principled Approach to Robust Policy Optimization
por: Zhang, Yiheng, et al.
Publicado: (2026)
por: Zhang, Yiheng, et al.
Publicado: (2026)
A Unifying View of Coverage in Linear Off-Policy Evaluation
por: Amortila, Philip, et al.
Publicado: (2026)
por: Amortila, Philip, et al.
Publicado: (2026)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
por: Jin, Hongbo, et al.
Publicado: (2026)
por: Jin, Hongbo, et al.
Publicado: (2026)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning
por: Mao, Yixiu, et al.
Publicado: (2026)
por: Mao, Yixiu, et al.
Publicado: (2026)
Clustering Context in Off-Policy Evaluation
por: Guzman-Olivares, Daniel, et al.
Publicado: (2025)
por: Guzman-Olivares, Daniel, et al.
Publicado: (2025)
Zero-Shot Off-Policy Learning
por: Asadulaev, Arip, et al.
Publicado: (2026)
por: Asadulaev, Arip, et al.
Publicado: (2026)
Concept-driven Off Policy Evaluation
por: Majumdar, Ritam, et al.
Publicado: (2024)
por: Majumdar, Ritam, et al.
Publicado: (2024)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
por: Luo, Yu, et al.
Publicado: (2024)
por: Luo, Yu, et al.
Publicado: (2024)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
A General Benchmark Framework is Dynamic Graph Neural Network Need
por: Zhang, Yusen
Publicado: (2024)
por: Zhang, Yusen
Publicado: (2024)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
por: Nakanishi, Kosuke, et al.
Publicado: (2025)
por: Nakanishi, Kosuke, et al.
Publicado: (2025)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
por: Liu, Zeyuan, et al.
Publicado: (2026)
por: Liu, Zeyuan, et al.
Publicado: (2026)
Relative Policy-Transition Optimization for Fast Policy Transfer
por: Xu, Jiawei, et al.
Publicado: (2022)
por: Xu, Jiawei, et al.
Publicado: (2022)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
por: Lee, Haanvid, et al.
Publicado: (2024)
por: Lee, Haanvid, et al.
Publicado: (2024)
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
por: Patel, Nirmal, et al.
Publicado: (2026)
por: Patel, Nirmal, et al.
Publicado: (2026)
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
por: Zixian, Wang
Publicado: (2026)
por: Zixian, Wang
Publicado: (2026)
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic
por: Ji, Tianying, et al.
Publicado: (2023)
por: Ji, Tianying, et al.
Publicado: (2023)
Learning Action Embeddings for Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2023)
por: Cief, Matej, et al.
Publicado: (2023)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
por: Zhuang, Yuan, et al.
Publicado: (2026)
por: Zhuang, Yuan, et al.
Publicado: (2026)
Ejemplares similares
-
Spend Search Where It Pays: Value-Guided Structured Sampling and Optimization for Generative Recommendation
por: Jiang, Jie, et al.
Publicado: (2026) -
Optimistic Policy Regularization
por: Pham, Mai, et al.
Publicado: (2026) -
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025) -
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
por: Zhang, Yuheng, et al.
Publicado: (2024) -
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
por: Nishimori, Soichiro, et al.
Publicado: (2025)