Gespeichert in:
| Hauptverfasser: | Shu, Yao, Wei, Chenxing, Lin, Hongbin, Qiu, Shuang, Xiong, Hui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2605.02469 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
On the Effect of Regularization in Policy Mirror Descent
von: Kleuker, Jan Felix, et al.
Veröffentlicht: (2025)
von: Kleuker, Jan Felix, et al.
Veröffentlicht: (2025)
One-Step Flow Policy Mirror Descent
von: Chen, Tianyi, et al.
Veröffentlicht: (2025)
von: Chen, Tianyi, et al.
Veröffentlicht: (2025)
Forward KL Regularized Preference Optimization for Aligning Diffusion Policies
von: Shan, Zhao, et al.
Veröffentlicht: (2024)
von: Shan, Zhao, et al.
Veröffentlicht: (2024)
Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints
von: Gao, Ting, et al.
Veröffentlicht: (2026)
von: Gao, Ting, et al.
Veröffentlicht: (2026)
Policy Mirror Descent with Lookahead
von: Protopapas, Kimon, et al.
Veröffentlicht: (2024)
von: Protopapas, Kimon, et al.
Veröffentlicht: (2024)
On the Convergence of Policy in Unregularized Policy Mirror Descent
von: Lin, Dachao, et al.
Veröffentlicht: (2022)
von: Lin, Dachao, et al.
Veröffentlicht: (2022)
Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds
von: Xu, Zhenghao, et al.
Veröffentlicht: (2023)
von: Xu, Zhenghao, et al.
Veröffentlicht: (2023)
Functional Acceleration for Policy Mirror Descent
von: Chelu, Veronica, et al.
Veröffentlicht: (2024)
von: Chelu, Veronica, et al.
Veröffentlicht: (2024)
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
von: Qu, Yun, et al.
Veröffentlicht: (2026)
von: Qu, Yun, et al.
Veröffentlicht: (2026)
A New Kernel Regularity Condition for Distributed Mirror Descent: Broader Coverage and Simpler Analysis
von: Qiu, Junwen, et al.
Veröffentlicht: (2026)
von: Qiu, Junwen, et al.
Veröffentlicht: (2026)
Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent
von: Wang, Zeyuan, et al.
Veröffentlicht: (2026)
von: Wang, Zeyuan, et al.
Veröffentlicht: (2026)
Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors
von: Yuan, Chaohao, et al.
Veröffentlicht: (2026)
von: Yuan, Chaohao, et al.
Veröffentlicht: (2026)
Entropy-Guided Multiplicative Updates: KL Projections for Multi-Factor Target Exposures
von: Qiu, Yimeng
Veröffentlicht: (2025)
von: Qiu, Yimeng
Veröffentlicht: (2025)
Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training
von: Xu, Zhenghao, et al.
Veröffentlicht: (2026)
von: Xu, Zhenghao, et al.
Veröffentlicht: (2026)
KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity
von: Aminian, Gholamali, et al.
Veröffentlicht: (2025)
von: Aminian, Gholamali, et al.
Veröffentlicht: (2025)
Stress-Aware Learning under KL Drift via Trust-Decayed Mirror Descent
von: Raj, Gabriel Nixon
Veröffentlicht: (2025)
von: Raj, Gabriel Nixon
Veröffentlicht: (2025)
Minimizing Weighted Counterfactual Regret with Optimistic Online Mirror Descent
von: Xu, Hang, et al.
Veröffentlicht: (2024)
von: Xu, Hang, et al.
Veröffentlicht: (2024)
On the Convergence of Policy Mirror Descent with Temporal Difference Evaluation
von: Liu, Jiacai, et al.
Veröffentlicht: (2025)
von: Liu, Jiacai, et al.
Veröffentlicht: (2025)
Stability and Robustness via Regularization: Bandit Inference via Regularized Stochastic Mirror Descent
von: Halder, Budhaditya, et al.
Veröffentlicht: (2026)
von: Halder, Budhaditya, et al.
Veröffentlicht: (2026)
Policy Mirror Descent with Temporal Difference Learning: Sample Complexity under Online Markov Data
von: Li, Wenye, et al.
Veröffentlicht: (2025)
von: Li, Wenye, et al.
Veröffentlicht: (2025)
Fast Rates in $α$-Potential Games via Regularized Mirror Descent
von: Chen, Claire, et al.
Veröffentlicht: (2026)
von: Chen, Claire, et al.
Veröffentlicht: (2026)
A Unified Approach to Controlling Implicit Regularization via Mirror Descent
von: Sun, Haoyuan, et al.
Veröffentlicht: (2023)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2023)
Score-Regularized Joint Sampling with Importance Weights for Flow Matching
von: Liu, Xinshuang, et al.
Veröffentlicht: (2025)
von: Liu, Xinshuang, et al.
Veröffentlicht: (2025)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
von: Sherman, Uri, et al.
Veröffentlicht: (2025)
von: Sherman, Uri, et al.
Veröffentlicht: (2025)
StaQ it! Growing neural networks for Policy Mirror Descent
von: Shilova, Alena, et al.
Veröffentlicht: (2025)
von: Shilova, Alena, et al.
Veröffentlicht: (2025)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
von: Li, Xiang, et al.
Veröffentlicht: (2026)
von: Li, Xiang, et al.
Veröffentlicht: (2026)
Mirror Descent Methods with Weighting Scheme for Outputs for Constrained Variational Inequality Problems
von: Alkousa, Mohammad S., et al.
Veröffentlicht: (2025)
von: Alkousa, Mohammad S., et al.
Veröffentlicht: (2025)
Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes
von: Bossens, David M., et al.
Veröffentlicht: (2025)
von: Bossens, David M., et al.
Veröffentlicht: (2025)
Energy-Weighted Flow Matching: Unlocking Continuous Normalizing Flows for Efficient and Scalable Boltzmann Sampling
von: Dern, Niclas, et al.
Veröffentlicht: (2025)
von: Dern, Niclas, et al.
Veröffentlicht: (2025)
Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR
von: Bounhar, Abdelaziz, et al.
Veröffentlicht: (2025)
von: Bounhar, Abdelaziz, et al.
Veröffentlicht: (2025)
Parameter-free Mirror Descent
von: Jacobsen, Andrew, et al.
Veröffentlicht: (2022)
von: Jacobsen, Andrew, et al.
Veröffentlicht: (2022)
Mirror Descent on Riemannian Manifolds
von: Jiang, Jiaxin, et al.
Veröffentlicht: (2026)
von: Jiang, Jiaxin, et al.
Veröffentlicht: (2026)
A Mirror Descent Perspective of Smoothed Sign Descent
von: Wang, Shuyang, et al.
Veröffentlicht: (2024)
von: Wang, Shuyang, et al.
Veröffentlicht: (2024)
HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
von: Liu, Zhanyu, et al.
Veröffentlicht: (2026)
von: Liu, Zhanyu, et al.
Veröffentlicht: (2026)
Shuffling the Stochastic Mirror Descent via Dual Lipschitz Continuity and Kernel Conditioning
von: Qiu, Junwen, et al.
Veröffentlicht: (2026)
von: Qiu, Junwen, et al.
Veröffentlicht: (2026)
Target Mirror Descent: A Unifying Framework for Solving Monotone Variational Inequalities
von: Chen, Yu-Wen, et al.
Veröffentlicht: (2026)
von: Chen, Yu-Wen, et al.
Veröffentlicht: (2026)
Taming Audio VAEs via Target-KL Regularization
von: Seetharaman, Prem, et al.
Veröffentlicht: (2026)
von: Seetharaman, Prem, et al.
Veröffentlicht: (2026)
A Novel Framework for Policy Mirror Descent with General Parameterization and Linear Convergence
von: Alfano, Carlo, et al.
Veröffentlicht: (2023)
von: Alfano, Carlo, et al.
Veröffentlicht: (2023)
Finite-Particle Rates for Regularized Stein Variational Gradient Descent
von: He, Ye, et al.
Veröffentlicht: (2026)
von: He, Ye, et al.
Veröffentlicht: (2026)
Leave No One Undermined: Policy Targeting with Regret Aversion
von: Kitagawa, Toru, et al.
Veröffentlicht: (2025)
von: Kitagawa, Toru, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
On the Effect of Regularization in Policy Mirror Descent
von: Kleuker, Jan Felix, et al.
Veröffentlicht: (2025) -
One-Step Flow Policy Mirror Descent
von: Chen, Tianyi, et al.
Veröffentlicht: (2025) -
Forward KL Regularized Preference Optimization for Aligning Diffusion Policies
von: Shan, Zhao, et al.
Veröffentlicht: (2024) -
Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints
von: Gao, Ting, et al.
Veröffentlicht: (2026) -
Policy Mirror Descent with Lookahead
von: Protopapas, Kimon, et al.
Veröffentlicht: (2024)