Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Zhenghao, Lu, Qin, Yu, Changlong, Zhao, Tuo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds
por: Xu, Zhenghao, et al.
Publicado: (2023)
por: Xu, Zhenghao, et al.
Publicado: (2023)
On the Effect of Regularization in Policy Mirror Descent
por: Kleuker, Jan Felix, et al.
Publicado: (2025)
por: Kleuker, Jan Felix, et al.
Publicado: (2025)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
por: Sherman, Uri, et al.
Publicado: (2025)
por: Sherman, Uri, et al.
Publicado: (2025)
A Unified Approach to Controlling Implicit Regularization via Mirror Descent
por: Sun, Haoyuan, et al.
Publicado: (2023)
por: Sun, Haoyuan, et al.
Publicado: (2023)
Functional Acceleration for Policy Mirror Descent
por: Chelu, Veronica, et al.
Publicado: (2024)
por: Chelu, Veronica, et al.
Publicado: (2024)
Activation Sensitivity as a Unifying Principle for Post-Training Quantization
por: Xu, Bruce Changlong
Publicado: (2026)
por: Xu, Bruce Changlong
Publicado: (2026)
Ask a Strong LLM Judge when Your Reward Model is Uncertain
por: Xu, Zhenghao, et al.
Publicado: (2025)
por: Xu, Zhenghao, et al.
Publicado: (2025)
The Hidden Cost of Approximation in Online Mirror Descent
por: Schlisselberg, Ofir, et al.
Publicado: (2025)
por: Schlisselberg, Ofir, et al.
Publicado: (2025)
Policy Mirror Descent with Lookahead
por: Protopapas, Kimon, et al.
Publicado: (2024)
por: Protopapas, Kimon, et al.
Publicado: (2024)
Mirror, Mirror of the Flow: How Does Regularization Shape Implicit Bias?
por: Jacobs, Tom, et al.
Publicado: (2025)
por: Jacobs, Tom, et al.
Publicado: (2025)
Implicit Bias and Convergence of Matrix Stochastic Mirror Descent
por: Akhtiamov, Danil, et al.
Publicado: (2026)
por: Akhtiamov, Danil, et al.
Publicado: (2026)
On the Convergence of Policy in Unregularized Policy Mirror Descent
por: Lin, Dachao, et al.
Publicado: (2022)
por: Lin, Dachao, et al.
Publicado: (2022)
One-Step Flow Policy Mirror Descent
por: Chen, Tianyi, et al.
Publicado: (2025)
por: Chen, Tianyi, et al.
Publicado: (2025)
Stability and Robustness via Regularization: Bandit Inference via Regularized Stochastic Mirror Descent
por: Halder, Budhaditya, et al.
Publicado: (2026)
por: Halder, Budhaditya, et al.
Publicado: (2026)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
por: Hong, Ilgee, et al.
Publicado: (2025)
por: Hong, Ilgee, et al.
Publicado: (2025)
Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints
por: Gao, Ting, et al.
Publicado: (2026)
por: Gao, Ting, et al.
Publicado: (2026)
Efficient Training of Boltzmann Generators Using Off-Policy Log-Dispersion Regularization
por: Schopmans, Henrik, et al.
Publicado: (2026)
por: Schopmans, Henrik, et al.
Publicado: (2026)
On the Convergence of Policy Mirror Descent with Temporal Difference Evaluation
por: Liu, Jiacai, et al.
Publicado: (2025)
por: Liu, Jiacai, et al.
Publicado: (2025)
StaQ it! Growing neural networks for Policy Mirror Descent
por: Shilova, Alena, et al.
Publicado: (2025)
por: Shilova, Alena, et al.
Publicado: (2025)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
por: Hu, Pingbang, et al.
Publicado: (2026)
por: Hu, Pingbang, et al.
Publicado: (2026)
Understanding the Implicit Regularization of Gradient Descent in Over-parameterized Models
por: Ma, Jianhao, et al.
Publicado: (2025)
por: Ma, Jianhao, et al.
Publicado: (2025)
Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schrödinger Bridge
por: Gong, Yuehu, et al.
Publicado: (2026)
por: Gong, Yuehu, et al.
Publicado: (2026)
Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent
por: Wang, Zeyuan, et al.
Publicado: (2026)
por: Wang, Zeyuan, et al.
Publicado: (2026)
Policy Regularized Distributionally Robust Markov Decision Processes with Linear Function Approximation
por: Gu, Jingwen, et al.
Publicado: (2025)
por: Gu, Jingwen, et al.
Publicado: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
Mirror Descent on Riemannian Manifolds
por: Jiang, Jiaxin, et al.
Publicado: (2026)
por: Jiang, Jiaxin, et al.
Publicado: (2026)
Parameter-free Mirror Descent
por: Jacobsen, Andrew, et al.
Publicado: (2022)
por: Jacobsen, Andrew, et al.
Publicado: (2022)
Optimistic Online Mirror Descent for Bridging Stochastic and Adversarial Online Convex Optimization
por: Chen, Sijia, et al.
Publicado: (2023)
por: Chen, Sijia, et al.
Publicado: (2023)
A Mirror Descent Perspective of Smoothed Sign Descent
por: Wang, Shuyang, et al.
Publicado: (2024)
por: Wang, Shuyang, et al.
Publicado: (2024)
A Universal Banach--Bregman Framework for Stochastic Iterations: Unifying Stochastic Mirror Descent, Learning and LLM Training
por: Zhang, Johnny R., et al.
Publicado: (2025)
por: Zhang, Johnny R., et al.
Publicado: (2025)
Implicit Regularization for Tubal Tensor Factorizations via Gradient Descent
por: Karnik, Santhosh, et al.
Publicado: (2024)
por: Karnik, Santhosh, et al.
Publicado: (2024)
Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes
por: Bossens, David M., et al.
Publicado: (2025)
por: Bossens, David M., et al.
Publicado: (2025)
Mask in the Mirror: Implicit Sparsification
por: Jacobs, Tom, et al.
Publicado: (2024)
por: Jacobs, Tom, et al.
Publicado: (2024)
Mirror Descent-Type Algorithms for the Variational Inequality Problem with Functional Constraints
por: Alkousa, Mohammad S., et al.
Publicado: (2026)
por: Alkousa, Mohammad S., et al.
Publicado: (2026)
COSMOS: A Hybrid Adaptive Optimizer for Memory-Efficient Training of LLMs
por: Liu, Liming, et al.
Publicado: (2025)
por: Liu, Liming, et al.
Publicado: (2025)
Asymptotic Behavior of Multi--Task Learning: Implicit Regularization and Double Descent Effects
por: Alrashdi, Ayed M., et al.
Publicado: (2026)
por: Alrashdi, Ayed M., et al.
Publicado: (2026)
Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent
por: Shu, Yao, et al.
Publicado: (2026)
por: Shu, Yao, et al.
Publicado: (2026)
Implicit Regularization of the Deep Inverse Prior Trained with Inertia
por: Buskulic, Nathan, et al.
Publicado: (2025)
por: Buskulic, Nathan, et al.
Publicado: (2025)
Rank-Induced PL Mirror Descent: A Rank-Faithful Second-Order Algorithm for Sleeping Experts
por: Zhang, Tiantian
Publicado: (2025)
por: Zhang, Tiantian
Publicado: (2025)
Ejemplares similares
-
Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds
por: Xu, Zhenghao, et al.
Publicado: (2023) -
On the Effect of Regularization in Policy Mirror Descent
por: Kleuker, Jan Felix, et al.
Publicado: (2025) -
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
por: Sherman, Uri, et al.
Publicado: (2025) -
A Unified Approach to Controlling Implicit Regularization via Mirror Descent
por: Sun, Haoyuan, et al.
Publicado: (2023) -
Functional Acceleration for Policy Mirror Descent
por: Chelu, Veronica, et al.
Publicado: (2024)