A Minibatch-SGD-Based Learning Meta-Policy for Inventory Systems with Myopic Optimal Policy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lyu, Jiameng, Xie, Jinxing, Yuan, Shilin, Zhou, Yuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Closing the Gaps: Optimality of Sample Average Approximation for Data-Driven Newsvendor Problems
par: Lyu, Jiameng, et autres
Publié: (2024)
par: Lyu, Jiameng, et autres
Publié: (2024)
Learning When to Restart: Nonstationary Newsvendor from Uncensored to Censored Demand
par: Chen, Xin, et autres
Publié: (2025)
par: Chen, Xin, et autres
Publié: (2025)
On Building Myopic MPC Policies using Supervised Learning
par: Orrico, Christopher A., et autres
Publié: (2024)
par: Orrico, Christopher A., et autres
Publié: (2024)
From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees
par: Xie, Shengping, et autres
Publié: (2025)
par: Xie, Shengping, et autres
Publié: (2025)
Traversing Pareto Optimal Policies: Provably Efficient Multi-Objective Reinforcement Learning
par: Qiu, Shuang, et autres
Publié: (2024)
par: Qiu, Shuang, et autres
Publié: (2024)
Optimal and Order-optimal Gated Priority-based Greedy Policies for Two-layer Multi-item Order Fulfillment
par: Chen, Xi, et autres
Publié: (2026)
par: Chen, Xi, et autres
Publié: (2026)
The Marginal Value of Momentum for Small Learning Rate SGD
par: Wang, Runzhe, et autres
Publié: (2023)
par: Wang, Runzhe, et autres
Publié: (2023)
Non-Myopic Multifidelity Bayesian Optimization
par: Di Fiore, Francesco, et autres
Publié: (2022)
par: Di Fiore, Francesco, et autres
Publié: (2022)
Beyond adaptive gradient: Fast-Controlled Minibatch Algorithm for large-scale optimization
par: Coppola, Corrado, et autres
Publié: (2024)
par: Coppola, Corrado, et autres
Publié: (2024)
Heavy-Tail Phenomenon in Decentralized SGD
par: Gurbuzbalaban, Mert, et autres
Publié: (2022)
par: Gurbuzbalaban, Mert, et autres
Publié: (2022)
Policy Transfer for Continuous-Time Reinforcement Learning: A (Rough) Differential Equation Approach
par: Guo, Xin, et autres
Publié: (2025)
par: Guo, Xin, et autres
Publié: (2025)
Achieve Performatively Optimal Policy for Performative Reinforcement Learning
par: Chen, Ziyi, et autres
Publié: (2025)
par: Chen, Ziyi, et autres
Publié: (2025)
Shadowheart SGD: Distributed Asynchronous SGD with Optimal Time Complexity Under Arbitrary Computation and Communication Heterogeneity
par: Tyurin, Alexander, et autres
Publié: (2024)
par: Tyurin, Alexander, et autres
Publié: (2024)
On Policy Stochasticity in Mutual Information Optimal Control of Linear Systems
par: Enami, Shoju, et autres
Publié: (2025)
par: Enami, Shoju, et autres
Publié: (2025)
An Efficient On-Policy Deep Learning Framework for Stochastic Optimal Control
par: Hua, Mengjian, et autres
Publié: (2024)
par: Hua, Mengjian, et autres
Publié: (2024)
The Optimality of (Accelerated) SGD for High-Dimensional Quadratic Optimization
par: Zhang, Haihan, et autres
Publié: (2024)
par: Zhang, Haihan, et autres
Publié: (2024)
Optimal Projection-Free Adaptive SGD for Matrix Optimization
par: Kovalev, Dmitry
Publié: (2026)
par: Kovalev, Dmitry
Publié: (2026)
Policy Gradient Converges to the Globally Optimal Policy for Nearly Linear-Quadratic Regulators
par: Han, Yinbin, et autres
Publié: (2023)
par: Han, Yinbin, et autres
Publié: (2023)
Optimal Growth Schedules for Batch Size and Learning Rate in SGD that Reduce SFO Complexity
par: Umeda, Hikaru, et autres
Publié: (2025)
par: Umeda, Hikaru, et autres
Publié: (2025)
Bias-Optimal Bounds for SGD: A Computer-Aided Lyapunov Analysis
par: Cortild, Daniel, et autres
Publié: (2025)
par: Cortild, Daniel, et autres
Publié: (2025)
Learning an Optimal Assortment Policy under Observational Data
par: Han, Yuxuan, et autres
Publié: (2025)
par: Han, Yuxuan, et autres
Publié: (2025)
AdaSwitch: An Adaptive Switching Meta-Algorithm for Learning-Augmented Bounded-Influence Problems
par: Chen, Xi, et autres
Publié: (2025)
par: Chen, Xi, et autres
Publié: (2025)
Revisiting Gradient Normalization and Clipping for Nonconvex SGD under Heavy-Tailed Noise: Necessity, Sufficiency, and Acceleration
par: Sun, Tao, et autres
Publié: (2024)
par: Sun, Tao, et autres
Publié: (2024)
Benchmarking Reinforcement Learning via Stochastic Converse Optimality: Generating Systems with Known Optimal Policies
par: Ibrahim, Sinan, et autres
Publié: (2026)
par: Ibrahim, Sinan, et autres
Publié: (2026)
Meta-Learning Linear Quadratic Regulators: A Policy Gradient MAML Approach for Model-free LQR
par: Toso, Leonardo F., et autres
Publié: (2024)
par: Toso, Leonardo F., et autres
Publié: (2024)
ROOT-SGD: Sharp Nonasymptotics and Near-Optimal Asymptotics in a Single Algorithm
par: Li, Chris Junchi, et autres
Publié: (2020)
par: Li, Chris Junchi, et autres
Publié: (2020)
Sequential Bayesian Optimal Experimental Design in Infinite Dimensions via Policy Gradient Reinforcement Learning
par: Shen, Kaichen, et autres
Publié: (2026)
par: Shen, Kaichen, et autres
Publié: (2026)
Wasserstein Formulation of Reinforcement Learning. An Optimal Transport Perspective on Policy Optimization
par: Dus, Mathias
Publié: (2026)
par: Dus, Mathias
Publié: (2026)
Performative Policy Gradient: Optimality in Performative Reinforcement Learning
par: Basu, Debabrota, et autres
Publié: (2025)
par: Basu, Debabrota, et autres
Publié: (2025)
Classical and Deep Reinforcement Learning Inventory Control Policies for Pharmaceutical Supply Chains with Perishability and Non-Stationarity
par: Stranieri, Francesco, et autres
Publié: (2025)
par: Stranieri, Francesco, et autres
Publié: (2025)
Asynchronous Decentralized SGD under Non-Convexity: A Block-Coordinate Descent Framework
par: Zhou, Yijie, et autres
Publié: (2025)
par: Zhou, Yijie, et autres
Publié: (2025)
SLowcal-SGD: Slow Query Points Improve Local-SGD for Stochastic Convex Optimization
par: Dahan, Tehila, et autres
Publié: (2023)
par: Dahan, Tehila, et autres
Publié: (2023)
Making SGD Parameter-Free
par: Carmon, Yair, et autres
Publié: (2022)
par: Carmon, Yair, et autres
Publié: (2022)
On the Trajectories of SGD Without Replacement
par: Beneventano, Pierfrancesco
Publié: (2023)
par: Beneventano, Pierfrancesco
Publié: (2023)
On the Convergence of Policy in Unregularized Policy Mirror Descent
par: Lin, Dachao, et autres
Publié: (2022)
par: Lin, Dachao, et autres
Publié: (2022)
Scalable Bi-causal Optimal Transport via KL Relaxation and Policy Gradients
par: Cao, Haoyang, et autres
Publié: (2026)
par: Cao, Haoyang, et autres
Publié: (2026)
Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
par: Wang, Shengbo, et autres
Publié: (2026)
par: Wang, Shengbo, et autres
Publié: (2026)
How Neural Networks Learn the Support is an Implicit Regularization Effect of SGD
par: Beneventano, Pierfrancesco, et autres
Publié: (2024)
par: Beneventano, Pierfrancesco, et autres
Publié: (2024)
Understanding Outer Optimizers in Local SGD: Learning Rates, Momentum, and Acceleration
par: Khaled, Ahmed, et autres
Publié: (2025)
par: Khaled, Ahmed, et autres
Publié: (2025)
A Novel Framework for Policy Mirror Descent with General Parameterization and Linear Convergence
par: Alfano, Carlo, et autres
Publié: (2023)
par: Alfano, Carlo, et autres
Publié: (2023)
Documents similaires
-
Closing the Gaps: Optimality of Sample Average Approximation for Data-Driven Newsvendor Problems
par: Lyu, Jiameng, et autres
Publié: (2024) -
Learning When to Restart: Nonstationary Newsvendor from Uncensored to Censored Demand
par: Chen, Xin, et autres
Publié: (2025) -
On Building Myopic MPC Policies using Supervised Learning
par: Orrico, Christopher A., et autres
Publié: (2024) -
From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees
par: Xie, Shengping, et autres
Publié: (2025) -
Traversing Pareto Optimal Policies: Provably Efficient Multi-Objective Reinforcement Learning
par: Qiu, Shuang, et autres
Publié: (2024)