Recursive Entropic Risk Optimization in Discounted MDPs: Sample Complexity Bounds with a Generative Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mortensen, Oliver, Talebi, Mohammad Sadegh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents
par: Mortensen, Oliver, et autres
Publié: (2026)
par: Mortensen, Oliver, et autres
Publié: (2026)
Hereditary Geometric Meta-RL: Nonlocal Generalization via Task Symmetries
par: Nitschke, Paul, et autres
Publié: (2026)
par: Nitschke, Paul, et autres
Publié: (2026)
Efficient Risk-sensitive Planning via Entropic Risk Measures
par: Marthe, Alexandre, et autres
Publié: (2025)
par: Marthe, Alexandre, et autres
Publié: (2025)
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
par: Zhang, Runyu, et autres
Publié: (2023)
par: Zhang, Runyu, et autres
Publié: (2023)
Provable Offline Reinforcement Learning for Structured Cyclic MDPs
par: Lee, Kyungbok, et autres
Publié: (2026)
par: Lee, Kyungbok, et autres
Publié: (2026)
Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs
par: Ding, Dongsheng, et autres
Publié: (2022)
par: Ding, Dongsheng, et autres
Publié: (2022)
Analysis of Thompson Sampling for Controlling Unknown Linear Diffusion Processes
par: Faradonbeh, Mohamad Kazem Shirani, et autres
Publié: (2022)
par: Faradonbeh, Mohamad Kazem Shirani, et autres
Publié: (2022)
How to Shrink Confidence Sets for Many Equivalent Discrete Distributions?
par: Maillard, Odalric-Ambrym, et autres
Publié: (2024)
par: Maillard, Odalric-Ambrym, et autres
Publié: (2024)
Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Data-Driven Portfolio Management for Motion Pictures Industry: A New Data-Driven Optimization Methodology Using a Large Language Model as the Expert
par: Alipour-Vaezi, Mohammad, et autres
Publié: (2024)
par: Alipour-Vaezi, Mohammad, et autres
Publié: (2024)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
par: Huang, Feihu, et autres
Publié: (2026)
par: Huang, Feihu, et autres
Publié: (2026)
BAGEL: Projection-Free Algorithm for Adversarially Constrained Online Convex Optimization
par: Lu, Yiyang, et autres
Publié: (2025)
par: Lu, Yiyang, et autres
Publié: (2025)
Unsupervised Training of Diffusion Models for Feasible Solution Generation in Neural Combinatorial Optimization
par: Hong, Seong-Hyun, et autres
Publié: (2024)
par: Hong, Seong-Hyun, et autres
Publié: (2024)
$γ$-weakly $θ$-up-concavity: A Unified Framework for Non-Convex Optimization Beyond DR-Submodular and OSS Functions
par: Pedramfar, Mohammad, et autres
Publié: (2026)
par: Pedramfar, Mohammad, et autres
Publié: (2026)
Optimization and Generalization Guarantees for Weight Normalization
par: Cisneros-Velarde, Pedro, et autres
Publié: (2024)
par: Cisneros-Velarde, Pedro, et autres
Publié: (2024)
Provably Safe Generative Sampling with Constricting Barrier Functions
par: Gadginmath, Darshan, et autres
Publié: (2026)
par: Gadginmath, Darshan, et autres
Publié: (2026)
Ginger: An Efficient Curvature Approximation with Linear Complexity for General Neural Networks
par: Hao, Yongchang, et autres
Publié: (2024)
par: Hao, Yongchang, et autres
Publié: (2024)
Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less
par: Liu, Yuxing, et autres
Publié: (2026)
par: Liu, Yuxing, et autres
Publié: (2026)
Beyond the Bellman Recursion: A Pontryagin-Guided Framework for Non-Exponential Discounting
par: Ko, Hojin, et autres
Publié: (2026)
par: Ko, Hojin, et autres
Publié: (2026)
Constructing Industrial-Scale Optimization Modeling Benchmark
par: Li, Zhong, et autres
Publié: (2026)
par: Li, Zhong, et autres
Publié: (2026)
Training Safe Neural Networks with Global SDP Bounds
par: Soletskyi, Roman, et autres
Publié: (2024)
par: Soletskyi, Roman, et autres
Publié: (2024)
Double-Bounded Optimal Transport for Advanced Clustering and Classification
par: Shi, Liangliang, et autres
Publié: (2024)
par: Shi, Liangliang, et autres
Publié: (2024)
Thinking Beyond Visibility: A Near-Optimal Policy Framework for Locally Interdependent Multi-Agent MDPs
par: DeWeese, Alex, et autres
Publié: (2025)
par: DeWeese, Alex, et autres
Publié: (2025)
From Large Language Models and Optimization to Decision Optimization CoPilot: A Research Manifesto
par: Wasserkrug, Segev, et autres
Publié: (2024)
par: Wasserkrug, Segev, et autres
Publié: (2024)
MINTS: Minimalist Thompson Sampling
par: Wang, Kaizheng
Publié: (2026)
par: Wang, Kaizheng
Publié: (2026)
ARO: A New Lens On Matrix Optimization For Large Models
par: Gong, Wenbo, et autres
Publié: (2026)
par: Gong, Wenbo, et autres
Publié: (2026)
Isotropic Curvature Model for Understanding Deep Learning Optimization: Is Gradient Orthogonalization Optimal?
par: Su, Weijie
Publié: (2025)
par: Su, Weijie
Publié: (2025)
DT-PBO: an Interpretable Tree-based Surrogate Model for Preferential Bayesian Optimization
par: Leenders, Nick, et autres
Publié: (2025)
par: Leenders, Nick, et autres
Publié: (2025)
Uncovering Symmetry Transfer in Large Language Models via Layer-Peeled Optimization
par: Du, Zhehang, et autres
Publié: (2026)
par: Du, Zhehang, et autres
Publié: (2026)
From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling
par: Lin, Jianghao, et autres
Publié: (2026)
par: Lin, Jianghao, et autres
Publié: (2026)
Conformal Prediction-Driven Adaptive Sampling for Digital Water Twins
par: Homaei, Mohammadhossein, et autres
Publié: (2025)
par: Homaei, Mohammadhossein, et autres
Publié: (2025)
CORL: Reinforcement Learning of MILP Policies Solved via Branch and Bound
par: Anand, Akhil S, et autres
Publié: (2025)
par: Anand, Akhil S, et autres
Publié: (2025)
Bucketized Active Sampling for Learning ACOPF
par: Klamkin, Michael, et autres
Publié: (2022)
par: Klamkin, Michael, et autres
Publié: (2022)
OptiRepair: Closed-Loop Diagnosis and Repair of Supply Chain Optimization Models with LLM Agents
par: Ao, Ruicheng, et autres
Publié: (2026)
par: Ao, Ruicheng, et autres
Publié: (2026)
Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Optimal Labeler Assignment and Sampling for Active Learning in the Presence of Imperfect Labels
par: Ahadi, Pouya, et autres
Publié: (2025)
par: Ahadi, Pouya, et autres
Publié: (2025)
Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling
par: Hao, Yongchang, et autres
Publié: (2026)
par: Hao, Yongchang, et autres
Publié: (2026)
Asymptotic and Finite Sample Analysis of Nonexpansive Stochastic Approximations with Markovian Noise
par: Blaser, Ethan, et autres
Publié: (2024)
par: Blaser, Ethan, et autres
Publié: (2024)
Mean-Field Path-Integral Diffusion: From Samples to Interacting Agents
par: Chertkov, Michael
Publié: (2026)
par: Chertkov, Michael
Publié: (2026)
Documents similaires
-
On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents
par: Mortensen, Oliver, et autres
Publié: (2026) -
Hereditary Geometric Meta-RL: Nonlocal Generalization via Task Symmetries
par: Nitschke, Paul, et autres
Publié: (2026) -
Efficient Risk-sensitive Planning via Entropic Risk Measures
par: Marthe, Alexandre, et autres
Publié: (2025) -
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
par: Zurek, Matthew, et autres
Publié: (2024) -
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
par: Zhang, Runyu, et autres
Publié: (2023)