Reducing Blackwell and Average Optimality to Discounted MDPs via the Blackwell Discount Factor
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Grand-Clément, Julien, Petrik, Marek |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Risk-averse Total-reward MDPs with ERM and EVaR
par: Su, Xihong, et autres
Publié: (2024)
par: Su, Xihong, et autres
Publié: (2024)
Beyond discounted returns: Robust Markov decision processes with average and Blackwell optimality
par: Grand-Clément, Julien, et autres
Publié: (2023)
par: Grand-Clément, Julien, et autres
Publié: (2023)
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
par: Hong, Kihyuk, et autres
Publié: (2024)
par: Hong, Kihyuk, et autres
Publié: (2024)
Efficiently Solving Discounted MDPs with Predictions on Transition Matrices
par: Lyu, Lixing, et autres
Publié: (2025)
par: Lyu, Lixing, et autres
Publié: (2025)
Extensive-Form Game Solving via Blackwell Approachability on Treeplexes
par: Chakrabarti, Darshan, et autres
Publié: (2024)
par: Chakrabarti, Darshan, et autres
Publié: (2024)
Slowly Changing Adversarial Bandit Algorithms are Efficient for Discounted MDPs
par: Kash, Ian A., et autres
Publié: (2022)
par: Kash, Ian A., et autres
Publié: (2022)
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
par: Thoppe, Gugan, et autres
Publié: (2026)
par: Thoppe, Gugan, et autres
Publié: (2026)
Imitation Learning in Discounted Linear MDPs without exploration assumptions
par: Viano, Luca, et autres
Publié: (2024)
par: Viano, Luca, et autres
Publié: (2024)
Solving Multi-Model MDPs by Coordinate Ascent and Dynamic Programming
par: Su, Xihong, et autres
Publié: (2024)
par: Su, Xihong, et autres
Publié: (2024)
Thresholds for sensitive optimality and Blackwell optimality in stochastic games
par: Gaubert, Stéphane, et autres
Publié: (2025)
par: Gaubert, Stéphane, et autres
Publié: (2025)
Bridging the Gap Between Average and Discounted TD Learning
par: Tian, Haoxing, et autres
Publié: (2026)
par: Tian, Haoxing, et autres
Publié: (2026)
Probabilistic Safety Guarantee for Stochastic Control Systems Using Average Reward MDPs
par: Omidi, Saber, et autres
Publié: (2025)
par: Omidi, Saber, et autres
Publié: (2025)
Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition
par: Manivannan, Sanjeev, et autres
Publié: (2026)
par: Manivannan, Sanjeev, et autres
Publié: (2026)
Towards Blackwell Optimality: Bellman Optimality Is All You Can Get
par: Boone, Victor, et autres
Publié: (2025)
par: Boone, Victor, et autres
Publié: (2025)
Policy Gradient in Robust MDPs with Global Convergence Guarantee
par: Wang, Qiuhao, et autres
Publié: (2022)
par: Wang, Qiuhao, et autres
Publié: (2022)
Blackwell's Approachability with Approximation Algorithms
par: Garber, Dan, et autres
Publié: (2025)
par: Garber, Dan, et autres
Publié: (2025)
Rao-Blackwellized Score Matching on Manifolds
par: Rawal, Divit
Publié: (2026)
par: Rawal, Divit
Publié: (2026)
Rate-Preserving Reductions for Blackwell Approachability
par: Dann, Christoph, et autres
Publié: (2024)
par: Dann, Christoph, et autres
Publié: (2024)
Rao-Blackwellized POMDP Planning
par: Lee, Jiho, et autres
Publié: (2024)
par: Lee, Jiho, et autres
Publié: (2024)
Revisiting Value Iteration: Unified Analysis of Discounted and Average-Reward Cases
par: Mustafin, Arsenii, et autres
Publié: (2025)
par: Mustafin, Arsenii, et autres
Publié: (2025)
Reducing Reward Dependence in RL Through Adaptive Confidence Discounting
par: Satici, Muhammed Yusuf, et autres
Publié: (2025)
par: Satici, Muhammed Yusuf, et autres
Publié: (2025)
Teaching Precommitted Agents: Model-Free Policy Evaluation and Control in Quasi-Hyperbolic Discounted MDPs
par: Eshwar, S. R.
Publié: (2025)
par: Eshwar, S. R.
Publié: (2025)
Goal inference with Rao-Blackwellized Particle Filters
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Rao-Blackwell Gradient Estimators for Equivariant Denoising Diffusion
par: Tong, Vinh, et autres
Publié: (2025)
par: Tong, Vinh, et autres
Publié: (2025)
Simultaneous Blackwell Approachability and Applications to Multiclass Omniprediction
par: Hu, Lunjia, et autres
Publié: (2026)
par: Hu, Lunjia, et autres
Publié: (2026)
Recursive Entropic Risk Optimization in Discounted MDPs: Sample Complexity Bounds with a Generative Model
par: Mortensen, Oliver, et autres
Publié: (2025)
par: Mortensen, Oliver, et autres
Publié: (2025)
Blackwell's Approachability for Sequential Conformal Inference
par: Principato, Guillaume, et autres
Publié: (2025)
par: Principato, Guillaume, et autres
Publié: (2025)
Stochastic Discount Factors with Cross-Asset Spillovers
par: Avramov, Doron, et autres
Publié: (2026)
par: Avramov, Doron, et autres
Publié: (2026)
Multi-agent decision making: A Blackwell's informativeness approach
par: Zhang, Zheng, et autres
Publié: (2026)
par: Zhang, Zheng, et autres
Publié: (2026)
Online Linear Regression in Dynamic Environments via Discounting
par: Jacobsen, Andrew, et autres
Publié: (2024)
par: Jacobsen, Andrew, et autres
Publié: (2024)
Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis
par: Hau, Jia Lin, et autres
Publié: (2024)
par: Hau, Jia Lin, et autres
Publié: (2024)
RASR: Risk-Averse Soft-Robust MDPs with EVaR and Entropic Risk
par: Hau, Jia Lin, et autres
Publié: (2022)
par: Hau, Jia Lin, et autres
Publié: (2022)
Learning to Reason Efficiently with Discounted Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2025)
par: Ayoub, Alex, et autres
Publié: (2025)
Reinforcement Learning with Quasi-Hyperbolic Discounting
par: Eshwar, S. R., et autres
Publié: (2024)
par: Eshwar, S. R., et autres
Publié: (2024)
Second-Order Mirror Descent: Convergence in Games Beyond Averaging and Discounting
par: Gao, Bolin, et autres
Publié: (2021)
par: Gao, Bolin, et autres
Publié: (2021)
Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning
par: Zhang, Jiahao, et autres
Publié: (2026)
par: Zhang, Jiahao, et autres
Publié: (2026)
Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs
par: Yadav, Divakar Kumar, et autres
Publié: (2026)
par: Yadav, Divakar Kumar, et autres
Publié: (2026)
Discounted Adaptive Online Learning: Towards Better Regularization
par: Zhang, Zhiyu, et autres
Publié: (2024)
par: Zhang, Zhiyu, et autres
Publié: (2024)
Adaptive Discounting of Training Time Attacks
par: Bector, Ridhima, et autres
Publié: (2024)
par: Bector, Ridhima, et autres
Publié: (2024)
Documents similaires
-
Risk-averse Total-reward MDPs with ERM and EVaR
par: Su, Xihong, et autres
Publié: (2024) -
Beyond discounted returns: Robust Markov decision processes with average and Blackwell optimality
par: Grand-Clément, Julien, et autres
Publié: (2023) -
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
par: Zurek, Matthew, et autres
Publié: (2024) -
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
par: Hong, Kihyuk, et autres
Publié: (2024) -
Efficiently Solving Discounted MDPs with Predictions on Transition Matrices
par: Lyu, Lixing, et autres
Publié: (2025)