A Spectral Revisit of the Distributional Bellman Operator under the Cramér Metric
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Keru, Deng, Yixin, Lyu, Yao, Redmond, Stephen, Li, Shengbo Eben |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dataset Clustering for Improved Offline Policy Learning
par: Wang, Qiang, et autres
Publié: (2024)
par: Wang, Qiang, et autres
Publié: (2024)
Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning
par: Zhang, Jiaming, et autres
Publié: (2026)
par: Zhang, Jiaming, et autres
Publié: (2026)
Distributional Bellman Operators over Mean Embeddings
par: Wenliang, Li Kevin, et autres
Publié: (2023)
par: Wenliang, Li Kevin, et autres
Publié: (2023)
Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion
par: Zheng, Ziang, et autres
Publié: (2025)
par: Zheng, Ziang, et autres
Publié: (2025)
On the Equilibrium between Feasible Zone and Uncertain Model in Safe Exploration
par: Yang, Yujie, et autres
Publié: (2026)
par: Yang, Yujie, et autres
Publié: (2026)
Bellman Diffusion: Generative Modeling as Learning a Linear Operator in the Distribution Space
par: Li, Yangming, et autres
Publié: (2024)
par: Li, Yangming, et autres
Publié: (2024)
Information-Directed Offline-to-Online Reinforcement Learning
par: Chen, Keru
Publié: (2026)
par: Chen, Keru
Publié: (2026)
Exchange Policy Optimization Algorithm for Semi-Infinite Safe Reinforcement Learning
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
Real-Time Generative Policy via Langevin-Guided Flow Matching for Autonomous Driving
par: Zhu, Tianze, et autres
Publié: (2026)
par: Zhu, Tianze, et autres
Publié: (2026)
Conformal Symplectic Optimization for Stable Reinforcement Learning
par: Lyu, Yao, et autres
Publié: (2024)
par: Lyu, Yao, et autres
Publié: (2024)
Parameterized Projected Bellman Operator
par: Vincent, Théo, et autres
Publié: (2023)
par: Vincent, Théo, et autres
Publié: (2023)
Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning
par: Omura, Motoki, et autres
Publié: (2025)
par: Omura, Motoki, et autres
Publié: (2025)
Revisiting Bisimulation Metric for Robust Representations in Reinforcement Learning
par: Zhang, Leiji, et autres
Publié: (2025)
par: Zhang, Leiji, et autres
Publié: (2025)
Convolutional Bayesian Filtering
par: Cao, Wenhan, et autres
Publié: (2024)
par: Cao, Wenhan, et autres
Publié: (2024)
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
par: Zhang, Feihong, et autres
Publié: (2025)
par: Zhang, Feihong, et autres
Publié: (2025)
Spectral Bellman Method: Unifying Representation and Exploration in RL
par: Nabati, Ofir, et autres
Publié: (2025)
par: Nabati, Ofir, et autres
Publié: (2025)
Policy Bifurcation in Safe Reinforcement Learning
par: Zou, Wenjun, et autres
Publié: (2024)
par: Zou, Wenjun, et autres
Publié: (2024)
Zeroth-Order Actor-Critic: An Evolutionary Framework for Sequential Decision Problems
par: Lei, Yuheng, et autres
Publié: (2022)
par: Lei, Yuheng, et autres
Publié: (2022)
Enhance Sample Efficiency and Robustness of End-to-end Urban Autonomous Driving via Semantic Masked World Model
par: Gao, Zeyu, et autres
Publié: (2022)
par: Gao, Zeyu, et autres
Publié: (2022)
Distributional Soft Actor-Critic with Diffusion Policy
par: Liu, Tong, et autres
Publié: (2025)
par: Liu, Tong, et autres
Publié: (2025)
Mixed Policy Gradient: off-policy reinforcement learning driven jointly by data and model
par: Guan, Yang, et autres
Publié: (2021)
par: Guan, Yang, et autres
Publié: (2021)
Predictive Lagrangian Optimization for Constrained Reinforcement Learning
par: Zhang, Tianqi, et autres
Publié: (2025)
par: Zhang, Tianqi, et autres
Publié: (2025)
Distributional Soft Actor-Critic with Three Refinements
par: Duan, Jingliang, et autres
Publié: (2023)
par: Duan, Jingliang, et autres
Publié: (2023)
Distributional Reinforcement Learning via the Cramér Distance
par: Aziz, Vanya, et autres
Publié: (2026)
par: Aziz, Vanya, et autres
Publié: (2026)
Near-Optimal Sample Complexities of Divergence-based S-rectangular Distributionally Robust Reinforcement Learning
par: Li, Zhenghao, et autres
Publié: (2025)
par: Li, Zhenghao, et autres
Publié: (2025)
One Filters All: A Generalist Filter for State Estimation
par: Liu, Shiqi, et autres
Publié: (2025)
par: Liu, Shiqi, et autres
Publié: (2025)
Distributional Off-policy Evaluation with Bellman Residual Minimization
par: Hong, Sungee, et autres
Publié: (2024)
par: Hong, Sungee, et autres
Publié: (2024)
Bootstrap Off-policy with World Model
par: Zhan, Guojian, et autres
Publié: (2025)
par: Zhan, Guojian, et autres
Publié: (2025)
Central Limit Theorem for Two-Time-Scale Approximate Distributionally Robust RL
par: Wang, Shengbo, et autres
Publié: (2026)
par: Wang, Shengbo, et autres
Publié: (2026)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
par: Zhan, Guojian, et autres
Publié: (2025)
par: Zhan, Guojian, et autres
Publié: (2025)
Towards Fast Safe Online Reinforcement Learning via Policy Finetuning
par: Chen, Keru, et autres
Publié: (2024)
par: Chen, Keru, et autres
Publié: (2024)
MICRO: Model-Based Offline Reinforcement Learning with a Conservative Bellman Operator
par: Liu, Xiao-Yin, et autres
Publié: (2023)
par: Liu, Xiao-Yin, et autres
Publié: (2023)
A Finite Sample Complexity Bound for Distributionally Robust Q-learning
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Bellman Error Centering
par: Chen, Xingguo, et autres
Publié: (2025)
par: Chen, Xingguo, et autres
Publié: (2025)
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
par: Chen, Zijun, et autres
Publié: (2025)
par: Chen, Zijun, et autres
Publié: (2025)
Q-Measure-Learning for Continuous State RL: Efficient Implementation and Convergence
par: Wang, Shengbo
Publié: (2026)
par: Wang, Shengbo
Publié: (2026)
Nonparametric Bellman Mappings for Value Iteration in Distributed Reinforcement Learning
par: Akiyama, Yuki, et autres
Publié: (2025)
par: Akiyama, Yuki, et autres
Publié: (2025)
Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework
par: Nanda, Phalguni, et autres
Publié: (2026)
par: Nanda, Phalguni, et autres
Publié: (2026)
Bellman Diffusion Models
par: Schramm, Liam, et autres
Publié: (2024)
par: Schramm, Liam, et autres
Publié: (2024)
Documents similaires
-
Dataset Clustering for Improved Offline Policy Learning
par: Wang, Qiang, et autres
Publié: (2024) -
Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning
par: Zhang, Jiaming, et autres
Publié: (2026) -
Distributional Bellman Operators over Mean Embeddings
par: Wenliang, Li Kevin, et autres
Publié: (2023) -
Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
par: Wang, Shengbo, et autres
Publié: (2025) -
Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion
par: Zheng, Ziang, et autres
Publié: (2025)