Worst-Case Regret Bounds for Exploration via Randomized Value Functions
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Russo, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2019
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Distributionally Robust Safety Verification of Neural Networks via Worst-Case CVaR
par: Kishida, Masako
Publié: (2025)
par: Kishida, Masako
Publié: (2025)
Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success
par: Russo, Daniel
Publié: (2026)
par: Russo, Daniel
Publié: (2026)
RL for Mitigating Cascading Failures: Targeted Exploration via Sensitivity Factors
par: Dwivedi, Anmol, et autres
Publié: (2024)
par: Dwivedi, Anmol, et autres
Publié: (2024)
Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems
par: Huang, Yilie, et autres
Publié: (2024)
par: Huang, Yilie, et autres
Publié: (2024)
Conformal Off-Policy Evaluation in Markov Decision Processes
par: Foffano, Daniele, et autres
Publié: (2023)
par: Foffano, Daniele, et autres
Publié: (2023)
CORL: Reinforcement Learning of MILP Policies Solved via Branch and Bound
par: Anand, Akhil S, et autres
Publié: (2025)
par: Anand, Akhil S, et autres
Publié: (2025)
Improving Variational Autoencoder using Random Fourier Transformation: An Aviation Safety Anomaly Detection Case-Study
par: Asanjan, Ata Akbari, et autres
Publié: (2026)
par: Asanjan, Ata Akbari, et autres
Publié: (2026)
An Optimal Policy for Learning Controllable Dynamics by Exploration
par: Loxley, Peter N.
Publié: (2025)
par: Loxley, Peter N.
Publié: (2025)
Offline Reinforcement Learning and Sequence Modeling for Downlink Link Adaptation
par: Peri, Samuele, et autres
Publié: (2024)
par: Peri, Samuele, et autres
Publié: (2024)
Optimizing Audio Recommendations for the Long-Term: A Reinforcement Learning Perspective
par: Maystre, Lucas, et autres
Publié: (2023)
par: Maystre, Lucas, et autres
Publié: (2023)
Provably Bounding Neural Network Preimages
par: Kotha, Suhas, et autres
Publié: (2023)
par: Kotha, Suhas, et autres
Publié: (2023)
Runtime-Certified Bounded-Error Quantized Attention
par: Calver, Dean
Publié: (2026)
par: Calver, Dean
Publié: (2026)
Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case Regret
par: Zhong, Han, et autres
Publié: (2023)
par: Zhong, Han, et autres
Publié: (2023)
Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning
par: Mete, Akshay, et autres
Publié: (2026)
par: Mete, Akshay, et autres
Publié: (2026)
Oracle-Efficient Reinforcement Learning for Max Value Ensembles
par: Hussing, Marcel, et autres
Publié: (2024)
par: Hussing, Marcel, et autres
Publié: (2024)
Tangential Randomization in Linear Bandits (TRAiL): Guaranteed Inference and Regret Bounds
par: Güçlü, Arda, et autres
Publié: (2024)
par: Güçlü, Arda, et autres
Publié: (2024)
Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems
par: Huang, Yilie, et autres
Publié: (2025)
par: Huang, Yilie, et autres
Publié: (2025)
Thermodynamic Liquid Manifold Networks: Physics-Bounded Deep Learning for Solar Forecasting in Autonomous Off-Grid Microgrids
par: Abdullah, Mohammed Ezzaldin Babiker
Publié: (2026)
par: Abdullah, Mohammed Ezzaldin Babiker
Publié: (2026)
Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods
par: Lyu, Xubo, et autres
Publié: (2020)
par: Lyu, Xubo, et autres
Publié: (2020)
Constrained Reinforcement Learning with Smoothed Log Barrier Function
par: Zhang, Baohe, et autres
Publié: (2024)
par: Zhang, Baohe, et autres
Publié: (2024)
Certified Training with Branch-and-Bound for Lyapunov-stable Neural Control
par: Shi, Zhouxing, et autres
Publié: (2024)
par: Shi, Zhouxing, et autres
Publié: (2024)
Safe Deep Model-Based Reinforcement Learning with Lyapunov Functions
par: Zhang, Harry
Publié: (2024)
par: Zhang, Harry
Publié: (2024)
Provably Safe Generative Sampling with Constricting Barrier Functions
par: Gadginmath, Darshan, et autres
Publié: (2026)
par: Gadginmath, Darshan, et autres
Publié: (2026)
Verification-Aided Learning of Neural Network Barrier Functions with Termination Guarantees
par: Chen, Shaoru, et autres
Publié: (2024)
par: Chen, Shaoru, et autres
Publié: (2024)
Learning Geometrically-Informed Lyapunov Functions with Deep Diffeomorphic RBF Networks
par: Tesfazgi, Samuel, et autres
Publié: (2025)
par: Tesfazgi, Samuel, et autres
Publié: (2025)
Function Approximation for Reinforcement Learning Controller for Energy from Spread Waves
par: Sarkar, Soumyendu, et autres
Publié: (2024)
par: Sarkar, Soumyendu, et autres
Publié: (2024)
Analyzing Generalization in Policy Networks: A Case Study with the Double-Integrator System
par: Zhang, Ruining, et autres
Publié: (2023)
par: Zhang, Ruining, et autres
Publié: (2023)
Deep Learning Based Simulators for the Phosphorus Removal Process Control in Wastewater Treatment via Deep Reinforcement Learning Algorithms
par: Mohammadi, Esmaeel, et autres
Publié: (2024)
par: Mohammadi, Esmaeel, et autres
Publié: (2024)
Towards Developing Safety Assurance Cases for Learning-Enabled Medical Cyber-Physical Systems
par: Bagheri, Maryam, et autres
Publié: (2022)
par: Bagheri, Maryam, et autres
Publié: (2022)
On-Meter Graph Machine Learning: A Case Study of PV Power Forecasting for Grid Edge Intelligence
par: Huang, Jian, et autres
Publié: (2026)
par: Huang, Jian, et autres
Publié: (2026)
Lyapunov Function Consistent Adaptive Network Signal Control with Back Pressure and Reinforcement Learning
par: Ma, Chaolun, et autres
Publié: (2022)
par: Ma, Chaolun, et autres
Publié: (2022)
Every Call is Precious: Global Optimization of Black-Box Functions with Unknown Lipschitz Constants
par: Fourati, Fares, et autres
Publié: (2025)
par: Fourati, Fares, et autres
Publié: (2025)
Approximate Information States for Worst-Case Control and Learning in Uncertain Systems
par: Dave, Aditya, et autres
Publié: (2023)
par: Dave, Aditya, et autres
Publié: (2023)
Inference with the Upper Confidence Bound Algorithm
par: Khamaru, Koulik, et autres
Publié: (2024)
par: Khamaru, Koulik, et autres
Publié: (2024)
Feature Engineering Approach to Building Load Prediction: A Case Study for Commercial Building Chiller Plant Optimization in Tropical Weather
par: Wang, Zhan, et autres
Publié: (2025)
par: Wang, Zhan, et autres
Publié: (2025)
Trustworthy and Explainable Deep Reinforcement Learning for Safe and Energy-Efficient Process Control: A Use Case in Industrial Compressed Air Systems
par: Bezold, Vincent, et autres
Publié: (2025)
par: Bezold, Vincent, et autres
Publié: (2025)
Stabilizing Policy Gradient Methods via Reward Profiling
par: Ahmed, Shihab, et autres
Publié: (2025)
par: Ahmed, Shihab, et autres
Publié: (2025)
From Model-Based and Adaptive Control to Evolving Fuzzy Control
par: Leite, Daniel, et autres
Publié: (2025)
par: Leite, Daniel, et autres
Publié: (2025)
SEAL: SEmantic-Augmented Imitation Learning via Language Model
par: Gu, Chengyang, et autres
Publié: (2024)
par: Gu, Chengyang, et autres
Publié: (2024)
Stochastic Actor-Critic: Mitigating Overestimation via Temporal Aleatoric Uncertainty
par: Özalp, Uğurcan
Publié: (2026)
par: Özalp, Uğurcan
Publié: (2026)
Documents similaires
-
Distributionally Robust Safety Verification of Neural Networks via Worst-Case CVaR
par: Kishida, Masako
Publié: (2025) -
Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success
par: Russo, Daniel
Publié: (2026) -
RL for Mitigating Cascading Failures: Targeted Exploration via Sensitivity Factors
par: Dwivedi, Anmol, et autres
Publié: (2024) -
Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems
par: Huang, Yilie, et autres
Publié: (2024) -
Conformal Off-Policy Evaluation in Markov Decision Processes
par: Foffano, Daniele, et autres
Publié: (2023)