Generalized Policy Improvement Algorithms with Theoretically Supported Sample Reuse
Fuente:
arXiv
Salvato in:
| Autori principali: | Queeney, James, Paschalidis, Ioannis Ch., Cassandras, Christos G. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees
di: Queeney, James, et al.
Pubblicazione: (2023)
di: Queeney, James, et al.
Pubblicazione: (2023)
Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
Adversarial Imitation Learning from Visual Observations using Latent Information
di: Giammarino, Vittorio, et al.
Pubblicazione: (2023)
di: Giammarino, Vittorio, et al.
Pubblicazione: (2023)
Multiple-policy Evaluation via Density Estimation
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
Distributionally Robust Token Optimization in RLHF
di: Jin, Yeping, et al.
Pubblicazione: (2026)
di: Jin, Yeping, et al.
Pubblicazione: (2026)
Visually Robust Adversarial Imitation Learning from Videos with Contrastive Learning
di: Giammarino, Vittorio, et al.
Pubblicazione: (2024)
di: Giammarino, Vittorio, et al.
Pubblicazione: (2024)
A Model-Based Approach for Improving Reinforcement Learning Efficiency Leveraging Expert Observations
di: Ozcan, Erhan Can, et al.
Pubblicazione: (2024)
di: Ozcan, Erhan Can, et al.
Pubblicazione: (2024)
Reinforcement Learning-based Receding Horizon Control using Adaptive Control Barrier Functions for Safety-Critical Systems
di: Sabouni, Ehsan, et al.
Pubblicazione: (2024)
di: Sabouni, Ehsan, et al.
Pubblicazione: (2024)
Theoretical Convergence of SMOTE-Generated Samples
di: Kamalov, Firuz, et al.
Pubblicazione: (2026)
di: Kamalov, Firuz, et al.
Pubblicazione: (2026)
GRAM: Generalization in Deep RL with a Robust Adaptation Module
di: Queeney, James, et al.
Pubblicazione: (2024)
di: Queeney, James, et al.
Pubblicazione: (2024)
Prism: Policy Reuse via Interpretable Strategy Mapping in Reinforcement Learning
di: Pravetz, Thomas
Pubblicazione: (2026)
di: Pravetz, Thomas
Pubblicazione: (2026)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
di: Miao, Yuchun, et al.
Pubblicazione: (2026)
di: Miao, Yuchun, et al.
Pubblicazione: (2026)
SOE: Sample-Efficient Robot Policy Self-Improvement via On-Manifold Exploration
di: Jin, Yang, et al.
Pubblicazione: (2025)
di: Jin, Yang, et al.
Pubblicazione: (2025)
Vision-Language Model Dialog Games for Self-Improvement
di: Konyushkova, Ksenia, et al.
Pubblicazione: (2025)
di: Konyushkova, Ksenia, et al.
Pubblicazione: (2025)
Method-Based Reasoning for Large Language Models: Extraction, Reuse, and Continuous Improvement
di: Su, Hong
Pubblicazione: (2025)
di: Su, Hong
Pubblicazione: (2025)
One-Shot Averaging for Distributed TD($λ$) Under Markov Sampling
di: Tian, Haoxing, et al.
Pubblicazione: (2024)
di: Tian, Haoxing, et al.
Pubblicazione: (2024)
Geometric Re-Analysis of Classical MDP Solving Algorithms
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
Provable and Practical In-Context Policy Optimization for Self-Improvement
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
Blending Imitation and Reinforcement Learning for Robust Policy Improvement
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
Deep SPI: Safe Policy Improvement via World Models
di: Delgrange, Florent, et al.
Pubblicazione: (2025)
di: Delgrange, Florent, et al.
Pubblicazione: (2025)
Active Policy Improvement from Multiple Black-box Oracles
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
Going Beyond Heuristics by Imposing Policy Improvement as a Constraint
di: Lee, Chi-Chang, et al.
Pubblicazione: (2025)
di: Lee, Chi-Chang, et al.
Pubblicazione: (2025)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
di: Liang, Haodong, et al.
Pubblicazione: (2026)
di: Liang, Haodong, et al.
Pubblicazione: (2026)
Simulus: Combining Improvements in Sample-Efficient World Model Agents
di: Cohen, Lior, et al.
Pubblicazione: (2025)
di: Cohen, Lior, et al.
Pubblicazione: (2025)
On the Generalization Capability of Temporal Graph Learning Algorithms: Theoretical Insights and a Simpler Method
di: Cong, Weilin, et al.
Pubblicazione: (2024)
di: Cong, Weilin, et al.
Pubblicazione: (2024)
Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing
di: Toral, Lukas, et al.
Pubblicazione: (2025)
di: Toral, Lukas, et al.
Pubblicazione: (2025)
Hierarchical Multi-Agent Reinforcement Learning with Control Barrier Functions for Safety-Critical Autonomous Systems
di: Ahmad, H. M. Sabbir, et al.
Pubblicazione: (2025)
di: Ahmad, H. M. Sabbir, et al.
Pubblicazione: (2025)
Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients
di: Thrampoulidis, Christos, et al.
Pubblicazione: (2025)
di: Thrampoulidis, Christos, et al.
Pubblicazione: (2025)
Skill Reuse as Compression in Agentic RL
di: Xu, Zhikun, et al.
Pubblicazione: (2026)
di: Xu, Zhikun, et al.
Pubblicazione: (2026)
Self-Improvement as Coherence Optimization: A Theoretical Account
di: Qiu, Tianyi, et al.
Pubblicazione: (2026)
di: Qiu, Tianyi, et al.
Pubblicazione: (2026)
Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective
di: Zhang, Jinouwen, et al.
Pubblicazione: (2024)
di: Zhang, Jinouwen, et al.
Pubblicazione: (2024)
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
di: Peysakhovich, Alexander, et al.
Pubblicazione: (2026)
di: Peysakhovich, Alexander, et al.
Pubblicazione: (2026)
Active Test-Time Adaptation: Theoretical Analyses and An Algorithm
di: Gui, Shurui, et al.
Pubblicazione: (2024)
di: Gui, Shurui, et al.
Pubblicazione: (2024)
Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap
di: Sun, Yifan, et al.
Pubblicazione: (2025)
di: Sun, Yifan, et al.
Pubblicazione: (2025)
Closing the gap between SVRG and TD-SVRG with Gradient Splitting
di: Mustafin, Arsenii, et al.
Pubblicazione: (2022)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2022)
On Value Iteration Convergence in Connected MDPs
di: Mustafin, Arsenii, et al.
Pubblicazione: (2024)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2024)
SIME: Enhancing Policy Self-Improvement with Modal-level Exploration
di: Jin, Yang, et al.
Pubblicazione: (2025)
di: Jin, Yang, et al.
Pubblicazione: (2025)
Policy Improvement using Language Feedback Models
di: Zhong, Victor, et al.
Pubblicazione: (2024)
di: Zhong, Victor, et al.
Pubblicazione: (2024)
Neural Predictive Control to Coordinate Discrete- and Continuous-Time Models for Time-Series Analysis with Control-Theoretical Improvements
di: Li, Haoran, et al.
Pubblicazione: (2025)
di: Li, Haoran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees
di: Queeney, James, et al.
Pubblicazione: (2023) -
Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees
di: Chen, Yilei, et al.
Pubblicazione: (2024) -
Adversarial Imitation Learning from Visual Observations using Latent Information
di: Giammarino, Vittorio, et al.
Pubblicazione: (2023) -
Multiple-policy Evaluation via Density Estimation
di: Chen, Yilei, et al.
Pubblicazione: (2024) -
Distributionally Robust Token Optimization in RLHF
di: Jin, Yeping, et al.
Pubblicazione: (2026)