Salvato in:
| Autori principali: | Geng, Sinong, Pacchiano, Aldo, Kolobov, Andrey, Cheng, Ching-An |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2306.00321 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2025)
di: Afshar, Aida, et al.
Pubblicazione: (2025)
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024)
di: Pacchiano, Aldo
Pubblicazione: (2024)
Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms
di: Hu, Xinyi, et al.
Pubblicazione: (2025)
di: Hu, Xinyi, et al.
Pubblicazione: (2025)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
di: Afshar, Aida, et al.
Pubblicazione: (2024)
di: Afshar, Aida, et al.
Pubblicazione: (2024)
In-Context Learning for Pure Exploration in Continuous Spaces
di: Russo, Alessio, et al.
Pubblicazione: (2026)
di: Russo, Alessio, et al.
Pubblicazione: (2026)
Bayesian Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2026)
di: Afshar, Aida, et al.
Pubblicazione: (2026)
Pure Exploration with Feedback Graphs
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
Contextual Bandits with Stage-wise Constraints
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
Data-Driven Online Model Selection With Regret Guarantees
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
State-free Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
In-Context Learning for Pure Exploration
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
PRISE: LLM-Style Sequence Compression for Learning Temporal Action Abstractions in Control
di: Zheng, Ruijie, et al.
Pubblicazione: (2024)
di: Zheng, Ruijie, et al.
Pubblicazione: (2024)
Multiple-policy Evaluation via Density Estimation
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
Experiment Planning with Function Approximation
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
On the Hardness of Bandit Learning
di: Brukhim, Nataly, et al.
Pubblicazione: (2025)
di: Brukhim, Nataly, et al.
Pubblicazione: (2025)
Language Model Personalization via Reward Factorization
di: Shenfeld, Idan, et al.
Pubblicazione: (2025)
di: Shenfeld, Idan, et al.
Pubblicazione: (2025)
Provable Interactive Learning with Hindsight Instruction Feedback
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
A Theoretical Framework for Partially Observed Reward-States in RLHF
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
Streetwise Agents: Empowering Offline RL Policies to Outsmart Exogenous Stochastic Disturbances in RTC
di: Soni, Aditya, et al.
Pubblicazione: (2024)
di: Soni, Aditya, et al.
Pubblicazione: (2024)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
di: Luo, Yu, et al.
Pubblicazione: (2024)
di: Luo, Yu, et al.
Pubblicazione: (2024)
When Less is Enough: Efficient Inference via Collaborative Reasoning
di: Chen, Yilei, et al.
Pubblicazione: (2026)
di: Chen, Yilei, et al.
Pubblicazione: (2026)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
Budgeting Counterfactual for Offline RL
di: Liu, Yao, et al.
Pubblicazione: (2023)
di: Liu, Yao, et al.
Pubblicazione: (2023)
Improving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy Initialization
di: Landers, Matthew, et al.
Pubblicazione: (2026)
di: Landers, Matthew, et al.
Pubblicazione: (2026)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2025)
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2025)
Latent Policy Steering through One-Step Flow Policies
di: Im, Hokyun, et al.
Pubblicazione: (2026)
di: Im, Hokyun, et al.
Pubblicazione: (2026)
Selective Uncertainty Propagation in Offline RL
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
Decoupled Prioritized Resampling for Offline RL
di: Yue, Yang, et al.
Pubblicazione: (2023)
di: Yue, Yang, et al.
Pubblicazione: (2023)
Augmenting Offline RL with Unlabeled Data
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
When Are RL Hyperparameters Benign? A Study in Offline Goal-Conditioned RL
di: Töpperwien, Jan Malte, et al.
Pubblicazione: (2026)
di: Töpperwien, Jan Malte, et al.
Pubblicazione: (2026)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
di: Wang, Qi, et al.
Pubblicazione: (2023)
di: Wang, Qi, et al.
Pubblicazione: (2023)
How to Solve Contextual Goal-Oriented Problems with Offline Datasets?
di: Fan, Ying, et al.
Pubblicazione: (2024)
di: Fan, Ying, et al.
Pubblicazione: (2024)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
di: Su, Jianhai, et al.
Pubblicazione: (2025)
di: Su, Jianhai, et al.
Pubblicazione: (2025)
Algorithmic Guarantees for Distilling Supervised and Offline RL Datasets
di: Gupta, Aaryan, et al.
Pubblicazione: (2025)
di: Gupta, Aaryan, et al.
Pubblicazione: (2025)
Offline RL via Feature-Occupancy Gradient Ascent
di: Neu, Gergely, et al.
Pubblicazione: (2024)
di: Neu, Gergely, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2025) -
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024) -
Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms
di: Hu, Xinyi, et al.
Pubblicazione: (2025) -
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
di: Russo, Alessio, et al.
Pubblicazione: (2025) -
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
di: Afshar, Aida, et al.
Pubblicazione: (2024)