Experiment Planning with Function Approximation
Fuente:
arXiv
Salvato in:
| Autori principali: | Pacchiano, Aldo, Lee, Jonathan N., Brunskill, Emma |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024)
di: Pacchiano, Aldo
Pubblicazione: (2024)
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
di: Afshar, Aida, et al.
Pubblicazione: (2024)
di: Afshar, Aida, et al.
Pubblicazione: (2024)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2025)
di: Afshar, Aida, et al.
Pubblicazione: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
State-free Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
Data-Driven Online Model Selection With Regret Guarantees
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
In-Context Learning for Pure Exploration
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2026)
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2026)
In-Context Learning for Pure Exploration in Continuous Spaces
di: Russo, Alessio, et al.
Pubblicazione: (2026)
di: Russo, Alessio, et al.
Pubblicazione: (2026)
Multiple-policy Evaluation via Density Estimation
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
A Theoretical Framework for Partially Observed Reward-States in RLHF
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
Provable Interactive Learning with Hindsight Instruction Feedback
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
Predicting Long Term Sequential Policy Value Using Softer Surrogates
di: Nam, Hyunji, et al.
Pubblicazione: (2024)
di: Nam, Hyunji, et al.
Pubblicazione: (2024)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
Adaptive Interventions with User-Defined Goals for Health Behavior Change
di: Mandyam, Aishwarya, et al.
Pubblicazione: (2023)
di: Mandyam, Aishwarya, et al.
Pubblicazione: (2023)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
When Less is Enough: Efficient Inference via Collaborative Reasoning
di: Chen, Yilei, et al.
Pubblicazione: (2026)
di: Chen, Yilei, et al.
Pubblicazione: (2026)
Local Manifold Approximation and Projection for Manifold-Aware Diffusion Planning
di: Lee, Kyowoon, et al.
Pubblicazione: (2025)
di: Lee, Kyowoon, et al.
Pubblicazione: (2025)
Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
di: Lim, Han-Dong, et al.
Pubblicazione: (2025)
di: Lim, Han-Dong, et al.
Pubblicazione: (2025)
Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation
di: Cho, Taehyun, et al.
Pubblicazione: (2024)
di: Cho, Taehyun, et al.
Pubblicazione: (2024)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
Misspecified $Q$-Learning with Sparse Linear Function Approximation: Tight Bounds on Approximation Error
di: Du, Ally Yalei, et al.
Pubblicazione: (2024)
di: Du, Ally Yalei, et al.
Pubblicazione: (2024)
Enhancing Neural Function Approximation: The XNet Outperforming KAN
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms
di: Hu, Xinyi, et al.
Pubblicazione: (2025)
di: Hu, Xinyi, et al.
Pubblicazione: (2025)
On Evaluating LLMs' Capabilities as Functional Approximators: A Bayesian Perspective
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2024)
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2024)
Uncertainty-Aware Reward-Free Exploration with General Function Approximation
di: Zhang, Junkai, et al.
Pubblicazione: (2024)
di: Zhang, Junkai, et al.
Pubblicazione: (2024)
Tensor Low-rank Approximation of Finite-horizon Value Functions
di: Rozada, Sergio, et al.
Pubblicazione: (2024)
di: Rozada, Sergio, et al.
Pubblicazione: (2024)
Heavy-Ball Momentum Accelerated Actor-Critic With Function Approximation
di: Dong, Yanjie, et al.
Pubblicazione: (2024)
di: Dong, Yanjie, et al.
Pubblicazione: (2024)
Towards Differentially Private Reinforcement Learning with General Function Approximation
di: He, Yi, et al.
Pubblicazione: (2026)
di: He, Yi, et al.
Pubblicazione: (2026)
Subspace-based Approximate Hessian Method for Zeroth-Order Optimization
di: Kim, Dongyoon, et al.
Pubblicazione: (2025)
di: Kim, Dongyoon, et al.
Pubblicazione: (2025)
Tensor and Matrix Low-Rank Value-Function Approximation in Reinforcement Learning
di: Rozada, Sergio, et al.
Pubblicazione: (2022)
di: Rozada, Sergio, et al.
Pubblicazione: (2022)
On the Statistical Efficiency of Mean-Field Reinforcement Learning with General Function Approximation
di: Huang, Jiawei, et al.
Pubblicazione: (2023)
di: Huang, Jiawei, et al.
Pubblicazione: (2023)
SASSHA: Sharpness-aware Adaptive Second-order Optimization with Stable Hessian Approximation
di: Shin, Dahun, et al.
Pubblicazione: (2025)
di: Shin, Dahun, et al.
Pubblicazione: (2025)
FSP-Laplace: Function-Space Priors for the Laplace Approximation in Bayesian Deep Learning
di: Cinquin, Tristan, et al.
Pubblicazione: (2024)
di: Cinquin, Tristan, et al.
Pubblicazione: (2024)
The Approximate Fisher Influence Function: Faster Estimation of Data Influence in Statistical Models
di: Lev, Omri, et al.
Pubblicazione: (2024)
di: Lev, Omri, et al.
Pubblicazione: (2024)
Target Networks and Over-parameterization Stabilize Off-policy Bootstrapping with Function Approximation
di: Che, Fengdi, et al.
Pubblicazione: (2024)
di: Che, Fengdi, et al.
Pubblicazione: (2024)
The Role of Inherent Bellman Error in Offline Reinforcement Learning with Linear Function Approximation
di: Golowich, Noah, et al.
Pubblicazione: (2024)
di: Golowich, Noah, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024) -
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
di: Afshar, Aida, et al.
Pubblicazione: (2024) -
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
di: Russo, Alessio, et al.
Pubblicazione: (2025) -
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2025) -
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)