Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Russo, Alessio, Pacchiano, Aldo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
In-Context Learning for Pure Exploration
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
In-Context Learning for Pure Exploration in Continuous Spaces
di: Russo, Alessio, et al.
Pubblicazione: (2026)
di: Russo, Alessio, et al.
Pubblicazione: (2026)
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024)
di: Pacchiano, Aldo
Pubblicazione: (2024)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
Pure Exploration with Feedback Graphs
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
A Theoretical Framework for Partially Observed Reward-States in RLHF
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2025)
di: Afshar, Aida, et al.
Pubblicazione: (2025)
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
di: Afshar, Aida, et al.
Pubblicazione: (2024)
di: Afshar, Aida, et al.
Pubblicazione: (2024)
Multiple-policy Evaluation via Density Estimation
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
Data-Driven Online Model Selection With Regret Guarantees
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
State-free Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
Experiment Planning with Function Approximation
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
Conformal Off-Policy Evaluation in Markov Decision Processes
di: Foffano, Daniele, et al.
Pubblicazione: (2023)
di: Foffano, Daniele, et al.
Pubblicazione: (2023)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
Provable Interactive Learning with Hindsight Instruction Feedback
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
Proximal Policy Optimization with Adaptive Exploration
di: Lixandru, Andrei
Pubblicazione: (2024)
di: Lixandru, Andrei
Pubblicazione: (2024)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
Explainable Reinforcement Learning via Temporal Policy Decomposition
di: Ruggeri, Franco, et al.
Pubblicazione: (2025)
di: Ruggeri, Franco, et al.
Pubblicazione: (2025)
More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration
di: Yuan, Xiaoyang, et al.
Pubblicazione: (2025)
di: Yuan, Xiaoyang, et al.
Pubblicazione: (2025)
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
Fair Best Arm Identification with Fixed Confidence
di: Russo, Alessio, et al.
Pubblicazione: (2024)
di: Russo, Alessio, et al.
Pubblicazione: (2024)
When Less is Enough: Efficient Inference via Collaborative Reasoning
di: Chen, Yilei, et al.
Pubblicazione: (2026)
di: Chen, Yilei, et al.
Pubblicazione: (2026)
AMPED: Adaptive Multi-objective Projection for balancing Exploration and skill Diversification
di: Cho, Geonwoo, et al.
Pubblicazione: (2025)
di: Cho, Geonwoo, et al.
Pubblicazione: (2025)
Exploration by Random Reward Perturbation
di: Ma, Haozhe, et al.
Pubblicazione: (2025)
di: Ma, Haozhe, et al.
Pubblicazione: (2025)
Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation
di: Patel, Bhrij, et al.
Pubblicazione: (2023)
di: Patel, Bhrij, et al.
Pubblicazione: (2023)
Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms
di: Hu, Xinyi, et al.
Pubblicazione: (2025)
di: Hu, Xinyi, et al.
Pubblicazione: (2025)
AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models
di: Liu, Qi, et al.
Pubblicazione: (2025)
di: Liu, Qi, et al.
Pubblicazione: (2025)
ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
di: Cao, Ruike, et al.
Pubblicazione: (2026)
di: Cao, Ruike, et al.
Pubblicazione: (2026)
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
di: Mou, Zhiyu, et al.
Pubblicazione: (2025)
di: Mou, Zhiyu, et al.
Pubblicazione: (2025)
Adversarial Diffusion for Robust Reinforcement Learning
di: Foffano, Daniele, et al.
Pubblicazione: (2025)
di: Foffano, Daniele, et al.
Pubblicazione: (2025)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
di: Cho, Minjae, et al.
Pubblicazione: (2026)
di: Cho, Minjae, et al.
Pubblicazione: (2026)
Deceptive Exploration in Multi-armed Bandits
di: Vurankaya, I. Arda, et al.
Pubblicazione: (2025)
di: Vurankaya, I. Arda, et al.
Pubblicazione: (2025)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
di: Jain, Arushi, et al.
Pubblicazione: (2024)
di: Jain, Arushi, et al.
Pubblicazione: (2024)
Abstract Reward Processes: Leveraging State Abstraction for Consistent Off-Policy Evaluation
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
Worst-Case Regret Bounds for Exploration via Randomized Value Functions
di: Russo, Daniel
Pubblicazione: (2019)
di: Russo, Daniel
Pubblicazione: (2019)
Provably Efficient Exploration in Reward Machines with Low Regret
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
Multi-Task Reward Learning from Human Ratings
di: Wu, Mingkang, et al.
Pubblicazione: (2025)
di: Wu, Mingkang, et al.
Pubblicazione: (2025)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
di: Wu, Feijie, et al.
Pubblicazione: (2025)
di: Wu, Feijie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
In-Context Learning for Pure Exploration
di: Russo, Alessio, et al.
Pubblicazione: (2025) -
In-Context Learning for Pure Exploration in Continuous Spaces
di: Russo, Alessio, et al.
Pubblicazione: (2026) -
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024) -
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024) -
Pure Exploration with Feedback Graphs
di: Russo, Alessio, et al.
Pubblicazione: (2025)