Multiple-policy Evaluation via Density Estimation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yilei, Pacchiano, Aldo, Paschalidis, Ioannis Ch. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Less is Enough: Efficient Inference via Collaborative Reasoning
par: Chen, Yilei, et autres
Publié: (2026)
par: Chen, Yilei, et autres
Publié: (2026)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
par: Lin, Xiaofeng, et autres
Publié: (2026)
par: Lin, Xiaofeng, et autres
Publié: (2026)
Second Order Bounds for Contextual Bandits with Function Approximation
par: Pacchiano, Aldo
Publié: (2024)
par: Pacchiano, Aldo
Publié: (2024)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
par: Afshar, Aida, et autres
Publié: (2025)
par: Afshar, Aida, et autres
Publié: (2025)
Distributionally Robust Token Optimization in RLHF
par: Jin, Yeping, et autres
Publié: (2026)
par: Jin, Yeping, et autres
Publié: (2026)
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
par: Afshar, Aida, et autres
Publié: (2024)
par: Afshar, Aida, et autres
Publié: (2024)
Generalized Policy Improvement Algorithms with Theoretically Supported Sample Reuse
par: Queeney, James, et autres
Publié: (2022)
par: Queeney, James, et autres
Publié: (2022)
State-free Reinforcement Learning
par: Chen, Mingyu, et autres
Publié: (2024)
par: Chen, Mingyu, et autres
Publié: (2024)
Post-training Large Language Models for Diverse High-Quality Responses
par: Chen, Yilei, et autres
Publié: (2025)
par: Chen, Yilei, et autres
Publié: (2025)
Data-Driven Online Model Selection With Regret Guarantees
par: Pacchiano, Aldo, et autres
Publié: (2023)
par: Pacchiano, Aldo, et autres
Publié: (2023)
In-Context Learning for Pure Exploration
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees
par: Queeney, James, et autres
Publié: (2023)
par: Queeney, James, et autres
Publié: (2023)
Experiment Planning with Function Approximation
par: Pacchiano, Aldo, et autres
Publié: (2024)
par: Pacchiano, Aldo, et autres
Publié: (2024)
A Theoretical Framework for Partially Observed Reward-States in RLHF
par: Kausik, Chinmaya, et autres
Publié: (2024)
par: Kausik, Chinmaya, et autres
Publié: (2024)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
In-Context Learning for Pure Exploration in Continuous Spaces
par: Russo, Alessio, et autres
Publié: (2026)
par: Russo, Alessio, et autres
Publié: (2026)
Provable Interactive Learning with Hindsight Instruction Feedback
par: Misra, Dipendra, et autres
Publié: (2024)
par: Misra, Dipendra, et autres
Publié: (2024)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
par: Baharav, Tavor Z., et autres
Publié: (2025)
par: Baharav, Tavor Z., et autres
Publié: (2025)
Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees
par: Chen, Yilei, et autres
Publié: (2024)
par: Chen, Yilei, et autres
Publié: (2024)
Active Preference Optimization for Sample Efficient RLHF
par: Das, Nirjhar, et autres
Publié: (2024)
par: Das, Nirjhar, et autres
Publié: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
par: Misra, Dipendra, et autres
Publié: (2026)
par: Misra, Dipendra, et autres
Publié: (2026)
Towards Stable Machine Learning Model Retraining via Slowly Varying Sequences
par: Bertsimas, Dimitris, et autres
Publié: (2024)
par: Bertsimas, Dimitris, et autres
Publié: (2024)
OPERA: Automatic Offline Policy Evaluation with Re-weighted Aggregates of Multiple Estimators
par: Nie, Allen, et autres
Publié: (2024)
par: Nie, Allen, et autres
Publié: (2024)
Learning from Sparse Offline Datasets via Conservative Density Estimation
par: Cen, Zhepeng, et autres
Publié: (2024)
par: Cen, Zhepeng, et autres
Publié: (2024)
On Value Iteration Convergence in Connected MDPs
par: Mustafin, Arsenii, et autres
Publié: (2024)
par: Mustafin, Arsenii, et autres
Publié: (2024)
Closing the gap between SVRG and TD-SVRG with Gradient Splitting
par: Mustafin, Arsenii, et autres
Publié: (2022)
par: Mustafin, Arsenii, et autres
Publié: (2022)
Distributionally Robust Learning in Survival Analysis
par: Jin, Yeping, et autres
Publié: (2025)
par: Jin, Yeping, et autres
Publié: (2025)
Adversarial Imitation Learning from Visual Observations using Latent Information
par: Giammarino, Vittorio, et autres
Publié: (2023)
par: Giammarino, Vittorio, et autres
Publié: (2023)
Bridging the Gap Between Average and Discounted TD Learning
par: Tian, Haoxing, et autres
Publié: (2026)
par: Tian, Haoxing, et autres
Publié: (2026)
Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms
par: Hu, Xinyi, et autres
Publié: (2025)
par: Hu, Xinyi, et autres
Publié: (2025)
ConjNorm: Tractable Density Estimation for Out-of-Distribution Detection
par: Peng, Bo, et autres
Publié: (2024)
par: Peng, Bo, et autres
Publié: (2024)
Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation
par: Bi, Zhen, et autres
Publié: (2025)
par: Bi, Zhen, et autres
Publié: (2025)
FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
Multitask Learning for Earth Observation Data Classification with Hybrid Quantum Network
par: Fan, Fan, et autres
Publié: (2026)
par: Fan, Fan, et autres
Publié: (2026)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
par: Hu, Zhengyu, et autres
Publié: (2024)
par: Hu, Zhengyu, et autres
Publié: (2024)
A Minimum Variance Path Principle for Accurate and Stable Score-Based Density Ratio Estimation
par: Chen, Wei, et autres
Publié: (2026)
par: Chen, Wei, et autres
Publié: (2026)
A Mathematical Theory of Top-$k$ Sparse Attention via Total Variation Distance
par: Tzachristas, Georgios, et autres
Publié: (2025)
par: Tzachristas, Georgios, et autres
Publié: (2025)
Enhanced Generative Model Evaluation with Clipped Density and Coverage
par: Salvy, Nicolas, et autres
Publié: (2025)
par: Salvy, Nicolas, et autres
Publié: (2025)
Empirical Analysis of Model Selection for Heterogeneous Causal Effect Estimation
par: Mahajan, Divyat, et autres
Publié: (2022)
par: Mahajan, Divyat, et autres
Publié: (2022)
Documents similaires
-
When Less is Enough: Efficient Inference via Collaborative Reasoning
par: Chen, Yilei, et autres
Publié: (2026) -
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
par: Lin, Xiaofeng, et autres
Publié: (2026) -
Second Order Bounds for Contextual Bandits with Function Approximation
par: Pacchiano, Aldo
Publié: (2024) -
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
par: Russo, Alessio, et autres
Publié: (2025) -
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
par: Afshar, Aida, et autres
Publié: (2025)