Short-Long Policy Evaluation with Novel Actions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nam, Hyunji Alex, Chandak, Yash, Brunskill, Emma |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Predicting Long Term Sequential Policy Value Using Softer Surrogates
par: Nam, Hyunji, et autres
Publié: (2024)
par: Nam, Hyunji, et autres
Publié: (2024)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
par: Chandak, Kushagra, et autres
Publié: (2025)
par: Chandak, Kushagra, et autres
Publié: (2025)
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
par: Hatgis-Kessell, Stephane, et autres
Publié: (2026)
par: Hatgis-Kessell, Stephane, et autres
Publié: (2026)
OPERA: Automatic Offline Policy Evaluation with Re-weighted Aggregates of Multiple Estimators
par: Nie, Allen, et autres
Publié: (2024)
par: Nie, Allen, et autres
Publié: (2024)
PERRY: Policy Evaluation with Confidence Intervals using Auxiliary Data
par: Mandyam, Aishwarya, et autres
Publié: (2025)
par: Mandyam, Aishwarya, et autres
Publié: (2025)
Active Learning for Stochastic Contextual Linear Bandits
par: Brunskill, Emma, et autres
Publié: (2026)
par: Brunskill, Emma, et autres
Publié: (2026)
Predicting Long-Term Student Outcomes from Short-Term EdTech Log Data
par: Gao, Ge, et autres
Publié: (2024)
par: Gao, Ge, et autres
Publié: (2024)
Experiment Planning with Function Approximation
par: Pacchiano, Aldo, et autres
Publié: (2024)
par: Pacchiano, Aldo, et autres
Publié: (2024)
Learning to be Fair: A Consequentialist Approach to Equitable Decision-Making
par: Chohlas-Wood, Alex, et autres
Publié: (2021)
par: Chohlas-Wood, Alex, et autres
Publié: (2021)
A/B testing under Interference with Partial Network Information
par: Shankar, Shiv, et autres
Publié: (2024)
par: Shankar, Shiv, et autres
Publié: (2024)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data
par: Nam, Hyunji, et autres
Publié: (2026)
par: Nam, Hyunji, et autres
Publié: (2026)
Trading off rewards and errors in multi-armed bandits
par: Erraqabi, Akram, et autres
Publié: (2026)
par: Erraqabi, Akram, et autres
Publié: (2026)
$O(1/k)$ Finite-Time Bound for Non-Linear Two-Time-Scale Stochastic Approximation
par: Chandak, Siddharth
Publié: (2025)
par: Chandak, Siddharth
Publié: (2025)
Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients
par: Alvo, Matias, et autres
Publié: (2026)
par: Alvo, Matias, et autres
Publié: (2026)
Policy Learning for Balancing Short-Term and Long-Term Rewards
par: Wu, Peng, et autres
Publié: (2024)
par: Wu, Peng, et autres
Publié: (2024)
Q-Policy: Quantum-Enhanced Policy Evaluation for Scalable Reinforcement Learning
par: Cherukuri, Kalyan, et autres
Publié: (2025)
par: Cherukuri, Kalyan, et autres
Publié: (2025)
Adaptive Interventions with User-Defined Goals for Health Behavior Change
par: Mandyam, Aishwarya, et autres
Publié: (2023)
par: Mandyam, Aishwarya, et autres
Publié: (2023)
Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion
par: Flet-Berliac, Yannis, et autres
Publié: (2024)
par: Flet-Berliac, Yannis, et autres
Publié: (2024)
A Concentration Bound for TD(0) with Function Approximation
par: Chandak, Siddharth, et autres
Publié: (2023)
par: Chandak, Siddharth, et autres
Publié: (2023)
Heavy-Tailed and Long-Range Dependent Noise in Stochastic Approximation: A Finite-Time Analysis
par: Chandak, Siddharth, et autres
Publié: (2026)
par: Chandak, Siddharth, et autres
Publié: (2026)
Long-term Off-Policy Evaluation and Learning
par: Saito, Yuta, et autres
Publié: (2024)
par: Saito, Yuta, et autres
Publié: (2024)
Learning Action Embeddings for Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2023)
par: Cief, Matej, et autres
Publié: (2023)
Policy Gradient Methods for Non-Markovian Reinforcement Learning
par: Kar, Avik, et autres
Publié: (2026)
par: Kar, Avik, et autres
Publié: (2026)
Learning to summarize user information for personalized reinforcement learning from human feedback
par: Nam, Hyunji, et autres
Publié: (2025)
par: Nam, Hyunji, et autres
Publié: (2025)
Pareto-Optimal Estimation and Policy Learning on Short-term and Long-term Treatment Effects
par: Wang, Yingrong, et autres
Publié: (2024)
par: Wang, Yingrong, et autres
Publié: (2024)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
par: Aouali, Imad, et autres
Publié: (2024)
par: Aouali, Imad, et autres
Publié: (2024)
Efficient RL for optimizing conversation level outcomes with an LLM-based tutor
par: Nam, Hyunji, et autres
Publié: (2025)
par: Nam, Hyunji, et autres
Publié: (2025)
On the Identifiability of Latent Action Policies
par: Lachapelle, Sébastien
Publié: (2025)
par: Lachapelle, Sébastien
Publié: (2025)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
par: Chandak, Nikhil, et autres
Publié: (2025)
par: Chandak, Nikhil, et autres
Publié: (2025)
Data-driven Error Estimation: Excess Risk Bounds without Class Complexity as Input
par: Krishnamurthy, Sanath Kumar, et autres
Publié: (2024)
par: Krishnamurthy, Sanath Kumar, et autres
Publié: (2024)
Evaluating Model-Free Policy Optimization in Masked-Action Environments via an Exact Blackjack Oracle
par: Song, Kevin
Publié: (2026)
par: Song, Kevin
Publié: (2026)
Convergence and Implicit Bias of Gradient Descent on Continual Linear Classification
par: Jung, Hyunji, et autres
Publié: (2025)
par: Jung, Hyunji, et autres
Publié: (2025)
Learning to Control Unknown Strongly Monotone Games
par: Chandak, Siddharth, et autres
Publié: (2024)
par: Chandak, Siddharth, et autres
Publié: (2024)
Proportional Aggregation of Preferences for Sequential Decision Making
par: Chandak, Nikhil, et autres
Publié: (2023)
par: Chandak, Nikhil, et autres
Publié: (2023)
Efficient Evaluation of LLM Performance with Statistical Guarantees
par: Wu, Skyler, et autres
Publié: (2026)
par: Wu, Skyler, et autres
Publié: (2026)
A Novel GAN Approach to Augment Limited Tabular Data for Short-Term Substance Use Prediction
par: Thach, Nguyen, et autres
Publié: (2024)
par: Thach, Nguyen, et autres
Publié: (2024)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
par: Zhou, Zhongzhu, et autres
Publié: (2025)
par: Zhou, Zhongzhu, et autres
Publié: (2025)
Regret and Sample Complexity of Online Q-Learning via Concentration of Stochastic Approximation with Time-Inhomogeneous Markov Chains
par: Singh, Rahul, et autres
Publié: (2026)
par: Singh, Rahul, et autres
Publié: (2026)
Policies and Evaluation for Online Meeting Summarization
par: Schneider, Felix, et autres
Publié: (2025)
par: Schneider, Felix, et autres
Publié: (2025)
Documents similaires
-
Predicting Long Term Sequential Policy Value Using Softer Surrogates
par: Nam, Hyunji, et autres
Publié: (2024) -
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
par: Chandak, Kushagra, et autres
Publié: (2025) -
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
par: Hatgis-Kessell, Stephane, et autres
Publié: (2026) -
OPERA: Automatic Offline Policy Evaluation with Re-weighted Aggregates of Multiple Estimators
par: Nie, Allen, et autres
Publié: (2024) -
PERRY: Policy Evaluation with Confidence Intervals using Auxiliary Data
par: Mandyam, Aishwarya, et autres
Publié: (2025)