Optimal Policy Learning with Observational Data in Multi-Action Scenarios: Estimation, Risk Preference, and Potential Failures
Fuente:
arXiv
Guardado en:
| Autor principal: | Cerulli, Giovanni |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Optimal Policy Learning under Budget and Coverage Constraints
por: Cerulli, Giovanni
Publicado: (2026)
por: Cerulli, Giovanni
Publicado: (2026)
Optimal Policy Learning for Multi-Action Treatment with Risk Preference using Stata
por: Cerulli, Giovanni
Publicado: (2025)
por: Cerulli, Giovanni
Publicado: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2024)
por: Zhang, Han, et al.
Publicado: (2024)
PERSCEN: Learning Personalized Interaction Pattern and Scenario Preference for Multi-Scenario Matching
por: Du, Haotong, et al.
Publicado: (2025)
por: Du, Haotong, et al.
Publicado: (2025)
POWQMIX: Weighted Value Factorization with Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning
por: Huang, Chang, et al.
Publicado: (2024)
por: Huang, Chang, et al.
Publicado: (2024)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
por: Cho, Taehyun, et al.
Publicado: (2025)
por: Cho, Taehyun, et al.
Publicado: (2025)
Optimal Policy Minimum Bayesian Risk
por: Astudillo, Ramón Fernandez, et al.
Publicado: (2025)
por: Astudillo, Ramón Fernandez, et al.
Publicado: (2025)
Can We Detect Failures Without Failure Data? Uncertainty-Aware Runtime Failure Detection for Imitation Learning Policies
por: Xu, Chen, et al.
Publicado: (2025)
por: Xu, Chen, et al.
Publicado: (2025)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
por: Meng, Wenjia, et al.
Publicado: (2024)
por: Meng, Wenjia, et al.
Publicado: (2024)
Distributionally Robust Policy Evaluation and Learning for Continuous Treatment with Observational Data
por: Leung, Cheuk Hang, et al.
Publicado: (2025)
por: Leung, Cheuk Hang, et al.
Publicado: (2025)
Action-Free Offline-to-Online RL via Discretised State Policies
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
por: Ambadkar, Tanmay, et al.
Publicado: (2026)
por: Ambadkar, Tanmay, et al.
Publicado: (2026)
Ranking Policy Learning via Marketplace Expected Value Estimation From Observational Data
por: Ebrahimzadeh, Ehsan, et al.
Publicado: (2024)
por: Ebrahimzadeh, Ehsan, et al.
Publicado: (2024)
Pareto-Optimal Estimation and Policy Learning on Short-term and Long-term Treatment Effects
por: Wang, Yingrong, et al.
Publicado: (2024)
por: Wang, Yingrong, et al.
Publicado: (2024)
Preference Elicitation for Multi-objective Combinatorial Optimization with Active Learning and Maximum Likelihood Estimation
por: Defresne, Marianne, et al.
Publicado: (2025)
por: Defresne, Marianne, et al.
Publicado: (2025)
Pareto-Optimal Learning from Preferences with Hidden Context
por: Bahlous-Boldi, Ryan, et al.
Publicado: (2024)
por: Bahlous-Boldi, Ryan, et al.
Publicado: (2024)
Learning Action Embeddings for Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2023)
por: Cief, Matej, et al.
Publicado: (2023)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
por: Xu, Yinglun, et al.
Publicado: (2023)
por: Xu, Yinglun, et al.
Publicado: (2023)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
por: Kang, Hyungkyu, et al.
Publicado: (2025)
por: Kang, Hyungkyu, et al.
Publicado: (2025)
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning
por: Ma, Hao, et al.
Publicado: (2025)
por: Ma, Hao, et al.
Publicado: (2025)
Optimal Signal Decomposition-based Multi-Stage Learning for Battery Health Estimation
por: Pamshetti, Vijay Babu, et al.
Publicado: (2025)
por: Pamshetti, Vijay Babu, et al.
Publicado: (2025)
Action-Adaptive Continual Learning: Enabling Policy Generalization under Dynamic Action Spaces
por: Pan, Chaofan, et al.
Publicado: (2025)
por: Pan, Chaofan, et al.
Publicado: (2025)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
por: Xu, Wenzhe, et al.
Publicado: (2026)
por: Xu, Wenzhe, et al.
Publicado: (2026)
Multi-modal Heart Failure Risk Estimation based on Short ECG and Sampled Long-Term HRV
por: González, Sergio, et al.
Publicado: (2024)
por: González, Sergio, et al.
Publicado: (2024)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
por: Shianifar, Jonaid, et al.
Publicado: (2026)
por: Shianifar, Jonaid, et al.
Publicado: (2026)
Fine-tuning Behavioral Cloning Policies with Preference-Based Reinforcement Learning
por: Macuglia, Maël, et al.
Publicado: (2025)
por: Macuglia, Maël, et al.
Publicado: (2025)
Cost-Sensitive Unbiased Risk Estimation for Multi-Class Positive-Unlabeled Learning
por: Zhang, Miao, et al.
Publicado: (2025)
por: Zhang, Miao, et al.
Publicado: (2025)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
por: Choi, Heewoong, et al.
Publicado: (2024)
por: Choi, Heewoong, et al.
Publicado: (2024)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
por: Aouali, Imad, et al.
Publicado: (2024)
por: Aouali, Imad, et al.
Publicado: (2024)
Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning
por: Hazra, Somnath, et al.
Publicado: (2025)
por: Hazra, Somnath, et al.
Publicado: (2025)
Preference Optimization by Estimating the Ratio of the Data Distribution
por: Kim, Yeongmin, et al.
Publicado: (2025)
por: Kim, Yeongmin, et al.
Publicado: (2025)
APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport
por: Li, Zhuo, et al.
Publicado: (2025)
por: Li, Zhuo, et al.
Publicado: (2025)
Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge
por: Wang, Yuhang, et al.
Publicado: (2025)
por: Wang, Yuhang, et al.
Publicado: (2025)
Learning Optimal and Sample-Efficient Decision Policies with Guarantees
por: Shao, Daqian
Publicado: (2026)
por: Shao, Daqian
Publicado: (2026)
Adaptive Action Chunking via Multi-Chunk Q Value Estimation
por: Shin, Yongjae, et al.
Publicado: (2026)
por: Shin, Yongjae, et al.
Publicado: (2026)
Constrained Latent Action Policies for Model-Based Offline Reinforcement Learning
por: Alles, Marvin, et al.
Publicado: (2024)
por: Alles, Marvin, et al.
Publicado: (2024)
Evaluation-Time Policy Switching for Offline Reinforcement Learning
por: Neggatu, Natinael Solomon, et al.
Publicado: (2025)
por: Neggatu, Natinael Solomon, et al.
Publicado: (2025)
Mitigating Preference Hacking in Policy Optimization with Pessimism
por: Gupta, Dhawal, et al.
Publicado: (2025)
por: Gupta, Dhawal, et al.
Publicado: (2025)
Learning Partial Action Replacement in Offline MARL
por: Jin, Yue, et al.
Publicado: (2026)
por: Jin, Yue, et al.
Publicado: (2026)
Ejemplares similares
-
Optimal Policy Learning under Budget and Coverage Constraints
por: Cerulli, Giovanni
Publicado: (2026) -
Optimal Policy Learning for Multi-Action Treatment with Risk Preference using Stata
por: Cerulli, Giovanni
Publicado: (2025) -
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024) -
COPR: Continual Human Preference Learning via Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2024) -
PERSCEN: Learning Personalized Interaction Pattern and Scenario Preference for Multi-Scenario Matching
por: Du, Haotong, et al.
Publicado: (2025)