Automatic Reward Shaping from Confounded Offline Data
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Mingxuan, Zhang, Junzhe, Bareinboim, Elias |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Confounding Robust Continuous Control via Automatic Reward Shaping
by: Juliani, Mateo, et al.
Published: (2026)
by: Juliani, Mateo, et al.
Published: (2026)
Causal Flow Q-Learning for Robust Offline Reinforcement Learning
by: Li, Mingxuan, et al.
Published: (2026)
by: Li, Mingxuan, et al.
Published: (2026)
Causally Aligned Curriculum Learning
by: Li, Mingxuan, et al.
Published: (2025)
by: Li, Mingxuan, et al.
Published: (2025)
Confounding Robust Deep Reinforcement Learning: A Causal Approach
by: Li, Mingxuan, et al.
Published: (2025)
by: Li, Mingxuan, et al.
Published: (2025)
Partial Identification Approach to Counterfactual Fairness Assessment
by: Rho, Saeyoung, et al.
Published: (2025)
by: Rho, Saeyoung, et al.
Published: (2025)
Confounder Detection via Treatment Intent: A New Observational Study Design
by: Plecko, Drago, et al.
Published: (2026)
by: Plecko, Drago, et al.
Published: (2026)
Fairness-Accuracy Trade-Offs: A Causal Perspective
by: Plecko, Drago, et al.
Published: (2024)
by: Plecko, Drago, et al.
Published: (2024)
Mind the Gap: A Causal Perspective on Bias Amplification in Prediction & Decision-Making
by: Plecko, Drago, et al.
Published: (2024)
by: Plecko, Drago, et al.
Published: (2024)
Neural Causal Abstractions
by: Xia, Kevin, et al.
Published: (2024)
by: Xia, Kevin, et al.
Published: (2024)
Causal Identification from Counterfactual Data: Completeness and Bounding Results
by: Raghavan, Arvind, et al.
Published: (2026)
by: Raghavan, Arvind, et al.
Published: (2026)
Less Greedy Equivalence Search
by: Ejaz, Adiba, et al.
Published: (2025)
by: Ejaz, Adiba, et al.
Published: (2025)
From Black-box to Causal-box: Towards Building More Interpretable Models
by: Hwang, Inwoo, et al.
Published: (2025)
by: Hwang, Inwoo, et al.
Published: (2025)
Partial Transportability for Domain Generalization
by: Jalaldoust, Kasra, et al.
Published: (2025)
by: Jalaldoust, Kasra, et al.
Published: (2025)
Causal Algorithmic Recourse: Foundations and Methods
by: Plecko, Drago, et al.
Published: (2026)
by: Plecko, Drago, et al.
Published: (2026)
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
by: Wang, Danyang, et al.
Published: (2024)
by: Wang, Danyang, et al.
Published: (2024)
Automatic Reward Shaping from Multi-Objective Human Heuristics
by: Xie, Yuqing, et al.
Published: (2025)
by: Xie, Yuqing, et al.
Published: (2025)
Counterfactual Realizability
by: Raghavan, Arvind, et al.
Published: (2025)
by: Raghavan, Arvind, et al.
Published: (2025)
Testing Causal Models with Hidden Variables in Polynomial Delay via Conditional Independencies
by: Jeong, Hyunchai, et al.
Published: (2024)
by: Jeong, Hyunchai, et al.
Published: (2024)
Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge
by: Plecko, Drago, et al.
Published: (2025)
by: Plecko, Drago, et al.
Published: (2025)
Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
by: Kim, Jeonghye, et al.
Published: (2025)
by: Kim, Jeonghye, et al.
Published: (2025)
Offline Reinforcement Learning with Imputed Rewards
by: Romeo, Carlo, et al.
Published: (2024)
by: Romeo, Carlo, et al.
Published: (2024)
CROP: Conservative Reward for Model-based Offline Policy Optimization
by: Li, Hao, et al.
Published: (2023)
by: Li, Hao, et al.
Published: (2023)
GAS: Enhancing Reward-Cost Balance of Generative Model-assisted Offline Safe RL
by: Liu, Zifan, et al.
Published: (2026)
by: Liu, Zifan, et al.
Published: (2026)
Bootstrapped Reward Shaping
by: Adamczyk, Jacob, et al.
Published: (2025)
by: Adamczyk, Jacob, et al.
Published: (2025)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
by: Zhu, Jin, et al.
Published: (2023)
by: Zhu, Jin, et al.
Published: (2023)
Exploring and Addressing Reward Confusion in Offline Preference Learning
by: Chen, Xin, et al.
Published: (2024)
by: Chen, Xin, et al.
Published: (2024)
DataLight: Offline Data-Driven Traffic Signal Control
by: Zhang, Liang, et al.
Published: (2023)
by: Zhang, Liang, et al.
Published: (2023)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
by: Holmes, Ian, et al.
Published: (2025)
by: Holmes, Ian, et al.
Published: (2025)
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
by: Mou, Zhiyu, et al.
Published: (2025)
by: Mou, Zhiyu, et al.
Published: (2025)
A Unified Linear Programming Framework for Offline Reward Learning from Human Demonstrations and Feedback
by: Kim, Kihyun, et al.
Published: (2024)
by: Kim, Kihyun, et al.
Published: (2024)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
by: Choi, Heewoong, et al.
Published: (2024)
by: Choi, Heewoong, et al.
Published: (2024)
Automatically Finding Reward Model Biases
by: Wang, Atticus, et al.
Published: (2026)
by: Wang, Atticus, et al.
Published: (2026)
MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
by: Zhang, Yu, et al.
Published: (2025)
by: Zhang, Yu, et al.
Published: (2025)
RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning
by: Liu, Zehua, et al.
Published: (2026)
by: Liu, Zehua, et al.
Published: (2026)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
by: Sun, Shengjie, et al.
Published: (2025)
by: Sun, Shengjie, et al.
Published: (2025)
Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards
by: Yousuf, Muhammad Hamza, et al.
Published: (2025)
by: Yousuf, Muhammad Hamza, et al.
Published: (2025)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
by: Lee, Younghwan, et al.
Published: (2025)
by: Lee, Younghwan, et al.
Published: (2025)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
by: Lim, Yooseok, et al.
Published: (2024)
by: Lim, Yooseok, et al.
Published: (2024)
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
by: Lidayan, Aly, et al.
Published: (2024)
by: Lidayan, Aly, et al.
Published: (2024)
Combining Automated Optimisation of Hyperparameters and Reward Shape
by: Dierkes, Julian, et al.
Published: (2024)
by: Dierkes, Julian, et al.
Published: (2024)
Similar Items
-
Confounding Robust Continuous Control via Automatic Reward Shaping
by: Juliani, Mateo, et al.
Published: (2026) -
Causal Flow Q-Learning for Robust Offline Reinforcement Learning
by: Li, Mingxuan, et al.
Published: (2026) -
Causally Aligned Curriculum Learning
by: Li, Mingxuan, et al.
Published: (2025) -
Confounding Robust Deep Reinforcement Learning: A Causal Approach
by: Li, Mingxuan, et al.
Published: (2025) -
Partial Identification Approach to Counterfactual Fairness Assessment
by: Rho, Saeyoung, et al.
Published: (2025)