UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hoang, Huy, Mai, Tien, Varakantham, Pradeep |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
par: Hoang, Huy, et autres
Publié: (2025)
par: Hoang, Huy, et autres
Publié: (2025)
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
par: Hoang, Huy, et autres
Publié: (2024)
par: Hoang, Huy, et autres
Publié: (2024)
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
par: Hoang, Huy, et autres
Publié: (2023)
par: Hoang, Huy, et autres
Publié: (2023)
Offline Safe Reinforcement Learning Using Trajectory Classification
par: Gong, Ze, et autres
Publié: (2024)
par: Gong, Ze, et autres
Publié: (2024)
Solving Richly Constrained Reinforcement Learning through State Augmentation and Reward Penalties
par: Jiang, Hao, et autres
Publié: (2023)
par: Jiang, Hao, et autres
Publié: (2023)
Enhancing the Hierarchical Environment Design via Generative Trajectory Modeling
par: Li, Dexun, et autres
Publié: (2023)
par: Li, Dexun, et autres
Publié: (2023)
On Minimizing Adversarial Counterfactual Error in Adversarial RL
par: Belaire, Roman, et autres
Publié: (2024)
par: Belaire, Roman, et autres
Publié: (2024)
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
par: Lu, Yuxiao, et autres
Publié: (2023)
par: Lu, Yuxiao, et autres
Publié: (2023)
Automatic LLM Red Teaming
par: Belaire, Roman, et autres
Publié: (2025)
par: Belaire, Roman, et autres
Publié: (2025)
Imitating Cost-Constrained Behaviors in Reinforcement Learning
par: Shao, Qian, et autres
Publié: (2024)
par: Shao, Qian, et autres
Publié: (2024)
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
par: Ge, Zichang, et autres
Publié: (2025)
par: Ge, Zichang, et autres
Publié: (2025)
Regret-Based Defense in Adversarial Reinforcement Learning
par: Belaire, Roman, et autres
Publié: (2023)
par: Belaire, Roman, et autres
Publié: (2023)
Exclusively Penalized Q-learning for Offline Reinforcement Learning
par: Yeom, Junghyuk, et autres
Publié: (2024)
par: Yeom, Junghyuk, et autres
Publié: (2024)
Yes, Q-learning Helps Offline In-Context RL
par: Tarasov, Denis, et autres
Publié: (2025)
par: Tarasov, Denis, et autres
Publié: (2025)
MisoDICE: Multi-Agent Imitation from Unlabeled Mixed-Quality Demonstrations
par: Bui, The Viet, et autres
Publié: (2025)
par: Bui, The Viet, et autres
Publié: (2025)
Multi-Agent Inverse Q-Learning from Demonstrations
par: Haynam, Nathaniel, et autres
Publié: (2025)
par: Haynam, Nathaniel, et autres
Publié: (2025)
When Demonstrations Meet Generative World Models: A Maximum Likelihood Framework for Offline Inverse Reinforcement Learning
par: Zeng, Siliang, et autres
Publié: (2023)
par: Zeng, Siliang, et autres
Publié: (2023)
Offline Safe Policy Optimization From Heterogeneous Feedback
par: Gong, Ze, et autres
Publié: (2025)
par: Gong, Ze, et autres
Publié: (2025)
IRL for Restless Multi-Armed Bandits with Applications in Maternal and Child Health
par: Jain, Gauri, et autres
Publié: (2024)
par: Jain, Gauri, et autres
Publié: (2024)
How to Leverage Diverse Demonstrations in Offline Imitation Learning
par: Yue, Sheng, et autres
Publié: (2024)
par: Yue, Sheng, et autres
Publié: (2024)
OffSim: Offline Simulator for Model-based Offline Inverse Reinforcement Learning
par: Ahn, Woo-Jin, et autres
Publié: (2025)
par: Ahn, Woo-Jin, et autres
Publié: (2025)
Inverse Reinforcement Learning by Estimating Expertise of Demonstrators
par: Beliaev, Mark, et autres
Publié: (2024)
par: Beliaev, Mark, et autres
Publié: (2024)
Expert Q-learning: Deep Reinforcement Learning with Coarse State Values from Offline Expert Examples
par: Meng, Li, et autres
Publié: (2021)
par: Meng, Li, et autres
Publié: (2021)
TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning
par: Sestini, Alessandro, et autres
Publié: (2025)
par: Sestini, Alessandro, et autres
Publié: (2025)
Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting
par: Nam, Yunhun, et autres
Publié: (2025)
par: Nam, Yunhun, et autres
Publié: (2025)
In-Context Compositional Q-Learning for Offline Reinforcement Learning
par: Xu, Qiushui, et autres
Publié: (2025)
par: Xu, Qiushui, et autres
Publié: (2025)
Imagination-Limited Q-Learning for Offline Reinforcement Learning
par: Liu, Wenhui, et autres
Publié: (2025)
par: Liu, Wenhui, et autres
Publié: (2025)
Mildly Conservative Q-Learning for Offline Reinforcement Learning
par: Lyu, Jiafei, et autres
Publié: (2022)
par: Lyu, Jiafei, et autres
Publié: (2022)
Learning Surrogates for Offline Black-Box Optimization via Gradient Matching
par: Hoang, Minh, et autres
Publié: (2025)
par: Hoang, Minh, et autres
Publié: (2025)
Identifying Latent Actions and Dynamics from Offline Data via Demonstrator Diversity
par: Schur, Felix
Publié: (2026)
par: Schur, Felix
Publié: (2026)
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
par: Sun, Hao, et autres
Publié: (2024)
par: Sun, Hao, et autres
Publié: (2024)
Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
par: Mao, Yixiu, et autres
Publié: (2025)
par: Mao, Yixiu, et autres
Publié: (2025)
Who's the Evil Twin? Differential Auditing for Undesired Behavior
par: Balappanawar, Ishwar, et autres
Publié: (2025)
par: Balappanawar, Ishwar, et autres
Publié: (2025)
Offline-to-online Reinforcement Learning for Image-based Grasping with Scarce Demonstrations
par: Chan, Bryan, et autres
Publié: (2024)
par: Chan, Bryan, et autres
Publié: (2024)
Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training
par: Xiao, Frank, et autres
Publié: (2026)
par: Xiao, Frank, et autres
Publié: (2026)
Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning
par: Park, Kwanyoung, et autres
Publié: (2024)
par: Park, Kwanyoung, et autres
Publié: (2024)
Residual Q-Learning: Offline and Online Policy Customization without Value
par: Li, Chenran, et autres
Publié: (2023)
par: Li, Chenran, et autres
Publié: (2023)
On the Complexity of Offline Reinforcement Learning with $Q^\star$-Approximation and Partial Coverage
par: Liu, Haolin, et autres
Publié: (2026)
par: Liu, Haolin, et autres
Publié: (2026)
FORLER: Federated Offline Reinforcement Learning with Q-Ensemble and Actor Rectification
par: Qiao, Nan, et autres
Publié: (2026)
par: Qiao, Nan, et autres
Publié: (2026)
A Unified Linear Programming Framework for Offline Reward Learning from Human Demonstrations and Feedback
par: Kim, Kihyun, et autres
Publié: (2024)
par: Kim, Kihyun, et autres
Publié: (2024)
Documents similaires
-
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
par: Hoang, Huy, et autres
Publié: (2025) -
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
par: Hoang, Huy, et autres
Publié: (2024) -
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
par: Hoang, Huy, et autres
Publié: (2023) -
Offline Safe Reinforcement Learning Using Trajectory Classification
par: Gong, Ze, et autres
Publié: (2024) -
Solving Richly Constrained Reinforcement Learning through State Augmentation and Reward Penalties
par: Jiang, Hao, et autres
Publié: (2023)