Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
Fuente:
arXiv
Salvato in:
| Autori principali: | Hoang, Huy, Mai, Tien, Varakantham, Pradeep, Verma, Tanvi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
di: Hoang, Huy, et al.
Pubblicazione: (2024)
di: Hoang, Huy, et al.
Pubblicazione: (2024)
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
di: Hoang, Huy, et al.
Pubblicazione: (2024)
di: Hoang, Huy, et al.
Pubblicazione: (2024)
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
di: Hoang, Huy, et al.
Pubblicazione: (2023)
di: Hoang, Huy, et al.
Pubblicazione: (2023)
Offline Safe Reinforcement Learning Using Trajectory Classification
di: Gong, Ze, et al.
Pubblicazione: (2024)
di: Gong, Ze, et al.
Pubblicazione: (2024)
Imitating Cost-Constrained Behaviors in Reinforcement Learning
di: Shao, Qian, et al.
Pubblicazione: (2024)
di: Shao, Qian, et al.
Pubblicazione: (2024)
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
di: Ge, Zichang, et al.
Pubblicazione: (2025)
di: Ge, Zichang, et al.
Pubblicazione: (2025)
Solving Richly Constrained Reinforcement Learning through State Augmentation and Reward Penalties
di: Jiang, Hao, et al.
Pubblicazione: (2023)
di: Jiang, Hao, et al.
Pubblicazione: (2023)
How to Leverage Diverse Demonstrations in Offline Imitation Learning
di: Yue, Sheng, et al.
Pubblicazione: (2024)
di: Yue, Sheng, et al.
Pubblicazione: (2024)
MisoDICE: Multi-Agent Imitation from Unlabeled Mixed-Quality Demonstrations
di: Bui, The Viet, et al.
Pubblicazione: (2025)
di: Bui, The Viet, et al.
Pubblicazione: (2025)
Enhancing the Hierarchical Environment Design via Generative Trajectory Modeling
di: Li, Dexun, et al.
Pubblicazione: (2023)
di: Li, Dexun, et al.
Pubblicazione: (2023)
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
di: Lu, Yuxiao, et al.
Pubblicazione: (2023)
di: Lu, Yuxiao, et al.
Pubblicazione: (2023)
What Do Learned Models Measure?
di: Žliobaitė, Indrė
Pubblicazione: (2026)
di: Žliobaitė, Indrė
Pubblicazione: (2026)
Automatic LLM Red Teaming
di: Belaire, Roman, et al.
Pubblicazione: (2025)
di: Belaire, Roman, et al.
Pubblicazione: (2025)
On Minimizing Adversarial Counterfactual Error in Adversarial RL
di: Belaire, Roman, et al.
Pubblicazione: (2024)
di: Belaire, Roman, et al.
Pubblicazione: (2024)
Regret-Based Defense in Adversarial Reinforcement Learning
di: Belaire, Roman, et al.
Pubblicazione: (2023)
di: Belaire, Roman, et al.
Pubblicazione: (2023)
What Do Latent Action Models Actually Learn?
di: Zhang, Chuheng, et al.
Pubblicazione: (2025)
di: Zhang, Chuheng, et al.
Pubblicazione: (2025)
What Do Machine Learning Researchers Mean by "Reproducible"?
di: Raff, Edward, et al.
Pubblicazione: (2024)
di: Raff, Edward, et al.
Pubblicazione: (2024)
Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning
di: Huang, Kevin, et al.
Pubblicazione: (2025)
di: Huang, Kevin, et al.
Pubblicazione: (2025)
DITTO: Offline Imitation Learning with World Models
di: DeMoss, Branton, et al.
Pubblicazione: (2023)
di: DeMoss, Branton, et al.
Pubblicazione: (2023)
OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning
di: Yue, Sheng, et al.
Pubblicazione: (2024)
di: Yue, Sheng, et al.
Pubblicazione: (2024)
Offline Imitation Learning with Model-based Reverse Augmentation
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
Prediction Bottlenecks Don't Discover Causal Structure (But Here's What They Actually Do)
di: Lade, Ankit Hemant, et al.
Pubblicazione: (2026)
di: Lade, Ankit Hemant, et al.
Pubblicazione: (2026)
Balance Equation-based Distributionally Robust Offline Imitation Learning
di: Agrawal, Rishabh, et al.
Pubblicazione: (2025)
di: Agrawal, Rishabh, et al.
Pubblicazione: (2025)
Imitation Learning from Suboptimal Demonstrations via Meta-Learning An Action Ranker
di: Fan, Jiangdong, et al.
Pubblicazione: (2024)
di: Fan, Jiangdong, et al.
Pubblicazione: (2024)
Offline Imitation Learning Through Graph Search and Retrieval
di: Yin, Zhao-Heng, et al.
Pubblicazione: (2024)
di: Yin, Zhao-Heng, et al.
Pubblicazione: (2024)
Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding
di: Shao, Daqian, et al.
Pubblicazione: (2025)
di: Shao, Daqian, et al.
Pubblicazione: (2025)
What Can You Do When You Have Zero Rewards During RL?
di: Prakash, Jatin, et al.
Pubblicazione: (2025)
di: Prakash, Jatin, et al.
Pubblicazione: (2025)
SEABO: A Simple Search-Based Method for Offline Imitation Learning
di: Lyu, Jiafei, et al.
Pubblicazione: (2024)
di: Lyu, Jiafei, et al.
Pubblicazione: (2024)
Align Your Intents: Offline Imitation Learning via Optimal Transport
di: Bobrin, Maksim, et al.
Pubblicazione: (2024)
di: Bobrin, Maksim, et al.
Pubblicazione: (2024)
Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting
di: Nam, Yunhun, et al.
Pubblicazione: (2025)
di: Nam, Yunhun, et al.
Pubblicazione: (2025)
A Dual Approach to Imitation Learning from Observations with Offline Datasets
di: Sikchi, Harshit, et al.
Pubblicazione: (2024)
di: Sikchi, Harshit, et al.
Pubblicazione: (2024)
On Discovering Algorithms for Adversarial Imitation Learning
di: Chirra, Shashank Reddy, et al.
Pubblicazione: (2025)
di: Chirra, Shashank Reddy, et al.
Pubblicazione: (2025)
SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories
di: Burnwal, Returaj, et al.
Pubblicazione: (2025)
di: Burnwal, Returaj, et al.
Pubblicazione: (2025)
LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
Offline Safe Policy Optimization From Heterogeneous Feedback
di: Gong, Ze, et al.
Pubblicazione: (2025)
di: Gong, Ze, et al.
Pubblicazione: (2025)
IRL for Restless Multi-Armed Bandits with Applications in Maternal and Child Health
di: Jain, Gauri, et al.
Pubblicazione: (2024)
di: Jain, Gauri, et al.
Pubblicazione: (2024)
Markov Balance Satisfaction Improves Performance in Strictly Batch Offline Imitation Learning
di: Agrawal, Rishabh, et al.
Pubblicazione: (2024)
di: Agrawal, Rishabh, et al.
Pubblicazione: (2024)
Hierarchical Imitation Learning of Team Behavior from Heterogeneous Demonstrations
di: Seo, Sangwon, et al.
Pubblicazione: (2025)
di: Seo, Sangwon, et al.
Pubblicazione: (2025)
OSIL: Learning Offline Safe Imitation Policies with Safety Inferred from Non-preferred Trajectories
di: Burnwal, Returaj, et al.
Pubblicazione: (2026)
di: Burnwal, Returaj, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
di: Hoang, Huy, et al.
Pubblicazione: (2024) -
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
di: Hoang, Huy, et al.
Pubblicazione: (2024) -
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
di: Hoang, Huy, et al.
Pubblicazione: (2023) -
Offline Safe Reinforcement Learning Using Trajectory Classification
di: Gong, Ze, et al.
Pubblicazione: (2024) -
Imitating Cost-Constrained Behaviors in Reinforcement Learning
di: Shao, Qian, et al.
Pubblicazione: (2024)