Explaining Learned Reward Functions with Counterfactual Trajectories
Fuente:
arXiv
Salvato in:
| Autori principali: | Wehner, Jan, Oliehoek, Frans, Siebert, Luciano Cavalcante |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoMI-IRL: Contrastive Multi-Intention Inverse Reinforcement Learning
di: Mone, Antonio, et al.
Pubblicazione: (2026)
di: Mone, Antonio, et al.
Pubblicazione: (2026)
Learning to Focus: Prioritizing Informative Histories with Structured Attention Mechanisms in Partially Observable Reinforcement Learning
di: Allegue, Daniel De Dios, et al.
Pubblicazione: (2025)
di: Allegue, Daniel De Dios, et al.
Pubblicazione: (2025)
SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation
di: Brita, Catalin E., et al.
Pubblicazione: (2024)
di: Brita, Catalin E., et al.
Pubblicazione: (2024)
Navigating Trade-offs: Policy Summarization for Multi-Objective Reinforcement Learning
di: Osika, Zuzanna, et al.
Pubblicazione: (2024)
di: Osika, Zuzanna, et al.
Pubblicazione: (2024)
Timing the Match: A Deep Reinforcement Learning Approach for Ride-Hailing and Ride-Pooling Services
di: Bao, Yiman, et al.
Pubblicazione: (2025)
di: Bao, Yiman, et al.
Pubblicazione: (2025)
Multi-Objective Reinforcement Learning for Water Management
di: Osika, Zuzanna, et al.
Pubblicazione: (2025)
di: Osika, Zuzanna, et al.
Pubblicazione: (2025)
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
di: Frans, Kevin, et al.
Pubblicazione: (2024)
di: Frans, Kevin, et al.
Pubblicazione: (2024)
Sample-Efficient Policy Space Response Oracles with Joint Experience Best Response
di: Bighashdel, Ariyan, et al.
Pubblicazione: (2026)
di: Bighashdel, Ariyan, et al.
Pubblicazione: (2026)
Online Planning in POMDPs with State-Requests
di: Avalos, Raphael, et al.
Pubblicazione: (2024)
di: Avalos, Raphael, et al.
Pubblicazione: (2024)
What model does MuZero learn?
di: He, Jinke, et al.
Pubblicazione: (2023)
di: He, Jinke, et al.
Pubblicazione: (2023)
Inverse Concave-Utility Reinforcement Learning is Inverse Game Theory
di: Çelikok, Mustafa Mert, et al.
Pubblicazione: (2024)
di: Çelikok, Mustafa Mert, et al.
Pubblicazione: (2024)
Uncoupled Learning of Differential Stackelberg Equilibria with Commitments
di: Loftin, Robert, et al.
Pubblicazione: (2023)
di: Loftin, Robert, et al.
Pubblicazione: (2023)
Explaining Concept Drift through the Evolution of Group Counterfactuals
di: Stępka, Ignacy, et al.
Pubblicazione: (2025)
di: Stępka, Ignacy, et al.
Pubblicazione: (2025)
Explaining k-Nearest Neighbors: Abductive and Counterfactual Explanations
di: Barceló, Pablo, et al.
Pubblicazione: (2025)
di: Barceló, Pablo, et al.
Pubblicazione: (2025)
Explaining RL Decisions with Trajectories
di: Deshmukh, Shripad Vilasrao, et al.
Pubblicazione: (2023)
di: Deshmukh, Shripad Vilasrao, et al.
Pubblicazione: (2023)
ACTER: Diverse and Actionable Counterfactual Sequences for Explaining and Diagnosing RL Policies
di: Gajcin, Jasmina, et al.
Pubblicazione: (2024)
di: Gajcin, Jasmina, et al.
Pubblicazione: (2024)
Explaining Fine Tuned LLMs via Counterfactuals A Knowledge Graph Driven Framework
di: Wang, Yucheng, et al.
Pubblicazione: (2025)
di: Wang, Yucheng, et al.
Pubblicazione: (2025)
Intra-Trajectory Consistency for Reward Modeling
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
Generating Counterfactual Trajectories with Latent Diffusion Models for Concept Discovery
di: Varshney, Payal, et al.
Pubblicazione: (2024)
di: Varshney, Payal, et al.
Pubblicazione: (2024)
What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
Learning Nonlinear Causal Reductions to Explain Reinforcement Learning Policies
di: Kekić, Armin, et al.
Pubblicazione: (2025)
di: Kekić, Armin, et al.
Pubblicazione: (2025)
Reinforcement Learning with Stochastic Reward Machines
di: Corazza, Jan, et al.
Pubblicazione: (2025)
di: Corazza, Jan, et al.
Pubblicazione: (2025)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
Explaining an Agent's Future Beliefs through Temporally Decomposing Future Reward Estimators
di: Towers, Mark, et al.
Pubblicazione: (2024)
di: Towers, Mark, et al.
Pubblicazione: (2024)
UniCoMTE: A Universal Counterfactual Framework for Explaining Time-Series Classifiers on ECG Data
di: Li, Justin, et al.
Pubblicazione: (2025)
di: Li, Justin, et al.
Pubblicazione: (2025)
Bad Habits: Policy Confounding and Out-of-Trajectory Generalization in RL
di: Suau, Miguel, et al.
Pubblicazione: (2023)
di: Suau, Miguel, et al.
Pubblicazione: (2023)
Integrating Policy Summaries with Reward Decomposition for Explaining Reinforcement Learning Agents
di: Septon, Yael, et al.
Pubblicazione: (2022)
di: Septon, Yael, et al.
Pubblicazione: (2022)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
Learning by Self-Explaining
di: Stammer, Wolfgang, et al.
Pubblicazione: (2023)
di: Stammer, Wolfgang, et al.
Pubblicazione: (2023)
Learning Causally Invariant Reward Functions from Diverse Demonstrations
di: Ovinnikov, Ivan, et al.
Pubblicazione: (2024)
di: Ovinnikov, Ivan, et al.
Pubblicazione: (2024)
Explaining Low Perception Model Competency with High-Competency Counterfactuals
di: Pohland, Sara, et al.
Pubblicazione: (2025)
di: Pohland, Sara, et al.
Pubblicazione: (2025)
Quasimetric Value Functions with Dense Rewards
di: Valieva, Khadichabonu, et al.
Pubblicazione: (2024)
di: Valieva, Khadichabonu, et al.
Pubblicazione: (2024)
Adapting the Behavior of Reinforcement Learning Agents to Changing Action Spaces and Reward Functions
di: de la Rosa, Raul, et al.
Pubblicazione: (2026)
di: de la Rosa, Raul, et al.
Pubblicazione: (2026)
Conditional Policy Generator for Dynamic Constraint Satisfaction and Optimization
di: Lee, Wook, et al.
Pubblicazione: (2025)
di: Lee, Wook, et al.
Pubblicazione: (2025)
Self-Distilled Disentangled Learning for Counterfactual Prediction
di: Li, Xinshu, et al.
Pubblicazione: (2024)
di: Li, Xinshu, et al.
Pubblicazione: (2024)
Batch Active Learning of Reward Functions from Human Preferences
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
A Generalized Acquisition Function for Preference-based Reward Learning
di: Ellis, Evan, et al.
Pubblicazione: (2024)
di: Ellis, Evan, et al.
Pubblicazione: (2024)
Counterfactual Explanations for Continuous Action Reinforcement Learning
di: Dong, Shuyang, et al.
Pubblicazione: (2025)
di: Dong, Shuyang, et al.
Pubblicazione: (2025)
AI Alignment with Changing and Influenceable Reward Functions
di: Carroll, Micah, et al.
Pubblicazione: (2024)
di: Carroll, Micah, et al.
Pubblicazione: (2024)
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
di: Duan, Xintong, et al.
Pubblicazione: (2025)
di: Duan, Xintong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoMI-IRL: Contrastive Multi-Intention Inverse Reinforcement Learning
di: Mone, Antonio, et al.
Pubblicazione: (2026) -
Learning to Focus: Prioritizing Informative Histories with Structured Attention Mechanisms in Partially Observable Reinforcement Learning
di: Allegue, Daniel De Dios, et al.
Pubblicazione: (2025) -
SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation
di: Brita, Catalin E., et al.
Pubblicazione: (2024) -
Navigating Trade-offs: Policy Summarization for Multi-Objective Reinforcement Learning
di: Osika, Zuzanna, et al.
Pubblicazione: (2024) -
Timing the Match: A Deep Reinforcement Learning Approach for Ride-Hailing and Ride-Pooling Services
di: Bao, Yiman, et al.
Pubblicazione: (2025)