On Minimizing Adversarial Counterfactual Error in Adversarial RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Belaire, Roman, Sinha, Arunesh, Varakantham, Pradeep |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automatic LLM Red Teaming
di: Belaire, Roman, et al.
Pubblicazione: (2025)
di: Belaire, Roman, et al.
Pubblicazione: (2025)
Regret-Based Defense in Adversarial Reinforcement Learning
di: Belaire, Roman, et al.
Pubblicazione: (2023)
di: Belaire, Roman, et al.
Pubblicazione: (2023)
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
di: Lu, Yuxiao, et al.
Pubblicazione: (2023)
di: Lu, Yuxiao, et al.
Pubblicazione: (2023)
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
di: Ge, Zichang, et al.
Pubblicazione: (2025)
di: Ge, Zichang, et al.
Pubblicazione: (2025)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
di: Lu, Yuxiao, et al.
Pubblicazione: (2024)
di: Lu, Yuxiao, et al.
Pubblicazione: (2024)
Enhancing the Hierarchical Environment Design via Generative Trajectory Modeling
di: Li, Dexun, et al.
Pubblicazione: (2023)
di: Li, Dexun, et al.
Pubblicazione: (2023)
UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
di: Hoang, Huy, et al.
Pubblicazione: (2024)
di: Hoang, Huy, et al.
Pubblicazione: (2024)
Offline Safe Reinforcement Learning Using Trajectory Classification
di: Gong, Ze, et al.
Pubblicazione: (2024)
di: Gong, Ze, et al.
Pubblicazione: (2024)
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
di: Hoang, Huy, et al.
Pubblicazione: (2024)
di: Hoang, Huy, et al.
Pubblicazione: (2024)
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
di: Hoang, Huy, et al.
Pubblicazione: (2023)
di: Hoang, Huy, et al.
Pubblicazione: (2023)
Imitating Cost-Constrained Behaviors in Reinforcement Learning
di: Shao, Qian, et al.
Pubblicazione: (2024)
di: Shao, Qian, et al.
Pubblicazione: (2024)
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
di: Hoang, Huy, et al.
Pubblicazione: (2025)
di: Hoang, Huy, et al.
Pubblicazione: (2025)
Induced Numerical Instability: Hidden Costs in Multimodal Large Language Models
di: Wong, Wai Tuck, et al.
Pubblicazione: (2026)
di: Wong, Wai Tuck, et al.
Pubblicazione: (2026)
On Discovering Algorithms for Adversarial Imitation Learning
di: Chirra, Shashank Reddy, et al.
Pubblicazione: (2025)
di: Chirra, Shashank Reddy, et al.
Pubblicazione: (2025)
Budgeting Counterfactual for Offline RL
di: Liu, Yao, et al.
Pubblicazione: (2023)
di: Liu, Yao, et al.
Pubblicazione: (2023)
IRL for Restless Multi-Armed Bandits with Applications in Maternal and Child Health
di: Jain, Gauri, et al.
Pubblicazione: (2024)
di: Jain, Gauri, et al.
Pubblicazione: (2024)
Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents
di: K, Deeraj S, et al.
Pubblicazione: (2026)
di: K, Deeraj S, et al.
Pubblicazione: (2026)
Safety through feedback in Constrained RL
di: Chirra, Shashank Reddy, et al.
Pubblicazione: (2024)
di: Chirra, Shashank Reddy, et al.
Pubblicazione: (2024)
De-confounding Representation Learning for Counterfactual Inference on Continuous Treatment via Generative Adversarial Network
di: Zhao, Yonghe, et al.
Pubblicazione: (2023)
di: Zhao, Yonghe, et al.
Pubblicazione: (2023)
FAST-Q: Fast-track Exploration with Adversarially Balanced State Representations for Counterfactual Action Estimation in Offline Reinforcement Learning
di: Agrawal, Pulkit, et al.
Pubblicazione: (2025)
di: Agrawal, Pulkit, et al.
Pubblicazione: (2025)
MemLoss: Enhancing Adversarial Training with Recycling Adversarial Examples
di: Mahdi, Soroush, et al.
Pubblicazione: (2025)
di: Mahdi, Soroush, et al.
Pubblicazione: (2025)
Towards Interpretable Adversarial Examples via Sparse Adversarial Attack
di: Lin, Fudong, et al.
Pubblicazione: (2025)
di: Lin, Fudong, et al.
Pubblicazione: (2025)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
di: Ilin, Aleksei, et al.
Pubblicazione: (2025)
di: Ilin, Aleksei, et al.
Pubblicazione: (2025)
ACTER: Diverse and Actionable Counterfactual Sequences for Explaining and Diagnosing RL Policies
di: Gajcin, Jasmina, et al.
Pubblicazione: (2024)
di: Gajcin, Jasmina, et al.
Pubblicazione: (2024)
Towards Neural Network based Cognitive Models of Dynamic Decision-Making by Humans
di: Chen, Changyu, et al.
Pubblicazione: (2024)
di: Chen, Changyu, et al.
Pubblicazione: (2024)
Adversarial Examples Might be Avoidable: The Role of Data Concentration in Adversarial Robustness
di: Pal, Ambar, et al.
Pubblicazione: (2023)
di: Pal, Ambar, et al.
Pubblicazione: (2023)
How Worst-Case Are Adversarial Attacks? Linking Adversarial and Perturbation Robustness
di: Rossolini, Giulio
Pubblicazione: (2026)
di: Rossolini, Giulio
Pubblicazione: (2026)
Discriminative Adversarial Unlearning
di: Sharma, Rohan, et al.
Pubblicazione: (2024)
di: Sharma, Rohan, et al.
Pubblicazione: (2024)
Adversarial Graph Disentanglement
di: Zheng, Shuai, et al.
Pubblicazione: (2021)
di: Zheng, Shuai, et al.
Pubblicazione: (2021)
SAFE-RL: Saliency-Aware Counterfactual Explainer for Deep Reinforcement Learning Policies
di: Samadi, Amir, et al.
Pubblicazione: (2024)
di: Samadi, Amir, et al.
Pubblicazione: (2024)
A Statistical Learning Perspective on Semi-dual Adversarial Neural Optimal Transport Solvers
di: Tarasov, Roman, et al.
Pubblicazione: (2025)
di: Tarasov, Roman, et al.
Pubblicazione: (2025)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Out-of-Distribution Adaptation in Offline RL: Counterfactual Reasoning via Causal Normalizing Flows
di: Cho, Minjae, et al.
Pubblicazione: (2024)
di: Cho, Minjae, et al.
Pubblicazione: (2024)
Conflict-Aware Adversarial Training
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
Adversarially Robust Decision Transformer
di: Tang, Xiaohang, et al.
Pubblicazione: (2024)
di: Tang, Xiaohang, et al.
Pubblicazione: (2024)
Adversarial Training: A Survey
di: Zhao, Mengnan, et al.
Pubblicazione: (2024)
di: Zhao, Mengnan, et al.
Pubblicazione: (2024)
Adversarial Attacks on Hyperbolic Networks
di: van Spengler, Max, et al.
Pubblicazione: (2024)
di: van Spengler, Max, et al.
Pubblicazione: (2024)
Adversarial Reasoning at Jailbreaking Time
di: Sabbaghi, Mahdi, et al.
Pubblicazione: (2025)
di: Sabbaghi, Mahdi, et al.
Pubblicazione: (2025)
Exploring Energy Landscapes for Minimal Counterfactual Explanations: Applications in Cybersecurity and Beyond
di: Evangelatos, Spyridon, et al.
Pubblicazione: (2025)
di: Evangelatos, Spyridon, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Automatic LLM Red Teaming
di: Belaire, Roman, et al.
Pubblicazione: (2025) -
Regret-Based Defense in Adversarial Reinforcement Learning
di: Belaire, Roman, et al.
Pubblicazione: (2023) -
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
di: Lu, Yuxiao, et al.
Pubblicazione: (2023) -
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
di: Ge, Zichang, et al.
Pubblicazione: (2025) -
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
di: Lu, Yuxiao, et al.
Pubblicazione: (2024)