Explanation-Guided Adversarial Training for Robust and Interpretable Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Chao, Chen, Yanhui, Lin, Shanshan, Hong, Dongsheng, Wu, Shu, Liao, Xiangwen, Liu, Chuanyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Attribution to Action: Jointly ALIGNing Predictions and Explanations
di: Hong, Dongsheng, et al.
Pubblicazione: (2025)
di: Hong, Dongsheng, et al.
Pubblicazione: (2025)
BAED: a New Paradigm for Few-shot Graph Learning with Explanation in the Loop
di: Chen, Chao, et al.
Pubblicazione: (2026)
di: Chen, Chao, et al.
Pubblicazione: (2026)
Provable Robust Saliency-based Explanations
di: Chen, Chao, et al.
Pubblicazione: (2022)
di: Chen, Chao, et al.
Pubblicazione: (2022)
Adversarial Training for Robust Coverage Network under Worst-case Facility Losses
di: Miao, Changhao, et al.
Pubblicazione: (2026)
di: Miao, Changhao, et al.
Pubblicazione: (2026)
A Survey on Memory-Efficient Transformer-Based Model Training in AI for Science
di: Tian, Kaiyuan, et al.
Pubblicazione: (2025)
di: Tian, Kaiyuan, et al.
Pubblicazione: (2025)
Is Your Explanation Reliable: Confidence-Aware Explanation on Graph Neural Networks
di: Zhang, Jiaxing, et al.
Pubblicazione: (2025)
di: Zhang, Jiaxing, et al.
Pubblicazione: (2025)
Interpreting Inflammation Prediction Model via Tag-based Cohort Explanation
di: Meng, Fanyu, et al.
Pubblicazione: (2024)
di: Meng, Fanyu, et al.
Pubblicazione: (2024)
Learning Robust Reasoning through Guided Adversarial Self-Play
di: Li, Shuozhe, et al.
Pubblicazione: (2026)
di: Li, Shuozhe, et al.
Pubblicazione: (2026)
Meta Additive Model: Interpretable Sparse Learning With Auto Weighting
di: Zhang, Xuelin, et al.
Pubblicazione: (2026)
di: Zhang, Xuelin, et al.
Pubblicazione: (2026)
Adversarial Instance Generation and Robust Training for Neural Combinatorial Optimization with Multiple Objectives
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Ignition Phase : Standard Training for Fast Adversarial Robustness
di: Yu-Hang, Wang, et al.
Pubblicazione: (2025)
di: Yu-Hang, Wang, et al.
Pubblicazione: (2025)
Bridging Interpretability and Robustness Using LIME-Guided Model Refinement
di: Nayyem, Navid, et al.
Pubblicazione: (2024)
di: Nayyem, Navid, et al.
Pubblicazione: (2024)
Robustness-enhanced Uplift Modeling with Adversarial Feature Desensitization
di: Sun, Zexu, et al.
Pubblicazione: (2023)
di: Sun, Zexu, et al.
Pubblicazione: (2023)
E-ICL: Enhancing Fine-Grained Emotion Recognition through the Lens of Prototype Theory
di: Ren, Zhaochun, et al.
Pubblicazione: (2024)
di: Ren, Zhaochun, et al.
Pubblicazione: (2024)
Annealing Self-Distillation Rectification Improves Adversarial Training
di: Wu, Yu-Yu, et al.
Pubblicazione: (2023)
di: Wu, Yu-Yu, et al.
Pubblicazione: (2023)
Causality-Aware Local Interpretable Model-Agnostic Explanations
di: Cinquini, Martina, et al.
Pubblicazione: (2022)
di: Cinquini, Martina, et al.
Pubblicazione: (2022)
Interpreting Language Reward Models via Contrastive Explanations
di: Jiang, Junqi, et al.
Pubblicazione: (2024)
di: Jiang, Junqi, et al.
Pubblicazione: (2024)
Generally-Occurring Model Change for Robust Counterfactual Explanations
di: Xu, Ao, et al.
Pubblicazione: (2024)
di: Xu, Ao, et al.
Pubblicazione: (2024)
Towards Interpretable Adversarial Examples via Sparse Adversarial Attack
di: Lin, Fudong, et al.
Pubblicazione: (2025)
di: Lin, Fudong, et al.
Pubblicazione: (2025)
Alignment-Based Adversarial Training (ABAT) for Improving the Robustness and Accuracy of EEG-Based BCIs
di: Chen, Xiaoqing, et al.
Pubblicazione: (2024)
di: Chen, Xiaoqing, et al.
Pubblicazione: (2024)
Structure-Guided Adversarial Training of Diffusion Models
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
ADEdgeDrop: Adversarial Edge Dropping for Robust Graph Neural Networks
di: Chen, Zhaoliang, et al.
Pubblicazione: (2024)
di: Chen, Zhaoliang, et al.
Pubblicazione: (2024)
Fast Adversarial Training against Sparse Attacks Requires Loss Smoothing
di: Zhong, Xuyang, et al.
Pubblicazione: (2025)
di: Zhong, Xuyang, et al.
Pubblicazione: (2025)
TimeX++: Learning Time-Series Explanations with Information Bottleneck
di: Liu, Zichuan, et al.
Pubblicazione: (2024)
di: Liu, Zichuan, et al.
Pubblicazione: (2024)
Explanation Space: A New Perspective into Time Series Interpretability
di: Rezaei, Shahbaz, et al.
Pubblicazione: (2024)
di: Rezaei, Shahbaz, et al.
Pubblicazione: (2024)
Adversarial Preference Learning for Robust LLM Alignment
di: Wang, Yuanfu, et al.
Pubblicazione: (2025)
di: Wang, Yuanfu, et al.
Pubblicazione: (2025)
LLMExplainer: Large Language Model based Bayesian Inference for Graph Explanation Generation
di: Zhang, Jiaxing, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxing, et al.
Pubblicazione: (2024)
Spectral Surgery: Training-Free Refinement of LoRA via Gradient-Guided Singular Value Reweighting
di: Tian, Zailong, et al.
Pubblicazione: (2026)
di: Tian, Zailong, et al.
Pubblicazione: (2026)
Training Free Guided Flow Matching with Optimal Control
di: Wang, Luran, et al.
Pubblicazione: (2024)
di: Wang, Luran, et al.
Pubblicazione: (2024)
Understanding and Improving Adversarial Robustness of Neural Probabilistic Circuits
di: Chen, Weixin, et al.
Pubblicazione: (2025)
di: Chen, Weixin, et al.
Pubblicazione: (2025)
FedProphet: Memory-Efficient Federated Adversarial Training via Robust and Consistent Cascade Learning
di: Tang, Minxue, et al.
Pubblicazione: (2024)
di: Tang, Minxue, et al.
Pubblicazione: (2024)
How Do Diffusion Models Improve Adversarial Robustness?
di: Yuezhang, Liu, et al.
Pubblicazione: (2025)
di: Yuezhang, Liu, et al.
Pubblicazione: (2025)
Counterfactual Training: Teaching Models Plausible and Actionable Explanations
di: Altmeyer, Patrick, et al.
Pubblicazione: (2026)
di: Altmeyer, Patrick, et al.
Pubblicazione: (2026)
GREAT Score: Global Robustness Evaluation of Adversarial Perturbation using Generative Models
di: Li, Zaitang, et al.
Pubblicazione: (2023)
di: Li, Zaitang, et al.
Pubblicazione: (2023)
TensorHyper-VQC: A Tensor-Train-Guided Hypernetwork for Robust and Scalable Variational Quantum Computing
di: Qi, Jun, et al.
Pubblicazione: (2025)
di: Qi, Jun, et al.
Pubblicazione: (2025)
Counterfactual Explanations with Probabilistic Guarantees on their Robustness to Model Change
di: Stępka, Ignacy, et al.
Pubblicazione: (2024)
di: Stępka, Ignacy, et al.
Pubblicazione: (2024)
F-Fidelity: A Robust Framework for Faithfulness Evaluation of Explainable AI
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
RainSeer: Fine-Grained Rainfall Reconstruction via Physics-Guided Modeling
di: Chen, Lin, et al.
Pubblicazione: (2025)
di: Chen, Lin, et al.
Pubblicazione: (2025)
Gradient Inversion Transcript: Leveraging Robust Generative Priors to Reconstruct Training Data from Gradient Leakage
di: Chen, Xinping, et al.
Pubblicazione: (2025)
di: Chen, Xinping, et al.
Pubblicazione: (2025)
Adversarial Training for Process Reward Models
di: Juneja, Gurusha, et al.
Pubblicazione: (2025)
di: Juneja, Gurusha, et al.
Pubblicazione: (2025)
Documenti analoghi
-
From Attribution to Action: Jointly ALIGNing Predictions and Explanations
di: Hong, Dongsheng, et al.
Pubblicazione: (2025) -
BAED: a New Paradigm for Few-shot Graph Learning with Explanation in the Loop
di: Chen, Chao, et al.
Pubblicazione: (2026) -
Provable Robust Saliency-based Explanations
di: Chen, Chao, et al.
Pubblicazione: (2022) -
Adversarial Training for Robust Coverage Network under Worst-case Facility Losses
di: Miao, Changhao, et al.
Pubblicazione: (2026) -
A Survey on Memory-Efficient Transformer-Based Model Training in AI for Science
di: Tian, Kaiyuan, et al.
Pubblicazione: (2025)