Adversarial Attack for Explanation Robustness of Rationalization Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yuankai, Kong, Lingxiao, Wang, Haozhao, Li, Ruixuan, Wang, Jun, Li, Yuhua, Liu, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing RAG with Active Learning on Conversation Records: Reject Incapables and Answer Capables
par: Geng, Xuzhao, et autres
Publié: (2025)
par: Geng, Xuzhao, et autres
Publié: (2025)
Beyond Higher Rank: Token-wise Input-Output Projections for Efficient Low-Rank Adaptation
par: Li, Shiwei, et autres
Publié: (2025)
par: Li, Shiwei, et autres
Publié: (2025)
Robustness of Large Language Models Against Adversarial Attacks
par: Tao, Yiyi, et autres
Publié: (2024)
par: Tao, Yiyi, et autres
Publié: (2024)
Adversarial Cooperative Rationalization: The Risk of Spurious Correlations in Even Clean Datasets
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoning
par: Liao, Zihan, et autres
Publié: (2024)
par: Liao, Zihan, et autres
Publié: (2024)
Aligning Language Models with Human Preferences via a Bayesian Approach
par: Wang, Jiashuo, et autres
Publié: (2023)
par: Wang, Jiashuo, et autres
Publié: (2023)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
par: Tran, Toan, et autres
Publié: (2025)
par: Tran, Toan, et autres
Publié: (2025)
BetaEdit: Null-Space Constrained Sequential Model Editing
par: Liu, Bingqing, et autres
Publié: (2026)
par: Liu, Bingqing, et autres
Publié: (2026)
TF-Attack: Transferable and Fast Adversarial Attacks on Large Language Models
par: Li, Zelin, et autres
Publié: (2024)
par: Li, Zelin, et autres
Publié: (2024)
MPAT: Building Robust Deep Neural Networks against Textual Adversarial Attacks
par: Zhang, Fangyuan, et autres
Publié: (2024)
par: Zhang, Fangyuan, et autres
Publié: (2024)
DiffuseDef: Improved Robustness to Adversarial Attacks via Iterative Denoising
par: Li, Zhenhao, et autres
Publié: (2024)
par: Li, Zhenhao, et autres
Publié: (2024)
Grounding Natural Language to SQL Translation with Data-Based Self-Explanations
par: Fan, Yuankai, et autres
Publié: (2024)
par: Fan, Yuankai, et autres
Publié: (2024)
On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks
par: Obadinma, Stephen, et autres
Publié: (2025)
par: Obadinma, Stephen, et autres
Publié: (2025)
SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack
par: Liu, Han, et autres
Publié: (2026)
par: Liu, Han, et autres
Publié: (2026)
CNNSum: Exploring Long-Context Summarization with Large Language Models in Chinese Novels
par: Wei, Lingxiao, et autres
Publié: (2024)
par: Wei, Lingxiao, et autres
Publié: (2024)
Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
par: Tong, Jintao, et autres
Publié: (2025)
par: Tong, Jintao, et autres
Publié: (2025)
Towards Faithful Explanations for Text Classification with Robustness Improvement and Explanation Guided Training
par: Li, Dongfang, et autres
Publié: (2023)
par: Li, Dongfang, et autres
Publié: (2023)
Rethinking Targeted Adversarial Attacks For Neural Machine Translation
par: Wu, Junjie, et autres
Publié: (2024)
par: Wu, Junjie, et autres
Publié: (2024)
Dynamically Allocated Interval-Based Generative Linguistic Steganography with Roulette Wheel
par: Wang, Yihao, et autres
Publié: (2024)
par: Wang, Yihao, et autres
Publié: (2024)
Imposter.AI: Adversarial Attacks with Hidden Intentions towards Aligned Large Language Models
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Adversarial Defence without Adversarial Defence: Enhancing Language Model Robustness via Instance-level Principal Component Removal
par: Wang, Yang, et autres
Publié: (2025)
par: Wang, Yang, et autres
Publié: (2025)
Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks
par: Tahmasebi, Sahar, et autres
Publié: (2026)
par: Tahmasebi, Sahar, et autres
Publié: (2026)
$\textbf{AGT$^{AO}$}$: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality
par: Li, Pengyu, et autres
Publié: (2026)
par: Li, Pengyu, et autres
Publié: (2026)
Robustness of Misinformation Classification Systems to Adversarial Examples Through BeamAttack
par: Fazla, Arnisa, et autres
Publié: (2025)
par: Fazla, Arnisa, et autres
Publié: (2025)
$DA^3$: A Distribution-Aware Adversarial Attack against Language Models
par: Wang, Yibo, et autres
Publié: (2023)
par: Wang, Yibo, et autres
Publié: (2023)
The Best Defense is Attack: Repairing Semantics in Textual Adversarial Examples
par: Yang, Heng, et autres
Publié: (2023)
par: Yang, Heng, et autres
Publié: (2023)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
par: Yeh, Yahsin, et autres
Publié: (2025)
par: Yeh, Yahsin, et autres
Publié: (2025)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent
par: Zhang, Yangshijie, et autres
Publié: (2025)
par: Zhang, Yangshijie, et autres
Publié: (2025)
Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach
par: Zhang, Chong, et autres
Publié: (2025)
par: Zhang, Chong, et autres
Publié: (2025)
Camouflage is all you need: Evaluating and Enhancing Language Model Robustness Against Camouflage Adversarial Attacks
par: Huertas-García, Álvaro, et autres
Publié: (2024)
par: Huertas-García, Álvaro, et autres
Publié: (2024)
Incorporating Human Explanations for Robust Hate Speech Detection
par: Chen, Jennifer L., et autres
Publié: (2024)
par: Chen, Jennifer L., et autres
Publié: (2024)
Are AI-Generated Text Detectors Robust to Adversarial Perturbations?
par: Huang, Guanhua, et autres
Publié: (2024)
par: Huang, Guanhua, et autres
Publié: (2024)
Iron Sharpens Iron: Defending Against Attacks in Machine-Generated Text Detection with Adversarial Training
par: Li, Yuanfan, et autres
Publié: (2025)
par: Li, Yuanfan, et autres
Publié: (2025)
Explanation based In-Context Demonstrations Retrieval for Multilingual Grammatical Error Correction
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Enhance Robustness of Language Models Against Variation Attack through Graph Integration
par: Xiong, Zi, et autres
Publié: (2024)
par: Xiong, Zi, et autres
Publié: (2024)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
par: Mu, Lin, et autres
Publié: (2025)
par: Mu, Lin, et autres
Publié: (2025)
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
par: Zhang, Xinyu, et autres
Publié: (2023)
par: Zhang, Xinyu, et autres
Publié: (2023)
Documents similaires
-
Enhancing RAG with Active Learning on Conversation Records: Reject Incapables and Answer Capables
par: Geng, Xuzhao, et autres
Publié: (2025) -
Beyond Higher Rank: Token-wise Input-Output Projections for Efficient Low-Rank Adaptation
par: Li, Shiwei, et autres
Publié: (2025) -
Robustness of Large Language Models Against Adversarial Attacks
par: Tao, Yiyi, et autres
Publié: (2024) -
Adversarial Cooperative Rationalization: The Risk of Spurious Correlations in Even Clean Datasets
par: Liu, Wei, et autres
Publié: (2025) -
E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoning
par: Liao, Zihan, et autres
Publié: (2024)