Fast Adversarial Training against Textual Adversarial Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yichen, Liu, Xin, He, Kun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack
par: Liu, Han, et autres
Publié: (2026)
par: Liu, Han, et autres
Publié: (2026)
Parameter Interpolation Adversarial Training for Robust Image Classification
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks
par: Zhang, Xiaomei, et autres
Publié: (2025)
par: Zhang, Xiaomei, et autres
Publié: (2025)
Breaking the Reviewer: Assessing the Vulnerability of Large Language Models in Automated Peer Review Under Textual Adversarial Attacks
par: Lin, Tzu-Ling, et autres
Publié: (2025)
par: Lin, Tzu-Ling, et autres
Publié: (2025)
A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents
par: Mo, Lingbo, et autres
Publié: (2024)
par: Mo, Lingbo, et autres
Publié: (2024)
Adversarial Attacks and Defense for Conversation Entailment Task
par: Yang, Zhenning, et autres
Publié: (2024)
par: Yang, Zhenning, et autres
Publié: (2024)
Combating Adversarial Attacks with Multi-Agent Debate
par: Chern, Steffi, et autres
Publié: (2024)
par: Chern, Steffi, et autres
Publié: (2024)
Fast Adversarial Attacks on Language Models In One GPU Minute
par: Sadasivan, Vinu Sankar, et autres
Publié: (2024)
par: Sadasivan, Vinu Sankar, et autres
Publié: (2024)
Less is More: Understanding Word-level Textual Adversarial Attack via n-gram Frequency Descend
par: Lu, Ning, et autres
Publié: (2023)
par: Lu, Ning, et autres
Publié: (2023)
STACK: Adversarial Attacks on LLM Safeguard Pipelines
par: McKenzie, Ian R., et autres
Publié: (2025)
par: McKenzie, Ian R., et autres
Publié: (2025)
A Generative Adversarial Attack for Multilingual Text Classifiers
par: Roth, Tom, et autres
Publié: (2024)
par: Roth, Tom, et autres
Publié: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
LLM Lies: Hallucinations are not Bugs, but Features as Adversarial Examples
par: Yao, Jia-Yu, et autres
Publié: (2023)
par: Yao, Jia-Yu, et autres
Publié: (2023)
HQA-Attack: Toward High Quality Black-Box Hard-Label Adversarial Attack on Text
par: Liu, Han, et autres
Publié: (2024)
par: Liu, Han, et autres
Publié: (2024)
Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent
par: Zhang, Yangshijie, et autres
Publié: (2025)
par: Zhang, Yangshijie, et autres
Publié: (2025)
Adversarial Attacks Against Automated Fact-Checking: A Survey
par: Liu, Fanzhen, et autres
Publié: (2025)
par: Liu, Fanzhen, et autres
Publié: (2025)
Revisiting Character-level Adversarial Attacks for Language Models
par: Rocamora, Elias Abad, et autres
Publié: (2024)
par: Rocamora, Elias Abad, et autres
Publié: (2024)
Paraphrasing Adversarial Attack on LLM-as-a-Reviewer
par: Kaneko, Masahiro
Publié: (2026)
par: Kaneko, Masahiro
Publié: (2026)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
par: Liu, Zesen, et autres
Publié: (2024)
par: Liu, Zesen, et autres
Publié: (2024)
Fast Adversarial Training against Sparse Attacks Requires Loss Smoothing
par: Zhong, Xuyang, et autres
Publié: (2025)
par: Zhong, Xuyang, et autres
Publié: (2025)
Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks
par: Liu, Haoyu, et autres
Publié: (2026)
par: Liu, Haoyu, et autres
Publié: (2026)
Not-in-Perspective: Towards Shielding Google's Perspective API Against Adversarial Negation Attacks
par: Alexiou, Michail S., et autres
Publié: (2026)
par: Alexiou, Michail S., et autres
Publié: (2026)
$\textit{LinkPrompt}$: Natural and Universal Adversarial Attacks on Prompt-based Language Models
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
MultiAgent Collaboration Attack: Investigating Adversarial Attacks in Large Language Model Collaborations via Debate
par: Amayuelas, Alfonso, et autres
Publié: (2024)
par: Amayuelas, Alfonso, et autres
Publié: (2024)
Defensive Dual Masking for Robust Adversarial Defense
par: Yang, Wangli, et autres
Publié: (2024)
par: Yang, Wangli, et autres
Publié: (2024)
Prompt-Driven Contrastive Learning for Transferable Adversarial Attacks
par: Yang, Hunmin, et autres
Publié: (2024)
par: Yang, Hunmin, et autres
Publié: (2024)
LLM-Based Adversarial Persuasion Attacks on Fact-Checking Systems
par: Leite, João A., et autres
Publié: (2026)
par: Leite, João A., et autres
Publié: (2026)
Emoti-Attack: Zero-Perturbation Adversarial Attacks on NLP Systems via Emoji Sequences
par: Zhang, Yangshijie
Publié: (2025)
par: Zhang, Yangshijie
Publié: (2025)
OpenFact at CheckThat! 2024: Combining Multiple Attack Methods for Effective Adversarial Text Generation
par: Lewoniewski, Włodzimierz, et autres
Publié: (2024)
par: Lewoniewski, Włodzimierz, et autres
Publié: (2024)
Certifying LLM Safety against Adversarial Prompting
par: Kumar, Aounon, et autres
Publié: (2023)
par: Kumar, Aounon, et autres
Publié: (2023)
Mitigating Adversarial Attacks in LLMs through Defensive Suffix Generation
par: Kim, Minkyoung, et autres
Publié: (2024)
par: Kim, Minkyoung, et autres
Publié: (2024)
Modeling the Attack: Detecting AI-Generated Text by Quantifying Adversarial Perturbations
par: Teja, Lekkala Sai, et autres
Publié: (2025)
par: Teja, Lekkala Sai, et autres
Publié: (2025)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)
par: Mu, Junjie, et autres
Publié: (2025)
Evaluating and Safeguarding the Adversarial Robustness of Retrieval-Based In-Context Learning
par: Yu, Simon, et autres
Publié: (2024)
par: Yu, Simon, et autres
Publié: (2024)
Imposter.AI: Adversarial Attacks with Hidden Intentions towards Aligned Large Language Models
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Textual Similarity as a Key Metric in Machine Translation Quality Estimation
par: Sun, Kun, et autres
Publié: (2024)
par: Sun, Kun, et autres
Publié: (2024)
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
par: Liu, Qihao, et autres
Publié: (2025)
par: Liu, Qihao, et autres
Publié: (2025)
X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP
par: Huang, Hanxun, et autres
Publié: (2025)
par: Huang, Hanxun, et autres
Publié: (2025)
Hidding the Ghostwriters: An Adversarial Evaluation of AI-Generated Student Essay Detection
par: Peng, Xinlin, et autres
Publié: (2024)
par: Peng, Xinlin, et autres
Publié: (2024)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
Documents similaires
-
SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack
par: Liu, Han, et autres
Publié: (2026) -
Parameter Interpolation Adversarial Training for Robust Image Classification
par: Liu, Xin, et autres
Publié: (2025) -
Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks
par: Zhang, Xiaomei, et autres
Publié: (2025) -
Breaking the Reviewer: Assessing the Vulnerability of Large Language Models in Automated Peer Review Under Textual Adversarial Attacks
par: Lin, Tzu-Ling, et autres
Publié: (2025) -
A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents
par: Mo, Lingbo, et autres
Publié: (2024)