Fast Adversarial Attacks on Language Models In One GPU Minute
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sadasivan, Vinu Sankar, Saha, Shoumik, Sriramanan, Gaurang, Kattakinda, Priyatham, Chegini, Atoosa, Feizi, Soheil |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IConMark: Robust Interpretable Concept-Based Watermark For AI Images
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025)
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025)
Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
par: Saha, Shoumik, et autres
Publié: (2026)
par: Saha, Shoumik, et autres
Publié: (2026)
Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025)
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025)
Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text
par: Cheng, Yize, et autres
Publié: (2025)
par: Cheng, Yize, et autres
Publié: (2025)
Tool Preferences in Agentic LLMs are Unreliable
par: Faghih, Kazem, et autres
Publié: (2025)
par: Faghih, Kazem, et autres
Publié: (2025)
DREW : Towards Robust Data Provenance by Leveraging Error-Controlled Watermarking
par: Saberi, Mehrdad, et autres
Publié: (2024)
par: Saberi, Mehrdad, et autres
Publié: (2024)
Maestro: Joint Graph & Config Optimization for Reliable AI Agents
par: Wang, Wenxiao, et autres
Publié: (2025)
par: Wang, Wenxiao, et autres
Publié: (2025)
Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning
par: Chegini, Atoosa, et autres
Publié: (2026)
par: Chegini, Atoosa, et autres
Publié: (2026)
Certifying LLM Safety against Adversarial Prompting
par: Kumar, Aounon, et autres
Publié: (2023)
par: Kumar, Aounon, et autres
Publié: (2023)
Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writing
par: Saha, Shoumik, et autres
Publié: (2025)
par: Saha, Shoumik, et autres
Publié: (2025)
Imposter.AI: Adversarial Attacks with Hidden Intentions towards Aligned Large Language Models
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks
par: Saha, Shoumik, et autres
Publié: (2025)
par: Saha, Shoumik, et autres
Publié: (2025)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
Modeling the Attack: Detecting AI-Generated Text by Quantifying Adversarial Perturbations
par: Teja, Lekkala Sai, et autres
Publié: (2025)
par: Teja, Lekkala Sai, et autres
Publié: (2025)
Can AI-Generated Text be Reliably Detected?
par: Sadasivan, Vinu Sankar, et autres
Publié: (2023)
par: Sadasivan, Vinu Sankar, et autres
Publié: (2023)
Robustness of AI-Image Detectors: Fundamental Limits and Practical Attacks
par: Saberi, Mehrdad, et autres
Publié: (2023)
par: Saberi, Mehrdad, et autres
Publié: (2023)
Emoti-Attack: Zero-Perturbation Adversarial Attacks on NLP Systems via Emoji Sequences
par: Zhang, Yangshijie
Publié: (2025)
par: Zhang, Yangshijie
Publié: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Adversarial Attacks Against Automated Fact-Checking: A Survey
par: Liu, Fanzhen, et autres
Publié: (2025)
par: Liu, Fanzhen, et autres
Publié: (2025)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)
par: Mu, Junjie, et autres
Publié: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
Large Language Model Sentinel: LLM Agent for Adversarial Purification
par: Lin, Guang, et autres
Publié: (2024)
par: Lin, Guang, et autres
Publié: (2024)
Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs
par: Fastowski, Alina, et autres
Publié: (2025)
par: Fastowski, Alina, et autres
Publié: (2025)
Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework
par: Pisano, Matthew, et autres
Publié: (2023)
par: Pisano, Matthew, et autres
Publié: (2023)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
par: Du, Wei, et autres
Publié: (2023)
par: Du, Wei, et autres
Publié: (2023)
Learnable Linguistic Watermarks for Tracing Model Extraction Attacks on Large Language Models
par: Bai, Minhao, et autres
Publié: (2024)
par: Bai, Minhao, et autres
Publié: (2024)
The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMs
par: Berezin, Sergey, et autres
Publié: (2025)
par: Berezin, Sergey, et autres
Publié: (2025)
Goal-guided Generative Prompt Injection Attack on Large Language Models
par: Zhang, Chong, et autres
Publié: (2024)
par: Zhang, Chong, et autres
Publié: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
par: Zhou, Guanghao, et autres
Publié: (2025)
par: Zhou, Guanghao, et autres
Publié: (2025)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
Rethinking Artistic Copyright Infringements in the Era of Text-to-Image Generative Models
par: Moayeri, Mazda, et autres
Publié: (2024)
par: Moayeri, Mazda, et autres
Publié: (2024)
MALIGN: Explainable Static Raw-byte Based Malware Family Classification using Sequence Alignment
par: Saha, Shoumik, et autres
Publié: (2021)
par: Saha, Shoumik, et autres
Publié: (2021)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
par: Zou, Qingsong, et autres
Publié: (2025)
par: Zou, Qingsong, et autres
Publié: (2025)
Multi-Granularity Tibetan Textual Adversarial Attack Method Based on Masked Language Model
par: Cao, Xi, et autres
Publié: (2024)
par: Cao, Xi, et autres
Publié: (2024)
Documents similaires
-
IConMark: Robust Interpretable Concept-Based Watermark For AI Images
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025) -
Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
par: Saha, Shoumik, et autres
Publié: (2026) -
Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025) -
Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text
par: Cheng, Yize, et autres
Publié: (2025) -
Tool Preferences in Agentic LLMs are Unreliable
par: Faghih, Kazem, et autres
Publié: (2025)