Reversible Jump Attack to Textual Classifiers with Modification Reduction
Fuente:
arXiv
Salvato in:
| Autori principali: | Ni, Mingze, Sun, Zhensu, Liu, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-Entropy Attacks to Language Models via Rare Event Simulation
di: Ni, Mingze, et al.
Pubblicazione: (2025)
di: Ni, Mingze, et al.
Pubblicazione: (2025)
Token-Modification Adversarial Attacks for Natural Language Processing: A Survey
di: Roth, Tom, et al.
Pubblicazione: (2021)
di: Roth, Tom, et al.
Pubblicazione: (2021)
MPAT: Building Robust Deep Neural Networks against Textual Adversarial Attacks
di: Zhang, Fangyuan, et al.
Pubblicazione: (2024)
di: Zhang, Fangyuan, et al.
Pubblicazione: (2024)
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers
di: Makroo, Owais, et al.
Pubblicazione: (2025)
di: Makroo, Owais, et al.
Pubblicazione: (2025)
Less is More: Understanding Word-level Textual Adversarial Attack via n-gram Frequency Descend
di: Lu, Ning, et al.
Pubblicazione: (2023)
di: Lu, Ning, et al.
Pubblicazione: (2023)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
di: Xin, Rui, et al.
Pubblicazione: (2025)
di: Xin, Rui, et al.
Pubblicazione: (2025)
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
di: Wang, Tianchun, et al.
Pubblicazione: (2024)
di: Wang, Tianchun, et al.
Pubblicazione: (2024)
AICAttack: Adversarial Image Captioning Attack with Attention-Based Optimization
di: Li, Jiyao, et al.
Pubblicazione: (2024)
di: Li, Jiyao, et al.
Pubblicazione: (2024)
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
Humanizing Machine-Generated Content: Evading AI-Text Detection through Adversarial Attack
di: Zhou, Ying, et al.
Pubblicazione: (2024)
di: Zhou, Ying, et al.
Pubblicazione: (2024)
A Curious Case of Searching for the Correlation between Training Data and Adversarial Robustness of Transformer Textual Models
di: Dang, Cuong, et al.
Pubblicazione: (2024)
di: Dang, Cuong, et al.
Pubblicazione: (2024)
Protecting Classifiers From Attacks
di: Gallego, Victor, et al.
Pubblicazione: (2020)
di: Gallego, Victor, et al.
Pubblicazione: (2020)
Graphene: Infrastructure Security Posture Analysis with AI-generated Attack Graphs
di: Jin, Xin, et al.
Pubblicazione: (2023)
di: Jin, Xin, et al.
Pubblicazione: (2023)
Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks
di: Hu, Hanjiang, et al.
Pubblicazione: (2025)
di: Hu, Hanjiang, et al.
Pubblicazione: (2025)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
Homograph Attacks on Maghreb Sentiment Analyzers
di: Qachfar, Fatima Zahra, et al.
Pubblicazione: (2024)
di: Qachfar, Fatima Zahra, et al.
Pubblicazione: (2024)
A Transfer Attack to Image Watermarks
di: Hu, Yuepeng, et al.
Pubblicazione: (2024)
di: Hu, Yuepeng, et al.
Pubblicazione: (2024)
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
di: Rastogi, Saksham, et al.
Pubblicazione: (2024)
di: Rastogi, Saksham, et al.
Pubblicazione: (2024)
GCG Attack On A Diffusion LLM
di: Neyroud, Ruben, et al.
Pubblicazione: (2025)
di: Neyroud, Ruben, et al.
Pubblicazione: (2025)
MARAGE: Transferable Multi-Model Adversarial Attack for Retrieval-Augmented Generation Data Extraction
di: Hu, Xiao, et al.
Pubblicazione: (2025)
di: Hu, Xiao, et al.
Pubblicazione: (2025)
Membership Inference Attacks and Privacy in Topic Modeling
di: Manzonelli, Nico, et al.
Pubblicazione: (2024)
di: Manzonelli, Nico, et al.
Pubblicazione: (2024)
User Inference Attacks on Large Language Models
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
di: Guo, Wenkai, et al.
Pubblicazione: (2025)
di: Guo, Wenkai, et al.
Pubblicazione: (2025)
Defending Against Indirect Prompt Injection Attacks With Spotlighting
di: Hines, Keegan, et al.
Pubblicazione: (2024)
di: Hines, Keegan, et al.
Pubblicazione: (2024)
IDT: Dual-Task Adversarial Attacks for Privacy Protection
di: Faustini, Pedro, et al.
Pubblicazione: (2024)
di: Faustini, Pedro, et al.
Pubblicazione: (2024)
Towards More Realistic Extraction Attacks: An Adversarial Perspective
di: More, Yash, et al.
Pubblicazione: (2024)
di: More, Yash, et al.
Pubblicazione: (2024)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
An Early Categorization of Prompt Injection Attacks on Large Language Models
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
di: Brown, Hannah, et al.
Pubblicazione: (2024)
di: Brown, Hannah, et al.
Pubblicazione: (2024)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
di: Chaudhari, Harsh, et al.
Pubblicazione: (2024)
di: Chaudhari, Harsh, et al.
Pubblicazione: (2024)
Blind Baselines Beat Membership Inference Attacks for Foundation Models
di: Das, Debeshee, et al.
Pubblicazione: (2024)
di: Das, Debeshee, et al.
Pubblicazione: (2024)
TFL: Targeted Bit-Flip Attack on Large Language Model
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
Semantic Stealth: Adversarial Text Attacks on NLP Using Several Methods
di: Dey, Roopkatha, et al.
Pubblicazione: (2024)
di: Dey, Roopkatha, et al.
Pubblicazione: (2024)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
di: Li, Qizhang, et al.
Pubblicazione: (2024)
di: Li, Qizhang, et al.
Pubblicazione: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
Enhancing Adversarial Text Attacks on BERT Models with Projected Gradient Descent
di: Waghela, Hetvi, et al.
Pubblicazione: (2024)
di: Waghela, Hetvi, et al.
Pubblicazione: (2024)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
di: Xue, Eric, et al.
Pubblicazione: (2025)
di: Xue, Eric, et al.
Pubblicazione: (2025)
Confidence Elicitation: A New Attack Vector for Large Language Models
di: Formento, Brian, et al.
Pubblicazione: (2025)
di: Formento, Brian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cross-Entropy Attacks to Language Models via Rare Event Simulation
di: Ni, Mingze, et al.
Pubblicazione: (2025) -
Token-Modification Adversarial Attacks for Natural Language Processing: A Survey
di: Roth, Tom, et al.
Pubblicazione: (2021) -
MPAT: Building Robust Deep Neural Networks against Textual Adversarial Attacks
di: Zhang, Fangyuan, et al.
Pubblicazione: (2024) -
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
di: Zhang, Xinyu, et al.
Pubblicazione: (2023) -
The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers
di: Makroo, Owais, et al.
Pubblicazione: (2025)