SSCAE -- Semantic, Syntactic, and Context-aware natural language Adversarial Examples generator
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Asl, Javad Rafiei, Rafiei, Mohammad H., Alohaly, Manar, Takabi, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks
par: Asl, Javad Rafiei, et autres
Publié: (2025)
par: Asl, Javad Rafiei, et autres
Publié: (2025)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
par: Narula, Sidhant, et autres
Publié: (2025)
par: Narula, Sidhant, et autres
Publié: (2025)
RobustSentEmbed: Robust Sentence Embeddings Using Adversarial Self-Supervised Contrastive Learning
par: Asl, Javad Rafiei, et autres
Publié: (2024)
par: Asl, Javad Rafiei, et autres
Publié: (2024)
MOFHEI: Model Optimizing Framework for Fast and Efficient Homomorphically Encrypted Neural Network Inference
par: Ghazvinian, Parsa, et autres
Publié: (2024)
par: Ghazvinian, Parsa, et autres
Publié: (2024)
Saliency Attention and Semantic Similarity-Driven Adversarial Perturbation
par: Waghela, Hetvi, et autres
Publié: (2024)
par: Waghela, Hetvi, et autres
Publié: (2024)
Privacy Challenges in Meta-Learning: An Investigation on Model-Agnostic Meta-Learning
par: Rafiei, Mina, et autres
Publié: (2024)
par: Rafiei, Mina, et autres
Publié: (2024)
SoK: Privacy Preserving Machine Learning using Functional Encryption: Opportunities and Challenges
par: Panzade, Prajwal, et autres
Publié: (2022)
par: Panzade, Prajwal, et autres
Publié: (2022)
Hijacking Large Language Models via Adversarial In-Context Learning
par: Zhou, Xiangyu, et autres
Publié: (2023)
par: Zhou, Xiangyu, et autres
Publié: (2023)
TaeBench: Improving Quality of Toxic Adversarial Examples
par: Zhu, Xuan, et autres
Publié: (2024)
par: Zhu, Xuan, et autres
Publié: (2024)
Semantic Stealth: Adversarial Text Attacks on NLP Using Several Methods
par: Dey, Roopkatha, et autres
Publié: (2024)
par: Dey, Roopkatha, et autres
Publié: (2024)
Adversarial Decoding: Generating Readable Documents for Adversarial Objectives
par: Zhang, Collin, et autres
Publié: (2024)
par: Zhang, Collin, et autres
Publié: (2024)
MedBlindTuner: Towards Privacy-preserving Fine-tuning on Biomedical Images with Transformers and Fully Homomorphic Encryption
par: Panzade, Prajwal, et autres
Publié: (2024)
par: Panzade, Prajwal, et autres
Publié: (2024)
Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against
par: Enkhbayar, Tsogt-Ochir
Publié: (2025)
par: Enkhbayar, Tsogt-Ochir
Publié: (2025)
Constructing Semantics-Aware Adversarial Examples with a Probabilistic Perspective
par: Zhang, Andi, et autres
Publié: (2023)
par: Zhang, Andi, et autres
Publié: (2023)
Graded Suspiciousness of Adversarial Texts to Human
par: Tonni, Shakila Mahjabin, et autres
Publié: (2024)
par: Tonni, Shakila Mahjabin, et autres
Publié: (2024)
Transcending Adversarial Perturbations: Manifold-Aided Adversarial Examples with Legitimate Semantics
par: Li, Shuai, et autres
Publié: (2024)
par: Li, Shuai, et autres
Publié: (2024)
Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry
par: Lan, Wenhao, et autres
Publié: (2026)
par: Lan, Wenhao, et autres
Publié: (2026)
IDT: Dual-Task Adversarial Attacks for Privacy Protection
par: Faustini, Pedro, et autres
Publié: (2024)
par: Faustini, Pedro, et autres
Publié: (2024)
Towards More Realistic Extraction Attacks: An Adversarial Perspective
par: More, Yash, et autres
Publié: (2024)
par: More, Yash, et autres
Publié: (2024)
Releasing Differentially Private Event Logs Using Generative Models
par: Wangelik, Frederik, et autres
Publié: (2025)
par: Wangelik, Frederik, et autres
Publié: (2025)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
par: Brown, Hannah, et autres
Publié: (2024)
par: Brown, Hannah, et autres
Publié: (2024)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
par: Biswas, Sajib, et autres
Publié: (2025)
par: Biswas, Sajib, et autres
Publié: (2025)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
par: Li, Qizhang, et autres
Publié: (2024)
par: Li, Qizhang, et autres
Publié: (2024)
Token-Modification Adversarial Attacks for Natural Language Processing: A Survey
par: Roth, Tom, et autres
Publié: (2021)
par: Roth, Tom, et autres
Publié: (2021)
Enhancing Adversarial Text Attacks on BERT Models with Projected Gradient Descent
par: Waghela, Hetvi, et autres
Publié: (2024)
par: Waghela, Hetvi, et autres
Publié: (2024)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
Image Hijacks: Adversarial Images can Control Generative Models at Runtime
par: Bailey, Luke, et autres
Publié: (2023)
par: Bailey, Luke, et autres
Publié: (2023)
Learning diverse attacks on large language models for robust red-teaming and safety tuning
par: Lee, Seanie, et autres
Publié: (2024)
par: Lee, Seanie, et autres
Publié: (2024)
Private prediction for large-scale synthetic text generation
par: Amin, Kareem, et autres
Publié: (2024)
par: Amin, Kareem, et autres
Publié: (2024)
A Modified Word Saliency-Based Adversarial Attack on Text Classification Models
par: Waghela, Hetvi, et autres
Publié: (2024)
par: Waghela, Hetvi, et autres
Publié: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
MPAT: Building Robust Deep Neural Networks against Textual Adversarial Attacks
par: Zhang, Fangyuan, et autres
Publié: (2024)
par: Zhang, Fangyuan, et autres
Publié: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
Detecting Adversarial Examples
par: Mumcu, Furkan, et autres
Publié: (2024)
par: Mumcu, Furkan, et autres
Publié: (2024)
Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
par: Kaneko, Masahiro, et autres
Publié: (2025)
par: Kaneko, Masahiro, et autres
Publié: (2025)
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
par: Zhang, Xinyu, et autres
Publié: (2023)
par: Zhang, Xinyu, et autres
Publié: (2023)
Humanizing Machine-Generated Content: Evading AI-Text Detection through Adversarial Attack
par: Zhou, Ying, et autres
Publié: (2024)
par: Zhou, Ying, et autres
Publié: (2024)
MARAGE: Transferable Multi-Model Adversarial Attack for Retrieval-Augmented Generation Data Extraction
par: Hu, Xiao, et autres
Publié: (2025)
par: Hu, Xiao, et autres
Publié: (2025)
Graphene: Infrastructure Security Posture Analysis with AI-generated Attack Graphs
par: Jin, Xin, et autres
Publié: (2023)
par: Jin, Xin, et autres
Publié: (2023)
Documents similaires
-
NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks
par: Asl, Javad Rafiei, et autres
Publié: (2025) -
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
par: Narula, Sidhant, et autres
Publié: (2025) -
RobustSentEmbed: Robust Sentence Embeddings Using Adversarial Self-Supervised Contrastive Learning
par: Asl, Javad Rafiei, et autres
Publié: (2024) -
MOFHEI: Model Optimizing Framework for Fast and Efficient Homomorphically Encrypted Neural Network Inference
par: Ghazvinian, Parsa, et autres
Publié: (2024) -
Saliency Attention and Semantic Similarity-Driven Adversarial Perturbation
par: Waghela, Hetvi, et autres
Publié: (2024)