Special-Character Adversarial Attacks on Open-Source Language Model
Fuente:
arXiv
Guardado en:
| Autor principal: | Sarabamoun, Ephraiem |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Ensemble Debates with Local Large Language Models for AI Alignment
por: Sarabamoun, Ephraiem
Publicado: (2025)
por: Sarabamoun, Ephraiem
Publicado: (2025)
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
por: Jha, Pranav K
Publicado: (2025)
por: Jha, Pranav K
Publicado: (2025)
Cloud-based XAI Services for Assessing Open Repository Models Under Adversarial Attacks
por: Wang, Zerui, et al.
Publicado: (2024)
por: Wang, Zerui, et al.
Publicado: (2024)
Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey
por: Jain, Bhavuk, et al.
Publicado: (2026)
por: Jain, Bhavuk, et al.
Publicado: (2026)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
por: Bai, Yang, et al.
Publicado: (2024)
por: Bai, Yang, et al.
Publicado: (2024)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
por: Ma, Siyuan, et al.
Publicado: (2024)
por: Ma, Siyuan, et al.
Publicado: (2024)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
por: Ma, Jiachen, et al.
Publicado: (2024)
por: Ma, Jiachen, et al.
Publicado: (2024)
VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models
por: Liu, Pang, et al.
Publicado: (2026)
por: Liu, Pang, et al.
Publicado: (2026)
Medical Multimodal Model Stealing Attacks via Adversarial Domain Alignment
por: Shen, Yaling, et al.
Publicado: (2025)
por: Shen, Yaling, et al.
Publicado: (2025)
DiffAttack: Evasion Attacks Against Diffusion-Based Adversarial Purification
por: Kang, Mintong, et al.
Publicado: (2023)
por: Kang, Mintong, et al.
Publicado: (2023)
Fast Adversarial Attacks on Language Models In One GPU Minute
por: Sadasivan, Vinu Sankar, et al.
Publicado: (2024)
por: Sadasivan, Vinu Sankar, et al.
Publicado: (2024)
Integrated Simulation Framework for Adversarial Attacks on Autonomous Vehicles
por: Anagnostopoulos, Christos, et al.
Publicado: (2025)
por: Anagnostopoulos, Christos, et al.
Publicado: (2025)
Explainer-guided Targeted Adversarial Attacks against Binary Code Similarity Detection Models
por: Chen, Mingjie, et al.
Publicado: (2025)
por: Chen, Mingjie, et al.
Publicado: (2025)
Multi-task Adversarial Attacks against Black-box Model with Few-shot Queries
por: Wang, Wenqiang, et al.
Publicado: (2025)
por: Wang, Wenqiang, et al.
Publicado: (2025)
Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
por: Chang, Chen-Wei, et al.
Publicado: (2025)
por: Chang, Chen-Wei, et al.
Publicado: (2025)
Provably Robust Watermarks for Open-Source Language Models
por: Christ, Miranda, et al.
Publicado: (2024)
por: Christ, Miranda, et al.
Publicado: (2024)
Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System
por: Dobrovolskyi, Ivan
Publicado: (2026)
por: Dobrovolskyi, Ivan
Publicado: (2026)
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
por: Domico, Kyle, et al.
Publicado: (2025)
por: Domico, Kyle, et al.
Publicado: (2025)
Explainable but Vulnerable: Adversarial Attacks on XAI Explanation in Cybersecurity Applications
por: Mia, Maraz, et al.
Publicado: (2025)
por: Mia, Maraz, et al.
Publicado: (2025)
Enhancing TinyML Security: Study of Adversarial Attack Transferability
por: Shah, Parin, et al.
Publicado: (2024)
por: Shah, Parin, et al.
Publicado: (2024)
Attention Masks Help Adversarial Attacks to Bypass Safety Detectors
por: Shi, Yunfan
Publicado: (2024)
por: Shi, Yunfan
Publicado: (2024)
Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models
por: Chen, Linzhi, et al.
Publicado: (2025)
por: Chen, Linzhi, et al.
Publicado: (2025)
A Survey of Attacks on Large Language Models
por: Xu, Wenrui, et al.
Publicado: (2025)
por: Xu, Wenrui, et al.
Publicado: (2025)
Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
por: Yuan, Leitao, et al.
Publicado: (2026)
por: Yuan, Leitao, et al.
Publicado: (2026)
Evaluating Adversarial Vulnerabilities in Modern Large Language Models
por: Perel, Tom
Publicado: (2025)
por: Perel, Tom
Publicado: (2025)
Adversarial attacks against Modern Vision-Language Models
por: La Torre, Alejandro Paredes
Publicado: (2026)
por: La Torre, Alejandro Paredes
Publicado: (2026)
TEAM: Temporal Adversarial Examples Attack Model against Network Intrusion Detection System Applied to RNN
por: Liu, Ziyi, et al.
Publicado: (2024)
por: Liu, Ziyi, et al.
Publicado: (2024)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
por: Park, Junyoung, et al.
Publicado: (2026)
por: Park, Junyoung, et al.
Publicado: (2026)
Vulnerability Disclosure through Adaptive Black-Box Adversarial Attacks on NIDS
por: Ennaji, Sabrine, et al.
Publicado: (2025)
por: Ennaji, Sabrine, et al.
Publicado: (2025)
Foe for Fraud: Transferable Adversarial Attacks in Credit Card Fraud Detection
por: Fok, Jan Lum, et al.
Publicado: (2025)
por: Fok, Jan Lum, et al.
Publicado: (2025)
Energy-Latency Attacks: A New Adversarial Threat to Deep Learning
por: Meftah, Hanene F. Z. Brachemi, et al.
Publicado: (2025)
por: Meftah, Hanene F. Z. Brachemi, et al.
Publicado: (2025)
LLM-Driven Feature-Level Adversarial Attacks on Android Malware Detectors
por: Lan, Tianwei, et al.
Publicado: (2025)
por: Lan, Tianwei, et al.
Publicado: (2025)
MATRA: Modeling the Attack Surface of Agentic AI Systems -- OpenClaw Case Study
por: Van hamme, Tim, et al.
Publicado: (2026)
por: Van hamme, Tim, et al.
Publicado: (2026)
Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
por: Li, Qinfeng, et al.
Publicado: (2025)
por: Li, Qinfeng, et al.
Publicado: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
por: Li, Jie, et al.
Publicado: (2024)
por: Li, Jie, et al.
Publicado: (2024)
Imposter.AI: Adversarial Attacks with Hidden Intentions towards Aligned Large Language Models
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
Concept-Guided Backdoor Attack on Vision Language Models
por: Shen, Haoyu, et al.
Publicado: (2025)
por: Shen, Haoyu, et al.
Publicado: (2025)
Membership Inference Attacks Against Vision-Language Models
por: Hu, Yuke, et al.
Publicado: (2025)
por: Hu, Yuke, et al.
Publicado: (2025)
Membership Inference Attacks on Tokenizers of Large Language Models
por: Tong, Meng, et al.
Publicado: (2025)
por: Tong, Meng, et al.
Publicado: (2025)
Optimizing Adaptive Attacks against Watermarks for Language Models
por: Diaa, Abdulrahman, et al.
Publicado: (2024)
por: Diaa, Abdulrahman, et al.
Publicado: (2024)
Ejemplares similares
-
Ensemble Debates with Local Large Language Models for AI Alignment
por: Sarabamoun, Ephraiem
Publicado: (2025) -
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
por: Jha, Pranav K
Publicado: (2025) -
Cloud-based XAI Services for Assessing Open Repository Models Under Adversarial Attacks
por: Wang, Zerui, et al.
Publicado: (2024) -
Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey
por: Jain, Bhavuk, et al.
Publicado: (2026) -
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
por: Bai, Yang, et al.
Publicado: (2024)