Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Struppek, Lukas, Gleave, Adam, Pelrine, Kellin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploiting Novel GPT-4 APIs
par: Pelrine, Kellin, et autres
Publié: (2023)
par: Pelrine, Kellin, et autres
Publié: (2023)
Scaling Trends for Data Poisoning in LLMs
par: Bowen, Dillon, et autres
Publié: (2024)
par: Bowen, Dillon, et autres
Publié: (2024)
Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility
par: Murphy, Brendan, et autres
Publié: (2025)
par: Murphy, Brendan, et autres
Publié: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
par: Gibbs, Tom, et autres
Publié: (2024)
par: Gibbs, Tom, et autres
Publié: (2024)
Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
Systematically Analyzing Prompt Injection Vulnerabilities in Diverse LLM Architectures
par: Benjamin, Victoria, et autres
Publié: (2024)
par: Benjamin, Victoria, et autres
Publié: (2024)
GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
par: Li, Xueyi, et autres
Publié: (2026)
par: Li, Xueyi, et autres
Publié: (2026)
A Large-Scale Empirical Analysis of Custom GPTs' Vulnerabilities in the OpenAI Ecosystem
par: Ogundoyin, Sunday Oyinlola, et autres
Publié: (2025)
par: Ogundoyin, Sunday Oyinlola, et autres
Publié: (2025)
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
par: Vega, Jason, et autres
Publié: (2023)
par: Vega, Jason, et autres
Publié: (2023)
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
par: Liu, Fuqiang, et autres
Publié: (2024)
par: Liu, Fuqiang, et autres
Publié: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
Automated Software Vulnerability Static Code Analysis Using Generative Pre-Trained Transformer Models
par: Pelofske, Elijah, et autres
Publié: (2024)
par: Pelofske, Elijah, et autres
Publié: (2024)
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards
par: Pandey, Punya Syon, et autres
Publié: (2025)
par: Pandey, Punya Syon, et autres
Publié: (2025)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
par: Sitawarin, Chawin, et autres
Publié: (2024)
par: Sitawarin, Chawin, et autres
Publié: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Scaling Trends in Language Model Robustness
par: Howe, Nikolaus, et autres
Publié: (2024)
par: Howe, Nikolaus, et autres
Publié: (2024)
Every Character Counts: From Vulnerability to Defense in Phishing Detection
par: Chiper, Maria, et autres
Publié: (2025)
par: Chiper, Maria, et autres
Publié: (2025)
Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion
par: Wang, Guanchu, et autres
Publié: (2024)
par: Wang, Guanchu, et autres
Publié: (2024)
Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities
par: Khattar, Vanshaj, et autres
Publié: (2026)
par: Khattar, Vanshaj, et autres
Publié: (2026)
Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers
par: Zhao, Andrew, et autres
Publié: (2025)
par: Zhao, Andrew, et autres
Publié: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
par: Lin, Shi, et autres
Publié: (2024)
par: Lin, Shi, et autres
Publié: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
par: Chang, Hongyan, et autres
Publié: (2024)
par: Chang, Hongyan, et autres
Publié: (2024)
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
par: Shetty, Anudeex, et autres
Publié: (2026)
par: Shetty, Anudeex, et autres
Publié: (2026)
Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
par: Tang, Haochun, et autres
Publié: (2026)
par: Tang, Haochun, et autres
Publié: (2026)
SVIP: Towards Verifiable Inference of Open-source Large Language Models
par: Sun, Yifan, et autres
Publié: (2024)
par: Sun, Yifan, et autres
Publié: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
par: Hu, Xiaomeng, et autres
Publié: (2024)
par: Hu, Xiaomeng, et autres
Publié: (2024)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
par: Bai, Yang, et autres
Publié: (2024)
par: Bai, Yang, et autres
Publié: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
par: Li, Xiao, et autres
Publié: (2024)
par: Li, Xiao, et autres
Publié: (2024)
Beyond Gradient and Priors in Privacy Attacks: Leveraging Pooler Layer Inputs of Language Models in Federated Learning
par: Li, Jianwei, et autres
Publié: (2023)
par: Li, Jianwei, et autres
Publié: (2023)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
par: Liu, Yupei, et autres
Publié: (2023)
par: Liu, Yupei, et autres
Publié: (2023)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
par: Ahmed, Mohamed, et autres
Publié: (2025)
par: Ahmed, Mohamed, et autres
Publié: (2025)
Weight space Detection of Backdoors in LoRA Adapters
par: Merenciano, David Puertolas, et autres
Publié: (2026)
par: Merenciano, David Puertolas, et autres
Publié: (2026)
GaussMark: A Practical Approach for Structural Watermarking of Language Models
par: Block, Adam, et autres
Publié: (2025)
par: Block, Adam, et autres
Publié: (2025)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023)
par: Mehrotra, Anay, et autres
Publié: (2023)
Federated Learning Under Attack: Exposing Vulnerabilities through Data Poisoning Attacks in Computer Networks
par: Nowroozi, Ehsan, et autres
Publié: (2024)
par: Nowroozi, Ehsan, et autres
Publié: (2024)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
par: Xu, Yijie, et autres
Publié: (2025)
par: Xu, Yijie, et autres
Publié: (2025)
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
par: Fang, Zhicheng, et autres
Publié: (2026)
par: Fang, Zhicheng, et autres
Publié: (2026)
REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2026)
par: Liang, Buyun, et autres
Publié: (2026)
Documents similaires
-
Exploiting Novel GPT-4 APIs
par: Pelrine, Kellin, et autres
Publié: (2023) -
Scaling Trends for Data Poisoning in LLMs
par: Bowen, Dillon, et autres
Publié: (2024) -
Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility
par: Murphy, Brendan, et autres
Publié: (2025) -
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
par: Gibbs, Tom, et autres
Publié: (2024) -
Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis
par: Zhang, Haoyu, et autres
Publié: (2026)