PromptLocate: Localizing Prompt Injection Attacks

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Jia, Yuqi, Liu, Yupei, Shao, Zedian, Jia, Jinyuan, Gong, Neil
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866908598446063616
author Jia, Yuqi
Liu, Yupei
Shao, Zedian
Jia, Jinyuan
Gong, Neil
author_facet Jia, Yuqi
Liu, Yupei
Shao, Zedian
Jia, Jinyuan
Gong, Neil
contents Prompt injection attacks deceive a large language model into completing an attacker-specified task instead of its intended task by contaminating its input data with an injected prompt, which consists of injected instruction(s) and data. Localizing the injected prompt within contaminated data is crucial for post-attack forensic analysis and data recovery. Despite its growing importance, prompt injection localization remains largely unexplored. In this work, we bridge this gap by proposing PromptLocate, the first method for localizing injected prompts. PromptLocate comprises three steps: (1) splitting the contaminated data into semantically coherent segments, (2) identifying segments contaminated by injected instructions, and (3) pinpointing segments contaminated by injected data. We show PromptLocate accurately localizes injected prompts across eight existing and eight adaptive attacks.
format Preprint
id arxiv_https___arxiv_org_abs_2510_12252
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle PromptLocate: Localizing Prompt Injection Attacks
Jia, Yuqi
Liu, Yupei
Shao, Zedian
Jia, Jinyuan
Gong, Neil
Cryptography and Security
Artificial Intelligence
Prompt injection attacks deceive a large language model into completing an attacker-specified task instead of its intended task by contaminating its input data with an injected prompt, which consists of injected instruction(s) and data. Localizing the injected prompt within contaminated data is crucial for post-attack forensic analysis and data recovery. Despite its growing importance, prompt injection localization remains largely unexplored. In this work, we bridge this gap by proposing PromptLocate, the first method for localizing injected prompts. PromptLocate comprises three steps: (1) splitting the contaminated data into semantically coherent segments, (2) identifying segments contaminated by injected instructions, and (3) pinpointing segments contaminated by injected data. We show PromptLocate accurately localizes injected prompts across eight existing and eight adaptive attacks.
title PromptLocate: Localizing Prompt Injection Attacks
topic Cryptography and Security
Artificial Intelligence
url https://arxiv.org/abs/2510.12252