Prefix Probing: Lightweight Harmful Content Detection for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Jirui, Guo, Hengqi, Lu, Zhihui, Zhao, Yi, Zhang, Yuansen, Hu, Shijing, Duan, Qiang, Wang, Yinggui, Wei, Tao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quantifying Privacy Leakage in Split Inference via Fisher-Approximated Shannon Information Analysis
by: Deng, Ruijun, et al.
Published: (2025)
by: Deng, Ruijun, et al.
Published: (2025)
Can LLM Infer Risk Information From MCP Server System Logs?
by: Fu, Jiayi, et al.
Published: (2025)
by: Fu, Jiayi, et al.
Published: (2025)
CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation
by: Yang, Jirui, et al.
Published: (2025)
by: Yang, Jirui, et al.
Published: (2025)
Supporting Human Raters with the Detection of Harmful Content using Large Language Models
by: Thomas, Kurt, et al.
Published: (2024)
by: Thomas, Kurt, et al.
Published: (2024)
UIFV: Data Reconstruction Attack in Vertical Federated Learning
by: Yang, Jirui, et al.
Published: (2024)
by: Yang, Jirui, et al.
Published: (2024)
N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
by: Lin, Zheyu, et al.
Published: (2025)
by: Lin, Zheyu, et al.
Published: (2025)
Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
by: Liu, Yuansen, et al.
Published: (2026)
by: Liu, Yuansen, et al.
Published: (2026)
Backdoor Attack on Vertical Federated Graph Neural Network Learning
by: Yang, Jirui, et al.
Published: (2024)
by: Yang, Jirui, et al.
Published: (2024)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
by: Chen, Yulong, et al.
Published: (2025)
by: Chen, Yulong, et al.
Published: (2025)
Information Leakage from Embedding in Large Language Models
by: Wan, Zhipeng, et al.
Published: (2024)
by: Wan, Zhipeng, et al.
Published: (2024)
A Fast, Performant, Secure Distributed Training Framework For Large Language Model
by: Huang, Wei, et al.
Published: (2024)
by: Huang, Wei, et al.
Published: (2024)
Privacy-Preserving End-to-End Spoken Language Understanding
by: Wang, Yinggui, et al.
Published: (2024)
by: Wang, Yinggui, et al.
Published: (2024)
PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement
by: Yue, Xubin, et al.
Published: (2025)
by: Yue, Xubin, et al.
Published: (2025)
Efficient Jailbreaking of Large Models by Freeze Training: Lower Layers Exhibit Greater Sensitivity to Harmful Content
by: Shen, Hongyuan, et al.
Published: (2025)
by: Shen, Hongyuan, et al.
Published: (2025)
Segment-Level Coherence for Robust Harmful Intent Probing in LLMs
by: He, Xuanli, et al.
Published: (2026)
by: He, Xuanli, et al.
Published: (2026)
InfoDecom: Decomposing Information for Defending Against Privacy Leakage in Split Inference
by: Deng, Ruijun, et al.
Published: (2025)
by: Deng, Ruijun, et al.
Published: (2025)
Outside the Comfort Zone: Analysing LLM Capabilities in Software Vulnerability Detection
by: Guo, Yuejun, et al.
Published: (2024)
by: Guo, Yuejun, et al.
Published: (2024)
GridSE: Towards Practical Secure Geographic Search via Prefix Symmetric Searchable Encryption (Full Version)
by: Guo, Ruoyang, et al.
Published: (2024)
by: Guo, Ruoyang, et al.
Published: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
by: Zhao, Jiawei, et al.
Published: (2024)
by: Zhao, Jiawei, et al.
Published: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
by: Lv, Huijie, et al.
Published: (2024)
by: Lv, Huijie, et al.
Published: (2024)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
by: Yi, Biao, et al.
Published: (2025)
by: Yi, Biao, et al.
Published: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
by: Chen, Yulin, et al.
Published: (2024)
by: Chen, Yulin, et al.
Published: (2024)
AgentGuard: A Multi-Agent Framework for Robust Package Confusion Detection via Hybrid Search and Metadata-Content Fusion
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
by: Liu, Yuexiao, et al.
Published: (2025)
by: Liu, Yuexiao, et al.
Published: (2025)
Measuring Copyright Risks of Large Language Model via Partial Information Probing
by: Zhao, Weijie, et al.
Published: (2024)
by: Zhao, Weijie, et al.
Published: (2024)
Patronus: Identifying and Mitigating Transferable Backdoors in Pre-trained Language Models
by: Zhao, Tianhang, et al.
Published: (2025)
by: Zhao, Tianhang, et al.
Published: (2025)
ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark
by: Liu, Kangwei, et al.
Published: (2025)
by: Liu, Kangwei, et al.
Published: (2025)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
by: Yang, Fan
Published: (2025)
by: Yang, Fan
Published: (2025)
Lightweight Fault Detection Architecture for NTT on FPGA
by: Paul, Rourab, et al.
Published: (2025)
by: Paul, Rourab, et al.
Published: (2025)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
by: Hu, Xiaomeng, et al.
Published: (2024)
by: Hu, Xiaomeng, et al.
Published: (2024)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
by: Huang, Tiansheng, et al.
Published: (2024)
by: Huang, Tiansheng, et al.
Published: (2024)
Fast and Lightweight Backdoor Detection via Head Random Probing
by: Yu, Yinbo, et al.
Published: (2026)
by: Yu, Yinbo, et al.
Published: (2026)
PSY: Posterior Sampling Based Privacy Enhancer in Large Language Models
by: Sun, Yulian, et al.
Published: (2024)
by: Sun, Yulian, et al.
Published: (2024)
Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential
by: Akiri, Charankumar, et al.
Published: (2025)
by: Akiri, Charankumar, et al.
Published: (2025)
Prefix Siphoning: Exploiting LSM-Tree Range Filters For Information Disclosure (Full Version)
by: Kaufman, Adi, et al.
Published: (2023)
by: Kaufman, Adi, et al.
Published: (2023)
DPTraj-PM: Differentially Private Trajectory Synthesis Using Prefix Tree and Markov Process
by: Wang, Nana, et al.
Published: (2024)
by: Wang, Nana, et al.
Published: (2024)
Oblivionis: A Lightweight Learning and Unlearning Framework for Federated Large Language Models
by: Zhang, Fuyao, et al.
Published: (2025)
by: Zhang, Fuyao, et al.
Published: (2025)
Unbundle-Rewrite-Rebundle: Runtime Detection and Rewriting of Privacy-Harming Code in JavaScript Bundles
by: Ali, Mir Masood, et al.
Published: (2024)
by: Ali, Mir Masood, et al.
Published: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
by: Zhang, Shenyi, et al.
Published: (2025)
by: Zhang, Shenyi, et al.
Published: (2025)
Similar Items
-
Quantifying Privacy Leakage in Split Inference via Fisher-Approximated Shannon Information Analysis
by: Deng, Ruijun, et al.
Published: (2025) -
Can LLM Infer Risk Information From MCP Server System Logs?
by: Fu, Jiayi, et al.
Published: (2025) -
CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation
by: Yang, Jirui, et al.
Published: (2025) -
Supporting Human Raters with the Detection of Harmful Content using Large Language Models
by: Thomas, Kurt, et al.
Published: (2024) -
UIFV: Data Reconstruction Attack in Vertical Federated Learning
by: Yang, Jirui, et al.
Published: (2024)