Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Dang, Trung Cuong, Mohaisen, David |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
por: Liu, Jinbo, et al.
Publicado: (2025)
por: Liu, Jinbo, et al.
Publicado: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
Quantifying Association Capabilities of Large Language Models and Its Implications on Privacy Leakage
por: Shao, Hanyin, et al.
Publicado: (2023)
por: Shao, Hanyin, et al.
Publicado: (2023)
Token-wise Influential Training Data Retrieval for Large Language Models
por: Lin, Huawei, et al.
Publicado: (2024)
por: Lin, Huawei, et al.
Publicado: (2024)
Prefix Probing: Lightweight Harmful Content Detection for Large Language Models
por: Yang, Jirui, et al.
Publicado: (2025)
por: Yang, Jirui, et al.
Publicado: (2025)
Large Language Models in Cybersecurity: Applications, Vulnerabilities, and Defense Techniques
por: Jaffal, Niveen O., et al.
Publicado: (2025)
por: Jaffal, Niveen O., et al.
Publicado: (2025)
Detecting Training Data of Large Language Models via Expectation Maximization
por: Kim, Gyuwan, et al.
Publicado: (2024)
por: Kim, Gyuwan, et al.
Publicado: (2024)
Watermarking Language Models for Many Adaptive Users
por: Cohen, Aloni, et al.
Publicado: (2024)
por: Cohen, Aloni, et al.
Publicado: (2024)
CATMark: A Context-Aware Thresholding Framework for Robust Cross-Task Watermarking in Large Language Models
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
por: Fu, Tingchen, et al.
Publicado: (2024)
por: Fu, Tingchen, et al.
Publicado: (2024)
IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems
por: Wang, Liwen, et al.
Publicado: (2025)
por: Wang, Liwen, et al.
Publicado: (2025)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024)
por: Luo, Weidi, et al.
Publicado: (2024)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
por: Chen, Zhuo, et al.
Publicado: (2024)
por: Chen, Zhuo, et al.
Publicado: (2024)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
por: Chen, Yulong, et al.
Publicado: (2025)
por: Chen, Yulong, et al.
Publicado: (2025)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
por: Cheng, Siyang, et al.
Publicado: (2025)
por: Cheng, Siyang, et al.
Publicado: (2025)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
por: Lv, Huijie, et al.
Publicado: (2024)
por: Lv, Huijie, et al.
Publicado: (2024)
Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models
por: Min, Nay Myat, et al.
Publicado: (2026)
por: Min, Nay Myat, et al.
Publicado: (2026)
ForensicsData: A Digital Forensics Dataset for Large Language Models
por: Chakir, Youssef, et al.
Publicado: (2025)
por: Chakir, Youssef, et al.
Publicado: (2025)
Advancing Beyond Identification: Multi-bit Watermark for Large Language Models
por: Yoo, KiYoon, et al.
Publicado: (2023)
por: Yoo, KiYoon, et al.
Publicado: (2023)
A Content-Based Framework for Cybersecurity Refusal Decisions in Large Language Models
por: Linder, Noa, et al.
Publicado: (2026)
por: Linder, Noa, et al.
Publicado: (2026)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024)
por: Jiang, Tanqiu, et al.
Publicado: (2024)
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
por: Cong, Tianshuo, et al.
Publicado: (2024)
por: Cong, Tianshuo, et al.
Publicado: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
por: Ying, Zonghao, et al.
Publicado: (2025)
por: Ying, Zonghao, et al.
Publicado: (2025)
Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
por: Zhou, Andy, et al.
Publicado: (2025)
por: Zhou, Andy, et al.
Publicado: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
A Curious Case of Searching for the Correlation between Training Data and Adversarial Robustness of Transformer Textual Models
por: Dang, Cuong, et al.
Publicado: (2024)
por: Dang, Cuong, et al.
Publicado: (2024)
SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From
por: Tong, Yao, et al.
Publicado: (2025)
por: Tong, Yao, et al.
Publicado: (2025)
LeakDojo: Decoding the Leakage Threats of RAG Systems
por: Zhang, Maosen, et al.
Publicado: (2026)
por: Zhang, Maosen, et al.
Publicado: (2026)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
por: Gu, Tianle, et al.
Publicado: (2024)
por: Gu, Tianle, et al.
Publicado: (2024)
ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models
por: Owiredu-Ashley, Harry
Publicado: (2026)
por: Owiredu-Ashley, Harry
Publicado: (2026)
Are All Prompt Components Value-Neutral? Understanding the Heterogeneous Adversarial Robustness of Dissected Prompt in Large Language Models
por: Zheng, Yujia, et al.
Publicado: (2025)
por: Zheng, Yujia, et al.
Publicado: (2025)
Automating Prompt Leakage Attacks on Large Language Models Using Agentic Approach
por: Sternak, Tvrtko, et al.
Publicado: (2025)
por: Sternak, Tvrtko, et al.
Publicado: (2025)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
por: Yu, Yongcan, et al.
Publicado: (2025)
por: Yu, Yongcan, et al.
Publicado: (2025)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
por: Bai, Yang, et al.
Publicado: (2024)
por: Bai, Yang, et al.
Publicado: (2024)
Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting
por: To, Bang Trinh Tran, et al.
Publicado: (2025)
por: To, Bang Trinh Tran, et al.
Publicado: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
por: Zhu, Sicheng, et al.
Publicado: (2024)
por: Zhu, Sicheng, et al.
Publicado: (2024)
ParaVul: A Parallel Large Language Model and Retrieval-Augmented Framework for Smart Contract Vulnerability Detection
por: Huang, Tenghui, et al.
Publicado: (2025)
por: Huang, Tenghui, et al.
Publicado: (2025)
Empirical Evaluation of Concept Drift in ML-Based Android Malware Detection
por: Sabbah, Ahmed, et al.
Publicado: (2025)
por: Sabbah, Ahmed, et al.
Publicado: (2025)
Ejemplares similares
-
Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
por: Liu, Jinbo, et al.
Publicado: (2025) -
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
por: Zhao, Jiawei, et al.
Publicado: (2024) -
Quantifying Association Capabilities of Large Language Models and Its Implications on Privacy Leakage
por: Shao, Hanyin, et al.
Publicado: (2023) -
Token-wise Influential Training Data Retrieval for Large Language Models
por: Lin, Huawei, et al.
Publicado: (2024) -
Prefix Probing: Lightweight Harmful Content Detection for Large Language Models
por: Yang, Jirui, et al.
Publicado: (2025)