Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Weichao, Zhang, Ruqing, Guo, Jiafeng, de Rijke, Maarten, Fan, Yixing, Cheng, Xueqi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-granular Adversarial Attacks against Black-box Neural Ranking Models
by: Liu, Yu-An, et al.
Published: (2024)
by: Liu, Yu-An, et al.
Published: (2024)
Detecting Pretraining Data from Large Language Models
by: Shi, Weijia, et al.
Published: (2023)
by: Shi, Weijia, et al.
Published: (2023)
Are Large Language Models Good at Utility Judgments?
by: Zhang, Hengran, et al.
Published: (2024)
by: Zhang, Hengran, et al.
Published: (2024)
Robust Neural Information Retrieval: An Adversarial and Out-of-distribution Perspective
by: Liu, Yu-An, et al.
Published: (2024)
by: Liu, Yu-An, et al.
Published: (2024)
CorpusBrain++: A Continual Generative Pre-Training Framework for Knowledge-Intensive Language Tasks
by: Guo, Jiafeng, et al.
Published: (2024)
by: Guo, Jiafeng, et al.
Published: (2024)
Tag&Tab: Pretraining Data Detection in Large Language Models Using Keyword-Based Membership Inference Attack
by: Antebi, Sagiv, et al.
Published: (2025)
by: Antebi, Sagiv, et al.
Published: (2025)
Attack-in-the-Chain: Bootstrapping Large Language Models for Attacks Against Black-box Neural Ranking Models
by: Liu, Yu-An, et al.
Published: (2024)
by: Liu, Yu-An, et al.
Published: (2024)
Continual Pretraining on Encrypted Synthetic Data for Privacy-Preserving LLMs
by: Liu, Honghao, et al.
Published: (2026)
by: Liu, Honghao, et al.
Published: (2026)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Data Defenses Against Large Language Models
by: Agnew, William, et al.
Published: (2024)
by: Agnew, William, et al.
Published: (2024)
Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
by: Li, Haoran, et al.
Published: (2024)
by: Li, Haoran, et al.
Published: (2024)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
by: Zhang, Anqi, et al.
Published: (2024)
by: Zhang, Anqi, et al.
Published: (2024)
On the Capacity of Citation Generation by Large Language Models
by: Qian, Haosheng, et al.
Published: (2024)
by: Qian, Haosheng, et al.
Published: (2024)
Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting Framework
by: Chen, Lu, et al.
Published: (2024)
by: Chen, Lu, et al.
Published: (2024)
Prompt Stealing Attacks Against Large Language Models
by: Sha, Zeyang, et al.
Published: (2024)
by: Sha, Zeyang, et al.
Published: (2024)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
by: Zheng, JiaYing, et al.
Published: (2024)
by: Zheng, JiaYing, et al.
Published: (2024)
Watermarking Large Language Models and the Generated Content: Opportunities and Challenges
by: Zhang, Ruisi, et al.
Published: (2024)
by: Zhang, Ruisi, et al.
Published: (2024)
TFL: Targeted Bit-Flip Attack on Large Language Model
by: Guo, Jingkai, et al.
Published: (2026)
by: Guo, Jingkai, et al.
Published: (2026)
Yet Another Watermark for Large Language Models
by: Bao, Siyuan, et al.
Published: (2025)
by: Bao, Siyuan, et al.
Published: (2025)
Majority Bit-Aware Watermarking For Large Language Models
by: Xu, Jiahao, et al.
Published: (2025)
by: Xu, Jiahao, et al.
Published: (2025)
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
by: Cheng, Pengzhou, et al.
Published: (2024)
by: Cheng, Pengzhou, et al.
Published: (2024)
SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
by: Guo, Jingkai, et al.
Published: (2025)
by: Guo, Jingkai, et al.
Published: (2025)
EmMark: Robust Watermarks for IP Protection of Embedded Quantized Large Language Models
by: Zhang, Ruisi, et al.
Published: (2024)
by: Zhang, Ruisi, et al.
Published: (2024)
Prompt Public Large Language Models to Synthesize Data for Private On-device Applications
by: Wu, Shanshan, et al.
Published: (2024)
by: Wu, Shanshan, et al.
Published: (2024)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
by: Chen, Zhuo, et al.
Published: (2024)
by: Chen, Zhuo, et al.
Published: (2024)
Copyright Traps for Large Language Models
by: Meeus, Matthieu, et al.
Published: (2024)
by: Meeus, Matthieu, et al.
Published: (2024)
From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification
by: Zhang, Hengran, et al.
Published: (2023)
by: Zhang, Hengran, et al.
Published: (2023)
Does Generative Retrieval Overcome the Limitations of Dense Retrieval?
by: Zhang, Yingchen, et al.
Published: (2025)
by: Zhang, Yingchen, et al.
Published: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Towards Safe AI Clinicians: A Comprehensive Study on Large Language Model Jailbreaking in Healthcare
by: Zhang, Hang, et al.
Published: (2025)
by: Zhang, Hang, et al.
Published: (2025)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
by: Zhang, Junbo, et al.
Published: (2025)
by: Zhang, Junbo, et al.
Published: (2025)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory
by: Fan, Wei, et al.
Published: (2024)
by: Fan, Wei, et al.
Published: (2024)
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
by: Zhang, Ruisi, et al.
Published: (2023)
by: Zhang, Ruisi, et al.
Published: (2023)
Resource Consumption Red-Teaming for Large Vision-Language Models
by: Gao, Haoran, et al.
Published: (2025)
by: Gao, Haoran, et al.
Published: (2025)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
by: Yu, Zhiyuan, et al.
Published: (2024)
by: Yu, Zhiyuan, et al.
Published: (2024)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
by: Li, Haoran, et al.
Published: (2023)
by: Li, Haoran, et al.
Published: (2023)
Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models
by: Huo, Mingjia, et al.
Published: (2024)
by: Huo, Mingjia, et al.
Published: (2024)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
by: Wu, Jialin, et al.
Published: (2025)
by: Wu, Jialin, et al.
Published: (2025)
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
by: Wu, Yihan, et al.
Published: (2023)
by: Wu, Yihan, et al.
Published: (2023)
Similar Items
-
Multi-granular Adversarial Attacks against Black-box Neural Ranking Models
by: Liu, Yu-An, et al.
Published: (2024) -
Detecting Pretraining Data from Large Language Models
by: Shi, Weijia, et al.
Published: (2023) -
Are Large Language Models Good at Utility Judgments?
by: Zhang, Hengran, et al.
Published: (2024) -
Robust Neural Information Retrieval: An Adversarial and Out-of-distribution Perspective
by: Liu, Yu-An, et al.
Published: (2024) -
CorpusBrain++: A Continual Generative Pre-Training Framework for Knowledge-Intensive Language Tasks
by: Guo, Jiafeng, et al.
Published: (2024)