Evading Data Contamination Detection for Language Models is (too) Easy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dekoninck, Jasper, Müller, Mark Niklas, Baader, Maximilian, Fischer, Marc, Vechev, Martin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AutoBaxBuilder: Bootstrapping Code Security Benchmarking
par: von Arx, Tobias, et autres
Publié: (2025)
par: von Arx, Tobias, et autres
Publié: (2025)
Ward: Provable RAG Dataset Inference via LLM Watermarks
par: Jovanović, Nikola, et autres
Publié: (2024)
par: Jovanović, Nikola, et autres
Publié: (2024)
BaxBench: Can LLMs Generate Correct and Secure Backends?
par: Vero, Mark, et autres
Publié: (2025)
par: Vero, Mark, et autres
Publié: (2025)
Polyrating: A Cost-Effective and Bias-Aware Rating System for LLM Evaluation
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
CommandSans: Securing AI Agents with Surgical Precision Prompt Sanitization
par: Das, Debeshee, et autres
Publié: (2025)
par: Das, Debeshee, et autres
Publié: (2025)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023)
par: Golchin, Shahriar, et autres
Publié: (2023)
ConStat: Performance-Based Contamination Detection in Large Language Models
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
Watermark Stealing in Large Language Models
par: Jovanović, Nikola, et autres
Publié: (2024)
par: Jovanović, Nikola, et autres
Publié: (2024)
Large Language Models are Advanced Anonymizers
par: Staab, Robin, et autres
Publié: (2024)
par: Staab, Robin, et autres
Publié: (2024)
Watermarking Diffusion Language Models
par: Gloaguen, Thibaud, et autres
Publié: (2025)
par: Gloaguen, Thibaud, et autres
Publié: (2025)
Discovering Spoofing Attempts on Language Model Watermarks
par: Gloaguen, Thibaud, et autres
Publié: (2024)
par: Gloaguen, Thibaud, et autres
Publié: (2024)
SPEAR:Exact Gradient Inversion of Batches in Federated Learning
par: Dimitrov, Dimitar I., et autres
Publié: (2024)
par: Dimitrov, Dimitar I., et autres
Publié: (2024)
Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems
par: Berezin, Sergey, et autres
Publié: (2024)
par: Berezin, Sergey, et autres
Publié: (2024)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
par: Dong, Yihong, et autres
Publié: (2024)
par: Dong, Yihong, et autres
Publié: (2024)
Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning
par: Gloaguen, Thibaud, et autres
Publié: (2025)
par: Gloaguen, Thibaud, et autres
Publié: (2025)
Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
par: De Muri, Giovanni, et autres
Publié: (2025)
par: De Muri, Giovanni, et autres
Publié: (2025)
Detecting Training Data of Large Language Models via Expectation Maximization
par: Kim, Gyuwan, et autres
Publié: (2024)
par: Kim, Gyuwan, et autres
Publié: (2024)
Exploiting LLM Quantization
par: Egashira, Kazuki, et autres
Publié: (2024)
par: Egashira, Kazuki, et autres
Publié: (2024)
Fewer Weights, More Problems: A Practical Attack on LLM Pruning
par: Egashira, Kazuki, et autres
Publié: (2025)
par: Egashira, Kazuki, et autres
Publié: (2025)
Mind the Gap: A Practical Attack on GGUF Quantization
par: Egashira, Kazuki, et autres
Publié: (2025)
par: Egashira, Kazuki, et autres
Publié: (2025)
BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs
par: Petrov, Ivo, et autres
Publié: (2025)
par: Petrov, Ivo, et autres
Publié: (2025)
On The Fragility of Benchmark Contamination Detection in Reasoning Models
par: Wang, Han, et autres
Publié: (2025)
par: Wang, Han, et autres
Publié: (2025)
Obliviate: Efficient Unmemorization for Protecting Intellectual Property in Large Language Models
par: Russinovich, Mark, et autres
Publié: (2025)
par: Russinovich, Mark, et autres
Publié: (2025)
AuthorMist: Evading AI Text Detectors with Reinforcement Learning
par: David, Isaac, et autres
Publié: (2025)
par: David, Isaac, et autres
Publié: (2025)
AnnoCTR: A Dataset for Detecting and Linking Entities, Tactics, and Techniques in Cyber Threat Reports
par: Lange, Lukas, et autres
Publié: (2024)
par: Lange, Lukas, et autres
Publié: (2024)
A Unified Framework for LLM Watermarks
par: Gloaguen, Thibaud, et autres
Publié: (2026)
par: Gloaguen, Thibaud, et autres
Publié: (2026)
Instruction Tuning for Secure Code Generation
par: He, Jingxuan, et autres
Publié: (2024)
par: He, Jingxuan, et autres
Publié: (2024)
Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models
par: Dang, Trung Cuong, et autres
Publié: (2025)
par: Dang, Trung Cuong, et autres
Publié: (2025)
Detection Made Easy: Potentials of Large Language Models for Solidity Vulnerabilities
par: Alam, Md Tauseef, et autres
Publié: (2024)
par: Alam, Md Tauseef, et autres
Publié: (2024)
Large Language Models for Code: Security Hardening and Adversarial Testing
par: He, Jingxuan, et autres
Publié: (2023)
par: He, Jingxuan, et autres
Publié: (2023)
Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark
par: Gloaguen, Thibaud, et autres
Publié: (2026)
par: Gloaguen, Thibaud, et autres
Publié: (2026)
Extracting Training Data from Diffusion Language Models via Infilling
par: Wang, Yihan, et autres
Publié: (2026)
par: Wang, Yihan, et autres
Publié: (2026)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
par: Hua, Peichun, et autres
Publié: (2025)
par: Hua, Peichun, et autres
Publié: (2025)
A Unified Approach to Routing and Cascading for LLMs
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
Privacy-Preserving Data Deduplication for Enhancing Federated Learning of Language Models (Extended Version)
par: Abadi, Aydin, et autres
Publié: (2024)
par: Abadi, Aydin, et autres
Publié: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
par: Hu, Xiaomeng, et autres
Publié: (2024)
par: Hu, Xiaomeng, et autres
Publié: (2024)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
par: Xu, Yijie, et autres
Publié: (2025)
par: Xu, Yijie, et autres
Publié: (2025)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
par: Bai, Yang, et autres
Publié: (2024)
par: Bai, Yang, et autres
Publié: (2024)
Adaptive Generation of Bias-Eliciting Questions for LLMs
par: Staab, Robin, et autres
Publié: (2025)
par: Staab, Robin, et autres
Publié: (2025)
KnowPhish: Large Language Models Meet Multimodal Knowledge Graphs for Enhancing Reference-Based Phishing Detection
par: Li, Yuexin, et autres
Publié: (2024)
par: Li, Yuexin, et autres
Publié: (2024)
Documents similaires
-
AutoBaxBuilder: Bootstrapping Code Security Benchmarking
par: von Arx, Tobias, et autres
Publié: (2025) -
Ward: Provable RAG Dataset Inference via LLM Watermarks
par: Jovanović, Nikola, et autres
Publié: (2024) -
BaxBench: Can LLMs Generate Correct and Secure Backends?
par: Vero, Mark, et autres
Publié: (2025) -
Polyrating: A Cost-Effective and Bias-Aware Rating System for LLM Evaluation
par: Dekoninck, Jasper, et autres
Publié: (2024) -
CommandSans: Securing AI Agents with Surgical Precision Prompt Sanitization
par: Das, Debeshee, et autres
Publié: (2025)