Concerned with Data Contamination? Assessing Countermeasures in Code Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Cao, Jialun, Zhang, Wuqi, Cheung, Shing-Chi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LLM-Powered Detection of Price Manipulation in DeFi
by: Liu, Lu, et al.
Published: (2025)
by: Liu, Lu, et al.
Published: (2025)
How Far are App Secrets from Being Stolen? A Case Study on Android
by: Wei, Lili, et al.
Published: (2025)
by: Wei, Lili, et al.
Published: (2025)
SandCell: Sandboxing Rust Beyond Unsafe Code
by: Zhang, Jialun, et al.
Published: (2025)
by: Zhang, Jialun, et al.
Published: (2025)
CODECLEANER: Elevating Standards with A Robust Data Contamination Mitigation Toolkit
by: Cao, Jialun, et al.
Published: (2024)
by: Cao, Jialun, et al.
Published: (2024)
RepoMark: A Data-Usage Auditing Framework for Code Large Language Models
by: Qu, Wenjie, et al.
Published: (2025)
by: Qu, Wenjie, et al.
Published: (2025)
Security of Language Models for Code: A Systematic Literature Review
by: Chen, Yuchen, et al.
Published: (2024)
by: Chen, Yuchen, et al.
Published: (2024)
LSPFuzz: Hunting Bugs in Language Servers
by: Zhu, Hengcheng, et al.
Published: (2025)
by: Zhu, Hengcheng, et al.
Published: (2025)
An Empirical Study on the Effectiveness of Large Language Models for Binary Code Understanding
by: Shang, Xiuwei, et al.
Published: (2025)
by: Shang, Xiuwei, et al.
Published: (2025)
Enhancing Pre-Trained Language Models for Vulnerability Detection via Semantic-Preserving Data Augmentation
by: Qi, Weiliang, et al.
Published: (2024)
by: Qi, Weiliang, et al.
Published: (2024)
Assessing Vulnerability in Smart Contracts: The Role of Code Complexity Metrics in Security Analysis
by: Tehrani, Masoud Jamshidiyan
Published: (2024)
by: Tehrani, Masoud Jamshidiyan
Published: (2024)
Large Language Models for Code Analysis: Do LLMs Really Do Their Job?
by: Fang, Chongzhou, et al.
Published: (2023)
by: Fang, Chongzhou, et al.
Published: (2023)
How Far Have We Gone in Binary Code Understanding Using Large Language Models
by: Shang, Xiuwei, et al.
Published: (2024)
by: Shang, Xiuwei, et al.
Published: (2024)
On the Adversarial Robustness of Instruction-Tuned Large Language Models for Code
by: Hossen, Md Imran, et al.
Published: (2024)
by: Hossen, Md Imran, et al.
Published: (2024)
Defending Code Language Models against Backdoor Attacks with Deceptive Cross-Entropy Loss
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
Large Language Models for Secure Code Assessment: A Multi-Language Empirical Study
by: Dozono, Kohei, et al.
Published: (2024)
by: Dozono, Kohei, et al.
Published: (2024)
Poisoning Programs by Un-Repairing Code: Security Concerns of AI-generated Code
by: Improta, Cristina
Published: (2024)
by: Improta, Cristina
Published: (2024)
VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities
by: Wang, Weizhe, et al.
Published: (2025)
by: Wang, Weizhe, et al.
Published: (2025)
SERSEM: Selective Entropy-Weighted Scoring for Membership Inference in Code Language Models
by: Dikici, Kıvanç Kuzey, et al.
Published: (2026)
by: Dikici, Kıvanç Kuzey, et al.
Published: (2026)
Models Are Codes: Towards Measuring Malicious Code Poisoning Attacks on Pre-trained Model Hubs
by: Zhao, Jian, et al.
Published: (2024)
by: Zhao, Jian, et al.
Published: (2024)
GenSIaC: Toward Security-Aware Infrastructure-as-Code Generation with Large Language Models
by: Li, Yikun, et al.
Published: (2025)
by: Li, Yikun, et al.
Published: (2025)
Gotcha! This Model Uses My Code! Evaluating Membership Leakage Risks in Code Models
by: Yang, Zhou, et al.
Published: (2023)
by: Yang, Zhou, et al.
Published: (2023)
SecCodePRM: A Process Reward Model for Code Security
by: Yu, Weichen, et al.
Published: (2026)
by: Yu, Weichen, et al.
Published: (2026)
Automated Generation of Accurate Privacy Captions From Android Source Code Using Large Language Models
by: Jain, Vijayanta, et al.
Published: (2026)
by: Jain, Vijayanta, et al.
Published: (2026)
Using AI Assistants in Software Development: A Qualitative Study on Security Practices and Concerns
by: Klemmer, Jan H., et al.
Published: (2024)
by: Klemmer, Jan H., et al.
Published: (2024)
Detecting Stealthy Data Poisoning Attacks in AI Code Generators
by: Improta, Cristina
Published: (2025)
by: Improta, Cristina
Published: (2025)
Transferable Backdoor Attacks for Code Models via Sharpness-Aware Adversarial Perturbation
by: Chang, Shuyu, et al.
Published: (2026)
by: Chang, Shuyu, et al.
Published: (2026)
Vulnerability Detection with Interprocedural Context in Multiple Languages: Assessing Effectiveness and Cost of Modern LLMs
by: Lira, Kevin, et al.
Published: (2026)
by: Lira, Kevin, et al.
Published: (2026)
Introducing Systems Thinking as a Framework for Teaching and Assessing Threat Modeling Competency
by: Joshi, Siddhant S., et al.
Published: (2024)
by: Joshi, Siddhant S., et al.
Published: (2024)
ORCAS: Obfuscation-Resilient Binary Code Similarity Analysis using Dominance Enhanced Semantic Graph
by: Wang, Yufeng, et al.
Published: (2025)
by: Wang, Yufeng, et al.
Published: (2025)
StagedVulBERT: Multi-Granular Vulnerability Detection with a Novel Pre-trained Code Model
by: Jiang, Yuan, et al.
Published: (2024)
by: Jiang, Yuan, et al.
Published: (2024)
Assessing Privacy Compliance of Android Third-Party SDKs
by: Meng, Mark Huasong, et al.
Published: (2024)
by: Meng, Mark Huasong, et al.
Published: (2024)
Verbatim Data Transcription Failures in LLM Code Generation: A State-Tracking Stress Test
by: Haque, Mohd Ariful, et al.
Published: (2026)
by: Haque, Mohd Ariful, et al.
Published: (2026)
How Code Representation Shapes False-Positive Dynamics in Cross-Language LLM Vulnerability Detection
by: Chen, Maofei, et al.
Published: (2026)
by: Chen, Maofei, et al.
Published: (2026)
On the effectiveness of Large Language Models for GitHub Workflows
by: Zhang, Xinyu, et al.
Published: (2024)
by: Zhang, Xinyu, et al.
Published: (2024)
Evaluating Large Language Models for Line-Level Vulnerability Localization
by: Zhang, Jian, et al.
Published: (2024)
by: Zhang, Jian, et al.
Published: (2024)
DeCoMa: Detecting and Purifying Code Dataset Watermarks through Dual Channel Code Abstraction
by: Xiao, Yuan, et al.
Published: (2025)
by: Xiao, Yuan, et al.
Published: (2025)
Unknown Attack Detection in IoT Networks using Large Language Models: A Robust, Data-efficient Approach
by: Ali, Shan, et al.
Published: (2026)
by: Ali, Shan, et al.
Published: (2026)
WildCode: An Empirical Analysis of Code Generated by ChatGPT
by: Khanmohammadi, Kobra, et al.
Published: (2025)
by: Khanmohammadi, Kobra, et al.
Published: (2025)
Demonstration Attack against In-Context Learning for Code Intelligence
by: Ge, Yifei, et al.
Published: (2024)
by: Ge, Yifei, et al.
Published: (2024)
LineBreaker: Finding Token-Inconsistency Bugs with Large Language Models
by: Chen, Hongbo, et al.
Published: (2024)
by: Chen, Hongbo, et al.
Published: (2024)
Similar Items
-
LLM-Powered Detection of Price Manipulation in DeFi
by: Liu, Lu, et al.
Published: (2025) -
How Far are App Secrets from Being Stolen? A Case Study on Android
by: Wei, Lili, et al.
Published: (2025) -
SandCell: Sandboxing Rust Beyond Unsafe Code
by: Zhang, Jialun, et al.
Published: (2025) -
CODECLEANER: Elevating Standards with A Robust Data Contamination Mitigation Toolkit
by: Cao, Jialun, et al.
Published: (2024) -
RepoMark: A Data-Usage Auditing Framework for Code Large Language Models
by: Qu, Wenjie, et al.
Published: (2025)