PuzzleMark: Implicit Jigsaw Learning for Robust Code Dataset Watermarking in Neural Code Completion Models
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Haocheng, Chen, Yuchen, Sun, Weisong, Lv, Peizhuo, Xiao, Yuan, Fang, Chunrong, Liu, Yang, Zhang, Xiaofang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DeCoMa: Detecting and Purifying Code Dataset Watermarks through Dual Channel Code Abstraction
by: Xiao, Yuan, et al.
Published: (2025)
by: Xiao, Yuan, et al.
Published: (2025)
Enhancing and Reporting Robustness Boundary of Neural Code Models for Intelligent Code Understanding
by: Han, Tingxu, et al.
Published: (2026)
by: Han, Tingxu, et al.
Published: (2026)
A Vulnerability Code Intent Summary Dataset
by: Huang, Yifan, et al.
Published: (2025)
by: Huang, Yifan, et al.
Published: (2025)
Probing Privacy Leaks in LLM-based Code Generation via Test Generation
by: Ge, Yifei, et al.
Published: (2026)
by: Ge, Yifei, et al.
Published: (2026)
Demonstration Attack against In-Context Learning for Code Intelligence
by: Ge, Yifei, et al.
Published: (2024)
by: Ge, Yifei, et al.
Published: (2024)
Eliminating Backdoors in Neural Code Models for Secure Code Understanding
by: Sun, Weisong, et al.
Published: (2024)
by: Sun, Weisong, et al.
Published: (2024)
Security of Language Models for Code: A Systematic Literature Review
by: Chen, Yuchen, et al.
Published: (2024)
by: Chen, Yuchen, et al.
Published: (2024)
Train in Vain: Functionality-Preserving Poisoning to Prevent Unauthorized Use of Code Datasets
by: Xiao, Yuan, et al.
Published: (2026)
by: Xiao, Yuan, et al.
Published: (2026)
Show Me Your Code! Kill Code Poisoning: A Lightweight Method Based on Code Naturalness
by: Sun, Weisong, et al.
Published: (2025)
by: Sun, Weisong, et al.
Published: (2025)
CooTest: An Automated Testing Approach for V2X Communication Systems
by: Guo, An, et al.
Published: (2024)
by: Guo, An, et al.
Published: (2024)
ESALE: Enhancing Code-Summary Alignment Learning for Source Code Summarization
by: Fang, Chunrong, et al.
Published: (2024)
by: Fang, Chunrong, et al.
Published: (2024)
TransformCode: A Contrastive Learning Framework for Code Embedding via Subtree Transformation
by: Xian, Zixiang, et al.
Published: (2023)
by: Xian, Zixiang, et al.
Published: (2023)
No Man is an Island: Towards Fully Automatic Programming by Code Search, Code Generation and Program Repair
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution
by: Shang, Ye, et al.
Published: (2026)
by: Shang, Ye, et al.
Published: (2026)
Test Script Intention Generation for Mobile Application via GUI Image and Code Understanding
by: Yu, Shengcheng, et al.
Published: (2021)
by: Yu, Shengcheng, et al.
Published: (2021)
Don't Complete It! Preventing Unhelpful Code Completion for Productive and Sustainable Neural Code Completion Systems
by: Sun, Zhensu, et al.
Published: (2022)
by: Sun, Zhensu, et al.
Published: (2022)
Teaching Code LLMs to Use Autocompletion Tools in Repository-Level Code Generation
by: Wang, Chong, et al.
Published: (2024)
by: Wang, Chong, et al.
Published: (2024)
Static Code Analyzer Recommendation via Preference Mining
by: Ge, Xiuting, et al.
Published: (2024)
by: Ge, Xiuting, et al.
Published: (2024)
A Critical Review of Large Language Model on Software Engineering: An Example from ChatGPT and Automated Program Repair
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
APPT: Boosting Automated Patch Correctness Prediction via Fine-tuning Pre-trained Models
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
On the Effectiveness of Code Representation in Deep Learning-Based Automated Patch Correctness Assessment
by: Zhang, Quanjun, et al.
Published: (2026)
by: Zhang, Quanjun, et al.
Published: (2026)
Commenting Higher-level Code Unit: Full Code, Reduced Code, or Hierarchical Code Summarization
by: Sun, Weisong, et al.
Published: (2025)
by: Sun, Weisong, et al.
Published: (2025)
An Effective Approach to Embedding Source Code by Combining Large Language and Sentence Embedding Models
by: Xian, Zixiang, et al.
Published: (2024)
by: Xian, Zixiang, et al.
Published: (2024)
CLARC: C/C++ Benchmark for Robust Code Search
by: Wang, Kaicheng, et al.
Published: (2026)
by: Wang, Kaicheng, et al.
Published: (2026)
A Systematic Literature Review on Large Language Models for Automated Program Repair
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
SynthCoder: A Synthetical Strategy to Tune LLMs for Code Completion
by: Yu, Dongjun, et al.
Published: (2025)
by: Yu, Dongjun, et al.
Published: (2025)
Effective Code Membership Inference for Code Completion Models via Adversarial Prompts
by: Jiang, Yuan, et al.
Published: (2025)
by: Jiang, Yuan, et al.
Published: (2025)
SoVAR: Building Generalizable Scenarios from Accident Reports for Autonomous Driving Testing
by: Guo, An, et al.
Published: (2024)
by: Guo, An, et al.
Published: (2024)
A Survey on Large Language Models for Software Engineering
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
Knowledge-Guided Multi-Agent Framework for Application-Level Software Code Generation
by: Xiong, Qian, et al.
Published: (2025)
by: Xiong, Qian, et al.
Published: (2025)
Requirements Development and Formalization for Reliable Code Generation: A Multi-Agent Vision
by: Lu, Xu, et al.
Published: (2025)
by: Lu, Xu, et al.
Published: (2025)
Does Your Neural Code Completion Model Use My Code? A Membership Inference Approach
by: Wan, Yao, et al.
Published: (2024)
by: Wan, Yao, et al.
Published: (2024)
Generate Realistic Test Scenes for V2X Communication Systems
by: Guo, An, et al.
Published: (2025)
by: Guo, An, et al.
Published: (2025)
RTLRepoCoder: Repository-Level RTL Code Completion through the Combination of Fine-Tuning and Retrieval Augmentation
by: Wu, Peiyang, et al.
Published: (2025)
by: Wu, Peiyang, et al.
Published: (2025)
MCGMark: An Encodable and Robust Online Watermark for Tracing LLM-Generated Malicious Code
by: Ning, Kaiwen, et al.
Published: (2024)
by: Ning, Kaiwen, et al.
Published: (2024)
Control Models for In-IDE Code Completion
by: de Moor, Aral, et al.
Published: (2026)
by: de Moor, Aral, et al.
Published: (2026)
Machine Translation Testing via Syntactic Tree Pruning
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
Towards Automated Crowdsourced Testing via Personified-LLM
by: Yu, Shengcheng, et al.
Published: (2026)
by: Yu, Shengcheng, et al.
Published: (2026)
DuCodeMark: Dual-Purpose Code Dataset Watermarking via Style-Aware Watermark-Poison Design
by: Chen, Yuchen, et al.
Published: (2026)
by: Chen, Yuchen, et al.
Published: (2026)
How Does Cognitive Capability and Personality Influence Problem Solving in Coding Interview Puzzles?
by: Hidellaarachchi, Dulaji, et al.
Published: (2025)
by: Hidellaarachchi, Dulaji, et al.
Published: (2025)
Similar Items
-
DeCoMa: Detecting and Purifying Code Dataset Watermarks through Dual Channel Code Abstraction
by: Xiao, Yuan, et al.
Published: (2025) -
Enhancing and Reporting Robustness Boundary of Neural Code Models for Intelligent Code Understanding
by: Han, Tingxu, et al.
Published: (2026) -
A Vulnerability Code Intent Summary Dataset
by: Huang, Yifan, et al.
Published: (2025) -
Probing Privacy Leaks in LLM-based Code Generation via Test Generation
by: Ge, Yifei, et al.
Published: (2026) -
Demonstration Attack against In-Context Learning for Code Intelligence
by: Ge, Yifei, et al.
Published: (2024)