RepoMark: A Data-Usage Auditing Framework for Code Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Qu, Wenjie, Zhou, Yuguang, Wang, Bo, Li, Yuexin, Wang, Lionel Z., Jia, Jinyuan, Zhang, Jiaheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReposVul: A Repository-Level High-Quality Vulnerability Dataset
by: Wang, Xinchen, et al.
Published: (2024)
by: Wang, Xinchen, et al.
Published: (2024)
Unknown Attack Detection in IoT Networks using Large Language Models: A Robust, Data-efficient Approach
by: Ali, Shan, et al.
Published: (2026)
by: Ali, Shan, et al.
Published: (2026)
How Code Representation Shapes False-Positive Dynamics in Cross-Language LLM Vulnerability Detection
by: Chen, Maofei, et al.
Published: (2026)
by: Chen, Maofei, et al.
Published: (2026)
Large Language Models-Aided Program Debloating
by: Lin, Bo, et al.
Published: (2025)
by: Lin, Bo, et al.
Published: (2025)
CEBin: A Cost-Effective Framework for Large-Scale Binary Code Similarity Detection
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
Beyond Metadata: Code-centric and Usage-based Analysis of Known Vulnerabilities in Open-source Software
by: Ponta, Serena E., et al.
Published: (2018)
by: Ponta, Serena E., et al.
Published: (2018)
Large Language Models for Code Analysis: Do LLMs Really Do Their Job?
by: Fang, Chongzhou, et al.
Published: (2023)
by: Fang, Chongzhou, et al.
Published: (2023)
On the Adversarial Robustness of Instruction-Tuned Large Language Models for Code
by: Hossen, Md Imran, et al.
Published: (2024)
by: Hossen, Md Imran, et al.
Published: (2024)
Concerned with Data Contamination? Assessing Countermeasures in Code Language Model
by: Cao, Jialun, et al.
Published: (2024)
by: Cao, Jialun, et al.
Published: (2024)
Large Language Models for Secure Code Assessment: A Multi-Language Empirical Study
by: Dozono, Kohei, et al.
Published: (2024)
by: Dozono, Kohei, et al.
Published: (2024)
Exploring the Security Threats of Retriever Backdoors in Retrieval-Augmented Code Generation
by: Li, Tian, et al.
Published: (2025)
by: Li, Tian, et al.
Published: (2025)
SCRUTINEER: Detecting Logic-Level Usage Violations of Reusable Components in Smart Contracts
by: Lin, Xingshuang, et al.
Published: (2025)
by: Lin, Xingshuang, et al.
Published: (2025)
An Empirical Study on the Effectiveness of Large Language Models for Binary Code Understanding
by: Shang, Xiuwei, et al.
Published: (2025)
by: Shang, Xiuwei, et al.
Published: (2025)
Exploring the Security Threats of Knowledge Base Poisoning in Retrieval-Augmented Code Generation
by: Lin, Bo, et al.
Published: (2025)
by: Lin, Bo, et al.
Published: (2025)
How Far Have We Gone in Binary Code Understanding Using Large Language Models
by: Shang, Xiuwei, et al.
Published: (2024)
by: Shang, Xiuwei, et al.
Published: (2024)
GenSIaC: Toward Security-Aware Infrastructure-as-Code Generation with Large Language Models
by: Li, Yikun, et al.
Published: (2025)
by: Li, Yikun, et al.
Published: (2025)
Give LLMs a Security Course: Securing Retrieval-Augmented Code Generation via Knowledge Injection
by: Lin, Bo, et al.
Published: (2025)
by: Lin, Bo, et al.
Published: (2025)
VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities
by: Wang, Weizhe, et al.
Published: (2025)
by: Wang, Weizhe, et al.
Published: (2025)
BinEnhance: An Enhancement Framework Based on External Environment Semantics for Binary Code Search
by: Wang, Yongpan, et al.
Published: (2024)
by: Wang, Yongpan, et al.
Published: (2024)
Automated Generation of Accurate Privacy Captions From Android Source Code Using Large Language Models
by: Jain, Vijayanta, et al.
Published: (2026)
by: Jain, Vijayanta, et al.
Published: (2026)
Models Are Codes: Towards Measuring Malicious Code Poisoning Attacks on Pre-trained Model Hubs
by: Zhao, Jian, et al.
Published: (2024)
by: Zhao, Jian, et al.
Published: (2024)
Auditing MCP Servers for Over-Privileged Tool Capabilities
by: Huang, Charoes, et al.
Published: (2026)
by: Huang, Charoes, et al.
Published: (2026)
Decoding Secret Memorization in Code LLMs Through Token-Level Characterization
by: Nie, Yuqing, et al.
Published: (2024)
by: Nie, Yuqing, et al.
Published: (2024)
On the Prevalence and Usage of Commit Signing on GitHub: A Longitudinal and Cross-Domain Study
by: Sharma, Anupam, et al.
Published: (2025)
by: Sharma, Anupam, et al.
Published: (2025)
Evaluating Large Language Models for Line-Level Vulnerability Localization
by: Zhang, Jian, et al.
Published: (2024)
by: Zhang, Jian, et al.
Published: (2024)
Backdoors in Code Summarizers: How Bad Is It?
by: Wang, Chenyu, et al.
Published: (2025)
by: Wang, Chenyu, et al.
Published: (2025)
DLAP: A Deep Learning Augmented Large Language Model Prompting Framework for Software Vulnerability Detection
by: Yang, Yanjing, et al.
Published: (2024)
by: Yang, Yanjing, et al.
Published: (2024)
Detecting Stealthy Data Poisoning Attacks in AI Code Generators
by: Improta, Cristina
Published: (2025)
by: Improta, Cristina
Published: (2025)
Gotcha! This Model Uses My Code! Evaluating Membership Leakage Risks in Code Models
by: Yang, Zhou, et al.
Published: (2023)
by: Yang, Zhou, et al.
Published: (2023)
Security of Language Models for Code: A Systematic Literature Review
by: Chen, Yuchen, et al.
Published: (2024)
by: Chen, Yuchen, et al.
Published: (2024)
KVerus: Scalable and Resilient Formal Verification Proof Generation for Rust Code
by: Liu, Yuwei, et al.
Published: (2026)
by: Liu, Yuwei, et al.
Published: (2026)
LineBreaker: Finding Token-Inconsistency Bugs with Large Language Models
by: Chen, Hongbo, et al.
Published: (2024)
by: Chen, Hongbo, et al.
Published: (2024)
Enhancing Pre-Trained Language Models for Vulnerability Detection via Semantic-Preserving Data Augmentation
by: Qi, Weiliang, et al.
Published: (2024)
by: Qi, Weiliang, et al.
Published: (2024)
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
by: Wang, Yanlin, et al.
Published: (2026)
by: Wang, Yanlin, et al.
Published: (2026)
SAGA: Detecting Security Vulnerabilities Using Static Aspect Analysis
by: Marquer, Yoann, et al.
Published: (2026)
by: Marquer, Yoann, et al.
Published: (2026)
Uncovering EDK2 Firmware Flaws: Insights from Code Audit Tools
by: Farahani, Mahsa, et al.
Published: (2024)
by: Farahani, Mahsa, et al.
Published: (2024)
ORCAS: Obfuscation-Resilient Binary Code Similarity Analysis using Dominance Enhanced Semantic Graph
by: Wang, Yufeng, et al.
Published: (2025)
by: Wang, Yufeng, et al.
Published: (2025)
Traces of Memorisation in Large Language Models for Code
by: Al-Kaswan, Ali, et al.
Published: (2023)
by: Al-Kaswan, Ali, et al.
Published: (2023)
On Trojan Signatures in Large Language Models of Code
by: Hussain, Aftab, et al.
Published: (2024)
by: Hussain, Aftab, et al.
Published: (2024)
The Invisible Hand: Unveiling Provider Bias in Large Language Models for Code Generation
by: Zhang, Xiaoyu, et al.
Published: (2025)
by: Zhang, Xiaoyu, et al.
Published: (2025)
Similar Items
-
ReposVul: A Repository-Level High-Quality Vulnerability Dataset
by: Wang, Xinchen, et al.
Published: (2024) -
Unknown Attack Detection in IoT Networks using Large Language Models: A Robust, Data-efficient Approach
by: Ali, Shan, et al.
Published: (2026) -
How Code Representation Shapes False-Positive Dynamics in Cross-Language LLM Vulnerability Detection
by: Chen, Maofei, et al.
Published: (2026) -
Large Language Models-Aided Program Debloating
by: Lin, Bo, et al.
Published: (2025) -
CEBin: A Cost-Effective Framework for Large-Scale Binary Code Similarity Detection
by: Wang, Hao, et al.
Published: (2024)