CodeMorph: Mitigating Data Leakage in Large Language Model Assessment
Fuente:
arXiv
Saved in:
| Main Authors: | Rao, Hongzhou, Zhao, Yanjie, Zhu, Wenjie, Xiao, Ling, Wang, Meizhen, Wang, Haoyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead
by: Rao, Hongzhou, et al.
Published: (2025)
by: Rao, Hongzhou, et al.
Published: (2025)
WaDec: Decompiling WebAssembly Using Large Language Model
by: She, Xinyu, et al.
Published: (2024)
by: She, Xinyu, et al.
Published: (2024)
Large Language Model Supply Chain: A Research Agenda
by: Wang, Shenao, et al.
Published: (2024)
by: Wang, Shenao, et al.
Published: (2024)
Understanding Large Language Model Supply Chain: Structure, Domain, and Vulnerabilities
by: Hu, Yanzhe, et al.
Published: (2025)
by: Hu, Yanzhe, et al.
Published: (2025)
Unsafe by Flow: Uncovering Bidirectional Data-Flow Risks in MCP Ecosystem
by: Hou, Xinyi, et al.
Published: (2026)
by: Hou, Xinyi, et al.
Published: (2026)
On Inter-dataset Code Duplication and Data Leakage in Large Language Models
by: López, José Antonio Hernández, et al.
Published: (2024)
by: López, José Antonio Hernández, et al.
Published: (2024)
GPTZoo: A Large-scale Dataset of GPTs for the Research Community
by: Hou, Xinyi, et al.
Published: (2024)
by: Hou, Xinyi, et al.
Published: (2024)
Voices from the Frontier: A Comprehensive Analysis of the OpenAI Developer Forum
by: Hou, Xinyi, et al.
Published: (2024)
by: Hou, Xinyi, et al.
Published: (2024)
Bridging Design and Development with Automated Declarative UI Code Generation
by: Zhou, Ting, et al.
Published: (2024)
by: Zhou, Ting, et al.
Published: (2024)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
by: Lin, Hong Yi, et al.
Published: (2025)
by: Lin, Hong Yi, et al.
Published: (2025)
LLM App Store Analysis: A Vision and Roadmap
by: Zhao, Yanjie, et al.
Published: (2024)
by: Zhao, Yanjie, et al.
Published: (2024)
Models Are Codes: Towards Measuring Malicious Code Poisoning Attacks on Pre-trained Model Hubs
by: Zhao, Jian, et al.
Published: (2024)
by: Zhao, Jian, et al.
Published: (2024)
Drowzee: Metamorphic Testing for Fact-Conflicting Hallucination Detection in Large Language Models
by: Li, Ningke, et al.
Published: (2024)
by: Li, Ningke, et al.
Published: (2024)
LLM Applications: Current Paradigms and the Next Frontier
by: Hou, Xinyi, et al.
Published: (2025)
by: Hou, Xinyi, et al.
Published: (2025)
RepoMark: A Data-Usage Auditing Framework for Code Large Language Models
by: Qu, Wenjie, et al.
Published: (2025)
by: Qu, Wenjie, et al.
Published: (2025)
Natural Is The Best: Model-Agnostic Code Simplification for Pre-trained Large Language Models
by: Wang, Yan, et al.
Published: (2024)
by: Wang, Yan, et al.
Published: (2024)
Enhancing Semantic Understanding in Pointer Analysis using Large Language Models
by: Cheng, Baijun, et al.
Published: (2025)
by: Cheng, Baijun, et al.
Published: (2025)
Gradient-Based Model Fingerprinting for LLM Similarity Detection and Family Classification
by: Wu, Zehao, et al.
Published: (2025)
by: Wu, Zehao, et al.
Published: (2025)
Agent-Based Software Artifact Evaluation
by: Wu, Zhaonan, et al.
Published: (2026)
by: Wu, Zhaonan, et al.
Published: (2026)
Not All RAGs Are Created Equal: A Component-Wise Empirical Study for Software Engineering Tasks
by: Ke, Qiang, et al.
Published: (2026)
by: Ke, Qiang, et al.
Published: (2026)
How Agentic AI Coding Assistants Become the Attacker's Shell
by: Liu, Yue, et al.
Published: (2026)
by: Liu, Yue, et al.
Published: (2026)
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
by: Guo, Xiaoyu, et al.
Published: (2025)
by: Guo, Xiaoyu, et al.
Published: (2025)
Large Language Models for Software Engineering: A Systematic Literature Review
by: Hou, Xinyi, et al.
Published: (2023)
by: Hou, Xinyi, et al.
Published: (2023)
Gotcha! This Model Uses My Code! Evaluating Membership Leakage Risks in Code Models
by: Yang, Zhou, et al.
Published: (2023)
by: Yang, Zhou, et al.
Published: (2023)
A Hybrid Approach for EMF Code Generation:Code Templates Meet Large Language Models
by: He, Xiao, et al.
Published: (2025)
by: He, Xiao, et al.
Published: (2025)
Human-Aligned Code Readability Assessment with Large Language Models
by: Ouédraogo, Wendkûuni C., et al.
Published: (2025)
by: Ouédraogo, Wendkûuni C., et al.
Published: (2025)
Understanding the Effectiveness of Coverage Criteria for Large Language Models: A Special Angle from Jailbreak Attacks
by: Zhou, Shide, et al.
Published: (2024)
by: Zhou, Shide, et al.
Published: (2024)
Semantic-Enhanced Indirect Call Analysis with Large Language Models
by: Cheng, Baijun, et al.
Published: (2024)
by: Cheng, Baijun, et al.
Published: (2024)
A Dual-Loop Agent Framework for Automated Vulnerability Reproduction
by: Liu, Bin, et al.
Published: (2026)
by: Liu, Bin, et al.
Published: (2026)
ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation
by: He, Minghua, et al.
Published: (2025)
by: He, Minghua, et al.
Published: (2025)
"Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors
by: Liu, Yue, et al.
Published: (2025)
by: Liu, Yue, et al.
Published: (2025)
Evaluating and Mitigating Linguistic Discrimination in Large Language Models
by: Dong, Guoliang, et al.
Published: (2024)
by: Dong, Guoliang, et al.
Published: (2024)
Condor: A Code Discriminator Integrating General Semantics with Code Details
by: Liang, Qingyuan, et al.
Published: (2024)
by: Liang, Qingyuan, et al.
Published: (2024)
Mitigating Gender Bias in Code Large Language Models via Model Editing
by: Qin, Zhanyue, et al.
Published: (2024)
by: Qin, Zhanyue, et al.
Published: (2024)
Toward Understanding Bugs in Vector Database Management Systems
by: Xie, Yinglin, et al.
Published: (2025)
by: Xie, Yinglin, et al.
Published: (2025)
DCE-LLM: Dead Code Elimination with Large Language Models
by: Chen, Minyu, et al.
Published: (2025)
by: Chen, Minyu, et al.
Published: (2025)
LLM Agents for Automated Web Vulnerability Reproduction: Are We There Yet?
by: Liu, Bin, et al.
Published: (2025)
by: Liu, Bin, et al.
Published: (2025)
Towards Reliable Vector Database Management Systems: A Software Testing Roadmap for 2030
by: Wang, Shenao, et al.
Published: (2025)
by: Wang, Shenao, et al.
Published: (2025)
Aligning Requirement for Large Language Model's Code Generation
by: Tian, Zhao, et al.
Published: (2025)
by: Tian, Zhao, et al.
Published: (2025)
Mitigating Sensitive Information Leakage in LLMs4Code through Machine Unlearning
by: Gu, Shanzhi, et al.
Published: (2025)
by: Gu, Shanzhi, et al.
Published: (2025)
Similar Items
-
Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead
by: Rao, Hongzhou, et al.
Published: (2025) -
WaDec: Decompiling WebAssembly Using Large Language Model
by: She, Xinyu, et al.
Published: (2024) -
Large Language Model Supply Chain: A Research Agenda
by: Wang, Shenao, et al.
Published: (2024) -
Understanding Large Language Model Supply Chain: Structure, Domain, and Vulnerabilities
by: Hu, Yanzhe, et al.
Published: (2025) -
Unsafe by Flow: Uncovering Bidirectional Data-Flow Risks in MCP Ecosystem
by: Hou, Xinyi, et al.
Published: (2026)