Clean Code, Better Models: Enhancing LLM Performance with Smell-Cleaned Dataset
Fuente:
arXiv
Salvato in:
| Autori principali: | Xue, Zhipeng, Zhang, Xiaoting, Gao, Zhipeng, Hu, Xing, Gao, Shan, Xia, Xin, Li, Shanping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SelfPiCo: Self-Guided Partial Code Execution with LLMs
di: Xue, Zhipeng, et al.
Pubblicazione: (2024)
di: Xue, Zhipeng, et al.
Pubblicazione: (2024)
Actionable Warning Is Not Enough: Recommending Valid Actionable Warnings with Weak Supervision
di: Xue, Zhipeng, et al.
Pubblicazione: (2025)
di: Xue, Zhipeng, et al.
Pubblicazione: (2025)
Easy over Hard: A Simple Baseline for Test Failures Causes Prediction
di: Gao, Zhipeng, et al.
Pubblicazione: (2024)
di: Gao, Zhipeng, et al.
Pubblicazione: (2024)
Automating TODO-missed Methods Detection and Patching
di: Gao, Zhipeng, et al.
Pubblicazione: (2024)
di: Gao, Zhipeng, et al.
Pubblicazione: (2024)
Towards Better Answers: Automated Stack Overflow Post Updating
di: Mai, Yubo, et al.
Pubblicazione: (2024)
di: Mai, Yubo, et al.
Pubblicazione: (2024)
Verify Implementation Equivalence of Large Models
di: Zhan, Qi, et al.
Pubblicazione: (2026)
di: Zhan, Qi, et al.
Pubblicazione: (2026)
Less is More: On the Importance of Data Quality for Unit Test Generation
di: Zhang, Junwei, et al.
Pubblicazione: (2025)
di: Zhang, Junwei, et al.
Pubblicazione: (2025)
Clean Code In Practice: Challenges and Opportunities
di: Yan, Dapeng, et al.
Pubblicazione: (2025)
di: Yan, Dapeng, et al.
Pubblicazione: (2025)
Automating Comment Generation for Smart Contract from Bytecode
di: Xiang, Jianhang, et al.
Pubblicazione: (2025)
di: Xiang, Jianhang, et al.
Pubblicazione: (2025)
Code2API: A Tool for Generating Reusable APIs from Stack Overflow Code Snippets
di: Mai, Yubo, et al.
Pubblicazione: (2025)
di: Mai, Yubo, et al.
Pubblicazione: (2025)
Clean Code, Better Models: Enhancing LLM Performance with Smell-Cleaned Dataset
di: ANONYMOUS
Pubblicazione: (2025)
di: ANONYMOUS
Pubblicazione: (2025)
The Current Challenges of Software Engineering in the Era of Large Language Models
di: Gao, Cuiyun, et al.
Pubblicazione: (2024)
di: Gao, Cuiyun, et al.
Pubblicazione: (2024)
Diffploit: Facilitating Cross-Version Exploit Migration for Open Source Library Vulnerabilities
di: Chen, Zirui, et al.
Pubblicazione: (2025)
di: Chen, Zirui, et al.
Pubblicazione: (2025)
PS$^3$: Precise Patch Presence Test based on Semantic Symbolic Signature
di: Zhan, Qi, et al.
Pubblicazione: (2023)
di: Zhan, Qi, et al.
Pubblicazione: (2023)
Automating Zero-Shot Patch Porting for Hard Forks
di: Pan, Shengyi, et al.
Pubblicazione: (2024)
di: Pan, Shengyi, et al.
Pubblicazione: (2024)
Mitigating Implicit Inconsistencies in Patch Porting
di: Pan, Shengyi, et al.
Pubblicazione: (2026)
di: Pan, Shengyi, et al.
Pubblicazione: (2026)
FGIT: Fault-Guided Fine-Tuning for Code Generation
di: Fan, Lishui, et al.
Pubblicazione: (2025)
di: Fan, Lishui, et al.
Pubblicazione: (2025)
Exploring the Capabilities of LLMs for Code Change Related Tasks
di: Fan, Lishui, et al.
Pubblicazione: (2024)
di: Fan, Lishui, et al.
Pubblicazione: (2024)
Mono: Is Your "Clean" Vulnerability Dataset Really Solvable? Exposing and Trapping Undecidable Patches and Beyond
di: Gao, Zeyu, et al.
Pubblicazione: (2025)
di: Gao, Zeyu, et al.
Pubblicazione: (2025)
Learning in the Wild: Towards Leveraging Unlabeled Data for Effectively Tuning Pre-trained Code Models
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
di: Feng, Jia, et al.
Pubblicazione: (2024)
di: Feng, Jia, et al.
Pubblicazione: (2024)
SACS: A Code Smell Dataset using Semi-automatic Generation Approach
di: Zhang, Hanyu, et al.
Pubblicazione: (2026)
di: Zhang, Hanyu, et al.
Pubblicazione: (2026)
CleanVul: Automatic Function-Level Vulnerability Detection in Code Commits Using LLM Heuristics
di: Li, Yikun, et al.
Pubblicazione: (2024)
di: Li, Yikun, et al.
Pubblicazione: (2024)
Specification and Detection of LLM Code Smells
di: Mahmoudi, Brahim, et al.
Pubblicazione: (2025)
di: Mahmoudi, Brahim, et al.
Pubblicazione: (2025)
Investigating The Smells of LLM Generated Code
di: Paul, Debalina Ghosh, et al.
Pubblicazione: (2025)
di: Paul, Debalina Ghosh, et al.
Pubblicazione: (2025)
An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation
di: Zhang, Binquan, et al.
Pubblicazione: (2026)
di: Zhang, Binquan, et al.
Pubblicazione: (2026)
CupCleaner: A Hybrid Data Cleaning Approach for Comment Updating
di: Liang, Qingyuan, et al.
Pubblicazione: (2023)
di: Liang, Qingyuan, et al.
Pubblicazione: (2023)
ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?
di: Fan, Lishui, et al.
Pubblicazione: (2026)
di: Fan, Lishui, et al.
Pubblicazione: (2026)
Are Human Rules Necessary? Generating Reusable APIs with CoT Reasoning and In-Context Learning
di: Mai, Yubo, et al.
Pubblicazione: (2024)
di: Mai, Yubo, et al.
Pubblicazione: (2024)
ActRef: Enhancing the Understanding of Python Code Refactoring with Action-Based Analysis
di: Wang, Siqi, et al.
Pubblicazione: (2025)
di: Wang, Siqi, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation of Parameter-Efficient Fine-Tuning on Code Smell Detection
di: Zhang, Beiqi, et al.
Pubblicazione: (2024)
di: Zhang, Beiqi, et al.
Pubblicazione: (2024)
An Empirical Study of Retrieval-Augmented Code Generation: Challenges and Opportunities
di: Yang, Zezhou, et al.
Pubblicazione: (2025)
di: Yang, Zezhou, et al.
Pubblicazione: (2025)
A Causal Perspective on Measuring, Explaining and Mitigating Smells in LLM-Generated Code
di: Velasco, Alejandro, et al.
Pubblicazione: (2025)
di: Velasco, Alejandro, et al.
Pubblicazione: (2025)
The Influence of Code Smells in Efferent Neighbors on Class Stability
di: Zhang, Zushuai, et al.
Pubblicazione: (2026)
di: Zhang, Zushuai, et al.
Pubblicazione: (2026)
An Event-Driven Tool for Context-Aware Code Smell Detection Using SmellDSL
di: Viegas, Matheus dos Santos, et al.
Pubblicazione: (2026)
di: Viegas, Matheus dos Santos, et al.
Pubblicazione: (2026)
Re-Evaluating Code LLM Benchmarks Under Semantic Mutation
di: Pan, Zhiyuan, et al.
Pubblicazione: (2025)
di: Pan, Zhiyuan, et al.
Pubblicazione: (2025)
On the Prevalence, Evolution, and Impact of Code Smells in Simulation Modelling Software
di: Mahbub, Riasat, et al.
Pubblicazione: (2024)
di: Mahbub, Riasat, et al.
Pubblicazione: (2024)
Empirical Characterization of Logging Smells in Machine Learning Code
di: Foalem, Patrick Loic, et al.
Pubblicazione: (2026)
di: Foalem, Patrick Loic, et al.
Pubblicazione: (2026)
Empirical Characterization of Logging Smells in Machine Learning Code
di: Foalem, Patrick Loic, et al.
Pubblicazione: (2026)
di: Foalem, Patrick Loic, et al.
Pubblicazione: (2026)
Automated Unit Test Refactoring
di: Gao, Yi, et al.
Pubblicazione: (2024)
di: Gao, Yi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SelfPiCo: Self-Guided Partial Code Execution with LLMs
di: Xue, Zhipeng, et al.
Pubblicazione: (2024) -
Actionable Warning Is Not Enough: Recommending Valid Actionable Warnings with Weak Supervision
di: Xue, Zhipeng, et al.
Pubblicazione: (2025) -
Easy over Hard: A Simple Baseline for Test Failures Causes Prediction
di: Gao, Zhipeng, et al.
Pubblicazione: (2024) -
Automating TODO-missed Methods Detection and Patching
di: Gao, Zhipeng, et al.
Pubblicazione: (2024) -
Towards Better Answers: Automated Stack Overflow Post Updating
di: Mai, Yubo, et al.
Pubblicazione: (2024)