CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Guang, Zhou, Yu, Chen, Xiang, Zheng, Wei, Hu, Xing, Zhou, Xin, Lo, David, Chen, Taolue |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Less is More: DocString Compression in Code Generation
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
CodeScore-R: An Automated Robustness Metric for Assessing the FunctionalCorrectness of Code Synthesis
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
Defending Code Language Models against Backdoor Attacks with Deceptive Cross-Entropy Loss
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
Chain-of-Thought in Neural Code Generation: From and For Lightweight Language Models
by: Yang, Guang, et al.
Published: (2023)
by: Yang, Guang, et al.
Published: (2023)
Less is More: Towards Green Code Large Language Models via Unified Structural Pruning
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
SimADFuzz: Simulation-Feedback Fuzz Testing for Autonomous Driving Systems
by: Yang, Huiwen, et al.
Published: (2024)
by: Yang, Huiwen, et al.
Published: (2024)
Semantic Consensus Decoding: Backdoor Defense for Verilog Code Generation
by: Yang, Guang, et al.
Published: (2026)
by: Yang, Guang, et al.
Published: (2026)
From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation
by: Yang, Guang, et al.
Published: (2026)
by: Yang, Guang, et al.
Published: (2026)
Anchor Attention, Small Cache: Code Generation with Large Language Models
by: Zhang, Xiangyu, et al.
Published: (2024)
by: Zhang, Xiangyu, et al.
Published: (2024)
Hotfixing Large Language Models for Code
by: Yang, Zhou, et al.
Published: (2024)
by: Yang, Zhou, et al.
Published: (2024)
DITING: A Static Analyzer for Identifying Bad Partitioning Issues in TEE Applications
by: Ma, Chengyan, et al.
Published: (2025)
by: Ma, Chengyan, et al.
Published: (2025)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
by: Hu, Xing, et al.
Published: (2025)
by: Hu, Xing, et al.
Published: (2025)
Open the Oyster: Empirical Evaluation and Improvement of Code Reasoning Confidence in LLMs
by: Wang, Shufan, et al.
Published: (2025)
by: Wang, Shufan, et al.
Published: (2025)
CREME: Robustness Enhancement of Code LLMs via Layer-Aware Model Editing
by: Liu, Shuhan, et al.
Published: (2025)
by: Liu, Shuhan, et al.
Published: (2025)
A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task
by: Liu, Shuhan, et al.
Published: (2026)
by: Liu, Shuhan, et al.
Published: (2026)
A Comprehensive Evaluation of Parameter-Efficient Fine-Tuning on Code Smell Detection
by: Zhang, Beiqi, et al.
Published: (2024)
by: Zhang, Beiqi, et al.
Published: (2024)
UniCode: Augmenting Evaluation for Code Reasoning
by: Zheng, Xinyue, et al.
Published: (2025)
by: Zheng, Xinyue, et al.
Published: (2025)
Ecosystem of Large Language Models for Code
by: Yang, Zhou, et al.
Published: (2024)
by: Yang, Zhou, et al.
Published: (2024)
An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks
by: Zhou, Xin, et al.
Published: (2025)
by: Zhou, Xin, et al.
Published: (2025)
Task Abstention for Large Language Models in Code Generation
by: Zhou, Yanke, et al.
Published: (2026)
by: Zhou, Yanke, et al.
Published: (2026)
Compiling Code LLMs into Lightweight Executables
by: Shi, Jieke, et al.
Published: (2026)
by: Shi, Jieke, et al.
Published: (2026)
Large Language Model for Vulnerability Detection: Emerging Results and Future Directions
by: Zhou, Xin, et al.
Published: (2024)
by: Zhou, Xin, et al.
Published: (2024)
VFDelta: A Framework for Detecting Silent Vulnerability Fixes by Enhancing Code Change Learning
by: Yang, Xu, et al.
Published: (2024)
by: Yang, Xu, et al.
Published: (2024)
Backdoors in Code Summarizers: How Bad Is It?
by: Wang, Chenyu, et al.
Published: (2025)
by: Wang, Chenyu, et al.
Published: (2025)
Demystifying Faulty Code with LLM: Step-by-Step Reasoning for Explainable Fault Localization
by: Widyasari, Ratnadira, et al.
Published: (2024)
by: Widyasari, Ratnadira, et al.
Published: (2024)
Think Like Human Developers: Harnessing Community Knowledge for Structured Code Reasoning
by: Yang, Chengran, et al.
Published: (2025)
by: Yang, Chengran, et al.
Published: (2025)
Gotcha! This Model Uses My Code! Evaluating Membership Leakage Risks in Code Models
by: Yang, Zhou, et al.
Published: (2023)
by: Yang, Zhou, et al.
Published: (2023)
Re-Evaluating Code LLM Benchmarks Under Semantic Mutation
by: Pan, Zhiyuan, et al.
Published: (2025)
by: Pan, Zhiyuan, et al.
Published: (2025)
Robustness, Security, Privacy, Explainability, Efficiency, and Usability of Large Language Models for Code
by: Yang, Zhou, et al.
Published: (2024)
by: Yang, Zhou, et al.
Published: (2024)
Greening Large Language Models of Code
by: Shi, Jieke, et al.
Published: (2023)
by: Shi, Jieke, et al.
Published: (2023)
Token Sugar: Making Source Code Sweeter for LLMs through Token-Efficient Shorthand
by: Sun, Zhensu, et al.
Published: (2025)
by: Sun, Zhensu, et al.
Published: (2025)
ActRef: Enhancing the Understanding of Python Code Refactoring with Action-Based Analysis
by: Wang, Siqi, et al.
Published: (2025)
by: Wang, Siqi, et al.
Published: (2025)
Uncertainty Quantification for LLM-based Code Generation
by: Xu, Senrong, et al.
Published: (2026)
by: Xu, Senrong, et al.
Published: (2026)
Adversarial Attacks on Code Models with Discriminative Graph Patterns
by: Nguyen, Thanh-Dat, et al.
Published: (2023)
by: Nguyen, Thanh-Dat, et al.
Published: (2023)
Unveiling Memorization in Code Models
by: Yang, Zhou, et al.
Published: (2023)
by: Yang, Zhou, et al.
Published: (2023)
Towards Efficient Verification of Constant-Time Cryptographic Implementations
by: Cai, Luwei, et al.
Published: (2024)
by: Cai, Luwei, et al.
Published: (2024)
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
by: Liu, Changshu, et al.
Published: (2025)
by: Liu, Changshu, et al.
Published: (2025)
Efficient and Green Large Language Models for Software Engineering: Literature Review, Vision, and the Road Ahead
by: Shi, Jieke, et al.
Published: (2024)
by: Shi, Jieke, et al.
Published: (2024)
Comment Traps: How Defective Commented-out Code Augment Defects in AI-Assisted Code Generation
by: Huang, Yuan, et al.
Published: (2025)
by: Huang, Yuan, et al.
Published: (2025)
An Empirical Study of Retrieval-Augmented Code Generation: Challenges and Opportunities
by: Yang, Zezhou, et al.
Published: (2025)
by: Yang, Zezhou, et al.
Published: (2025)
Similar Items
-
Less is More: DocString Compression in Code Generation
by: Yang, Guang, et al.
Published: (2024) -
CodeScore-R: An Automated Robustness Metric for Assessing the FunctionalCorrectness of Code Synthesis
by: Yang, Guang, et al.
Published: (2024) -
Defending Code Language Models against Backdoor Attacks with Deceptive Cross-Entropy Loss
by: Yang, Guang, et al.
Published: (2024) -
Chain-of-Thought in Neural Code Generation: From and For Lightweight Language Models
by: Yang, Guang, et al.
Published: (2023) -
Less is More: Towards Green Code Large Language Models via Unified Structural Pruning
by: Yang, Guang, et al.
Published: (2024)