Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Binquan, Zhang, Li, Luo, Zhiwen, Du, Yuxin, Liu, Fang, Wang, Song, Shi, Lin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation
by: Zhang, Binquan, et al.
Published: (2026)
by: Zhang, Binquan, et al.
Published: (2026)
Decoding Human-LLM Collaboration in Coding: An Empirical Study of Multi-Turn Conversations in the Wild
by: Zhang, Binquan, et al.
Published: (2025)
by: Zhang, Binquan, et al.
Published: (2025)
AdaptiveLLM: A Framework for Selecting Optimal Cost-Efficient LLM for Code-Generation Based on CoT Length
by: Cheng, Junhang, et al.
Published: (2025)
by: Cheng, Junhang, et al.
Published: (2025)
Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
CodeCoT: Tackling Code Syntax Errors in CoT Reasoning for Code Generation
by: Huang, Dong, et al.
Published: (2023)
by: Huang, Dong, et al.
Published: (2023)
The Good, the Bad, and the Missing: Neural Code Generation for Machine Learning Tasks
by: Shin, Jiho, et al.
Published: (2023)
by: Shin, Jiho, et al.
Published: (2023)
On the Road to Personalized Code Intelligence: Portraiting and Assisting Developers Based on Their In-IDE Behaviors
by: Liu, Yuhong, et al.
Published: (2026)
by: Liu, Yuhong, et al.
Published: (2026)
Human-Like Code Quality Evaluation through LLM-based Recursive Semantic Comprehension
by: Xu, Fangzhou, et al.
Published: (2024)
by: Xu, Fangzhou, et al.
Published: (2024)
LAURA: Enhancing Code Review Generation with Context-Enriched Retrieval-Augmented LLM
by: Zhang, Yuxin, et al.
Published: (2025)
by: Zhang, Yuxin, et al.
Published: (2025)
MCTS-Refined CoT: High-Quality Fine-Tuning Data for LLM-Based Repository Issue Resolution
by: Wang, Yibo, et al.
Published: (2025)
by: Wang, Yibo, et al.
Published: (2025)
CodeCoR: An LLM-Based Self-Reflective Multi-Agent Framework for Code Generation
by: Pan, Ruwei, et al.
Published: (2025)
by: Pan, Ruwei, et al.
Published: (2025)
Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
by: Liu, Fang, et al.
Published: (2024)
by: Liu, Fang, et al.
Published: (2024)
CodeArena: A Collective Evaluation Platform for LLM Code Generation
by: Du, Mingzhe, et al.
Published: (2025)
by: Du, Mingzhe, et al.
Published: (2025)
GraphCodeAgent: Dual Graph-Guided LLM Agent for Retrieval-Augmented Repo-Level Code Generation
by: Li, Jia, et al.
Published: (2025)
by: Li, Jia, et al.
Published: (2025)
Uncovering Weaknesses in Neural Code Generation
by: Lian, Xiaoli, et al.
Published: (2024)
by: Lian, Xiaoli, et al.
Published: (2024)
Are Human Rules Necessary? Generating Reusable APIs with CoT Reasoning and In-Context Learning
by: Mai, Yubo, et al.
Published: (2024)
by: Mai, Yubo, et al.
Published: (2024)
On Evaluating the Efficiency of Source Code Generated by LLMs
by: Niu, Changan, et al.
Published: (2024)
by: Niu, Changan, et al.
Published: (2024)
Inducing Vulnerable Code Generation in LLM Coding Assistants
by: Zeng, Binqi, et al.
Published: (2025)
by: Zeng, Binqi, et al.
Published: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
by: Wang, Peiding, et al.
Published: (2025)
by: Wang, Peiding, et al.
Published: (2025)
RepoScope: Leveraging Call Chain-Aware Multi-View Context for Repository-Level Code Generation
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
No Need to Lift a Finger Anymore? Assessing the Quality of Code Generation by ChatGPT
by: Liu, Zhijie, et al.
Published: (2023)
by: Liu, Zhijie, et al.
Published: (2023)
One Size Does Not Fit All: Investigating Efficacy of Perplexity in Detecting LLM-Generated Code
by: Xu, Jinwei, et al.
Published: (2024)
by: Xu, Jinwei, et al.
Published: (2024)
LLMs Meet Library Evolution: Evaluating Deprecated API Usage in LLM-based Code Completion
by: Wang, Chong, et al.
Published: (2024)
by: Wang, Chong, et al.
Published: (2024)
Bias Unveiled: Investigating Social Bias in LLM-Generated Code
by: Ling, Lin, et al.
Published: (2024)
by: Ling, Lin, et al.
Published: (2024)
Benchmarking and Studying the LLM-based Code Review
by: Zeng, Zhengran, et al.
Published: (2025)
by: Zeng, Zhengran, et al.
Published: (2025)
SolSearch: An LLM-Driven Framework for Efficient SAT-Solving Code Generation
by: Sheng, Junjie, et al.
Published: (2025)
by: Sheng, Junjie, et al.
Published: (2025)
Evaluating and Achieving Controllable Code Completion in Code LLM
by: Zhang, Jiajun, et al.
Published: (2026)
by: Zhang, Jiajun, et al.
Published: (2026)
Analyzing Chain of Thought (CoT) Approaches in Control Flow Code Deobfuscation Tasks
by: Mohseni, Seyedreza, et al.
Published: (2026)
by: Mohseni, Seyedreza, et al.
Published: (2026)
DSL or Code? Evaluating the Quality of LLM-Generated Algebraic Specifications: A Case Study in Optimization at Kinaxis
by: Ayoughi, Negin, et al.
Published: (2026)
by: Ayoughi, Negin, et al.
Published: (2026)
TestART: Improving LLM-based Unit Testing via Co-evolution of Automated Generation and Repair Iteration
by: Gu, Siqi, et al.
Published: (2024)
by: Gu, Siqi, et al.
Published: (2024)
CodeMEM: AST-Guided Adaptive Memory for Repository-Level Iterative Code Generation
by: Wang, Peiding, et al.
Published: (2026)
by: Wang, Peiding, et al.
Published: (2026)
Whose fault is it anyway? SILC: Safe Integration of LLM-Generated Code
by: Lin, Peisen, et al.
Published: (2024)
by: Lin, Peisen, et al.
Published: (2024)
ReVul-CoT: Towards Effective Software Vulnerability Assessment with Retrieval-Augmented Generation and Chain-of-Thought Prompting
by: Chen, Zhijie, et al.
Published: (2025)
by: Chen, Zhijie, et al.
Published: (2025)
Prompt-based Code Completion via Multi-Retrieval Augmented Generation
by: Tan, Hanzhuo, et al.
Published: (2024)
by: Tan, Hanzhuo, et al.
Published: (2024)
Code Copycat Conundrum: Demystifying Repetition in LLM-based Code Generation
by: Liu, Mingwei, et al.
Published: (2025)
by: Liu, Mingwei, et al.
Published: (2025)
Probing Privacy Leaks in LLM-based Code Generation via Test Generation
by: Ge, Yifei, et al.
Published: (2026)
by: Ge, Yifei, et al.
Published: (2026)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
by: He, Mengliang, et al.
Published: (2025)
by: He, Mengliang, et al.
Published: (2025)
Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation
by: Li, Minxiao, et al.
Published: (2026)
by: Li, Minxiao, et al.
Published: (2026)
Too Noisy To Learn: Enhancing Data Quality for Code Review Comment Generation
by: Liu, Chunhua, et al.
Published: (2025)
by: Liu, Chunhua, et al.
Published: (2025)
Multi-LLM Orchestration for High-Quality Code Generation: Exploiting Complementary Model Strengths
by: Chen, Huashan, et al.
Published: (2025)
by: Chen, Huashan, et al.
Published: (2025)
Similar Items
-
An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation
by: Zhang, Binquan, et al.
Published: (2026) -
Decoding Human-LLM Collaboration in Coding: An Empirical Study of Multi-Turn Conversations in the Wild
by: Zhang, Binquan, et al.
Published: (2025) -
AdaptiveLLM: A Framework for Selecting Optimal Cost-Efficient LLM for Code-Generation Based on CoT Length
by: Cheng, Junhang, et al.
Published: (2025) -
Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code
by: Liu, Yang, et al.
Published: (2026) -
CodeCoT: Tackling Code Syntax Errors in CoT Reasoning for Code Generation
by: Huang, Dong, et al.
Published: (2023)