Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Fang, Liu, Yang, Shi, Lin, Yang, Zhen, Zhang, Li, Lian, Xiaoli, Li, Zhongqi, Ma, Yuchi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Functional Correctness: Investigating Coding Style Inconsistencies in Large Language Models
by: Wang, Yanlin, et al.
Published: (2024)
by: Wang, Yanlin, et al.
Published: (2024)
FastCoder: Accelerating Repository-level Code Generation via Efficient Retrieval and Verification
by: Zhao, Qianhui, et al.
Published: (2025)
by: Zhao, Qianhui, et al.
Published: (2025)
Enhancing Automated Program Repair with Solution Design
by: Zhao, Jiuang, et al.
Published: (2024)
by: Zhao, Jiuang, et al.
Published: (2024)
Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis
by: Khati, Dipin, et al.
Published: (2026)
by: Khati, Dipin, et al.
Published: (2026)
Exploring and Unleashing the Power of Large Language Models in Automated Code Translation
by: Yang, Zhen, et al.
Published: (2024)
by: Yang, Zhen, et al.
Published: (2024)
SecureReviewer: Enhancing Large Language Models for Secure Code Review through Secure-aware Fine-tuning
by: Liu, Fang, et al.
Published: (2025)
by: Liu, Fang, et al.
Published: (2025)
Eliminating Hallucination-Induced Errors in LLM Code Generation with Functional Clustering
by: Ravuri, Chaitanya, et al.
Published: (2025)
by: Ravuri, Chaitanya, et al.
Published: (2025)
AutoPLC: Generating Vendor-Aware Structured Text for Programmable Logic Controllers
by: Yang, Donghao, et al.
Published: (2024)
by: Yang, Donghao, et al.
Published: (2024)
Towards Mitigating API Hallucination in Code Generated by LLMs with Hierarchical Dependency Aware
by: Chen, Yujia, et al.
Published: (2025)
by: Chen, Yujia, et al.
Published: (2025)
MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
by: Liu, Simiao, et al.
Published: (2026)
by: Liu, Simiao, et al.
Published: (2026)
Beyond Function-Level Search: Repository-Aware Dual-Encoder Code Retrieval with Adversarial Verification
by: Liu, Aofan, et al.
Published: (2025)
by: Liu, Aofan, et al.
Published: (2025)
Hallucinations in Code Change to Natural Language Generation: Prevalence and Evaluation of Detection Metrics
by: Liu, Chunhua, et al.
Published: (2025)
by: Liu, Chunhua, et al.
Published: (2025)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
by: Zheng, Dewu, et al.
Published: (2024)
by: Zheng, Dewu, et al.
Published: (2024)
Unseen Horizons: Unveiling the Real Capability of LLM Code Generation Beyond the Familiar
by: Zhang, Yuanliang, et al.
Published: (2024)
by: Zhang, Yuanliang, et al.
Published: (2024)
From Context to Intent: Reasoning-Guided Function-Level Code Completion
by: Li, Yanzhou, et al.
Published: (2025)
by: Li, Yanzhou, et al.
Published: (2025)
Hallucination in LLM-Based Code Generation: An Automotive Case Study
by: Pavel, Marc, et al.
Published: (2025)
by: Pavel, Marc, et al.
Published: (2025)
CodeCircuit: Toward Inferring LLM-Generated Code Correctness via Attribution Graphs
by: He, Yicheng, et al.
Published: (2026)
by: He, Yicheng, et al.
Published: (2026)
Towards Better Correctness and Efficiency in Code Generation
by: Feng, Yunlong, et al.
Published: (2025)
by: Feng, Yunlong, et al.
Published: (2025)
Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs
by: Chen, Yujia, et al.
Published: (2026)
by: Chen, Yujia, et al.
Published: (2026)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
by: Wang, Peiding, et al.
Published: (2025)
by: Wang, Peiding, et al.
Published: (2025)
ShortCoder: Knowledge-Augmented Syntax Optimization for Token-Efficient Code Generation
by: Liu, Sicong, et al.
Published: (2026)
by: Liu, Sicong, et al.
Published: (2026)
LLM4EFFI: Leveraging Large Language Models to Enhance Code Efficiency and Correctness
by: Ye, Tong, et al.
Published: (2025)
by: Ye, Tong, et al.
Published: (2025)
Beyond Functional Correctness: Design Issues in AI IDE-Generated Large-Scale Projects
by: Kashif, Syed Mohammad, et al.
Published: (2026)
by: Kashif, Syed Mohammad, et al.
Published: (2026)
NARRepair: Non-Autoregressive Code Generation Model for Automatic Program Repair
by: Yang, Zhenyu, et al.
Published: (2024)
by: Yang, Zhenyu, et al.
Published: (2024)
VerilogReader: LLM-Aided Hardware Test Generation
by: Ma, Ruiyang, et al.
Published: (2024)
by: Ma, Ruiyang, et al.
Published: (2024)
LLM Hallucinations in Practical Code Generation: Phenomena, Mechanism, and Mitigation
by: Zhang, Ziyao, et al.
Published: (2024)
by: Zhang, Ziyao, et al.
Published: (2024)
Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
by: Li, Chengze, et al.
Published: (2025)
by: Li, Chengze, et al.
Published: (2025)
Code Hallucination
by: Rahman, Mirza Masfiqur, et al.
Published: (2024)
by: Rahman, Mirza Masfiqur, et al.
Published: (2024)
Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes
by: Chon, Heejae, et al.
Published: (2024)
by: Chon, Heejae, et al.
Published: (2024)
Personality-Guided Code Generation Using Large Language Models
by: Guo, Yaoqi, et al.
Published: (2024)
by: Guo, Yaoqi, et al.
Published: (2024)
HLSDebugger: Identification and Correction of Logic Bugs in HLS Code with LLM Solutions
by: Wang, Jing, et al.
Published: (2025)
by: Wang, Jing, et al.
Published: (2025)
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
by: Lin, Feng, et al.
Published: (2025)
by: Lin, Feng, et al.
Published: (2025)
DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs
by: Liu, Zhihan, et al.
Published: (2024)
by: Liu, Zhihan, et al.
Published: (2024)
CodeMirage: Hallucinations in Code Generated by Large Language Models
by: Agarwal, Vibhor, et al.
Published: (2024)
by: Agarwal, Vibhor, et al.
Published: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
Faver: Boosting LLM-based RTL Generation with Function Abstracted Verifiable Middleware
by: Mu, Jianan, et al.
Published: (2025)
by: Mu, Jianan, et al.
Published: (2025)
An Empirical Study on Failures in Automated Issue Solving
by: Liu, Simiao, et al.
Published: (2025)
by: Liu, Simiao, et al.
Published: (2025)
Uncertainty Quantification for LLM-based Code Generation
by: Xu, Senrong, et al.
Published: (2026)
by: Xu, Senrong, et al.
Published: (2026)
Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling
by: Ni, Ziyi, et al.
Published: (2024)
by: Ni, Ziyi, et al.
Published: (2024)
Correctness isnt Efficiency: Runtime Memory Divergence in LLM-Generated Code
by: Rajput, Prateek, et al.
Published: (2026)
by: Rajput, Prateek, et al.
Published: (2026)
Similar Items
-
Beyond Functional Correctness: Investigating Coding Style Inconsistencies in Large Language Models
by: Wang, Yanlin, et al.
Published: (2024) -
FastCoder: Accelerating Repository-level Code Generation via Efficient Retrieval and Verification
by: Zhao, Qianhui, et al.
Published: (2025) -
Enhancing Automated Program Repair with Solution Design
by: Zhao, Jiuang, et al.
Published: (2024) -
Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis
by: Khati, Dipin, et al.
Published: (2026) -
Exploring and Unleashing the Power of Large Language Models in Automated Code Translation
by: Yang, Zhen, et al.
Published: (2024)