Hallucinations in Code Change to Natural Language Generation: Prevalence and Evaluation of Detection Metrics
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Chunhua, Lin, Hong Yi, Thongtanunam, Patanamon |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring the Potential of Large Language Models in Fine-Grained Review Comment Classification
by: Nguyen, Linh, et al.
Published: (2025)
by: Nguyen, Linh, et al.
Published: (2025)
Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision
by: Lin, Hong Yi, et al.
Published: (2026)
by: Lin, Hong Yi, et al.
Published: (2026)
HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation
by: Tantithamthavorn, Kla, et al.
Published: (2026)
by: Tantithamthavorn, Kla, et al.
Published: (2026)
Too Noisy To Learn: Enhancing Data Quality for Code Review Comment Generation
by: Liu, Chunhua, et al.
Published: (2025)
by: Liu, Chunhua, et al.
Published: (2025)
Enhancing Neural Code Representation with Additional Context
by: Nguyen, Huy, et al.
Published: (2025)
by: Nguyen, Huy, et al.
Published: (2025)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
by: Lin, Hong Yi, et al.
Published: (2025)
by: Lin, Hong Yi, et al.
Published: (2025)
AI-Assisted Code Review as a Scaffold for Code Quality and Self-Regulated Learning: An Experience Report
by: Oliveira, Eduardo, et al.
Published: (2026)
by: Oliveira, Eduardo, et al.
Published: (2026)
AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection
by: Charoenwet, Wachiraphan, et al.
Published: (2026)
by: Charoenwet, Wachiraphan, et al.
Published: (2026)
Code Ownership: The Principles, Differences, and Their Associations with Software Quality
by: Thongtanunam, Patanamon, et al.
Published: (2024)
by: Thongtanunam, Patanamon, et al.
Published: (2024)
Leveraging Reviewer Experience in Code Review Comment Generation
by: Lin, Hong Yi, et al.
Published: (2024)
by: Lin, Hong Yi, et al.
Published: (2024)
Should Code Models Learn Pedagogically? A Preliminary Evaluation of Curriculum Learning for Real-World Software Engineering Tasks
by: Khant, Kyi Shin, et al.
Published: (2025)
by: Khant, Kyi Shin, et al.
Published: (2025)
Improving Automated Code Reviews: Learning from Experience
by: Lin, Hong Yi, et al.
Published: (2024)
by: Lin, Hong Yi, et al.
Published: (2024)
Automatic Programming: Large Language Models and Beyond
by: Lyu, Michael R., et al.
Published: (2024)
by: Lyu, Michael R., et al.
Published: (2024)
Encoding Version History Context for Better Code Representation
by: Nguyen, Huy, et al.
Published: (2024)
by: Nguyen, Huy, et al.
Published: (2024)
Benchmarks and Metrics for Evaluations of Code Generation: A Critical Review
by: Paul, Debalina Ghosh, et al.
Published: (2024)
by: Paul, Debalina Ghosh, et al.
Published: (2024)
Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
by: Liu, Fang, et al.
Published: (2024)
by: Liu, Fang, et al.
Published: (2024)
CodeMirage: Hallucinations in Code Generated by Large Language Models
by: Agarwal, Vibhor, et al.
Published: (2024)
by: Agarwal, Vibhor, et al.
Published: (2024)
Automatically Recommend Code Updates: Are We There Yet?
by: Liu, Yue, et al.
Published: (2022)
by: Liu, Yue, et al.
Published: (2022)
Toward Effective Secure Code Reviews: An Empirical Study of Security-Related Coding Weaknesses
by: Charoenwet, Wachiraphan, et al.
Published: (2023)
by: Charoenwet, Wachiraphan, et al.
Published: (2023)
Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis
by: Khati, Dipin, et al.
Published: (2026)
by: Khati, Dipin, et al.
Published: (2026)
Code Hallucination
by: Rahman, Mirza Masfiqur, et al.
Published: (2024)
by: Rahman, Mirza Masfiqur, et al.
Published: (2024)
Enhancing Code Review through Fuzzing and Likely Invariants
by: Charoenwet, Wachiraphan, et al.
Published: (2025)
by: Charoenwet, Wachiraphan, et al.
Published: (2025)
Can Code Evaluation Metrics Detect Code Plagiarism?
by: Ebrahim, Fahad, et al.
Published: (2026)
by: Ebrahim, Fahad, et al.
Published: (2026)
An Empirical Study of Static Analysis Tools for Secure Code Review
by: Charoenwet, Wachiraphan, et al.
Published: (2024)
by: Charoenwet, Wachiraphan, et al.
Published: (2024)
A Systematic Literature Review on Reasons and Approaches for Accurate Effort Estimations in Agile
by: Pasuksmit, Jirat, et al.
Published: (2024)
by: Pasuksmit, Jirat, et al.
Published: (2024)
User Centric Evaluation of Code Generation Tools
by: Miah, Tanha, et al.
Published: (2024)
by: Miah, Tanha, et al.
Published: (2024)
A Qualitative Investigation into LLM-Generated Multilingual Code Comments and Automatic Evaluation Metrics
by: Katzy, Jonathan, et al.
Published: (2025)
by: Katzy, Jonathan, et al.
Published: (2025)
Hallucination in LLM-Based Code Generation: An Automotive Case Study
by: Pavel, Marc, et al.
Published: (2025)
by: Pavel, Marc, et al.
Published: (2025)
Hallucination by Code Generation LLMs: Taxonomy, Benchmarks, Mitigation, and Challenges
by: Lee, Yunseo, et al.
Published: (2025)
by: Lee, Yunseo, et al.
Published: (2025)
Eliminating Hallucination-Induced Errors in LLM Code Generation with Functional Clustering
by: Ravuri, Chaitanya, et al.
Published: (2025)
by: Ravuri, Chaitanya, et al.
Published: (2025)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
by: He, Mengliang, et al.
Published: (2025)
by: He, Mengliang, et al.
Published: (2025)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
by: Guo, Chengquan, et al.
Published: (2024)
by: Guo, Chengquan, et al.
Published: (2024)
Automated Classification of Source Code Changes Based on Metrics Clustering in the Software Development Process
by: Kniazev, Evgenii
Published: (2026)
by: Kniazev, Evgenii
Published: (2026)
Revisiting the Role of Natural Language Code Comments in Code Translation
by: Gupta, Monika, et al.
Published: (2026)
by: Gupta, Monika, et al.
Published: (2026)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
by: Jiang, Nan, et al.
Published: (2024)
by: Jiang, Nan, et al.
Published: (2024)
Insights from Benchmarking Frontier Language Models on Web App Code Generation
by: Cui, Yi
Published: (2024)
by: Cui, Yi
Published: (2024)
ScenEval: A Benchmark for Scenario-Based Evaluation of Code Generation
by: Paul, Debalina Ghosh, et al.
Published: (2024)
by: Paul, Debalina Ghosh, et al.
Published: (2024)
CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval
by: Geng, Jiahui, et al.
Published: (2026)
by: Geng, Jiahui, et al.
Published: (2026)
ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation
by: Hong, Jiseung, et al.
Published: (2026)
by: Hong, Jiseung, et al.
Published: (2026)
Structure-Aware Corpus Construction and User-Perception-Aligned Metrics for Large-Language-Model Code Completion
by: Liu, Dengfeng, et al.
Published: (2025)
by: Liu, Dengfeng, et al.
Published: (2025)
Similar Items
-
Exploring the Potential of Large Language Models in Fine-Grained Review Comment Classification
by: Nguyen, Linh, et al.
Published: (2025) -
Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision
by: Lin, Hong Yi, et al.
Published: (2026) -
HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation
by: Tantithamthavorn, Kla, et al.
Published: (2026) -
Too Noisy To Learn: Enhancing Data Quality for Code Review Comment Generation
by: Liu, Chunhua, et al.
Published: (2025) -
Enhancing Neural Code Representation with Additional Context
by: Nguyen, Huy, et al.
Published: (2025)