Are LLMs Reliable Code Reviewers? Systematic Overcorrection in Requirement Conformance Judgement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jin, Haolin, Chen, Huaming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications
par: Jin, Haolin, et autres
Publié: (2025)
par: Jin, Haolin, et autres
Publié: (2025)
Towards Advancing Code Generation with Large Language Models: A Research Roadmap
par: Jin, Haolin, et autres
Publié: (2025)
par: Jin, Haolin, et autres
Publié: (2025)
RGD: Multi-LLM Based Agent Debugger via Refinement and Generation Guidance
par: Jin, Haolin, et autres
Publié: (2024)
par: Jin, Haolin, et autres
Publié: (2024)
From LLMs to LLM-based Agents for Software Engineering: A Survey of Current, Challenges and Future
par: Jin, Haolin, et autres
Publié: (2024)
par: Jin, Haolin, et autres
Publié: (2024)
LLMs are All You Need? Improving Fuzz Testing for MOJO with Large Language Models
par: Huang, Linghan, et autres
Publié: (2025)
par: Huang, Linghan, et autres
Publié: (2025)
Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code
par: He, Kaifeng, et autres
Publié: (2026)
par: He, Kaifeng, et autres
Publié: (2026)
Generative AI for Requirements Engineering: A Systematic Literature Review
par: Cheng, Haowei, et autres
Publié: (2024)
par: Cheng, Haowei, et autres
Publié: (2024)
Chain of Targeted Verification Questions to Improve the Reliability of Code Generated by LLMs
par: Ngassom, Sylvain Kouemo, et autres
Publié: (2024)
par: Ngassom, Sylvain Kouemo, et autres
Publié: (2024)
TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework
par: Gao, Shuzheng, et autres
Publié: (2025)
par: Gao, Shuzheng, et autres
Publié: (2025)
What You See Is Not Always What You Get: Evaluating GPT's Comprehension of Source Code
par: Wen, Jiawen, et autres
Publié: (2024)
par: Wen, Jiawen, et autres
Publié: (2024)
Improving LLM Code Generation via Requirement-Aware Curriculum Reinforcement Learning
par: Yin, Shouyu, et autres
Publié: (2026)
par: Yin, Shouyu, et autres
Publié: (2026)
Metamorphic Testing of Deep Code Models: A Systematic Literature Review
par: Asgari, Ali, et autres
Publié: (2025)
par: Asgari, Ali, et autres
Publié: (2025)
Using LLMs in Software Requirements Specifications: An Empirical Evaluation
par: Krishna, Madhava, et autres
Publié: (2024)
par: Krishna, Madhava, et autres
Publié: (2024)
Analysis of LLMs vs Human Experts in Requirements Engineering
par: Hymel, Cory, et autres
Publié: (2025)
par: Hymel, Cory, et autres
Publié: (2025)
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
par: Hu, Ruida, et autres
Publié: (2025)
par: Hu, Ruida, et autres
Publié: (2025)
An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors
par: Yu, Jiaxin, et autres
Publié: (2024)
par: Yu, Jiaxin, et autres
Publié: (2024)
On the Challenges of Fuzzing Techniques via Large Language Models
par: Huang, Linghan, et autres
Publié: (2024)
par: Huang, Linghan, et autres
Publié: (2024)
Novice Developers' Perspectives on Adopting LLMs for Software Development: A Systematic Literature Review
par: Ferino, Samuel, et autres
Publié: (2025)
par: Ferino, Samuel, et autres
Publié: (2025)
Explicating Tacit Regulatory Knowledge from LLMs to Auto-Formalize Requirements for Compliance Test Case Generation
par: Xue, Zhiyi, et autres
Publié: (2026)
par: Xue, Zhiyi, et autres
Publié: (2026)
From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation
par: Yang, Guang, et autres
Publié: (2026)
par: Yang, Guang, et autres
Publié: (2026)
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
par: Lin, Feng, et autres
Publié: (2025)
par: Lin, Feng, et autres
Publié: (2025)
LLMs and Stack Overflow Discussions: Reliability, Impact, and Challenges
par: Da Silva, Leuson, et autres
Publié: (2024)
par: Da Silva, Leuson, et autres
Publié: (2024)
Survey of GenAI for Automotive Software Development: From Requirements to Executable Code
par: Petrovic, Nenad, et autres
Publié: (2025)
par: Petrovic, Nenad, et autres
Publié: (2025)
From Inductive to Deductive: LLMs-Based Qualitative Data Analysis in Requirements Engineering
par: Shah, Syed Tauhid Ullah, et autres
Publié: (2025)
par: Shah, Syed Tauhid Ullah, et autres
Publié: (2025)
DockSmith: Scaling Reliable Coding Environments via an Agentic Docker Builder
par: Zhang, Jiaran, et autres
Publié: (2026)
par: Zhang, Jiaran, et autres
Publié: (2026)
Mastering the Craft of Data Synthesis for CodeLLMs
par: Chen, Meng, et autres
Publié: (2024)
par: Chen, Meng, et autres
Publié: (2024)
Migrating Code At Scale With LLMs At Google
par: Ziftci, Celal, et autres
Publié: (2025)
par: Ziftci, Celal, et autres
Publié: (2025)
Analysis on LLMs Performance for Code Summarization
par: Akib, Md. Ahnaf, et autres
Publié: (2024)
par: Akib, Md. Ahnaf, et autres
Publié: (2024)
Goal2Story: A Multi-Agent Fleet based on Privately Enabled sLLMs for Impacting Mapping on Requirements Elicitation
par: Zou, Xinkai, et autres
Publié: (2025)
par: Zou, Xinkai, et autres
Publié: (2025)
Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review
par: Kamalı, Hüseyin Özgür, et autres
Publié: (2026)
par: Kamalı, Hüseyin Özgür, et autres
Publié: (2026)
ZS4C: Zero-Shot Synthesis of Compilable Code for Incomplete Code Snippets using LLMs
par: Kabir, Azmain, et autres
Publié: (2024)
par: Kabir, Azmain, et autres
Publié: (2024)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
par: Wu, Fan, et autres
Publié: (2026)
par: Wu, Fan, et autres
Publié: (2026)
Bridging LLM-Generated Code and Requirements: Reverse Generation technique and SBC Metric for Developer Insights
par: Ponnusamy, Ahilan Ayyachamy Nadar
Publié: (2025)
par: Ponnusamy, Ahilan Ayyachamy Nadar
Publié: (2025)
Application Modernization with LLMs: Addressing Core Challenges in Reliability, Security, and Quality
par: Ponnusamy, Ahilan Ayyachamy Nadar
Publié: (2025)
par: Ponnusamy, Ahilan Ayyachamy Nadar
Publié: (2025)
ARLO: A Tailorable Approach for Transforming Natural Language Software Requirements into Architecture using LLMs
par: Helmi, Tooraj
Publié: (2025)
par: Helmi, Tooraj
Publié: (2025)
Open the Oyster: Empirical Evaluation and Improvement of Code Reasoning Confidence in LLMs
par: Wang, Shufan, et autres
Publié: (2025)
par: Wang, Shufan, et autres
Publié: (2025)
CodeTF: One-stop Transformer Library for State-of-the-art Code LLMs
par: Bui, Nghi D. Q., et autres
Publié: (2023)
par: Bui, Nghi D. Q., et autres
Publié: (2023)
The Code Barrier: What LLMs Actually Understand?
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
Do Code LLMs Understand Design Patterns?
par: Pan, Zhenyu, et autres
Publié: (2025)
par: Pan, Zhenyu, et autres
Publié: (2025)
Function-to-Style Guidance of LLMs for Code Translation
par: Zhang, Longhui, et autres
Publié: (2025)
par: Zhang, Longhui, et autres
Publié: (2025)
Documents similaires
-
Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications
par: Jin, Haolin, et autres
Publié: (2025) -
Towards Advancing Code Generation with Large Language Models: A Research Roadmap
par: Jin, Haolin, et autres
Publié: (2025) -
RGD: Multi-LLM Based Agent Debugger via Refinement and Generation Guidance
par: Jin, Haolin, et autres
Publié: (2024) -
From LLMs to LLM-based Agents for Software Engineering: A Survey of Current, Challenges and Future
par: Jin, Haolin, et autres
Publié: (2024) -
LLMs are All You Need? Improving Fuzz Testing for MOJO with Large Language Models
par: Huang, Linghan, et autres
Publié: (2025)