Open the Oyster: Empirical Evaluation and Improvement of Code Reasoning Confidence in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Shufan, Hu, Xing, Chen, Junkai, Pan, Zhiyuan, Xia, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Re-Evaluating Code LLM Benchmarks Under Semantic Mutation
par: Pan, Zhiyuan, et autres
Publié: (2025)
par: Pan, Zhiyuan, et autres
Publié: (2025)
CATCODER: Repository-Level Code Generation with Relevant Code and Type Context
par: Pan, Zhiyuan, et autres
Publié: (2024)
par: Pan, Zhiyuan, et autres
Publié: (2024)
GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers
par: Jiang, Shufan, et autres
Publié: (2026)
par: Jiang, Shufan, et autres
Publié: (2026)
CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation
par: Yang, Guang, et autres
Publié: (2025)
par: Yang, Guang, et autres
Publié: (2025)
From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation
par: Yang, Guang, et autres
Publié: (2026)
par: Yang, Guang, et autres
Publié: (2026)
An Empirical Study of Knowledge Distillation for Code Understanding Tasks
par: Wang, Ruiqi, et autres
Publié: (2025)
par: Wang, Ruiqi, et autres
Publié: (2025)
Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering
par: Wang, Ruiqi, et autres
Publié: (2025)
par: Wang, Ruiqi, et autres
Publié: (2025)
Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision
par: Lin, Hong Yi, et autres
Publié: (2026)
par: Lin, Hong Yi, et autres
Publié: (2026)
NLPerturbator: Studying the Robustness of Code LLMs to Natural Language Variations
par: Chen, Junkai, et autres
Publié: (2024)
par: Chen, Junkai, et autres
Publié: (2024)
An Empirical Study of Speculative Decoding on Software Engineering Tasks
par: Li, Yijia, et autres
Publié: (2026)
par: Li, Yijia, et autres
Publié: (2026)
Using LLMs in Software Requirements Specifications: An Empirical Evaluation
par: Krishna, Madhava, et autres
Publié: (2024)
par: Krishna, Madhava, et autres
Publié: (2024)
An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code
par: Vulićević, Jelena Ilić
Publié: (2026)
par: Vulićević, Jelena Ilić
Publié: (2026)
Reasoning Runtime Behavior of a Program with LLM: How Far Are We?
par: Chen, Junkai, et autres
Publié: (2024)
par: Chen, Junkai, et autres
Publié: (2024)
Rectifier: Code Translation with Corrector via LLMs
par: Yin, Xin, et autres
Publié: (2024)
par: Yin, Xin, et autres
Publié: (2024)
Evaluating the Energy-Efficiency of the Code Generated by LLMs
par: Islam, Md Arman, et autres
Publié: (2025)
par: Islam, Md Arman, et autres
Publié: (2025)
Do Code LLMs Understand Design Patterns?
par: Pan, Zhenyu, et autres
Publié: (2025)
par: Pan, Zhenyu, et autres
Publié: (2025)
CoRe: Benchmarking LLMs Code Reasoning Capabilities through Static Analysis Tasks
par: Xie, Danning, et autres
Publié: (2025)
par: Xie, Danning, et autres
Publié: (2025)
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
par: Hu, Ruida, et autres
Publié: (2025)
par: Hu, Ruida, et autres
Publié: (2025)
An Empirical Study of OpenAI API Discussions on Stack Overflow
par: Chen, Xiang, et autres
Publié: (2025)
par: Chen, Xiang, et autres
Publié: (2025)
HFuzzer: Testing Large Language Models for Package Hallucinations via Phrase-based Fuzzing
par: Zhao, Yukai, et autres
Publié: (2025)
par: Zhao, Yukai, et autres
Publié: (2025)
Holistic Evaluation of State-of-the-Art LLMs for Code Generation
par: Zhang, Le, et autres
Publié: (2025)
par: Zhang, Le, et autres
Publié: (2025)
Coding in a Bubble? Evaluating LLMs in Resolving Context Adaptation Bugs During Code Adaptation
par: Zhang, Tanghaoran, et autres
Publié: (2026)
par: Zhang, Tanghaoran, et autres
Publié: (2026)
From Empirical Evaluation to Context-Aware Enhancement: Repairing Regression Errors with LLMs
par: Ho, Anh, et autres
Publié: (2025)
par: Ho, Anh, et autres
Publié: (2025)
TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework
par: Gao, Shuzheng, et autres
Publié: (2025)
par: Gao, Shuzheng, et autres
Publié: (2025)
AutoCodeRover: Autonomous Program Improvement
par: Zhang, Yuntong, et autres
Publié: (2024)
par: Zhang, Yuntong, et autres
Publié: (2024)
COAST: Enhancing the Code Debugging Ability of LLMs through Communicative Agent Based Data Synthesis
par: Yang, Weiqing, et autres
Publié: (2024)
par: Yang, Weiqing, et autres
Publié: (2024)
Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code
par: He, Kaifeng, et autres
Publié: (2026)
par: He, Kaifeng, et autres
Publié: (2026)
Generating High-Quality Datasets for Code Editing via Open-Source Language Models
par: Zhang, Zekai, et autres
Publié: (2025)
par: Zhang, Zekai, et autres
Publié: (2025)
Code Review Agent Benchmark
par: Zhang, Yuntong, et autres
Publié: (2026)
par: Zhang, Yuntong, et autres
Publié: (2026)
Beyond Accuracy: An Empirical Study on Unit Testing in Open-source Deep Learning Projects
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software
par: Yi, Lirong, et autres
Publié: (2025)
par: Yi, Lirong, et autres
Publié: (2025)
FastCode: Fast and Cost-Efficient Code Understanding and Reasoning
par: Li, Zhonghang, et autres
Publié: (2026)
par: Li, Zhonghang, et autres
Publié: (2026)
DeepCode: Open Agentic Coding
par: Li, Zongwei, et autres
Publié: (2025)
par: Li, Zongwei, et autres
Publié: (2025)
The Fools are Certain; the Wise are Doubtful: Exploring LLM Confidence in Code Completion
par: Kotti, Zoe, et autres
Publié: (2025)
par: Kotti, Zoe, et autres
Publié: (2025)
Mutation-based Consistency Testing for Evaluating the Code Understanding Capability of LLMs
par: Li, Ziyu, et autres
Publié: (2024)
par: Li, Ziyu, et autres
Publié: (2024)
Augmenting Large Language Models with Static Code Analysis for Automated Code Quality Improvements
par: Abtahi, Seyed Moein, et autres
Publié: (2025)
par: Abtahi, Seyed Moein, et autres
Publié: (2025)
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities
par: Wang, Hanbin, et autres
Publié: (2025)
par: Wang, Hanbin, et autres
Publié: (2025)
Reducing False Positives in Static Bug Detection with LLMs: An Empirical Study in Industry
par: Du, Xueying, et autres
Publié: (2026)
par: Du, Xueying, et autres
Publié: (2026)
Boosting Source Code Learning with Text-Oriented Data Augmentation: An Empirical Study
par: Dong, Zeming, et autres
Publié: (2023)
par: Dong, Zeming, et autres
Publié: (2023)
An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems
par: Saju, Md Hasan, et autres
Publié: (2026)
par: Saju, Md Hasan, et autres
Publié: (2026)
Documents similaires
-
Re-Evaluating Code LLM Benchmarks Under Semantic Mutation
par: Pan, Zhiyuan, et autres
Publié: (2025) -
CATCODER: Repository-Level Code Generation with Relevant Code and Type Context
par: Pan, Zhiyuan, et autres
Publié: (2024) -
GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers
par: Jiang, Shufan, et autres
Publié: (2026) -
CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation
par: Yang, Guang, et autres
Publié: (2025) -
From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation
par: Yang, Guang, et autres
Publié: (2026)