On LLMs' Internal Representation of Code Correctness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ribeiro, Francisco, Spiess, Claudio, Devanbu, Prem, Nadi, Sarah |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Robustly do LLMs Understand Execution Semantics?
par: Spiess, Claudio, et autres
Publié: (2026)
par: Spiess, Claudio, et autres
Publié: (2026)
Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs
par: Al-Kaswan, Ali, et autres
Publié: (2026)
par: Al-Kaswan, Ali, et autres
Publié: (2026)
Localized Calibrated Uncertainty in Code Language Models
par: Gros, David, et autres
Publié: (2025)
par: Gros, David, et autres
Publié: (2025)
Calibration and Correctness of Language Models for Code
par: Spiess, Claudio, et autres
Publié: (2024)
par: Spiess, Claudio, et autres
Publié: (2024)
Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time
par: Popescu, Razvan Mihai, et autres
Publié: (2026)
par: Popescu, Razvan Mihai, et autres
Publié: (2026)
Does In-IDE Calibration of Large Language Models work at Scale?
par: Koohestani, Roham, et autres
Publié: (2025)
par: Koohestani, Roham, et autres
Publié: (2025)
Operational Robustness of LLMs on Code Generation
par: Paul, Debalina Ghosh, et autres
Publié: (2026)
par: Paul, Debalina Ghosh, et autres
Publié: (2026)
CodeTaste: Can LLMs Generate Human-Level Code Refactorings?
par: Thillen, Alex, et autres
Publié: (2026)
par: Thillen, Alex, et autres
Publié: (2026)
Evaluating the Use of LLMs for Documentation to Code Traceability
par: Alor, Ebube, et autres
Publié: (2025)
par: Alor, Ebube, et autres
Publié: (2025)
LLMs in Coding and their Impact on the Commercial Software Engineering Landscape
par: Belozerov, Vladislav, et autres
Publié: (2025)
par: Belozerov, Vladislav, et autres
Publié: (2025)
Protocode: Prototype-Driven Interpretability for Code Generation in LLMs
par: Bodla, Krishna Vamshi, et autres
Publié: (2025)
par: Bodla, Krishna Vamshi, et autres
Publié: (2025)
The Struggles of LLMs in Cross-lingual Code Clone Detection
par: Moumoula, Micheline Bénédicte, et autres
Publié: (2024)
par: Moumoula, Micheline Bénédicte, et autres
Publié: (2024)
Automating Code Adaptation for MLOps -- A Benchmarking Study on LLMs
par: Patel, Harsh, et autres
Publié: (2024)
par: Patel, Harsh, et autres
Publié: (2024)
Drawing Pandas: A Benchmark for LLMs in Generating Plotting Code
par: Galimzyanov, Timur, et autres
Publié: (2024)
par: Galimzyanov, Timur, et autres
Publié: (2024)
SnipGen: A Mining Repository Framework for Evaluating LLMs for Code
par: Rodriguez-Cardenas, Daniel, et autres
Publié: (2025)
par: Rodriguez-Cardenas, Daniel, et autres
Publié: (2025)
An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code
par: Vulićević, Jelena Ilić
Publié: (2026)
par: Vulićević, Jelena Ilić
Publié: (2026)
LiCoEval: Evaluating LLMs on License Compliance in Code Generation
par: Xu, Weiwei, et autres
Publié: (2024)
par: Xu, Weiwei, et autres
Publié: (2024)
Free and Customizable Code Documentation with LLMs: A Fine-Tuning Approach
par: Chakrabarty, Sayak, et autres
Publié: (2024)
par: Chakrabarty, Sayak, et autres
Publié: (2024)
Towards Understanding What Code Language Models Learned
par: Ahmed, Toufique, et autres
Publié: (2023)
par: Ahmed, Toufique, et autres
Publié: (2023)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026)
par: Li, Yuangang, et autres
Publié: (2026)
Towards More Trustworthy and Interpretable LLMs for Code through Syntax-Grounded Explanations
par: Palacio, David N., et autres
Publié: (2024)
par: Palacio, David N., et autres
Publié: (2024)
CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance
par: Pai, Kunal, et autres
Publié: (2025)
par: Pai, Kunal, et autres
Publié: (2025)
Prism: Dynamic and Flexible Benchmarking of LLMs Code Generation with Monte Carlo Tree Search
par: Majdinasab, Vahid, et autres
Publié: (2025)
par: Majdinasab, Vahid, et autres
Publié: (2025)
Keeping Code-Aware LLMs Fresh: Full Refresh, In-Context Deltas, and Incremental Fine-Tuning
par: Sharma, Pradeep Kumar, et autres
Publié: (2025)
par: Sharma, Pradeep Kumar, et autres
Publié: (2025)
Correctness Assessment of Code Generated by Large Language Models Using Internal Representations
par: Bui, Tuan-Dung, et autres
Publié: (2025)
par: Bui, Tuan-Dung, et autres
Publié: (2025)
Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
par: Yang, Dayu, et autres
Publié: (2025)
par: Yang, Dayu, et autres
Publié: (2025)
Automatic Semantic Augmentation of Language Model Prompts (for Code Summarization)
par: Ahmed, Toufique, et autres
Publié: (2023)
par: Ahmed, Toufique, et autres
Publié: (2023)
Rethinking Repetition Problems of LLMs in Code Generation
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
miniCodeProps: a Minimal Benchmark for Proving Code Properties
par: Lohn, Evan, et autres
Publié: (2024)
par: Lohn, Evan, et autres
Publié: (2024)
Relative Positioning Based Code Chunking Method For Rich Context Retrieval In Repository Level Code Completion Task With Code Language Model
par: Rahman, Imranur, et autres
Publié: (2025)
par: Rahman, Imranur, et autres
Publié: (2025)
ZnTrack -- Data as Code
par: Zills, Fabian, et autres
Publié: (2024)
par: Zills, Fabian, et autres
Publié: (2024)
CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model
par: Di, Peng, et autres
Publié: (2023)
par: Di, Peng, et autres
Publié: (2023)
Evaluating the Effectiveness of LLMs in Fixing Maintainability Issues in Real-World Projects
par: Nunes, Henrique, et autres
Publié: (2025)
par: Nunes, Henrique, et autres
Publié: (2025)
Optimizing AI-Assisted Code Generation
par: Torka, Simon, et autres
Publié: (2024)
par: Torka, Simon, et autres
Publié: (2024)
Can Coding Agents Be General Agents?
par: Ivanov, Maksim, et autres
Publié: (2026)
par: Ivanov, Maksim, et autres
Publié: (2026)
RepairAgent: An Autonomous, LLM-Based Agent for Program Repair
par: Bouzenia, Islem, et autres
Publié: (2024)
par: Bouzenia, Islem, et autres
Publié: (2024)
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X
par: Zheng, Qinkai, et autres
Publié: (2023)
par: Zheng, Qinkai, et autres
Publié: (2023)
Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks
par: Gong, Linyuan, et autres
Publié: (2024)
par: Gong, Linyuan, et autres
Publié: (2024)
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
par: Wang, Yejie, et autres
Publié: (2024)
par: Wang, Yejie, et autres
Publié: (2024)
I Know Which LLM Wrote Your Code Last Summer: LLM generated Code Stylometry for Authorship Attribution
par: Bisztray, Tamas, et autres
Publié: (2025)
par: Bisztray, Tamas, et autres
Publié: (2025)
Documents similaires
-
How Robustly do LLMs Understand Execution Semantics?
par: Spiess, Claudio, et autres
Publié: (2026) -
Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs
par: Al-Kaswan, Ali, et autres
Publié: (2026) -
Localized Calibrated Uncertainty in Code Language Models
par: Gros, David, et autres
Publié: (2025) -
Calibration and Correctness of Language Models for Code
par: Spiess, Claudio, et autres
Publié: (2024) -
Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time
par: Popescu, Razvan Mihai, et autres
Publié: (2026)