Calibration and Correctness of Language Models for Code
Fuente:
arXiv
Saved in:
| Main Authors: | Spiess, Claudio, Gros, David, Pai, Kunal Suresh, Pradel, Michael, Rabin, Md Rafiqul Islam, Alipour, Amin, Jha, Susmit, Devanbu, Prem, Ahmed, Toufique |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Survey of Trojans in Neural Models of Source Code: Taxonomy and Techniques
by: Hussain, Aftab, et al.
Published: (2023)
by: Hussain, Aftab, et al.
Published: (2023)
Trojans in Large Language Models of Code: A Critical Review through a Trigger-Based Taxonomy
by: Hussain, Aftab, et al.
Published: (2024)
by: Hussain, Aftab, et al.
Published: (2024)
Automatic Semantic Augmentation of Language Model Prompts (for Code Summarization)
by: Ahmed, Toufique, et al.
Published: (2023)
by: Ahmed, Toufique, et al.
Published: (2023)
CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance
by: Pai, Kunal, et al.
Published: (2025)
by: Pai, Kunal, et al.
Published: (2025)
Localized Calibrated Uncertainty in Code Language Models
by: Gros, David, et al.
Published: (2025)
by: Gros, David, et al.
Published: (2025)
Measuring Impacts of Poisoning on Model Parameters and Embeddings for Large Language Models of Code
by: Hussain, Aftab, et al.
Published: (2024)
by: Hussain, Aftab, et al.
Published: (2024)
Calibration of Large Language Models on Code Summarization
by: Virk, Yuvraj, et al.
Published: (2024)
by: Virk, Yuvraj, et al.
Published: (2024)
On Trojan Signatures in Large Language Models of Code
by: Hussain, Aftab, et al.
Published: (2024)
by: Hussain, Aftab, et al.
Published: (2024)
Measuring Impacts of Poisoning on Model Parameters and Neuron Activations: A Case Study of Poisoning CodeBERT
by: Hussain, Aftab, et al.
Published: (2024)
by: Hussain, Aftab, et al.
Published: (2024)
On LLMs' Internal Representation of Code Correctness
by: Ribeiro, Francisco, et al.
Published: (2025)
by: Ribeiro, Francisco, et al.
Published: (2025)
Does In-IDE Calibration of Large Language Models work at Scale?
by: Koohestani, Roham, et al.
Published: (2025)
by: Koohestani, Roham, et al.
Published: (2025)
Unlearning Trojans in Large Language Models: A Comparison Between Natural Language and Source Code
by: Kazemi, Mahdi, et al.
Published: (2024)
by: Kazemi, Mahdi, et al.
Published: (2024)
Can LLMs Replace Manual Annotation of Software Engineering Artifacts?
by: Ahmed, Toufique, et al.
Published: (2024)
by: Ahmed, Toufique, et al.
Published: (2024)
How Robustly do LLMs Understand Execution Semantics?
by: Spiess, Claudio, et al.
Published: (2026)
by: Spiess, Claudio, et al.
Published: (2026)
Towards Understanding What Code Language Models Learned
by: Ahmed, Toufique, et al.
Published: (2023)
by: Ahmed, Toufique, et al.
Published: (2023)
Capturing the Effects of Quantization on Trojans in Code LLMs
by: Hussain, Aftab, et al.
Published: (2025)
by: Hussain, Aftab, et al.
Published: (2025)
Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs
by: Al-Kaswan, Ali, et al.
Published: (2026)
by: Al-Kaswan, Ali, et al.
Published: (2026)
Harnessing the Power of LLMs: Automating Unit Test Generation for High-Performance Computing
by: Karanjai, Rabimba, et al.
Published: (2024)
by: Karanjai, Rabimba, et al.
Published: (2024)
Studying LLM Performance on Closed- and Open-source Data
by: Ahmed, Toufique, et al.
Published: (2024)
by: Ahmed, Toufique, et al.
Published: (2024)
RepairAgent: An Autonomous, LLM-Based Agent for Program Repair
by: Bouzenia, Islem, et al.
Published: (2024)
by: Bouzenia, Islem, et al.
Published: (2024)
Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time
by: Popescu, Razvan Mihai, et al.
Published: (2026)
by: Popescu, Razvan Mihai, et al.
Published: (2026)
CodeMapper: A Language-Agnostic Approach to Mapping Code Regions Across Commits
by: Hu, Huimin, et al.
Published: (2025)
by: Hu, Huimin, et al.
Published: (2025)
Ecosystem of Large Language Models for Code
by: Yang, Zhou, et al.
Published: (2024)
by: Yang, Zhou, et al.
Published: (2024)
Testora: Using Natural Language Intent to Detect Behavioral Regressions
by: Pradel, Michael
Published: (2025)
by: Pradel, Michael
Published: (2025)
Robustness, Security, Privacy, Explainability, Efficiency, and Usability of Large Language Models for Code
by: Yang, Zhou, et al.
Published: (2024)
by: Yang, Zhou, et al.
Published: (2024)
De-Hallucinator: Mitigating LLM Hallucinations in Code Generation Tasks via Iterative Grounding
by: Eghbali, Aryaz, et al.
Published: (2024)
by: Eghbali, Aryaz, et al.
Published: (2024)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
by: Haider, Md. Asif, et al.
Published: (2024)
by: Haider, Md. Asif, et al.
Published: (2024)
Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study
by: Wang, You, et al.
Published: (2025)
by: Wang, You, et al.
Published: (2025)
Code Refactoring with LLM: A Comprehensive Evaluation With Few-Shot Settings
by: Tapader, Md. Raihan, et al.
Published: (2025)
by: Tapader, Md. Raihan, et al.
Published: (2025)
ChangeGuard: Validating Code Changes via Pairwise Learning-Guided Execution
by: Gröninger, Lars, et al.
Published: (2024)
by: Gröninger, Lars, et al.
Published: (2024)
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
by: Ahmed, Toufique, et al.
Published: (2025)
by: Ahmed, Toufique, et al.
Published: (2025)
Reproduction Test Generation for Java SWE Issues
by: Ahmed, Toufique, et al.
Published: (2026)
by: Ahmed, Toufique, et al.
Published: (2026)
Can Old Tests Do New Tricks for Resolving SWE Issues?
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
CodeT5-RNN: Reinforcing Contextual Embeddings for Enhanced Code Comprehension
by: Rahman, Md Mostafizer, et al.
Published: (2026)
by: Rahman, Md Mostafizer, et al.
Published: (2026)
NoCode-bench: A Benchmark for Evaluating Natural Language-Driven Feature Addition
by: Deng, Le, et al.
Published: (2025)
by: Deng, Le, et al.
Published: (2025)
An Empirical Study of Python Library Migration Using Large Language Models
by: Islam, Md Mohayeminul, et al.
Published: (2025)
by: Islam, Md Mohayeminul, et al.
Published: (2025)
Context Before Code: An Experience Report on Vibe Coding in Practice
by: Shuvo, Md Nasir Uddin, et al.
Published: (2026)
by: Shuvo, Md Nasir Uddin, et al.
Published: (2026)
Artisan: Agentic Artifact Evaluation
by: Baek, Doehyun, et al.
Published: (2026)
by: Baek, Doehyun, et al.
Published: (2026)
CodeCureAgent: Automatic Classification and Repair of Static Analysis Warnings
by: Joos, Pascal, et al.
Published: (2025)
by: Joos, Pascal, et al.
Published: (2025)
Investigating Test Overfitting on SWE-bench
by: Ahmed, Toufique, et al.
Published: (2025)
by: Ahmed, Toufique, et al.
Published: (2025)
Similar Items
-
A Survey of Trojans in Neural Models of Source Code: Taxonomy and Techniques
by: Hussain, Aftab, et al.
Published: (2023) -
Trojans in Large Language Models of Code: A Critical Review through a Trigger-Based Taxonomy
by: Hussain, Aftab, et al.
Published: (2024) -
Automatic Semantic Augmentation of Language Model Prompts (for Code Summarization)
by: Ahmed, Toufique, et al.
Published: (2023) -
CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance
by: Pai, Kunal, et al.
Published: (2025) -
Localized Calibrated Uncertainty in Code Language Models
by: Gros, David, et al.
Published: (2025)