Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Maharaj, Kishan, Menon, Nandakishore, Saxena, Ashita, Tamilselvam, Srikanth |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ETF: An Entity Tracing Framework for Hallucination Detection in Code Summaries
by: Maharaj, Kishan, et al.
Published: (2024)
by: Maharaj, Kishan, et al.
Published: (2024)
A Code Comprehension Benchmark for Large Language Models for Code
by: Havare, Jayant, et al.
Published: (2025)
by: Havare, Jayant, et al.
Published: (2025)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
by: Kammakomati, Mehant, et al.
Published: (2024)
by: Kammakomati, Mehant, et al.
Published: (2024)
Lost in Transcription: How Speech-to-Text Errors Derail Code Understanding
by: Havare, Jayant, et al.
Published: (2026)
by: Havare, Jayant, et al.
Published: (2026)
DocCGen: Document-based Controlled Code Generation
by: Pimparkhede, Sameer, et al.
Published: (2024)
by: Pimparkhede, Sameer, et al.
Published: (2024)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
by: Hu, Ruida, et al.
Published: (2024)
by: Hu, Ruida, et al.
Published: (2024)
Beyond Code Snippets: Benchmarking LLMs on Repository-Level Question Answering
by: Alebachew, Yoseph Berhanu, et al.
Published: (2026)
by: Alebachew, Yoseph Berhanu, et al.
Published: (2026)
DialogAgent: An Auto-engagement Agent for Code Question Answering Data Production
by: Liang, Xiaoyun, et al.
Published: (2024)
by: Liang, Xiaoyun, et al.
Published: (2024)
Automated Code Review Using Large Language Models with Symbolic Reasoning
by: Icoz, Busra, et al.
Published: (2025)
by: Icoz, Busra, et al.
Published: (2025)
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation
by: Gui, Ningxin, et al.
Published: (2025)
by: Gui, Ningxin, et al.
Published: (2025)
Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?
by: Orvalho, Pedro, et al.
Published: (2025)
by: Orvalho, Pedro, et al.
Published: (2025)
Comparative Analysis of Large Language Models for Context-Aware Code Completion using SAFIM Framework
by: Zhang, Hang, et al.
Published: (2025)
by: Zhang, Hang, et al.
Published: (2025)
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
by: Qiu, Jielin, et al.
Published: (2025)
by: Qiu, Jielin, et al.
Published: (2025)
A Comparison of Conversational Models and Humans in Answering Technical Questions: the Firefox Case
by: Correia, Joao, et al.
Published: (2025)
by: Correia, Joao, et al.
Published: (2025)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
by: Zhao, Bingchen, et al.
Published: (2026)
by: Zhao, Bingchen, et al.
Published: (2026)
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
by: Lin, Feng, et al.
Published: (2025)
by: Lin, Feng, et al.
Published: (2025)
ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java
by: Pavuluri, Advait, et al.
Published: (2026)
by: Pavuluri, Advait, et al.
Published: (2026)
Evaluating Large Language Models for Code Review
by: Cihan, Umut, et al.
Published: (2025)
by: Cihan, Umut, et al.
Published: (2025)
Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern General-Purpose Large Language Models
by: Walczak, Jakub, et al.
Published: (2025)
by: Walczak, Jakub, et al.
Published: (2025)
RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations
by: Li, Hanyu, et al.
Published: (2026)
by: Li, Hanyu, et al.
Published: (2026)
From Context to Intent: Reasoning-Guided Function-Level Code Completion
by: Li, Yanzhou, et al.
Published: (2025)
by: Li, Yanzhou, et al.
Published: (2025)
Large Language Models Should Ask Clarifying Questions to Increase Confidence in Generated Code
by: Wu, Jie JW
Published: (2023)
by: Wu, Jie JW
Published: (2023)
Task Abstention for Large Language Models in Code Generation
by: Zhou, Yanke, et al.
Published: (2026)
by: Zhou, Yanke, et al.
Published: (2026)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
by: Hou, Shuyang, et al.
Published: (2024)
by: Hou, Shuyang, et al.
Published: (2024)
Augmenting Large Language Models with Static Code Analysis for Automated Code Quality Improvements
by: Abtahi, Seyed Moein, et al.
Published: (2025)
by: Abtahi, Seyed Moein, et al.
Published: (2025)
Personality-Guided Code Generation Using Large Language Models
by: Guo, Yaoqi, et al.
Published: (2024)
by: Guo, Yaoqi, et al.
Published: (2024)
Large Language Model Guided Self-Debugging Code Generation
by: Adnan, Muntasir, et al.
Published: (2025)
by: Adnan, Muntasir, et al.
Published: (2025)
Bugs in Large Language Models Generated Code: An Empirical Study
by: Tambon, Florian, et al.
Published: (2024)
by: Tambon, Florian, et al.
Published: (2024)
Assessing the Code Clone Detection Capability of Large Language Models
by: Zhang, Zixian, et al.
Published: (2024)
by: Zhang, Zixian, et al.
Published: (2024)
CodeFort: Robust Training for Code Generation Models
by: Zhang, Yuhao, et al.
Published: (2024)
by: Zhang, Yuhao, et al.
Published: (2024)
An Evaluation of Context Length Extrapolation in Long Code via Positional Embeddings and Efficient Attention
by: Ghosh, Madhusudan, et al.
Published: (2026)
by: Ghosh, Madhusudan, et al.
Published: (2026)
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
by: Lam, Man Ho, et al.
Published: (2025)
by: Lam, Man Ho, et al.
Published: (2025)
Modeling Code: Is Text All You Need?
by: Nichols, Daniel, et al.
Published: (2025)
by: Nichols, Daniel, et al.
Published: (2025)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
by: He, Mengliang, et al.
Published: (2025)
by: He, Mengliang, et al.
Published: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
by: Padwal, Vedant
Published: (2026)
by: Padwal, Vedant
Published: (2026)
Towards Leveraging Large Language Model Summaries for Topic Modeling in Source Code
by: Carissimi, Michele, et al.
Published: (2025)
by: Carissimi, Michele, et al.
Published: (2025)
Large Language Model-Driven Code Compliance Checking in Building Information Modeling
by: Madireddy, Soumya, et al.
Published: (2025)
by: Madireddy, Soumya, et al.
Published: (2025)
Demo-Craft: Using In-Context Learning to Improve Code Generation in Large Language Models
by: Kapu, Nirmal Joshua, et al.
Published: (2024)
by: Kapu, Nirmal Joshua, et al.
Published: (2024)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
by: Xiong, Zhanhang, et al.
Published: (2025)
by: Xiong, Zhanhang, et al.
Published: (2025)
Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
by: Mächtle, Felix, et al.
Published: (2026)
by: Mächtle, Felix, et al.
Published: (2026)
Similar Items
-
ETF: An Entity Tracing Framework for Hallucination Detection in Code Summaries
by: Maharaj, Kishan, et al.
Published: (2024) -
A Code Comprehension Benchmark for Large Language Models for Code
by: Havare, Jayant, et al.
Published: (2025) -
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
by: Kammakomati, Mehant, et al.
Published: (2024) -
Lost in Transcription: How Speech-to-Text Errors Derail Code Understanding
by: Havare, Jayant, et al.
Published: (2026) -
DocCGen: Document-based Controlled Code Generation
by: Pimparkhede, Sameer, et al.
Published: (2024)