Evaluating LLMs Code Reasoning Under Real-World Context
Fuente:
arXiv
Guardado en:
| Autor principal: | Liu, Changshu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
por: Liu, Changshu, et al.
Publicado: (2025)
por: Liu, Changshu, et al.
Publicado: (2025)
A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models
por: Liu, Changshu, et al.
Publicado: (2025)
por: Liu, Changshu, et al.
Publicado: (2025)
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
por: Liu, Changshu, et al.
Publicado: (2025)
por: Liu, Changshu, et al.
Publicado: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024)
por: Liu, Changshu, et al.
Publicado: (2024)
Automated Code Editing with Search-Generate-Modify
por: Liu, Changshu, et al.
Publicado: (2023)
por: Liu, Changshu, et al.
Publicado: (2023)
Towards Translating Real-World Code with LLMs: A Study of Translating to Rust
por: Eniser, Hasan Ferit, et al.
Publicado: (2024)
por: Eniser, Hasan Ferit, et al.
Publicado: (2024)
CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning
por: Roy, Monoshi Kumar, et al.
Publicado: (2025)
por: Roy, Monoshi Kumar, et al.
Publicado: (2025)
EDIT-Bench: Evaluating LLM Abilities to Perform Real-World Instructed Code Edits
por: Chi, Wayne, et al.
Publicado: (2025)
por: Chi, Wayne, et al.
Publicado: (2025)
UniCode: Augmenting Evaluation for Code Reasoning
por: Zheng, Xinyue, et al.
Publicado: (2025)
por: Zheng, Xinyue, et al.
Publicado: (2025)
Evolving Triple Knowledge-Augmented LLMs for Code Translation in Repository Context
por: Ou, Guangsheng, et al.
Publicado: (2025)
por: Ou, Guangsheng, et al.
Publicado: (2025)
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
por: Wang, Yanlin, et al.
Publicado: (2026)
por: Wang, Yanlin, et al.
Publicado: (2026)
Automated and Context-Aware Code Documentation Leveraging Advanced LLMs
por: Sarker, Swapnil Sharma, et al.
Publicado: (2025)
por: Sarker, Swapnil Sharma, et al.
Publicado: (2025)
Optimizing Token Consumption in LLMs: A Nano Surge Approach for Code Reasoning Efficiency
por: Hu, Junwei, et al.
Publicado: (2025)
por: Hu, Junwei, et al.
Publicado: (2025)
Coding in a Bubble? Evaluating LLMs in Resolving Context Adaptation Bugs During Code Adaptation
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
RepoMasterEval: Evaluating Code Completion via Real-World Repositories
por: Wu, Qinyun, et al.
Publicado: (2024)
por: Wu, Qinyun, et al.
Publicado: (2024)
Characterizing the Failure Modes of LLMs in Resolving Real-World GitHub Issues
por: Jiang, Yanjie, et al.
Publicado: (2026)
por: Jiang, Yanjie, et al.
Publicado: (2026)
CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs
por: Manh, Dung Nguyen, et al.
Publicado: (2024)
por: Manh, Dung Nguyen, et al.
Publicado: (2024)
On Evaluating the Efficiency of Source Code Generated by LLMs
por: Niu, Changan, et al.
Publicado: (2024)
por: Niu, Changan, et al.
Publicado: (2024)
Open the Oyster: Empirical Evaluation and Improvement of Code Reasoning Confidence in LLMs
por: Wang, Shufan, et al.
Publicado: (2025)
por: Wang, Shufan, et al.
Publicado: (2025)
Evaluating the Effectiveness of LLMs in Fixing Maintainability Issues in Real-World Projects
por: Nunes, Henrique, et al.
Publicado: (2025)
por: Nunes, Henrique, et al.
Publicado: (2025)
Context Matters: Evaluating Context Strategies for Automated ADR Generation Using LLMs
por: Gupta, Aviral, et al.
Publicado: (2026)
por: Gupta, Aviral, et al.
Publicado: (2026)
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
CodeGlance: Understanding Code Reasoning Challenges in LLMs through Multi-Dimensional Feature Analysis
por: Wang, Yunkun, et al.
Publicado: (2026)
por: Wang, Yunkun, et al.
Publicado: (2026)
CodeReasoner: Enhancing the Code Reasoning Ability with Reinforcement Learning
por: Tang, Lingxiao, et al.
Publicado: (2025)
por: Tang, Lingxiao, et al.
Publicado: (2025)
SeRe: A Security-Related Code Review Dataset Aligned with Real-World Review Activities
por: Zhao, Zixiao, et al.
Publicado: (2026)
por: Zhao, Zixiao, et al.
Publicado: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?
por: He, Xinyi, et al.
Publicado: (2025)
por: He, Xinyi, et al.
Publicado: (2025)
Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs
por: CodeArts Model Team, et al.
Publicado: (2026)
por: CodeArts Model Team, et al.
Publicado: (2026)
From Context to Intent: Reasoning-Guided Function-Level Code Completion
por: Li, Yanzhou, et al.
Publicado: (2025)
por: Li, Yanzhou, et al.
Publicado: (2025)
CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
Towards Verified Code Reasoning by LLMs
por: Sistla, Meghana, et al.
Publicado: (2025)
por: Sistla, Meghana, et al.
Publicado: (2025)
PATCHEVAL: A New Benchmark for Evaluating LLMs on Patching Real-World Vulnerabilities
por: Wei, Zichao, et al.
Publicado: (2025)
por: Wei, Zichao, et al.
Publicado: (2025)
Defects4Log: Benchmarking LLMs for Logging Code Defect Detection and Reasoning
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Evaluation of Code LLMs on Geospatial Code Generation
por: Gramacki, Piotr, et al.
Publicado: (2024)
por: Gramacki, Piotr, et al.
Publicado: (2024)
A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task
por: Liu, Shuhan, et al.
Publicado: (2026)
por: Liu, Shuhan, et al.
Publicado: (2026)
A Large-Scale Empirical Study of AI-Generated Code in Real-World Repositories
por: Mao, Tianhao, et al.
Publicado: (2026)
por: Mao, Tianhao, et al.
Publicado: (2026)
SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection
por: Ahmed, Md Basim Uddin, et al.
Publicado: (2025)
por: Ahmed, Md Basim Uddin, et al.
Publicado: (2025)
MRG-Bench: Evaluating and Exploring the Requirements of Context for Repository-Level Code Generation
por: Li, Haiyang
Publicado: (2025)
por: Li, Haiyang
Publicado: (2025)
EffiReasonTrans: RL-Optimized Reasoning for Code Translation
por: Wang, Yanlin, et al.
Publicado: (2025)
por: Wang, Yanlin, et al.
Publicado: (2025)
LLMs Meet Library Evolution: Evaluating Deprecated API Usage in LLM-based Code Completion
por: Wang, Chong, et al.
Publicado: (2024)
por: Wang, Chong, et al.
Publicado: (2024)
Ejemplares similares
-
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
por: Liu, Changshu, et al.
Publicado: (2025) -
A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models
por: Liu, Changshu, et al.
Publicado: (2025) -
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
por: Liu, Changshu, et al.
Publicado: (2025) -
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024) -
Automated Code Editing with Search-Generate-Modify
por: Liu, Changshu, et al.
Publicado: (2023)