Narrowing the Complexity Gap in the Evaluation of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Yang, Liu, Shuyang, Jabbarvand, Reyhaneh |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models
by: Liu, Changshu, et al.
Published: (2025)
by: Liu, Changshu, et al.
Published: (2025)
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
by: Liu, Changshu, et al.
Published: (2025)
by: Liu, Changshu, et al.
Published: (2025)
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
by: Liu, Changshu, et al.
Published: (2025)
by: Liu, Changshu, et al.
Published: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
by: Liu, Changshu, et al.
Published: (2024)
by: Liu, Changshu, et al.
Published: (2024)
A Generic Approach to Fix Test Flakiness in Real-World Projects
by: Chen, Yang, et al.
Published: (2024)
by: Chen, Yang, et al.
Published: (2024)
Evaluating Plan Compliance in Autonomous Programming Agents
by: Liu, Shuyang, et al.
Published: (2026)
by: Liu, Shuyang, et al.
Published: (2026)
Can Old Tests Do New Tricks for Resolving SWE Issues?
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
Challenging Bug Prediction and Repair Models with Synthetic Bugs
by: Ibrahimzada, Ali Reza, et al.
Published: (2023)
by: Ibrahimzada, Ali Reza, et al.
Published: (2023)
ReCodeAgent: A Multi-Agent Workflow for Language-agnostic Translation and Validation of Large-scale Repositories
by: Ibrahimzada, Ali Reza, et al.
Published: (2026)
by: Ibrahimzada, Ali Reza, et al.
Published: (2026)
SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation
by: Chowdhury, Jaid Monwar, et al.
Published: (2026)
by: Chowdhury, Jaid Monwar, et al.
Published: (2026)
WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models
by: Yang, Chenyuan, et al.
Published: (2023)
by: Yang, Chenyuan, et al.
Published: (2023)
Translating Large-Scale C Repositories to Idiomatic Rust
by: Dehghan, Saman, et al.
Published: (2025)
by: Dehghan, Saman, et al.
Published: (2025)
MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair
by: Ibrahimzada, Ali Reza, et al.
Published: (2025)
by: Ibrahimzada, Ali Reza, et al.
Published: (2025)
Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code
by: Pan, Rangeet, et al.
Published: (2023)
by: Pan, Rangeet, et al.
Published: (2023)
LeTI: Learning to Generate from Textual Interactions
by: Wang, Xingyao, et al.
Published: (2023)
by: Wang, Xingyao, et al.
Published: (2023)
Advancing Automated In-Isolation Validation in Repository-Level Code Translation
by: Ke, Kaiyao, et al.
Published: (2025)
by: Ke, Kaiyao, et al.
Published: (2025)
Process-Centric Analysis of Agentic Software Systems
by: Liu, Shuyang, et al.
Published: (2025)
by: Liu, Shuyang, et al.
Published: (2025)
GeoJSEval: An Automated Evaluation Framework for Large Language Models on JavaScript-Based Geospatial Computation and Visualization Code Generation
by: Chen, Guanyu, et al.
Published: (2025)
by: Chen, Guanyu, et al.
Published: (2025)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
Can Large Language Models Generate Geospatial Code?
by: Hou, Shuyang, et al.
Published: (2024)
by: Hou, Shuyang, et al.
Published: (2024)
On the Evaluation of Large Language Models in Unit Test Generation
by: Yang, Lin, et al.
Published: (2024)
by: Yang, Lin, et al.
Published: (2024)
Rethinking Code Complexity Through the Lens of Large Language Models
by: Xie, Chen, et al.
Published: (2026)
by: Xie, Chen, et al.
Published: (2026)
Darkit: A User-Friendly Software Toolkit for Spiking Large Language Model
by: Du, Xin, et al.
Published: (2024)
by: Du, Xin, et al.
Published: (2024)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
by: Feng, Jia, et al.
Published: (2024)
by: Feng, Jia, et al.
Published: (2024)
Can Large Language Models Serve as Evaluators for Code Summarization?
by: Wu, Yang, et al.
Published: (2024)
by: Wu, Yang, et al.
Published: (2024)
AutoGEEval++: A Multi-Level and Multi-Geospatial-Modality Automated Evaluation Framework for Large Language Models in Geospatial Code Generation on Google Earth Engine
by: Hou, Shuyang, et al.
Published: (2025)
by: Hou, Shuyang, et al.
Published: (2025)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
by: Ma, Lezhi, et al.
Published: (2024)
by: Ma, Lezhi, et al.
Published: (2024)
Evaluating Large Language Models for Time Series Anomaly Detection in Aerospace Software
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
by: Cheng, Cheng, et al.
Published: (2025)
by: Cheng, Cheng, et al.
Published: (2025)
Think Broad, Act Narrow: CWE Identification with Multi-Agent Large Language Models
by: Sayagh, Mohammed, et al.
Published: (2025)
by: Sayagh, Mohammed, et al.
Published: (2025)
Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling
by: Broadwater, Keita
Published: (2026)
by: Broadwater, Keita
Published: (2026)
On the Evaluation of Large Language Models in Multilingual Vulnerability Repair
by: wang, Dong, et al.
Published: (2025)
by: wang, Dong, et al.
Published: (2025)
MCeT: Behavioral Model Correctness Evaluation using Large Language Models
by: Ahmed, Khaled, et al.
Published: (2025)
by: Ahmed, Khaled, et al.
Published: (2025)
Evaluating Generated Commit Messages with Large Language Models
by: Zeng, Qunhong, et al.
Published: (2025)
by: Zeng, Qunhong, et al.
Published: (2025)
Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation
by: Sun, Zhihong, et al.
Published: (2025)
by: Sun, Zhihong, et al.
Published: (2025)
Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code
by: Saad, Mootez, et al.
Published: (2025)
by: Saad, Mootez, et al.
Published: (2025)
Evaluating Large Language Models for Multilingual Vulnerability Detection at Dual Granularities
by: Shu, Honglin, et al.
Published: (2025)
by: Shu, Honglin, et al.
Published: (2025)
When Elo Lies: Hidden Biases in Codeforces-Based Evaluation of Large Language Models
by: Zheng, Shenyu, et al.
Published: (2026)
by: Zheng, Shenyu, et al.
Published: (2026)
Debugging with Open-Source Large Language Models: An Evaluation
by: Majdoub, Yacine, et al.
Published: (2024)
by: Majdoub, Yacine, et al.
Published: (2024)
Evaluating Large Language Models in Detecting Test Smells
by: Lucas, Keila, et al.
Published: (2024)
by: Lucas, Keila, et al.
Published: (2024)
Similar Items
-
A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models
by: Liu, Changshu, et al.
Published: (2025) -
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
by: Liu, Changshu, et al.
Published: (2025) -
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
by: Liu, Changshu, et al.
Published: (2025) -
CodeMind: Evaluating Large Language Models for Code Reasoning
by: Liu, Changshu, et al.
Published: (2024) -
A Generic Approach to Fix Test Flakiness in Real-World Projects
by: Chen, Yang, et al.
Published: (2024)