ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xie, Bang, Zhang, Senjian, Peng, Zhiyuan, Chen, Wei, Ying, Chenhao, Luo, Yuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ArkTS-CodeSearch: A Open-Source ArkTS Dataset for Code Retrieval
von: He, Yulong, et al.
Veröffentlicht: (2026)
von: He, Yulong, et al.
Veröffentlicht: (2026)
Context-Sensitive Pointer Analysis for ArkTS
von: Yang, Yizhuo, et al.
Veröffentlicht: (2026)
von: Yang, Yizhuo, et al.
Veröffentlicht: (2026)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
SolAgent: A Specialized Multi-Agent Framework for Solidity Code Generation
von: Chen, Wei, et al.
Veröffentlicht: (2026)
von: Chen, Wei, et al.
Veröffentlicht: (2026)
A Preference-Driven Methodology for High-Quality Solidity Code Generation
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
PlayCoder: Making LLM-Generated GUI Code Playable
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2026)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
von: Dai, Dekun, et al.
Veröffentlicht: (2025)
von: Dai, Dekun, et al.
Veröffentlicht: (2025)
ScalerEval: Automated and Consistent Evaluation Testbed for Auto-scalers in Microservices
von: Xie, Shuaiyu, et al.
Veröffentlicht: (2025)
von: Xie, Shuaiyu, et al.
Veröffentlicht: (2025)
ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions
von: Li, Jialin, et al.
Veröffentlicht: (2026)
von: Li, Jialin, et al.
Veröffentlicht: (2026)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
von: Yu, Hao, et al.
Veröffentlicht: (2023)
von: Yu, Hao, et al.
Veröffentlicht: (2023)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
von: Feng, Jia, et al.
Veröffentlicht: (2024)
von: Feng, Jia, et al.
Veröffentlicht: (2024)
ArkAnalyzer: The Static Analysis Framework for OpenHarmony
von: Chen, Haonan, et al.
Veröffentlicht: (2025)
von: Chen, Haonan, et al.
Veröffentlicht: (2025)
SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
von: Liu, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Liu, Kaiyuan, et al.
Veröffentlicht: (2025)
ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation
von: Meng, Qianru, et al.
Veröffentlicht: (2025)
von: Meng, Qianru, et al.
Veröffentlicht: (2025)
RulER: Automated Rule-Based Semantic Error Localization and Repair for Code Translation
von: Jin, Shuo, et al.
Veröffentlicht: (2025)
von: Jin, Shuo, et al.
Veröffentlicht: (2025)
MulChain: Enabling Advanced Cross-Modal Queries in Hybrid-Storage Blockchains
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
von: Zhang, Tanghaoran, et al.
Veröffentlicht: (2026)
von: Zhang, Tanghaoran, et al.
Veröffentlicht: (2026)
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
von: Chen, Yeheng, et al.
Veröffentlicht: (2026)
von: Chen, Yeheng, et al.
Veröffentlicht: (2026)
ScenEval: A Benchmark for Scenario-Based Evaluation of Code Generation
von: Paul, Debalina Ghosh, et al.
Veröffentlicht: (2024)
von: Paul, Debalina Ghosh, et al.
Veröffentlicht: (2024)
CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection
von: Zhang, Qingyu, et al.
Veröffentlicht: (2025)
von: Zhang, Qingyu, et al.
Veröffentlicht: (2025)
RepoRepair: Leveraging Code Documentation for Repository-Level Automated Program Repair
von: Pan, Zhongqiang, et al.
Veröffentlicht: (2026)
von: Pan, Zhongqiang, et al.
Veröffentlicht: (2026)
VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities
von: Wang, Weizhe, et al.
Veröffentlicht: (2025)
von: Wang, Weizhe, et al.
Veröffentlicht: (2025)
Towards Automated Smart Contract Generation: Evaluation, Benchmarking, and Retrieval-Augmented Repair
von: Chen, Zaoyu, et al.
Veröffentlicht: (2025)
von: Chen, Zaoyu, et al.
Veröffentlicht: (2025)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
von: Wang, Jiexin, et al.
Veröffentlicht: (2024)
von: Wang, Jiexin, et al.
Veröffentlicht: (2024)
Empirical Evaluation of Large Language Models in Automated Program Repair
von: Sun, Jiajun, et al.
Veröffentlicht: (2025)
von: Sun, Jiajun, et al.
Veröffentlicht: (2025)
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
von: Xue, Pengyu, et al.
Veröffentlicht: (2024)
von: Xue, Pengyu, et al.
Veröffentlicht: (2024)
HumanEvalComm: Benchmarking the Communication Competence of Code Generation for LLMs and LLM Agent
von: Wu, Jie JW, et al.
Veröffentlicht: (2024)
von: Wu, Jie JW, et al.
Veröffentlicht: (2024)
Automated Repair of Ambiguous Problem Descriptions for LLM-Based Code Generation
von: Jia, Haoxiang, et al.
Veröffentlicht: (2025)
von: Jia, Haoxiang, et al.
Veröffentlicht: (2025)
What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair
von: Martinez, Matias, et al.
Veröffentlicht: (2026)
von: Martinez, Matias, et al.
Veröffentlicht: (2026)
SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement
von: Zhan, Zexun, et al.
Veröffentlicht: (2025)
von: Zhan, Zexun, et al.
Veröffentlicht: (2025)
Revisiting Evolutionary Program Repair via Code Language Model
von: Wang, Yunan, et al.
Veröffentlicht: (2024)
von: Wang, Yunan, et al.
Veröffentlicht: (2024)
Re-Evaluating Code LLM Benchmarks Under Semantic Mutation
von: Pan, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Pan, Zhiyuan, et al.
Veröffentlicht: (2025)
A Systematic Literature Review on Large Language Models for Automated Program Repair
von: Zhang, Quanjun, et al.
Veröffentlicht: (2024)
von: Zhang, Quanjun, et al.
Veröffentlicht: (2024)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
Evaluating the Generalizability of LLMs in Automated Program Repair
von: Li, Fengjie, et al.
Veröffentlicht: (2025)
von: Li, Fengjie, et al.
Veröffentlicht: (2025)
HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair
von: Rabbi, Fazle, et al.
Veröffentlicht: (2026)
von: Rabbi, Fazle, et al.
Veröffentlicht: (2026)
CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows
von: Muna, Rabeya Khatun, et al.
Veröffentlicht: (2026)
von: Muna, Rabeya Khatun, et al.
Veröffentlicht: (2026)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
von: Ma, Lezhi, et al.
Veröffentlicht: (2024)
von: Ma, Lezhi, et al.
Veröffentlicht: (2024)
ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming
von: Si, Yuan, et al.
Veröffentlicht: (2026)
von: Si, Yuan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
ArkTS-CodeSearch: A Open-Source ArkTS Dataset for Code Retrieval
von: He, Yulong, et al.
Veröffentlicht: (2026) -
Context-Sensitive Pointer Analysis for ArkTS
von: Yang, Yizhuo, et al.
Veröffentlicht: (2026) -
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025) -
SolAgent: A Specialized Multi-Agent Framework for Solidity Code Generation
von: Chen, Wei, et al.
Veröffentlicht: (2026) -
A Preference-Driven Methodology for High-Quality Solidity Code Generation
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)