TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Fujii, Ryo, Morishita, Makoto, Yano, Kazuki, Suzuki, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Refactoring Programs Using Large Language Models with Few-Shot Examples
di: Shirafuji, Atsushi, et al.
Pubblicazione: (2023)
di: Shirafuji, Atsushi, et al.
Pubblicazione: (2023)
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation
di: Liu, Steven, et al.
Pubblicazione: (2026)
di: Liu, Steven, et al.
Pubblicazione: (2026)
Repoformer: Selective Retrieval for Repository-Level Code Completion
di: Wu, Di, et al.
Pubblicazione: (2024)
di: Wu, Di, et al.
Pubblicazione: (2024)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
di: Du, Junjia, et al.
Pubblicazione: (2025)
di: Du, Junjia, et al.
Pubblicazione: (2025)
Dataflow-Guided Retrieval Augmentation for Repository-Level Code Completion
di: Cheng, Wei, et al.
Pubblicazione: (2024)
di: Cheng, Wei, et al.
Pubblicazione: (2024)
DI-BENCH: Benchmarking Large Language Models on Dependency Inference with Testable Repositories at Scale
di: Zhang, Linghao, et al.
Pubblicazione: (2025)
di: Zhang, Linghao, et al.
Pubblicazione: (2025)
Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving
di: Zan, Daoguang, et al.
Pubblicazione: (2025)
di: Zan, Daoguang, et al.
Pubblicazione: (2025)
MigrationBench: Repository-Level Code Migration Benchmark from Java 8
di: Liu, Linbo, et al.
Pubblicazione: (2025)
di: Liu, Linbo, et al.
Pubblicazione: (2025)
RepoST: Scalable Repository-Level Coding Environment Construction with Sandbox Testing
di: Xie, Yiqing, et al.
Pubblicazione: (2025)
di: Xie, Yiqing, et al.
Pubblicazione: (2025)
Retrieval-Augmented Code Generation: A Survey with Focus on Repository-Level Approaches
di: Tao, Yicheng, et al.
Pubblicazione: (2025)
di: Tao, Yicheng, et al.
Pubblicazione: (2025)
SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories
di: Bogin, Ben, et al.
Pubblicazione: (2024)
di: Bogin, Ben, et al.
Pubblicazione: (2024)
SWE-bench-java: A GitHub Issue Resolving Benchmark for Java
di: Zan, Daoguang, et al.
Pubblicazione: (2024)
di: Zan, Daoguang, et al.
Pubblicazione: (2024)
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
di: Wang, Yanli, et al.
Pubblicazione: (2024)
di: Wang, Yanli, et al.
Pubblicazione: (2024)
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding
di: Cai, Songcheng, et al.
Pubblicazione: (2026)
di: Cai, Songcheng, et al.
Pubblicazione: (2026)
SWE-bench Goes Live!
di: Zhang, Linghao, et al.
Pubblicazione: (2025)
di: Zhang, Linghao, et al.
Pubblicazione: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
M2rc-Eval: Massively Multilingual Repository-level Code Completion Evaluation
di: Liu, Jiaheng, et al.
Pubblicazione: (2024)
di: Liu, Jiaheng, et al.
Pubblicazione: (2024)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
di: Deng, Ken, et al.
Pubblicazione: (2024)
di: Deng, Ken, et al.
Pubblicazione: (2024)
Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation
di: Bae, Suyoung, et al.
Pubblicazione: (2026)
di: Bae, Suyoung, et al.
Pubblicazione: (2026)
Improving Code Localization with Repository Memory
di: Wang, Boshi, et al.
Pubblicazione: (2025)
di: Wang, Boshi, et al.
Pubblicazione: (2025)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
di: Liu, Kaiyuan, et al.
Pubblicazione: (2025)
di: Liu, Kaiyuan, et al.
Pubblicazione: (2025)
MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
di: Liu, Simiao, et al.
Pubblicazione: (2026)
di: Liu, Simiao, et al.
Pubblicazione: (2026)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
di: Huang, Shiting, et al.
Pubblicazione: (2025)
di: Huang, Shiting, et al.
Pubblicazione: (2025)
Closing the Loop: Universal Repository Representation with RPG-Encoder
di: Luo, Jane, et al.
Pubblicazione: (2026)
di: Luo, Jane, et al.
Pubblicazione: (2026)
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
di: Jimenez, Carlos E., et al.
Pubblicazione: (2023)
di: Jimenez, Carlos E., et al.
Pubblicazione: (2023)
Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation
di: Pysklo, Hubert M., et al.
Pubblicazione: (2026)
di: Pysklo, Hubert M., et al.
Pubblicazione: (2026)
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
di: Xin, Yutong, et al.
Pubblicazione: (2026)
di: Xin, Yutong, et al.
Pubblicazione: (2026)
SWE-QA: Can Language Models Answer Repository-level Code Questions?
di: Peng, Weihan, et al.
Pubblicazione: (2025)
di: Peng, Weihan, et al.
Pubblicazione: (2025)
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
di: Wang, Yanlin, et al.
Pubblicazione: (2026)
di: Wang, Yanlin, et al.
Pubblicazione: (2026)
A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task
di: Liu, Shuhan, et al.
Pubblicazione: (2026)
di: Liu, Shuhan, et al.
Pubblicazione: (2026)
Large Language Models are Qualified Benchmark Builders: Rebuilding Pre-Training Datasets for Advancing Code Intelligence Tasks
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
CodeRAG: Finding Relevant and Necessary Knowledge for Retrieval-Augmented Repository-Level Code Completion
di: Zhang, Sheng, et al.
Pubblicazione: (2025)
di: Zhang, Sheng, et al.
Pubblicazione: (2025)
Learning to Commit: Generating Organic Pull Requests via Online Repository Memory
di: Li, Mo, et al.
Pubblicazione: (2026)
di: Li, Mo, et al.
Pubblicazione: (2026)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?
di: Yang, John, et al.
Pubblicazione: (2024)
di: Yang, John, et al.
Pubblicazione: (2024)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
di: Adamenko, Pavel, et al.
Pubblicazione: (2025)
di: Adamenko, Pavel, et al.
Pubblicazione: (2025)
Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration
di: Ma, Yingwei, et al.
Pubblicazione: (2024)
di: Ma, Yingwei, et al.
Pubblicazione: (2024)
Advancing Automated In-Isolation Validation in Repository-Level Code Translation
di: Ke, Kaiyao, et al.
Pubblicazione: (2025)
di: Ke, Kaiyao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Refactoring Programs Using Large Language Models with Few-Shot Examples
di: Shirafuji, Atsushi, et al.
Pubblicazione: (2023) -
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation
di: Li, Wei, et al.
Pubblicazione: (2025) -
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
di: Fu, Lingyue, et al.
Pubblicazione: (2025) -
TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation
di: Liu, Steven, et al.
Pubblicazione: (2026) -
Repoformer: Selective Retrieval for Repository-Level Code Completion
di: Wu, Di, et al.
Pubblicazione: (2024)