CodeUpdateArena: Benchmarking Knowledge Editing on API Updates
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Zeyu Leo, Pandit, Shrey, Ye, Xi, Choi, Eunsol, Durrett, Greg |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReCode: Updating Code API Knowledge with Reinforcement Learning
par: Wu, Haoze, et autres
Publié: (2025)
par: Wu, Haoze, et autres
Publié: (2025)
PropMEND: Hypernetworks for Knowledge Propagation in LLMs
par: Liu, Zeyu Leo, et autres
Publié: (2025)
par: Liu, Zeyu Leo, et autres
Publié: (2025)
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
par: Xin, Yutong, et autres
Publié: (2026)
par: Xin, Yutong, et autres
Publié: (2026)
Coeditor: Leveraging Contextual Changes for Multi-round Code Auto-editing
par: Wei, Jiayi, et autres
Publié: (2023)
par: Wei, Jiayi, et autres
Publié: (2023)
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
par: Khatry, Anirudh, et autres
Publié: (2025)
par: Khatry, Anirudh, et autres
Publié: (2025)
Enhancing Project-Specific Code Completion by Inferring Internal API Information
par: Deng, Le, et autres
Publié: (2025)
par: Deng, Le, et autres
Publié: (2025)
Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation
par: Pysklo, Hubert M., et autres
Publié: (2026)
par: Pysklo, Hubert M., et autres
Publié: (2026)
Reasoning Trajectories for Socratic Debugging of Student Code: From Misconceptions to Contradictions and Updated Beliefs
par: Al-Hossami, Erfan, et autres
Publié: (2025)
par: Al-Hossami, Erfan, et autres
Publié: (2025)
From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning
par: Zhang, Jiajun, et autres
Publié: (2026)
par: Zhang, Jiajun, et autres
Publié: (2026)
Model Editing for LLMs4Code: How Far are We?
par: Li, Xiaopeng, et autres
Publié: (2024)
par: Li, Xiaopeng, et autres
Publié: (2024)
Compositional API Recommendation for Library-Oriented Code Generation
par: Ma, Zexiong, et autres
Publié: (2024)
par: Ma, Zexiong, et autres
Publié: (2024)
InstructCoder: Instruction Tuning Large Language Models for Code Editing
par: Li, Kaixin, et autres
Publié: (2023)
par: Li, Kaixin, et autres
Publié: (2023)
CLEVER: A Curated Benchmark for Formally Verified Code Generation
par: Thakur, Amitayush, et autres
Publié: (2025)
par: Thakur, Amitayush, et autres
Publié: (2025)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
par: Du, Mingzhe, et autres
Publié: (2024)
par: Du, Mingzhe, et autres
Publié: (2024)
BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution
par: Zhuo, Terry Yue, et autres
Publié: (2025)
par: Zhuo, Terry Yue, et autres
Publié: (2025)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
par: Xie, Yiqing, et autres
Publié: (2024)
par: Xie, Yiqing, et autres
Publié: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
par: Chou, Jason, et autres
Publié: (2025)
par: Chou, Jason, et autres
Publié: (2025)
Evaluating and Achieving Controllable Code Completion in Code LLM
par: Zhang, Jiajun, et autres
Publié: (2026)
par: Zhang, Jiajun, et autres
Publié: (2026)
Is Your Benchmark (Still) Useful? Dynamic Benchmarking for Code Language Models
par: Guan, Batu, et autres
Publié: (2025)
par: Guan, Batu, et autres
Publié: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions
par: Ding, Xianzhong, et autres
Publié: (2026)
par: Ding, Xianzhong, et autres
Publié: (2026)
Toward Reusability of AI Models Using Dynamic Updates of AI Documentation
par: Bajcsy, Peter, et autres
Publié: (2026)
par: Bajcsy, Peter, et autres
Publié: (2026)
To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing
par: Cheng, Wei, et autres
Publié: (2026)
par: Cheng, Wei, et autres
Publié: (2026)
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
par: Zhao, Songwen, et autres
Publié: (2025)
par: Zhao, Songwen, et autres
Publié: (2025)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
par: Wang, Sizhe, et autres
Publié: (2025)
par: Wang, Sizhe, et autres
Publié: (2025)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
par: Huang, Dong, et autres
Publié: (2024)
par: Huang, Dong, et autres
Publié: (2024)
FireBench: Evaluating Instruction Following in Enterprise and API-Driven LLM Applications
par: Zhang, Yunfan, et autres
Publié: (2026)
par: Zhang, Yunfan, et autres
Publié: (2026)
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
par: Fu, Lingyue, et autres
Publié: (2025)
par: Fu, Lingyue, et autres
Publié: (2025)
KCoEvo: A Knowledge Graph Augmented Framework for Evolutionary Code Generation
par: Kang, Jiazhen, et autres
Publié: (2026)
par: Kang, Jiazhen, et autres
Publié: (2026)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
par: Deng, Ken, et autres
Publié: (2024)
par: Deng, Ken, et autres
Publié: (2024)
Automated Update of Android Deprecated API Usages with Large Language Models
par: Mahmud, Tarek, et autres
Publié: (2024)
par: Mahmud, Tarek, et autres
Publié: (2024)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
par: Liu, Kaiyuan, et autres
Publié: (2025)
par: Liu, Kaiyuan, et autres
Publié: (2025)
CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
par: Chen, Zaoyu, et autres
Publié: (2026)
par: Chen, Zaoyu, et autres
Publié: (2026)
PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization
par: Jing, Huihao, et autres
Publié: (2026)
par: Jing, Huihao, et autres
Publié: (2026)
Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation
par: Bae, Suyoung, et autres
Publié: (2026)
par: Bae, Suyoung, et autres
Publié: (2026)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
par: Wu, Jiarong, et autres
Publié: (2025)
par: Wu, Jiarong, et autres
Publié: (2025)
Revolutionizing API Documentation through Summarization
par: Naghshzan, AmirHossein, et autres
Publié: (2024)
par: Naghshzan, AmirHossein, et autres
Publié: (2024)
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
par: Chen, Yeheng, et autres
Publié: (2026)
par: Chen, Yeheng, et autres
Publié: (2026)
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Documents similaires
-
ReCode: Updating Code API Knowledge with Reinforcement Learning
par: Wu, Haoze, et autres
Publié: (2025) -
PropMEND: Hypernetworks for Knowledge Propagation in LLMs
par: Liu, Zeyu Leo, et autres
Publié: (2025) -
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
par: Xin, Yutong, et autres
Publié: (2026) -
Coeditor: Leveraging Contextual Changes for Multi-round Code Auto-editing
par: Wei, Jiayi, et autres
Publié: (2023) -
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
par: Khatry, Anirudh, et autres
Publié: (2025)