LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Kuhar, Sachit, Ahmad, Wasi Uddin, Wang, Zijian, Jain, Nihal, Qian, Haifeng, Ray, Baishakhi, Ramanathan, Murali Krishna, Ma, Xiaofei, Deoras, Anoop |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UTFix: Change Aware Unit Test Repairing using LLM
by: Rahman, Shanto, et al.
Published: (2025)
by: Rahman, Shanto, et al.
Published: (2025)
CodeFort: Robust Training for Code Generation Models
by: Zhang, Yuhao, et al.
Published: (2024)
by: Zhang, Yuhao, et al.
Published: (2024)
On Mitigating Code LLM Hallucinations with API Documentation
by: Jain, Nihal, et al.
Published: (2024)
by: Jain, Nihal, et al.
Published: (2024)
Repoformer: Selective Retrieval for Repository-Level Code Completion
by: Wu, Di, et al.
Published: (2024)
by: Wu, Di, et al.
Published: (2024)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
by: Kim, Myeongsoo, et al.
Published: (2025)
by: Kim, Myeongsoo, et al.
Published: (2025)
Code-Aware Prompting: A study of Coverage Guided Test Generation in Regression Setting using LLM
by: Ryan, Gabriel, et al.
Published: (2024)
by: Ryan, Gabriel, et al.
Published: (2024)
Structural Code Search using Natural Language Queries
by: Limpanukorn, Ben, et al.
Published: (2025)
by: Limpanukorn, Ben, et al.
Published: (2025)
PLUM: Improving Inference Efficiency By Leveraging Repetition-Sparsity Trade-Off
by: Kuhar, Sachit, et al.
Published: (2023)
by: Kuhar, Sachit, et al.
Published: (2023)
Multi-IaC-Eval: Benchmarking Cloud Infrastructure as Code Across Multiple Formats
by: Davidson, Sam, et al.
Published: (2025)
by: Davidson, Sam, et al.
Published: (2025)
SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
by: Ma, George, et al.
Published: (2025)
by: Ma, George, et al.
Published: (2025)
Lightweight reranking for language model generations
by: Jain, Siddhartha, et al.
Published: (2023)
by: Jain, Siddhartha, et al.
Published: (2023)
SpecTra: Enhancing the Code Translation Ability of Language Models by Generating Multi-Modal Specifications
by: Nitin, Vikram, et al.
Published: (2024)
by: Nitin, Vikram, et al.
Published: (2024)
LeDex: Training LLMs to Better Self-Debug and Explain Code
by: Jiang, Nan, et al.
Published: (2024)
by: Jiang, Nan, et al.
Published: (2024)
Approximately Aligned Decoding
by: Melcer, Daniel, et al.
Published: (2024)
by: Melcer, Daniel, et al.
Published: (2024)
From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
by: Chen, Simin, et al.
Published: (2025)
by: Chen, Simin, et al.
Published: (2025)
Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam Generation
by: Guinet, Gauthier, et al.
Published: (2024)
by: Guinet, Gauthier, et al.
Published: (2024)
Learning to Discern: Imitating Heterogeneous Human Demonstrations with Preference and Representation Learning
by: Kuhar, Sachit, et al.
Published: (2023)
by: Kuhar, Sachit, et al.
Published: (2023)
OpenCodeReasoning: Advancing Data Distillation for Competitive Coding
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
BASS: Batched Attention-optimized Speculative Sampling
by: Qian, Haifeng, et al.
Published: (2024)
by: Qian, Haifeng, et al.
Published: (2024)
Non‐neurological factors associated with serum neurofilament levels in the United States population
by: Murali Ramanathan
Published: (2024)
by: Murali Ramanathan
Published: (2024)
Pre-trained Language Models for Keyphrase Generation: A Thorough Empirical Study
by: Wu, Di, et al.
Published: (2022)
by: Wu, Di, et al.
Published: (2022)
On Leveraging Encoder-only Pre-trained Language Models for Effective Keyphrase Generation
by: Wu, Di, et al.
Published: (2024)
by: Wu, Di, et al.
Published: (2024)
CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning
by: Roy, Monoshi Kumar, et al.
Published: (2025)
by: Roy, Monoshi Kumar, et al.
Published: (2025)
OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback
by: Jana, Prithwish, et al.
Published: (2026)
by: Jana, Prithwish, et al.
Published: (2026)
CODESTRUCT: Code Agents over Structured Action Spaces
by: Kim, Myeongsoo, et al.
Published: (2026)
by: Kim, Myeongsoo, et al.
Published: (2026)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
by: Ludwig, Nikolai, et al.
Published: (2026)
by: Ludwig, Nikolai, et al.
Published: (2026)
Fewer Truncations Improve Language Modeling
by: Ding, Hantian, et al.
Published: (2024)
by: Ding, Hantian, et al.
Published: (2024)
OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
by: Ahmad, Wasi Uddin, et al.
Published: (2025)
CYCLE: Learning to Self-Refine the Code Generation
by: Ding, Yangruibo, et al.
Published: (2024)
by: Ding, Yangruibo, et al.
Published: (2024)
Code Representation Learning At Scale
by: Zhang, Dejiao, et al.
Published: (2024)
by: Zhang, Dejiao, et al.
Published: (2024)
Mechanics of Learned Reasoning 1: TempoBench, A Benchmark for Interpretable Deconstruction of Reasoning System Performance
by: Holzer, Nikolaus, et al.
Published: (2025)
by: Holzer, Nikolaus, et al.
Published: (2025)
TransLibEval: Demystify Large Language Models' Capability in Third-party Library-targeted Code Translation
by: Xue, Pengyu, et al.
Published: (2025)
by: Xue, Pengyu, et al.
Published: (2025)
SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation
by: Petrukha, Ivan, et al.
Published: (2025)
by: Petrukha, Ivan, et al.
Published: (2025)
MigrationBench: Repository-Level Code Migration Benchmark from Java 8
by: Liu, Linbo, et al.
Published: (2025)
by: Liu, Linbo, et al.
Published: (2025)
Code4Lib Journal
Published: (2008)
Published: (2008)
C2SaferRust: Transforming C Projects into Safer Rust with NeuroSymbolic Techniques
by: Nitin, Vikram, et al.
Published: (2025)
by: Nitin, Vikram, et al.
Published: (2025)
EditLord: Learning Code Transformation Rules for Code Editing
by: Li, Weichen, et al.
Published: (2025)
by: Li, Weichen, et al.
Published: (2025)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
by: Ekbote, Chanakya, et al.
Published: (2025)
by: Ekbote, Chanakya, et al.
Published: (2025)
Similar Items
-
UTFix: Change Aware Unit Test Repairing using LLM
by: Rahman, Shanto, et al.
Published: (2025) -
CodeFort: Robust Training for Code Generation Models
by: Zhang, Yuhao, et al.
Published: (2024) -
On Mitigating Code LLM Hallucinations with API Documentation
by: Jain, Nihal, et al.
Published: (2024) -
Repoformer: Selective Retrieval for Repository-Level Code Completion
by: Wu, Di, et al.
Published: (2024) -
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
by: Kim, Myeongsoo, et al.
Published: (2025)