Diff-XYZ: A Benchmark for Evaluating Diff Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Glukhov, Evgeniy, Conti, Michele, Bogomolov, Egor, Golubev, Yaroslav, Bezzubov, Alexander |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Challenge on Optimization of Context Collection for Code Completion
por: Ustalov, Dmitry, et al.
Publicado: (2025)
por: Ustalov, Dmitry, et al.
Publicado: (2025)
Drawing Pandas: A Benchmark for LLMs in Generating Plotting Code
por: Galimzyanov, Timur, et al.
Publicado: (2024)
por: Galimzyanov, Timur, et al.
Publicado: (2024)
EnvBench: A Benchmark for Automated Environment Setup
por: Eliseeva, Aleksandra, et al.
Publicado: (2025)
por: Eliseeva, Aleksandra, et al.
Publicado: (2025)
Long Code Arena: a Set of Benchmarks for Long-Context Code Models
por: Bogomolov, Egor, et al.
Publicado: (2024)
por: Bogomolov, Egor, et al.
Publicado: (2024)
On Pretraining for Project-Level Code Completion
por: Sapronov, Maksim, et al.
Publicado: (2025)
por: Sapronov, Maksim, et al.
Publicado: (2025)
Towards Realistic Evaluation of Commit Message Generation by Matching Online and Offline Settings
por: Tsvetkov, Petr, et al.
Publicado: (2024)
por: Tsvetkov, Petr, et al.
Publicado: (2024)
PIPer: On-Device Environment Setup via Online Reinforcement Learning
por: Kovrigin, Alexander, et al.
Publicado: (2025)
por: Kovrigin, Alexander, et al.
Publicado: (2025)
GitGoodBench: A Novel Benchmark For Evaluating Agentic Performance On Git
por: Lindenbauer, Tobias, et al.
Publicado: (2025)
por: Lindenbauer, Tobias, et al.
Publicado: (2025)
Dynamic Retrieval-Augmented Generation
por: Shapkin, Anton, et al.
Publicado: (2023)
por: Shapkin, Anton, et al.
Publicado: (2023)
Step Rejection Fine-Tuning: A Practical Distillation Recipe
por: Slinko, Igor, et al.
Publicado: (2026)
por: Slinko, Igor, et al.
Publicado: (2026)
On Problems of Implicit Context Compression for Software Engineering Agents
por: Gelvan, Kirill, et al.
Publicado: (2026)
por: Gelvan, Kirill, et al.
Publicado: (2026)
Stack Trace Deduplication: Faster, More Accurately, and in More Realistic Scenarios
por: Shibaev, Egor, et al.
Publicado: (2024)
por: Shibaev, Egor, et al.
Publicado: (2024)
Tool-Augmented LLMs as a Universal Interface for IDEs
por: Zharov, Yaroslav, et al.
Publicado: (2024)
por: Zharov, Yaroslav, et al.
Publicado: (2024)
The Complexity Trap: Simple Observation Masking Is as Efficient as LLM Summarization for Agent Context Management
por: Lindenbauer, Tobias, et al.
Publicado: (2025)
por: Lindenbauer, Tobias, et al.
Publicado: (2025)
Context Composing for Full Line Code Completion
por: Semenkin, Anton, et al.
Publicado: (2024)
por: Semenkin, Anton, et al.
Publicado: (2024)
Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation
por: Pysklo, Hubert M., et al.
Publicado: (2026)
por: Pysklo, Hubert M., et al.
Publicado: (2026)
The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation
por: Bagirov, Farid, et al.
Publicado: (2025)
por: Bagirov, Farid, et al.
Publicado: (2025)
Analyzing and Evaluating the Behavior of Git Diff and Merge
por: Glodny, Niels
Publicado: (2025)
por: Glodny, Niels
Publicado: (2025)
Untangling Knots: Leveraging LLM for Error Resolution in Computational Notebooks
por: Grotov, Konstantin, et al.
Publicado: (2024)
por: Grotov, Konstantin, et al.
Publicado: (2024)
DiffGAN: A Test Generation Approach for Differential Testing of Deep Neural Networks for Image Analysis
por: Aghababaeyan, Zohreh, et al.
Publicado: (2024)
por: Aghababaeyan, Zohreh, et al.
Publicado: (2024)
On The Importance of Reasoning for Context Retrieval in Repository-Level Code Editing
por: Kovrigin, Alexander, et al.
Publicado: (2024)
por: Kovrigin, Alexander, et al.
Publicado: (2024)
Full Line Code Completion: Bringing AI to Desktop
por: Semenkin, Anton, et al.
Publicado: (2024)
por: Semenkin, Anton, et al.
Publicado: (2024)
AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion Generation
por: Pulavarthi, Vaishnavi, et al.
Publicado: (2024)
por: Pulavarthi, Vaishnavi, et al.
Publicado: (2024)
Mellum: Production-Grade in-IDE Contextual Code Completion with Multi-File Project Understanding
por: Pavlichenko, Nikita, et al.
Publicado: (2025)
por: Pavlichenko, Nikita, et al.
Publicado: (2025)
EM-Assist: Safe Automated ExtractMethod Refactoring with LLMs
por: Pomian, Dorin, et al.
Publicado: (2024)
por: Pomian, Dorin, et al.
Publicado: (2024)
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
por: Gu, Alex, et al.
Publicado: (2024)
por: Gu, Alex, et al.
Publicado: (2024)
A Novel Refactoring and Semantic Aware Abstract Syntax Tree Differencing Tool and a Benchmark for Evaluating the Accuracy of Diff Tools
por: Alikhanifard, Pouria, et al.
Publicado: (2024)
por: Alikhanifard, Pouria, et al.
Publicado: (2024)
Automating Benchmark Design
por: Dsouza, Amanda, et al.
Publicado: (2025)
por: Dsouza, Amanda, et al.
Publicado: (2025)
OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents
por: Kuntz, Thomas, et al.
Publicado: (2025)
por: Kuntz, Thomas, et al.
Publicado: (2025)
AICD Bench: A Challenging Benchmark for AI-Generated Code Detection
por: Orel, Daniil, et al.
Publicado: (2026)
por: Orel, Daniil, et al.
Publicado: (2026)
Understanding Robustness of Model Editing in Code LLMs
por: Chhetri, Vinaik, et al.
Publicado: (2025)
por: Chhetri, Vinaik, et al.
Publicado: (2025)
MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development
por: Fakorede, Moshood A., et al.
Publicado: (2026)
por: Fakorede, Moshood A., et al.
Publicado: (2026)
OSS-Bench: Benchmark Generator for Coding LLMs
por: Jiang, Yuancheng, et al.
Publicado: (2025)
por: Jiang, Yuancheng, et al.
Publicado: (2025)
RepoQA: Evaluating Long Context Code Understanding
por: Liu, Jiawei, et al.
Publicado: (2024)
por: Liu, Jiawei, et al.
Publicado: (2024)
Understanding Practitioners Perspectives on Monitoring Machine Learning Systems
por: Naveed, Hira, et al.
Publicado: (2025)
por: Naveed, Hira, et al.
Publicado: (2025)
ThrowBench: Benchmarking LLMs by Predicting Runtime Exceptions
por: Prenner, Julian Aron, et al.
Publicado: (2025)
por: Prenner, Julian Aron, et al.
Publicado: (2025)
To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing
por: Cheng, Wei, et al.
Publicado: (2026)
por: Cheng, Wei, et al.
Publicado: (2026)
SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?
por: Miserendino, Samuel, et al.
Publicado: (2025)
por: Miserendino, Samuel, et al.
Publicado: (2025)
Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation
por: Steenhoek, Benjamin, et al.
Publicado: (2023)
por: Steenhoek, Benjamin, et al.
Publicado: (2023)
Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation
por: Steenhoek, Benjamin, et al.
Publicado: (2024)
por: Steenhoek, Benjamin, et al.
Publicado: (2024)
Ejemplares similares
-
Challenge on Optimization of Context Collection for Code Completion
por: Ustalov, Dmitry, et al.
Publicado: (2025) -
Drawing Pandas: A Benchmark for LLMs in Generating Plotting Code
por: Galimzyanov, Timur, et al.
Publicado: (2024) -
EnvBench: A Benchmark for Automated Environment Setup
por: Eliseeva, Aleksandra, et al.
Publicado: (2025) -
Long Code Arena: a Set of Benchmarks for Long-Context Code Models
por: Bogomolov, Egor, et al.
Publicado: (2024) -
On Pretraining for Project-Level Code Completion
por: Sapronov, Maksim, et al.
Publicado: (2025)