Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Linxin, Chen, Jiefeng, Huang, Yue, Mishra, Bhavana Dalvi, Wang, Chi, Zhao, Jieyu, Yoon, Jinsung, Pfister, Tomas |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Finding Logic Bugs in Spatial Database Engines via Affine Equivalent Inputs
par: Deng, Wenjing, et autres
Publié: (2024)
par: Deng, Wenjing, et autres
Publié: (2024)
Generating Equivalent Representations of Code By A Self-Reflection Approach
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Is Productivity in Quantum Programming Equivalent to Expressiveness?
par: Corrales-Garro, Francini, et autres
Publié: (2025)
par: Corrales-Garro, Francini, et autres
Publié: (2025)
FormulaCode: Evaluating Agentic Optimization on Large Codebases
par: Sehgal, Atharva, et autres
Publié: (2026)
par: Sehgal, Atharva, et autres
Publié: (2026)
SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration
par: Chen, Jialong, et autres
Publié: (2026)
par: Chen, Jialong, et autres
Publié: (2026)
VERT: Verified Equivalent Rust Transpilation with Large Language Models as Few-Shot Learners
par: Yang, Aidan Z. H., et autres
Publié: (2024)
par: Yang, Aidan Z. H., et autres
Publié: (2024)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
par: Wei, Anjiang, et autres
Publié: (2025)
par: Wei, Anjiang, et autres
Publié: (2025)
FairCoder: Evaluating Social Bias of LLMs in Code Generation
par: Du, Yongkang, et autres
Publié: (2025)
par: Du, Yongkang, et autres
Publié: (2025)
RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation
par: Luo, Jane, et autres
Publié: (2025)
par: Luo, Jane, et autres
Publié: (2025)
Proving Cypher Query Equivalence
par: Tang, Lei, et autres
Publié: (2025)
par: Tang, Lei, et autres
Publié: (2025)
The Secrets Must Not Flow: Scaling Security Verification to Large Codebases (extended version)
par: Arquint, Linard, et autres
Publié: (2025)
par: Arquint, Linard, et autres
Publié: (2025)
QEMI: A Quantum Software Stacks Testing Framework via Equivalence Modulo Inputs
par: Luo, Junjie, et autres
Publié: (2026)
par: Luo, Junjie, et autres
Publié: (2026)
Verify Implementation Equivalence of Large Models
par: Zhan, Qi, et autres
Publié: (2026)
par: Zhan, Qi, et autres
Publié: (2026)
SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution
par: He, Kang, et autres
Publié: (2026)
par: He, Kang, et autres
Publié: (2026)
An Empirical Evaluation of Manually Created Equivalent Mutants
par: Straubinger, Philipp, et autres
Publié: (2024)
par: Straubinger, Philipp, et autres
Publié: (2024)
What can Large Language Models Capture about Code Functional Equivalence?
par: Maveli, Nickil, et autres
Publié: (2024)
par: Maveli, Nickil, et autres
Publié: (2024)
Large Language Models for Equivalent Mutant Detection: How Far Are We?
par: Tian, Zhao, et autres
Publié: (2024)
par: Tian, Zhao, et autres
Publié: (2024)
Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases
par: Wong, Sherman, et autres
Publié: (2025)
par: Wong, Sherman, et autres
Publié: (2025)
Code-Survey: An LLM-Driven Methodology for Analyzing Large-Scale Codebases
par: Zheng, Yusheng, et autres
Publié: (2024)
par: Zheng, Yusheng, et autres
Publié: (2024)
Disproving Program Equivalence with LLMs
par: Allamanis, Miltiadis, et autres
Publié: (2025)
par: Allamanis, Miltiadis, et autres
Publié: (2025)
Refactoring Codebases through Library Design
par: Kovacic, Ziga, et autres
Publié: (2025)
par: Kovacic, Ziga, et autres
Publié: (2025)
TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation
par: Liu, Steven, et autres
Publié: (2026)
par: Liu, Steven, et autres
Publié: (2026)
Compiler Optimization Testing Based on Optimization-Guided Equivalence Transformations
par: Wu, Jingwen, et autres
Publié: (2025)
par: Wu, Jingwen, et autres
Publié: (2025)
Prometheus: Towards Long-Horizon Codebase Navigation for Repository-Level Problem Solving
par: Pan, Yue, et autres
Publié: (2025)
par: Pan, Yue, et autres
Publié: (2025)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
par: Wu, Jiarong, et autres
Publié: (2025)
par: Wu, Jiarong, et autres
Publié: (2025)
RacerF: Lightweight Static Data Race Detection for C Code
par: Dacík, Tomáš, et autres
Publié: (2025)
par: Dacík, Tomáš, et autres
Publié: (2025)
RacerF: Data Race Detection with Frama-C (Competition Contribution)
par: Dacík, Tomáš, et autres
Publié: (2025)
par: Dacík, Tomáš, et autres
Publié: (2025)
Equivalence, Identity, and Unitarity Checking in Black-Box Testing of Quantum Programs
par: Long, Peixun, et autres
Publié: (2023)
par: Long, Peixun, et autres
Publié: (2023)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Codified Context: Infrastructure for AI Agents in a Complex Codebase
par: Vasilopoulos, Aristidis
Publié: (2026)
par: Vasilopoulos, Aristidis
Publié: (2026)
Documentation-Guided Agentic Codebase Migration from C to Rust
par: Le-Anh, Minh, et autres
Publié: (2026)
par: Le-Anh, Minh, et autres
Publié: (2026)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
par: Huang, Yue, et autres
Publié: (2023)
par: Huang, Yue, et autres
Publié: (2023)
Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?
par: Zhu, Wang Bill, et autres
Publié: (2026)
par: Zhu, Wang Bill, et autres
Publié: (2026)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
par: Huang, Dong, et autres
Publié: (2024)
par: Huang, Dong, et autres
Publié: (2024)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
par: Song, Huatong, et autres
Publié: (2026)
par: Song, Huatong, et autres
Publié: (2026)
Unseen-Codebases-Domain Data Synthesis and Training Based on Code Graphs
par: Ou, Guangsheng, et autres
Publié: (2026)
par: Ou, Guangsheng, et autres
Publié: (2026)
ReqToCode: Embedding Requirements Traceability as a Structural Property of the Codebase
par: Schlathölter, Thorsten
Publié: (2026)
par: Schlathölter, Thorsten
Publié: (2026)
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
par: Han, Hojae, et autres
Publié: (2025)
par: Han, Hojae, et autres
Publié: (2025)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
par: Du, Junjia, et autres
Publié: (2025)
par: Du, Junjia, et autres
Publié: (2025)
ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions
par: Ding, Xianzhong, et autres
Publié: (2026)
par: Ding, Xianzhong, et autres
Publié: (2026)
Documents similaires
-
Finding Logic Bugs in Spatial Database Engines via Affine Equivalent Inputs
par: Deng, Wenjing, et autres
Publié: (2024) -
Generating Equivalent Representations of Code By A Self-Reflection Approach
par: Li, Jia, et autres
Publié: (2024) -
Is Productivity in Quantum Programming Equivalent to Expressiveness?
par: Corrales-Garro, Francini, et autres
Publié: (2025) -
FormulaCode: Evaluating Agentic Optimization on Large Codebases
par: Sehgal, Atharva, et autres
Publié: (2026) -
SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration
par: Chen, Jialong, et autres
Publié: (2026)