SERA: Soft-Verified Efficient Repository Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Ethan, Tormoen, Daniel, Shah, Saurabh, Farhadi, Ali, Dettmers, Tim |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
by: Xin, Yutong, et al.
Published: (2026)
by: Xin, Yutong, et al.
Published: (2026)
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
by: Ahmed, Toufique, et al.
Published: (2024)
by: Ahmed, Toufique, et al.
Published: (2024)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
by: Jain, Naman, et al.
Published: (2025)
by: Jain, Naman, et al.
Published: (2025)
Efficient Detection of Intermittent Job Failures Using Few-Shot Learning
by: Aïdasso, Henri, et al.
Published: (2025)
by: Aïdasso, Henri, et al.
Published: (2025)
SEVerA: Verified Synthesis of Self-Evolving Agents
by: Banerjee, Debangshu, et al.
Published: (2026)
by: Banerjee, Debangshu, et al.
Published: (2026)
Solution-oriented Agent-based Models Generation with Verifier-assisted Iterative In-context Learning
by: Niu, Tong, et al.
Published: (2024)
by: Niu, Tong, et al.
Published: (2024)
GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents
by: Wu, Jie JW, et al.
Published: (2025)
by: Wu, Jie JW, et al.
Published: (2025)
StackEval: Benchmarking LLMs in Coding Assistance
by: Shah, Nidhish, et al.
Published: (2024)
by: Shah, Nidhish, et al.
Published: (2024)
SWE-Spot: Building Small Repo-Experts with Repository-Centric Learning
by: Peng, Jinjun, et al.
Published: (2026)
by: Peng, Jinjun, et al.
Published: (2026)
Hybrid-Gym: Training Coding Agents to Generalize Across Tasks
by: Xie, Yiqing, et al.
Published: (2026)
by: Xie, Yiqing, et al.
Published: (2026)
ReCodeAgent: A Multi-Agent Workflow for Language-agnostic Translation and Validation of Large-scale Repositories
by: Ibrahimzada, Ali Reza, et al.
Published: (2026)
by: Ibrahimzada, Ali Reza, et al.
Published: (2026)
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
by: Xia, Yunhui, et al.
Published: (2025)
by: Xia, Yunhui, et al.
Published: (2025)
SceneGenAgent: Precise Industrial Scene Generation with Coding Agent
by: Xia, Xiao, et al.
Published: (2024)
by: Xia, Xiao, et al.
Published: (2024)
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
by: Hu, Ruida, et al.
Published: (2025)
by: Hu, Ruida, et al.
Published: (2025)
MutaGReP: Execution-Free Repository-Grounded Plan Search for Code-Use
by: Khan, Zaid, et al.
Published: (2025)
by: Khan, Zaid, et al.
Published: (2025)
Routesplain: Towards Faithful and Intervenable Routing for Software-related Tasks
by: Štorek, Adam, et al.
Published: (2025)
by: Štorek, Adam, et al.
Published: (2025)
Synergizing LLMs and Knowledge Graphs: A Novel Approach to Software Repository-Related Question Answering
by: Abedu, Samuel, et al.
Published: (2024)
by: Abedu, Samuel, et al.
Published: (2024)
MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair
by: Ibrahimzada, Ali Reza, et al.
Published: (2025)
by: Ibrahimzada, Ali Reza, et al.
Published: (2025)
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
by: Ficek, Aleksander, et al.
Published: (2025)
by: Ficek, Aleksander, et al.
Published: (2025)
Exploring LLM-based Agents for Root Cause Analysis
by: Roy, Devjeet, et al.
Published: (2024)
by: Roy, Devjeet, et al.
Published: (2024)
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories
by: Wang, Lilin, et al.
Published: (2025)
by: Wang, Lilin, et al.
Published: (2025)
SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution
by: Li, Han, et al.
Published: (2025)
by: Li, Han, et al.
Published: (2025)
Evaluating Language Models for Efficient Code Generation
by: Liu, Jiawei, et al.
Published: (2024)
by: Liu, Jiawei, et al.
Published: (2024)
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
by: Golubev, Alexander, et al.
Published: (2025)
by: Golubev, Alexander, et al.
Published: (2025)
RANGER -- Repository-Level Agent for Graph-Enhanced Retrieval
by: Shah, Pratik, et al.
Published: (2025)
by: Shah, Pratik, et al.
Published: (2025)
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
by: Liu, Zuxin, et al.
Published: (2024)
by: Liu, Zuxin, et al.
Published: (2024)
SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations
by: Wang, Shuaiqi, et al.
Published: (2026)
by: Wang, Shuaiqi, et al.
Published: (2026)
GiFT: Gibbs Fine-Tuning for Code Generation
by: Li, Haochen, et al.
Published: (2025)
by: Li, Haochen, et al.
Published: (2025)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language Models
by: Weyssow, Martin, et al.
Published: (2023)
by: Weyssow, Martin, et al.
Published: (2023)
Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems
by: Liu, Jiacheng, et al.
Published: (2026)
by: Liu, Jiacheng, et al.
Published: (2026)
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
by: Jiang, Juyong, et al.
Published: (2026)
by: Jiang, Juyong, et al.
Published: (2026)
TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models
by: Park, Chansung, et al.
Published: (2026)
by: Park, Chansung, et al.
Published: (2026)
WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning
by: Jiang, Juyong, et al.
Published: (2026)
by: Jiang, Juyong, et al.
Published: (2026)
Data Augmentation for Code Translation with Comparable Corpora and Multiple References
by: Xie, Yiqing, et al.
Published: (2023)
by: Xie, Yiqing, et al.
Published: (2023)
MetaLint: Easy-to-Hard Generalization for Code Linting
by: Naik, Atharva, et al.
Published: (2025)
by: Naik, Atharva, et al.
Published: (2025)
Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases
by: Wong, Sherman, et al.
Published: (2025)
by: Wong, Sherman, et al.
Published: (2025)
Toward Training Superintelligent Software Agents through Self-Play SWE-RL
by: Wei, Yuxiang, et al.
Published: (2025)
by: Wei, Yuxiang, et al.
Published: (2025)
DocAgent: A Multi-Agent System for Automated Code Documentation Generation
by: Yang, Dayu, et al.
Published: (2025)
by: Yang, Dayu, et al.
Published: (2025)
Advancing Automated In-Isolation Validation in Repository-Level Code Translation
by: Ke, Kaiyao, et al.
Published: (2025)
by: Ke, Kaiyao, et al.
Published: (2025)
Similar Items
-
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
by: Xin, Yutong, et al.
Published: (2026) -
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
by: Ahmed, Toufique, et al.
Published: (2024) -
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
by: Jain, Naman, et al.
Published: (2025) -
Efficient Detection of Intermittent Job Failures Using Few-Shot Learning
by: Aïdasso, Henri, et al.
Published: (2025) -
SEVerA: Verified Synthesis of Self-Evolving Agents
by: Banerjee, Debangshu, et al.
Published: (2026)