SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Rashid, Muhammad Shihab, Bock, Christian, Zhuang, Yuan, Buchholz, Alexander, Esler, Tim, Valentin, Simon, Franceschi, Luca, Wistuba, Martin, Sivaprasad, Prabhu Teja, Kim, Woo Jung, Deoras, Anoop, Zappella, Giovanni, Callot, Laurent |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Choice of PEFT Technique in Continual Learning: Prompt Tuning is Not All You Need
por: Wistuba, Martin, et al.
Publicado: (2024)
por: Wistuba, Martin, et al.
Publicado: (2024)
CoRet: Improved Retriever for Code Editing
por: Fehr, Fabio, et al.
Publicado: (2025)
por: Fehr, Fabio, et al.
Publicado: (2025)
REDO: Execution-Free Runtime Error Detection for COding Agents
por: Li, Shou, et al.
Publicado: (2024)
por: Li, Shou, et al.
Publicado: (2024)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
por: Chen, Yuanjian, et al.
Publicado: (2026)
por: Chen, Yuanjian, et al.
Publicado: (2026)
Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam Generation
por: Guinet, Gauthier, et al.
Publicado: (2024)
por: Guinet, Gauthier, et al.
Publicado: (2024)
Multi-IaC-Eval: Benchmarking Cloud Infrastructure as Code Across Multiple Formats
por: Davidson, Sam, et al.
Publicado: (2025)
por: Davidson, Sam, et al.
Publicado: (2025)
PolyBench: Benchmarking LLM Forecasting and Trading Capabilities on Live Prediction Market Data
por: Cheng, Pu, et al.
Publicado: (2026)
por: Cheng, Pu, et al.
Publicado: (2026)
TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback
por: Jana, Prithwish, et al.
Publicado: (2026)
por: Jana, Prithwish, et al.
Publicado: (2026)
Lightweight reranking for language model generations
por: Jain, Siddhartha, et al.
Publicado: (2023)
por: Jain, Siddhartha, et al.
Publicado: (2023)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
por: Kim, Myeongsoo, et al.
Publicado: (2025)
por: Kim, Myeongsoo, et al.
Publicado: (2025)
Hyperband-based Bayesian Optimization for Black-box Prompt Selection
por: Schneider, Lennart, et al.
Publicado: (2024)
por: Schneider, Lennart, et al.
Publicado: (2024)
Effortless Spontaneity
por: Esler, Dylan
Publicado: (2024)
por: Esler, Dylan
Publicado: (2024)
Gestaltung medizinisch-sozialer Netzwerke
por: Wistuba, Martin
Publicado: (2019)
por: Wistuba, Martin
Publicado: (2019)
DevBench: A multimodal developmental benchmark for language learning
por: Tan, Alvin Wei Ming, et al.
Publicado: (2024)
por: Tan, Alvin Wei Ming, et al.
Publicado: (2024)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
por: Aleithan, Reem, et al.
Publicado: (2024)
por: Aleithan, Reem, et al.
Publicado: (2024)
Reconversión de industrias ligadas a recursos naturales: La promesa incumplida de la industria salmonera en Chile
por: Mirna Bräuning Wistuba
Publicado: (2017)
por: Mirna Bräuning Wistuba
Publicado: (2017)
iSafetyBench: A video-language benchmark for safety in industrial environment
por: Abdullah, Raiyaan, et al.
Publicado: (2025)
por: Abdullah, Raiyaan, et al.
Publicado: (2025)
SWE-Bench-CL: Continual Learning for Coding Agents
por: Joshi, Thomas, et al.
Publicado: (2025)
por: Joshi, Thomas, et al.
Publicado: (2025)
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench
por: Yu, Boxi, et al.
Publicado: (2025)
por: Yu, Boxi, et al.
Publicado: (2025)
SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization
por: Chaudhari, Shravan, et al.
Publicado: (2025)
por: Chaudhari, Shravan, et al.
Publicado: (2025)
SWE Context Bench: A Benchmark for Context Learning in Coding
por: Zhu, Jiayuan, et al.
Publicado: (2026)
por: Zhu, Jiayuan, et al.
Publicado: (2026)
MigrationBench: Repository-Level Code Migration Benchmark from Java 8
por: Liu, Linbo, et al.
Publicado: (2025)
por: Liu, Linbo, et al.
Publicado: (2025)
What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair
por: Martinez, Matias, et al.
Publicado: (2026)
por: Martinez, Matias, et al.
Publicado: (2026)
Does SWE-Bench-Verified Test Agent Ability or Model Memory?
por: Prathifkumar, Thanosan, et al.
Publicado: (2025)
por: Prathifkumar, Thanosan, et al.
Publicado: (2025)
Pre-trained Recommender Systems: A Causal Debiasing Perspective
por: Lin, Ziqian, et al.
Publicado: (2023)
por: Lin, Ziqian, et al.
Publicado: (2023)
Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation
por: Garg, Spandan, et al.
Publicado: (2025)
por: Garg, Spandan, et al.
Publicado: (2025)
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks
por: Mhatre, Sanket, et al.
Publicado: (2025)
por: Mhatre, Sanket, et al.
Publicado: (2025)
The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason
por: Liang, Shanchao, et al.
Publicado: (2025)
por: Liang, Shanchao, et al.
Publicado: (2025)
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
por: Yang, John, et al.
Publicado: (2024)
por: Yang, John, et al.
Publicado: (2024)
CESNET repositories
por: Šimek, Mirek
Publicado: (2025)
por: Šimek, Mirek
Publicado: (2025)
Thesis repository
por: Traks, Magnus
Publicado: (2026)
por: Traks, Magnus
Publicado: (2026)
Quantum Computation Using Large Spin Qudits
por: Omanakuttan, Sivaprasad
Publicado: (2024)
por: Omanakuttan, Sivaprasad
Publicado: (2024)
NORMY: Non-Uniform History Modeling for Open Retrieval Conversational Question Answering
por: Rashid, Muhammad Shihab, et al.
Publicado: (2024)
por: Rashid, Muhammad Shihab, et al.
Publicado: (2024)
Resolution Matters: An Evaluation of EFlows Assessment Methods Used for Hydropower in Developing Countries
por: Hassan Bukhari, et al.
Publicado: (2025)
por: Hassan Bukhari, et al.
Publicado: (2025)
Renal Denervation—“Gizmo Idolatry” Fact Checker
por: Markus P. Schlaich, et al.
Publicado: (2025)
por: Markus P. Schlaich, et al.
Publicado: (2025)
Logic-Scaffolding: Personalized Aspect-Instructed Recommendation Explanation Generation using LLMs
por: Rahdari, Behnam, et al.
Publicado: (2023)
por: Rahdari, Behnam, et al.
Publicado: (2023)
ContextWeaver: Selective and Dependency-Structured Memory Construction for LLM Agents
por: Wu, Yating, et al.
Publicado: (2026)
por: Wu, Yating, et al.
Publicado: (2026)
Lossless Token Sequence Compression via Meta-Tokens
por: Harvill, John, et al.
Publicado: (2025)
por: Harvill, John, et al.
Publicado: (2025)
Fewer Truncations Improve Language Modeling
por: Ding, Hantian, et al.
Publicado: (2024)
por: Ding, Hantian, et al.
Publicado: (2024)
Calumet Creek DOC, discharge and SWE data (SWE)
por: Meingast, Karl M, et al.
Publicado: (2019)
por: Meingast, Karl M, et al.
Publicado: (2019)
Ejemplares similares
-
Choice of PEFT Technique in Continual Learning: Prompt Tuning is Not All You Need
por: Wistuba, Martin, et al.
Publicado: (2024) -
CoRet: Improved Retriever for Code Editing
por: Fehr, Fabio, et al.
Publicado: (2025) -
REDO: Execution-Free Runtime Error Detection for COding Agents
por: Li, Shou, et al.
Publicado: (2024) -
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
por: Chen, Yuanjian, et al.
Publicado: (2026) -
Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam Generation
por: Guinet, Gauthier, et al.
Publicado: (2024)