umayer16/VIBEBENCH: v1.3.0 — Bug Fixes, CLI, Test Suite, Multi-Model Benchmark Results
Fuente:
Zenodo
Guardado en:
| Autor principal: | umayer16 |
|---|---|
| Formato: | Recurso digital |
| Publicado: |
Zenodo
2026
|
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
jonvon16/Arkansas_TBP_Canada_Goose_Data_2005_2020: v1.0.1
por: jonvon16
Publicado: (2025)
por: jonvon16
Publicado: (2025)
KokoFan16/CHiARA: CHiArA SC26 AD/AE submission
por: KokoFan16
Publicado: (2026)
por: KokoFan16
Publicado: (2026)
childmindresearch/actfast: v1.3.0
por: Florian Rupprecht
Publicado: (2026)
por: Florian Rupprecht
Publicado: (2026)
Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI
por: Zhang, Ruixin, et al.
Publicado: (2026)
por: Zhang, Ruixin, et al.
Publicado: (2026)
Render CLI チュートリアル
por: Kawai, Katsuhiko
Publicado: (2026)
por: Kawai, Katsuhiko
Publicado: (2026)
CLI-Gym: Scalable CLI Task Generation via Agentic Environment Inversion
por: Lin, Yusong, et al.
Publicado: (2026)
por: Lin, Yusong, et al.
Publicado: (2026)
HotBugs.jar: A Benchmark of Hot Fixes for Time-Critical Bugs
por: Hanna, Carol, et al.
Publicado: (2025)
por: Hanna, Carol, et al.
Publicado: (2025)
GitBug-Actions: Building Reproducible Bug-Fix Benchmarks with GitHub Actions
por: Saavedra, Nuno, et al.
Publicado: (2023)
por: Saavedra, Nuno, et al.
Publicado: (2023)
bioinfo-pf-curie/oncodriver: v1.3.0
por: Nicolas Servant, et al.
Publicado: (2026)
por: Nicolas Servant, et al.
Publicado: (2026)
andreibesleaga/kaiban-distributed: v1.3.0-beta
por: Andrei Besleaga (Nicolae)
Publicado: (2026)
por: Andrei Besleaga (Nicolae)
Publicado: (2026)
UCD-BDLab/BioNeuralNet: v1.3.0
por: Vicente Ramos, et al.
Publicado: (2026)
por: Vicente Ramos, et al.
Publicado: (2026)
SCFL Comparative Invariant Benchmark Suite 1.0
por: Brogdon, Ronald
Publicado: (2026)
por: Brogdon, Ronald
Publicado: (2026)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
por: Hu, Ruida, et al.
Publicado: (2026)
por: Hu, Ruida, et al.
Publicado: (2026)
sssssh1228/DLC_fBug: fBugs_v1
por: sssssh
Publicado: (2026)
por: sssssh
Publicado: (2026)
InnovationLine/BioImageSuiteLite: v0.1.4
por: raju1stnov
Publicado: (2025)
por: raju1stnov
Publicado: (2025)
Benchmarking Continuous Dynamic Multi-Objective Optimization: Survey and Generalized Test Suite
por: Shao, Chang, et al.
Publicado: (2026)
por: Shao, Chang, et al.
Publicado: (2026)
CREH Benchmark Results — Batch 1 (Final v3)
por: Aegis Solis, Thomas Vargo
Publicado: (2026)
por: Aegis Solis, Thomas Vargo
Publicado: (2026)
SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents
por: Mündler, Niels, et al.
Publicado: (2024)
por: Mündler, Niels, et al.
Publicado: (2024)
hassansaei/ImageJ-macro-workbench: ImageAnalyzer v1.3.0
por: Hassan Saei
Publicado: (2025)
por: Hassan Saei
Publicado: (2025)
epi2me-labs/wf-bacterial-genomes: v1.3.0
por: Chris Wright, et al.
Publicado: (2024)
por: Chris Wright, et al.
Publicado: (2024)
Fixing Hardware Security Bugs with Large Language Models
por: Ahmad, Baleegh, et al.
Publicado: (2023)
por: Ahmad, Baleegh, et al.
Publicado: (2023)
A Multi-objective Optimization Benchmark Test Suite for Real-time Semantic Segmentation
por: Zhao, Yifan, et al.
Publicado: (2024)
por: Zhao, Yifan, et al.
Publicado: (2024)
HAFix: History-Augmented Large Language Models for Bug Fixing
por: Shi, Yu, et al.
Publicado: (2025)
por: Shi, Yu, et al.
Publicado: (2025)
khanlab/zarrnii: v0.16.3-alpha1
por: Ali Khan, et al.
Publicado: (2026)
por: Ali Khan, et al.
Publicado: (2026)
LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces
por: Feng, Yukang, et al.
Publicado: (2026)
por: Feng, Yukang, et al.
Publicado: (2026)
Artifacts of the ADS Bug-Fix Pattern Study
por: Chen, Yuntianyi, et al.
Publicado: (2025)
por: Chen, Yuntianyi, et al.
Publicado: (2025)
A Scalable Benchmark Test Suite for Dynamic Multi-Objective Optimization with a Changing Number of Objectives
por: Shang, Ke, et al.
Publicado: (2026)
por: Shang, Ke, et al.
Publicado: (2026)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
por: Kytöniemi, Joona, et al.
Publicado: (2025)
por: Kytöniemi, Joona, et al.
Publicado: (2025)
SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs
por: Pham, Minh V. T., et al.
Publicado: (2025)
por: Pham, Minh V. T., et al.
Publicado: (2025)
Learning CLI Agents with Structured Action Credit under Selective Observation
por: Su, Haoyang, et al.
Publicado: (2026)
por: Su, Haoyang, et al.
Publicado: (2026)
Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection
por: Pushkar, Chinmay, et al.
Publicado: (2025)
por: Pushkar, Chinmay, et al.
Publicado: (2025)
The Limits of Long-Context Reasoning in Automated Bug Fixing
por: Raju, Ravi, et al.
Publicado: (2026)
por: Raju, Ravi, et al.
Publicado: (2026)
Are Large Language Models Memorizing Bug Benchmarks?
por: Ramos, Daniel, et al.
Publicado: (2024)
por: Ramos, Daniel, et al.
Publicado: (2024)
3DGen-Bench: Comprehensive Benchmark Suite for 3D Generative Models
por: Zhang, Yuhan, et al.
Publicado: (2025)
por: Zhang, Yuhan, et al.
Publicado: (2025)
BREEDING SYNCHRONY AND NEST PREDATION IN RED-WINGED BLACKBIRDS¦100WEATHERHEAD, PATRICK., ET AL.¦24082// 06/JUN/2001/16
por: WEATHERHEAD, PATRICK., ET AL.¦24082/06/JUN/2001/16
Publicado: (2001)
por: WEATHERHEAD, PATRICK., ET AL.¦24082/06/JUN/2001/16
Publicado: (2001)
TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation
por: Liu, Steven, et al.
Publicado: (2026)
por: Liu, Steven, et al.
Publicado: (2026)
Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites
por: Li, Chenglin, et al.
Publicado: (2026)
por: Li, Chenglin, et al.
Publicado: (2026)
ChiBench: a Benchmark Suite for Testing Electronic Design Automation Tools
por: Sumitani, Rafael, et al.
Publicado: (2024)
por: Sumitani, Rafael, et al.
Publicado: (2024)
Fixing 7,400 Bugs for 1$: Cheap Crash-Site Program Repair
por: Zheng, Han, et al.
Publicado: (2025)
por: Zheng, Han, et al.
Publicado: (2025)
MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability
por: Ma, Tie, et al.
Publicado: (2026)
por: Ma, Tie, et al.
Publicado: (2026)
Ejemplares similares
-
jonvon16/Arkansas_TBP_Canada_Goose_Data_2005_2020: v1.0.1
por: jonvon16
Publicado: (2025) -
KokoFan16/CHiARA: CHiArA SC26 AD/AE submission
por: KokoFan16
Publicado: (2026) -
childmindresearch/actfast: v1.3.0
por: Florian Rupprecht
Publicado: (2026) -
Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI
por: Zhang, Ruixin, et al.
Publicado: (2026) -
Render CLI チュートリアル
por: Kawai, Katsuhiko
Publicado: (2026)