ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Qianru, Ren, Zhaochun, Visser, Joost |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EviACT: An Evidence-to-Action Framework for Agentic Program Repair
di: Meng, Qianru, et al.
Pubblicazione: (2026)
di: Meng, Qianru, et al.
Pubblicazione: (2026)
When More Retrieval Hurts: Retrieval-Augmented Code Review Generation
di: Meng, Qianru, et al.
Pubblicazione: (2025)
di: Meng, Qianru, et al.
Pubblicazione: (2025)
Combining Retrieval and Classification: Balancing Efficiency and Accuracy in Duplicate Bug Report Detection
di: Meng, Qianru, et al.
Pubblicazione: (2024)
di: Meng, Qianru, et al.
Pubblicazione: (2024)
SmartNote: An LLM-Powered, Personalised Release Note Generator That Just Works
di: Daneshyan, Farbod, et al.
Pubblicazione: (2025)
di: Daneshyan, Farbod, et al.
Pubblicazione: (2025)
ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS
di: Xie, Bang, et al.
Pubblicazione: (2026)
di: Xie, Bang, et al.
Pubblicazione: (2026)
Establishing Traceability Links between Release Notes & Software Artifacts: Practitioners' Perspectives
di: Nath, Sristy Sumana, et al.
Pubblicazione: (2025)
di: Nath, Sristy Sumana, et al.
Pubblicazione: (2025)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
di: Liu, Kaiyuan, et al.
Pubblicazione: (2025)
di: Liu, Kaiyuan, et al.
Pubblicazione: (2025)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
di: Dai, Dekun, et al.
Pubblicazione: (2025)
di: Dai, Dekun, et al.
Pubblicazione: (2025)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
di: Peng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Peng, Zhiyuan, et al.
Pubblicazione: (2025)
SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation
di: Ye, Zhifan, et al.
Pubblicazione: (2025)
di: Ye, Zhifan, et al.
Pubblicazione: (2025)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
di: Yu, Hao, et al.
Pubblicazione: (2023)
di: Yu, Hao, et al.
Pubblicazione: (2023)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
di: Zhang, Tanghaoran, et al.
Pubblicazione: (2026)
di: Zhang, Tanghaoran, et al.
Pubblicazione: (2026)
Towards Semantic Versioning of Open Pre-trained Language Model Releases on Hugging Face
di: Ajibode, Adekunle, et al.
Pubblicazione: (2024)
di: Ajibode, Adekunle, et al.
Pubblicazione: (2024)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
di: Feng, Jia, et al.
Pubblicazione: (2024)
di: Feng, Jia, et al.
Pubblicazione: (2024)
ScenEval: A Benchmark for Scenario-Based Evaluation of Code Generation
di: Paul, Debalina Ghosh, et al.
Pubblicazione: (2024)
di: Paul, Debalina Ghosh, et al.
Pubblicazione: (2024)
ScalerEval: Automated and Consistent Evaluation Testbed for Auto-scalers in Microservices
di: Xie, Shuaiyu, et al.
Pubblicazione: (2025)
di: Xie, Shuaiyu, et al.
Pubblicazione: (2025)
A Process To Support Cloud Release Preparation
di: Cusick, James J.
Pubblicazione: (2022)
di: Cusick, James J.
Pubblicazione: (2022)
A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models
di: Hu, Ruida, et al.
Pubblicazione: (2024)
di: Hu, Ruida, et al.
Pubblicazione: (2024)
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
di: Xue, Pengyu, et al.
Pubblicazione: (2024)
di: Xue, Pengyu, et al.
Pubblicazione: (2024)
Predicting the Impact of Crashes Across Release Channels
di: Mujahid, Suhaib, et al.
Pubblicazione: (2024)
di: Mujahid, Suhaib, et al.
Pubblicazione: (2024)
ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions
di: Li, Jialin, et al.
Pubblicazione: (2026)
di: Li, Jialin, et al.
Pubblicazione: (2026)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
di: Ma, Lezhi, et al.
Pubblicazione: (2024)
di: Ma, Lezhi, et al.
Pubblicazione: (2024)
Analysis of Marketed versus Not-marketed Mobile App Releases
di: Nayebi, Maleknaz, et al.
Pubblicazione: (2024)
di: Nayebi, Maleknaz, et al.
Pubblicazione: (2024)
TAM-Eval: Evaluating LLMs for Automated Unit Test Maintenance
di: Bruches, Elena, et al.
Pubblicazione: (2026)
di: Bruches, Elena, et al.
Pubblicazione: (2026)
TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark
di: Jain, Kush, et al.
Pubblicazione: (2024)
di: Jain, Kush, et al.
Pubblicazione: (2024)
Identifying Privacy Concerns in Upcoming Software Release: A Peek into the Future
di: Chattopadhyay, Aurek, et al.
Pubblicazione: (2026)
di: Chattopadhyay, Aurek, et al.
Pubblicazione: (2026)
Question Answering for Multi-Release Systems: A Case Study at Ciena
di: Khamsepour, Parham, et al.
Pubblicazione: (2026)
di: Khamsepour, Parham, et al.
Pubblicazione: (2026)
From Release to Adoption: Challenges in Reusing Pre-trained AI Models for Downstream Developers
di: Banyongrakkul, Peerachai, et al.
Pubblicazione: (2025)
di: Banyongrakkul, Peerachai, et al.
Pubblicazione: (2025)
HumanEvalComm: Benchmarking the Communication Competence of Code Generation for LLMs and LLM Agent
di: Wu, Jie JW, et al.
Pubblicazione: (2024)
di: Wu, Jie JW, et al.
Pubblicazione: (2024)
Moving Faster and Reducing Risk: Using LLMs in Release Deployment
di: Abreu, Rui, et al.
Pubblicazione: (2024)
di: Abreu, Rui, et al.
Pubblicazione: (2024)
Pre-Release Experimentation in Indie Game Development: An Interview Survey
di: Linåker, Johan, et al.
Pubblicazione: (2024)
di: Linåker, Johan, et al.
Pubblicazione: (2024)
Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications
di: Maiorano, Alexandre Cristovão
Pubblicazione: (2026)
di: Maiorano, Alexandre Cristovão
Pubblicazione: (2026)
SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement
di: Zhan, Zexun, et al.
Pubblicazione: (2025)
di: Zhan, Zexun, et al.
Pubblicazione: (2025)
Uncovering and Mitigating the Impact of Frozen Package Versions for Fixed-Release Linux
di: Tang, Wei, et al.
Pubblicazione: (2024)
di: Tang, Wei, et al.
Pubblicazione: (2024)
Recommending and Release Planning of User-Driven Functionality Deletion for Mobile Apps
di: Nayebi, Maleknaz, et al.
Pubblicazione: (2024)
di: Nayebi, Maleknaz, et al.
Pubblicazione: (2024)
Efficient anytime algorithms to solve the bi-objective Next Release Problem
di: Domínguez-Ríos, Miguel Ángel, et al.
Pubblicazione: (2024)
di: Domínguez-Ríos, Miguel Ángel, et al.
Pubblicazione: (2024)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
di: Das, Gunjan, et al.
Pubblicazione: (2025)
di: Das, Gunjan, et al.
Pubblicazione: (2025)
Faster Releases, Fewer Risks: A Study on Maven Artifact Vulnerabilities and Lifecycle Management
di: Shafin, Md Shafiullah, et al.
Pubblicazione: (2025)
di: Shafin, Md Shafiullah, et al.
Pubblicazione: (2025)
VHDL-Eval: A Framework for Evaluating Large Language Models in VHDL Code Generation
di: Vijayaraghavan, Prashanth, et al.
Pubblicazione: (2024)
di: Vijayaraghavan, Prashanth, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EviACT: An Evidence-to-Action Framework for Agentic Program Repair
di: Meng, Qianru, et al.
Pubblicazione: (2026) -
When More Retrieval Hurts: Retrieval-Augmented Code Review Generation
di: Meng, Qianru, et al.
Pubblicazione: (2025) -
Combining Retrieval and Classification: Balancing Efficiency and Accuracy in Duplicate Bug Report Detection
di: Meng, Qianru, et al.
Pubblicazione: (2024) -
SmartNote: An LLM-Powered, Personalised Release Note Generator That Just Works
di: Daneshyan, Farbod, et al.
Pubblicazione: (2025) -
ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS
di: Xie, Bang, et al.
Pubblicazione: (2026)