SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhan, Zexun, Gao, Shuzheng, Hu, Ruida, Gao, Cuiyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Search-Based LLMs for Code Optimization
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
SEER: Enhancing Chain-of-Thought Code Generation through Self-Exploring Deep Reasoning
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
di: Wang, Xinchen, et al.
Pubblicazione: (2025)
di: Wang, Xinchen, et al.
Pubblicazione: (2025)
VulEval: Towards Repository-Level Evaluation of Software Vulnerability Detection
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
What Makes Good In-context Demonstrations for Code Intelligence Tasks with LLMs?
di: Gao, Shuzheng, et al.
Pubblicazione: (2023)
di: Gao, Shuzheng, et al.
Pubblicazione: (2023)
RepoMasterEval: Evaluating Code Completion via Real-World Repositories
di: Wu, Qinyun, et al.
Pubblicazione: (2024)
di: Wu, Qinyun, et al.
Pubblicazione: (2024)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
di: Feng, Jia, et al.
Pubblicazione: (2024)
di: Feng, Jia, et al.
Pubblicazione: (2024)
A Systematic Evaluation of Large Code Models in API Suggestion: When, Which, and How
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
Evaluating Repository-level Software Documentation via Question Answering and Feature-Driven Development
di: Wang, Xinchen, et al.
Pubblicazione: (2026)
di: Wang, Xinchen, et al.
Pubblicazione: (2026)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
di: Hu, Ruida, et al.
Pubblicazione: (2026)
di: Hu, Ruida, et al.
Pubblicazione: (2026)
Learning in the Wild: Towards Leveraging Unlabeled Data for Effectively Tuning Pre-trained Code Models
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
di: Hu, Ruida, et al.
Pubblicazione: (2025)
di: Hu, Ruida, et al.
Pubblicazione: (2025)
Empirical Study of Code Large Language Models for Binary Security Patch Detection
di: Li, Qingyuan, et al.
Pubblicazione: (2025)
di: Li, Qingyuan, et al.
Pubblicazione: (2025)
RAG or Fine-tuning? A Comparative Study on LCMs-based Code Completion in Industry
di: Wang, Chaozheng, et al.
Pubblicazione: (2025)
di: Wang, Chaozheng, et al.
Pubblicazione: (2025)
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
di: Hu, Ruida, et al.
Pubblicazione: (2025)
di: Hu, Ruida, et al.
Pubblicazione: (2025)
AEGIS: An Agent-based Framework for General Bug Reproduction from Issue Descriptions
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
Towards Mitigating API Hallucination in Code Generated by LLMs with Hierarchical Dependency Aware
di: Chen, Yujia, et al.
Pubblicazione: (2025)
di: Chen, Yujia, et al.
Pubblicazione: (2025)
Cascaded Code Editing: Large-Small Model Collaboration for Effective and Efficient Code Editing
di: Wang, Chaozheng, et al.
Pubblicazione: (2026)
di: Wang, Chaozheng, et al.
Pubblicazione: (2026)
A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models
di: Hu, Ruida, et al.
Pubblicazione: (2024)
di: Hu, Ruida, et al.
Pubblicazione: (2024)
Less is More? An Empirical Study on Configuration Issues in Python PyPI Ecosystem
di: Peng, Yun, et al.
Pubblicazione: (2023)
di: Peng, Yun, et al.
Pubblicazione: (2023)
LiCoEval: Evaluating LLMs on License Compliance in Code Generation
di: Xu, Weiwei, et al.
Pubblicazione: (2024)
di: Xu, Weiwei, et al.
Pubblicazione: (2024)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
di: Hu, Ruida, et al.
Pubblicazione: (2024)
di: Hu, Ruida, et al.
Pubblicazione: (2024)
SCALE: Constructing Structured Natural Language Comment Trees for Software Vulnerability Detection
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
EvalSVA: Multi-Agent Evaluators for Next-Gen Software Vulnerability Assessment
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
An Empirical Study of Retrieval-Augmented Code Generation: Challenges and Opportunities
di: Yang, Zezhou, et al.
Pubblicazione: (2025)
di: Yang, Zezhou, et al.
Pubblicazione: (2025)
The Prompt Alchemist: Automated LLM-Tailored Prompt Optimization for Test Case Generation
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
di: Wu, Fan, et al.
Pubblicazione: (2026)
di: Wu, Fan, et al.
Pubblicazione: (2026)
Integrating Rules and Semantics for LLM-Based C-to-Rust Translation
di: Luo, Feng, et al.
Pubblicazione: (2025)
di: Luo, Feng, et al.
Pubblicazione: (2025)
ReposVul: A Repository-Level High-Quality Vulnerability Dataset
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
Deep Learning Based Code Generation Methods: Literature Review
di: Yang, Zezhou, et al.
Pubblicazione: (2023)
di: Yang, Zezhou, et al.
Pubblicazione: (2023)
Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs
di: Chen, Yujia, et al.
Pubblicazione: (2026)
di: Chen, Yujia, et al.
Pubblicazione: (2026)
Does Teaming-Up LLMs Improve Secure Code Generation? A Comprehensive Evaluation with Multi-LLMSecCodeEval
di: Sabir, Bushra, et al.
Pubblicazione: (2026)
di: Sabir, Bushra, et al.
Pubblicazione: (2026)
TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
A Deep Dive into Retrieval-Augmented Generation for Code Completion: Experience on WeChat
di: Yang, Zezhou, et al.
Pubblicazione: (2025)
di: Yang, Zezhou, et al.
Pubblicazione: (2025)
Uncovering Weaknesses in Neural Code Generation
di: Lian, Xiaoli, et al.
Pubblicazione: (2024)
di: Lian, Xiaoli, et al.
Pubblicazione: (2024)
The Current Challenges of Software Engineering in the Era of Large Language Models
di: Gao, Cuiyun, et al.
Pubblicazione: (2024)
di: Gao, Cuiyun, et al.
Pubblicazione: (2024)
Bridge and Hint: Extending Pre-trained Language Models for Long-Range Code
di: Chen, Yujia, et al.
Pubblicazione: (2024)
di: Chen, Yujia, et al.
Pubblicazione: (2024)
Automated Prompt Generation for Code Intelligence: An Empirical study and Experience in WeChat
di: Ji, Kexing, et al.
Pubblicazione: (2025)
di: Ji, Kexing, et al.
Pubblicazione: (2025)
Requirements are All You Need: From Requirements to Code with LLMs
di: Wei, Bingyang
Pubblicazione: (2024)
di: Wei, Bingyang
Pubblicazione: (2024)
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Search-Based LLMs for Code Optimization
di: Gao, Shuzheng, et al.
Pubblicazione: (2024) -
SEER: Enhancing Chain-of-Thought Code Generation through Self-Exploring Deep Reasoning
di: Gao, Shuzheng, et al.
Pubblicazione: (2025) -
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
di: Wang, Xinchen, et al.
Pubblicazione: (2025) -
VulEval: Towards Repository-Level Evaluation of Software Vulnerability Detection
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024) -
What Makes Good In-context Demonstrations for Code Intelligence Tasks with LLMs?
di: Gao, Shuzheng, et al.
Pubblicazione: (2023)