A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Duan, Guoliang, Liu, Mingwei, Wang, Yanlin, Wang, Chong, Peng, Xin, Zheng, Zibin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RustRepoTrans: Repository-level Code Translation Benchmark Targeting Rust
par: Ou, Guangsheng, et autres
Publié: (2024)
par: Ou, Guangsheng, et autres
Publié: (2024)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
par: Dai, Dekun, et autres
Publié: (2025)
par: Dai, Dekun, et autres
Publié: (2025)
RustEvo^2: An Evolving Benchmark for API Evolution in LLM-based Rust Code Generation
par: Liang, Linxi, et autres
Publié: (2025)
par: Liang, Linxi, et autres
Publié: (2025)
A Preliminary Study on the Robustness of Code Generation by Large Language Models
par: Li, Zike, et autres
Publié: (2025)
par: Li, Zike, et autres
Publié: (2025)
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
par: Wang, Yanlin, et autres
Publié: (2026)
par: Wang, Yanlin, et autres
Publié: (2026)
AdaDec: A Uncertainty-Guided Lookahead Decoding Framework for LLM-Based Code Generation
par: He, Kaifeng, et autres
Publié: (2025)
par: He, Kaifeng, et autres
Publié: (2025)
Architecture-Aware Multi-Design Generation for Repository-Level Feature Addition
par: Liu, Mingwei, et autres
Publié: (2026)
par: Liu, Mingwei, et autres
Publié: (2026)
Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code
par: He, Kaifeng, et autres
Publié: (2026)
par: He, Kaifeng, et autres
Publié: (2026)
Knowledge-Graph-Driven Data Synthesis for Low-Resource Software Development: A HarmonyOS Case Study
par: Liu, Mingwei, et autres
Publié: (2025)
par: Liu, Mingwei, et autres
Publié: (2025)
Dynamic analysis enhances issue resolution
par: Liu, Mingwei, et autres
Publié: (2026)
par: Liu, Mingwei, et autres
Publié: (2026)
DRAINCODE: Stealthy Energy Consumption Attacks on Retrieval-Augmented Code Generation via Context Poisoning
par: Wang, Yanlin, et autres
Publié: (2026)
par: Wang, Yanlin, et autres
Publié: (2026)
EffiReasonTrans: RL-Optimized Reasoning for Code Translation
par: Wang, Yanlin, et autres
Publié: (2025)
par: Wang, Yanlin, et autres
Publié: (2025)
A Survey of Large Language Models for Code: Evolution, Benchmarking, and Future Trends
par: Zheng, Zibin, et autres
Publié: (2023)
par: Zheng, Zibin, et autres
Publié: (2023)
Are Decoder-Only Large Language Models the Silver Bullet for Code Search?
par: Chen, Yuxuan, et autres
Publié: (2024)
par: Chen, Yuxuan, et autres
Publié: (2024)
What to Retrieve for Effective Retrieval-Augmented Code Generation? An Empirical Study and Beyond
par: Gu, Wenchao, et autres
Publié: (2025)
par: Gu, Wenchao, et autres
Publié: (2025)
HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation
par: Zheng, Dewu, et autres
Publié: (2024)
par: Zheng, Dewu, et autres
Publié: (2024)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
par: Zheng, Dewu, et autres
Publié: (2024)
par: Zheng, Dewu, et autres
Publié: (2024)
LLM Hallucinations in Practical Code Generation: Phenomena, Mechanism, and Mitigation
par: Zhang, Ziyao, et autres
Publié: (2024)
par: Zhang, Ziyao, et autres
Publié: (2024)
Build-Aware Incremental C-to-Rust Migration via Skeleton-First Translation and Historical Knowledge Reuse
par: Wang, Shengbo, et autres
Publié: (2026)
par: Wang, Shengbo, et autres
Publié: (2026)
Evolving Triple Knowledge-Augmented LLMs for Code Translation in Repository Context
par: Ou, Guangsheng, et autres
Publié: (2025)
par: Ou, Guangsheng, et autres
Publié: (2025)
CoSQA+: Pioneering the Multi-Choice Code Search Benchmark with Test-Driven Agents
par: Gong, Jing, et autres
Publié: (2024)
par: Gong, Jing, et autres
Publié: (2024)
Identifying Smart Contract Security Issues in Code Snippets from Stack Overflow
par: Chen, Jiachi, et autres
Publié: (2024)
par: Chen, Jiachi, et autres
Publié: (2024)
Beyond Functional Correctness: Investigating Coding Style Inconsistencies in Large Language Models
par: Wang, Yanlin, et autres
Publié: (2024)
par: Wang, Yanlin, et autres
Publié: (2024)
Generating High-Quality Datasets for Code Editing via Open-Source Language Models
par: Zhang, Zekai, et autres
Publié: (2025)
par: Zhang, Zekai, et autres
Publié: (2025)
SparseCoder: Identifier-Aware Sparse Transformer for File-Level Code Summarization
par: Wang, Yanlin, et autres
Publié: (2024)
par: Wang, Yanlin, et autres
Publié: (2024)
KTester: Leveraging Domain and Testing Knowledge for More Effective LLM-based Test Generation
par: Li, Anji, et autres
Publié: (2025)
par: Li, Anji, et autres
Publié: (2025)
SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
par: Zhang, Jing, et autres
Publié: (2025)
par: Zhang, Jing, et autres
Publié: (2025)
RLCoder: Reinforcement Learning for Repository-Level Code Completion
par: Wang, Yanlin, et autres
Publié: (2024)
par: Wang, Yanlin, et autres
Publié: (2024)
RepoDoc: A Knowledge Graph-Based Framework to Automatic Documentation Generation and Incremental Updates
par: Xu, Dong, et autres
Publié: (2026)
par: Xu, Dong, et autres
Publié: (2026)
Code Digital Twin: A Knowledge Infrastructure for AI-Assisted Complex Software Development
par: Peng, Xin, et autres
Publié: (2025)
par: Peng, Xin, et autres
Publié: (2025)
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
par: Hu, Ruida, et autres
Publié: (2025)
par: Hu, Ruida, et autres
Publié: (2025)
AnomalyGen: Enhancing Log-Based Anomaly Detection with Code-Guided Data Augmentation
par: Li, Xinyu, et autres
Publié: (2026)
par: Li, Xinyu, et autres
Publié: (2026)
Code Digital Twin: Empowering LLMs with Tacit Knowledge for Complex Software Development
par: Peng, Xin, et autres
Publié: (2025)
par: Peng, Xin, et autres
Publié: (2025)
ParityFuzz: Finding Inconsistencies across Solidity Compilers via Fine-Grained Mutation and Differential Analysis
par: Su, Bowei, et autres
Publié: (2026)
par: Su, Bowei, et autres
Publié: (2026)
SmartState: Detecting State-Reverting Vulnerabilities in Smart Contracts via Fine-Grained State-Dependency Analysis
par: Liao, Zeqin, et autres
Publié: (2024)
par: Liao, Zeqin, et autres
Publié: (2024)
CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction
par: Gao, Jun, et autres
Publié: (2026)
par: Gao, Jun, et autres
Publié: (2026)
An Empirical Study on Low-Code Programming using Traditional vs Large Language Model Support
par: Liu, Yongkun, et autres
Publié: (2024)
par: Liu, Yongkun, et autres
Publié: (2024)
Efficiently Detecting Reentrancy Vulnerabilities in Complex Smart Contracts
par: Wang, Zexu, et autres
Publié: (2024)
par: Wang, Zexu, et autres
Publié: (2024)
OmniGIRL: A Multilingual and Multimodal Benchmark for GitHub Issue Resolution
par: Guo, Lianghong, et autres
Publié: (2025)
par: Guo, Lianghong, et autres
Publié: (2025)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
par: Feng, Jia, et autres
Publié: (2024)
par: Feng, Jia, et autres
Publié: (2024)
Documents similaires
-
RustRepoTrans: Repository-level Code Translation Benchmark Targeting Rust
par: Ou, Guangsheng, et autres
Publié: (2024) -
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
par: Dai, Dekun, et autres
Publié: (2025) -
RustEvo^2: An Evolving Benchmark for API Evolution in LLM-based Rust Code Generation
par: Liang, Linxi, et autres
Publié: (2025) -
A Preliminary Study on the Robustness of Code Generation by Large Language Models
par: Li, Zike, et autres
Publié: (2025) -
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
par: Wang, Yanlin, et autres
Publié: (2026)