Lyra: A Benchmark for Turducken-Style Code Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Qingyuan, Sun, Zeyu, Zhu, Qihao, Zhang, Wenjie, Yu, Lian, Xiong, Yingfei, Zhang, Lu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2021
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning to Guarantee Type Correctness in Code Generation through Type-Guided Program Synthesis
por: Huang, Zhechong, et al.
Publicado: (2025)
por: Huang, Zhechong, et al.
Publicado: (2025)
Directional Diffusion-Style Code Editing Pre-training
por: Liang, Qingyuan, et al.
Publicado: (2025)
por: Liang, Qingyuan, et al.
Publicado: (2025)
GramTrans: A Better Code Representation Approach in Code Generation
por: Zhang, Zhao, et al.
Publicado: (2025)
por: Zhang, Zhao, et al.
Publicado: (2025)
Condor: A Code Discriminator Integrating General Semantics with Code Details
por: Liang, Qingyuan, et al.
Publicado: (2024)
por: Liang, Qingyuan, et al.
Publicado: (2024)
AI Code in the Wild: Measuring Security Risks and Ecosystem Shifts of AI-Generated Code in Modern Software
por: Wang, Bin, et al.
Publicado: (2025)
por: Wang, Bin, et al.
Publicado: (2025)
Rethinking the effects of data contamination in Code Intelligence
por: Yang, Zhen, et al.
Publicado: (2025)
por: Yang, Zhen, et al.
Publicado: (2025)
Function-to-Style Guidance of LLMs for Code Translation
por: Zhang, Longhui, et al.
Publicado: (2025)
por: Zhang, Longhui, et al.
Publicado: (2025)
Contextualized Code Pretraining for Code Generation
por: Liu, Chen, et al.
Publicado: (2026)
por: Liu, Chen, et al.
Publicado: (2026)
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
por: Zhu, Qiming, et al.
Publicado: (2024)
por: Zhu, Qiming, et al.
Publicado: (2024)
DSCodeBench: A Realistic Benchmark for Data Science Code Generation
por: Ouyang, Shuyin, et al.
Publicado: (2025)
por: Ouyang, Shuyin, et al.
Publicado: (2025)
A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated Code
por: Lian, Keke, et al.
Publicado: (2025)
por: Lian, Keke, et al.
Publicado: (2025)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
CupCleaner: A Hybrid Data Cleaning Approach for Comment Updating
por: Liang, Qingyuan, et al.
Publicado: (2023)
por: Liang, Qingyuan, et al.
Publicado: (2023)
Benchmarks and Metrics for Evaluations of Code Generation: A Critical Review
por: Paul, Debalina Ghosh, et al.
Publicado: (2024)
por: Paul, Debalina Ghosh, et al.
Publicado: (2024)
Reducing Cost of LLM Agents with Trajectory Reduction
por: Xiao, Yuan-An, et al.
Publicado: (2025)
por: Xiao, Yuan-An, et al.
Publicado: (2025)
ScenEval: A Benchmark for Scenario-Based Evaluation of Code Generation
por: Paul, Debalina Ghosh, et al.
Publicado: (2024)
por: Paul, Debalina Ghosh, et al.
Publicado: (2024)
IndustryCode: A Benchmark for Industry Code Generation
por: Zeng, Puyu, et al.
Publicado: (2026)
por: Zeng, Puyu, et al.
Publicado: (2026)
A New Benchmark for the Appropriate Evaluation of RTL Code Optimization
por: Lu, Yao, et al.
Publicado: (2026)
por: Lu, Yao, et al.
Publicado: (2026)
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
por: Yan, Lu, et al.
Publicado: (2026)
por: Yan, Lu, et al.
Publicado: (2026)
A Benchmark for Localizing Code and Non-Code Issues in Software Projects
por: Zhang, Zejun, et al.
Publicado: (2025)
por: Zhang, Zejun, et al.
Publicado: (2025)
EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
por: Zhang, Wentao, et al.
Publicado: (2026)
por: Zhang, Wentao, et al.
Publicado: (2026)
Persistent Cross-Attempt State Optimization for Repository-Level Code Generation
por: Pan, Ruwei, et al.
Publicado: (2026)
por: Pan, Ruwei, et al.
Publicado: (2026)
Toward Executable Repository-Level Code Generation via Environment Alignment
por: Pan, Ruwei, et al.
Publicado: (2026)
por: Pan, Ruwei, et al.
Publicado: (2026)
MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences
por: Wang, Qihao, et al.
Publicado: (2026)
por: Wang, Qihao, et al.
Publicado: (2026)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
por: Guo, Chengquan, et al.
Publicado: (2024)
por: Guo, Chengquan, et al.
Publicado: (2024)
CLAP: Learning Transferable Binary Code Representations with Natural Language Supervision
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Deep Learning for Code Intelligence: Survey, Benchmark and Toolkit
por: Wan, Yao, et al.
Publicado: (2023)
por: Wan, Yao, et al.
Publicado: (2023)
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
por: Xue, Siqiao, et al.
Publicado: (2026)
por: Xue, Siqiao, et al.
Publicado: (2026)
Code Review Agent Benchmark
por: Zhang, Yuntong, et al.
Publicado: (2026)
por: Zhang, Yuntong, et al.
Publicado: (2026)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
por: Zhang, Zhe, et al.
Publicado: (2025)
por: Zhang, Zhe, et al.
Publicado: (2025)
Copilot-in-the-Loop: Fixing Code Smells in Copilot-Generated Python Code using Copilot
por: Zhang, Beiqi, et al.
Publicado: (2024)
por: Zhang, Beiqi, et al.
Publicado: (2024)
Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
por: Liu, Fang, et al.
Publicado: (2024)
por: Liu, Fang, et al.
Publicado: (2024)
HoarePrompt: Structural Reasoning About Program Correctness in Natural Language
por: Bouras, Dimitrios Stamatios, et al.
Publicado: (2025)
por: Bouras, Dimitrios Stamatios, et al.
Publicado: (2025)
Enhancing High-Quality Code Generation in Large Language Models with Comparative Prefix-Tuning
por: Jiang, Yuan, et al.
Publicado: (2025)
por: Jiang, Yuan, et al.
Publicado: (2025)
Towards Advancing Code Generation with Large Language Models: A Research Roadmap
por: Jin, Haolin, et al.
Publicado: (2025)
por: Jin, Haolin, et al.
Publicado: (2025)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
por: Gao, Zeyu, et al.
Publicado: (2025)
por: Gao, Zeyu, et al.
Publicado: (2025)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World
por: Xu, Qiao, et al.
Publicado: (2026)
por: Xu, Qiao, et al.
Publicado: (2026)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
por: He, Yibo, et al.
Publicado: (2025)
por: He, Yibo, et al.
Publicado: (2025)
Benchmarking Correctness and Security in Multi-Turn Code Generation
por: Rawal, Ruchit, et al.
Publicado: (2025)
por: Rawal, Ruchit, et al.
Publicado: (2025)
Ejemplares similares
-
Learning to Guarantee Type Correctness in Code Generation through Type-Guided Program Synthesis
por: Huang, Zhechong, et al.
Publicado: (2025) -
Directional Diffusion-Style Code Editing Pre-training
por: Liang, Qingyuan, et al.
Publicado: (2025) -
GramTrans: A Better Code Representation Approach in Code Generation
por: Zhang, Zhao, et al.
Publicado: (2025) -
Condor: A Code Discriminator Integrating General Semantics with Code Details
por: Liang, Qingyuan, et al.
Publicado: (2024) -
AI Code in the Wild: Measuring Security Risks and Ecosystem Shifts of AI-Generated Code in Modern Software
por: Wang, Bin, et al.
Publicado: (2025)