Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Mengliang, Zeng, Jiayi, Jiang, Yankai, Zhang, Wei, Liu, Zeming, Shi, Xiaoming, Zhou, Aimin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
por: Liu, Jingjing, et al.
Publicado: (2025)
por: Liu, Jingjing, et al.
Publicado: (2025)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
por: Yan, Kaiwen, et al.
Publicado: (2025)
por: Yan, Kaiwen, et al.
Publicado: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
por: Wang, Peiding, et al.
Publicado: (2025)
por: Wang, Peiding, et al.
Publicado: (2025)
Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code
por: Saad, Mootez, et al.
Publicado: (2025)
por: Saad, Mootez, et al.
Publicado: (2025)
Greening Large Language Models of Code
por: Shi, Jieke, et al.
Publicado: (2023)
por: Shi, Jieke, et al.
Publicado: (2023)
A Survey on Evaluating Large Language Models in Code Generation Tasks
por: Chen, Liguo, et al.
Publicado: (2024)
por: Chen, Liguo, et al.
Publicado: (2024)
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation
por: Gui, Ningxin, et al.
Publicado: (2025)
por: Gui, Ningxin, et al.
Publicado: (2025)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
por: Yang, Rem, et al.
Publicado: (2025)
por: Yang, Rem, et al.
Publicado: (2025)
Ecosystem of Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
V-GameGym: Visual Game Generation for Code Large Language Models
por: Zhang, Wei, et al.
Publicado: (2025)
por: Zhang, Wei, et al.
Publicado: (2025)
Inducing Vulnerable Code Generation in LLM Coding Assistants
por: Zeng, Binqi, et al.
Publicado: (2025)
por: Zeng, Binqi, et al.
Publicado: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
por: Padwal, Vedant
Publicado: (2026)
por: Padwal, Vedant
Publicado: (2026)
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
por: Li, Linyi, et al.
Publicado: (2024)
por: Li, Linyi, et al.
Publicado: (2024)
An Empirical Study on the Code Refactoring Capability of Large Language Models
por: Cordeiro, Jonathan, et al.
Publicado: (2024)
por: Cordeiro, Jonathan, et al.
Publicado: (2024)
Can Large Language Models Serve as Evaluators for Code Summarization?
por: Wu, Yang, et al.
Publicado: (2024)
por: Wu, Yang, et al.
Publicado: (2024)
A Hybrid Approach for EMF Code Generation:Code Templates Meet Large Language Models
por: He, Xiao, et al.
Publicado: (2025)
por: He, Xiao, et al.
Publicado: (2025)
Self-planning Code Generation with Large Language Models
por: Jiang, Xue, et al.
Publicado: (2023)
por: Jiang, Xue, et al.
Publicado: (2023)
Hotfixing Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
por: Guo, Jiawei, et al.
Publicado: (2024)
por: Guo, Jiawei, et al.
Publicado: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
por: Chou, Jason, et al.
Publicado: (2025)
por: Chou, Jason, et al.
Publicado: (2025)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
por: Wang, Jiexin, et al.
Publicado: (2024)
por: Wang, Jiexin, et al.
Publicado: (2024)
From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation
por: Xue, Zhantong, et al.
Publicado: (2025)
por: Xue, Zhantong, et al.
Publicado: (2025)
CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
por: Cheng, Cheng, et al.
Publicado: (2025)
por: Cheng, Cheng, et al.
Publicado: (2025)
A Preliminary Study on the Robustness of Code Generation by Large Language Models
por: Li, Zike, et al.
Publicado: (2025)
por: Li, Zike, et al.
Publicado: (2025)
CodeScore: Evaluating Code Generation by Learning Code Execution
por: Dong, Yihong, et al.
Publicado: (2023)
por: Dong, Yihong, et al.
Publicado: (2023)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
por: Riddell, Martin, et al.
Publicado: (2024)
por: Riddell, Martin, et al.
Publicado: (2024)
Evaluating the Impact of Post-Training Quantization on Large Language Models for Code Generation
por: Giagnorio, Alessandro, et al.
Publicado: (2025)
por: Giagnorio, Alessandro, et al.
Publicado: (2025)
Assessing the Code Clone Detection Capability of Large Language Models
por: Zhang, Zixian, et al.
Publicado: (2024)
por: Zhang, Zixian, et al.
Publicado: (2024)
On the Effectiveness of Large Language Models in Domain-Specific Code Generation
por: Gu, Xiaodong, et al.
Publicado: (2023)
por: Gu, Xiaodong, et al.
Publicado: (2023)
CodeJudge: Evaluating Code Generation with Large Language Models
por: Tong, Weixi, et al.
Publicado: (2024)
por: Tong, Weixi, et al.
Publicado: (2024)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
por: Feng, Jia, et al.
Publicado: (2024)
por: Feng, Jia, et al.
Publicado: (2024)
ROCODE: Integrating Backtracking Mechanism and Program Analysis in Large Language Models for Code Generation
por: Jiang, Xue, et al.
Publicado: (2024)
por: Jiang, Xue, et al.
Publicado: (2024)
Can Large Language Models Generate Geospatial Code?
por: Hou, Shuyang, et al.
Publicado: (2024)
por: Hou, Shuyang, et al.
Publicado: (2024)
Large Language Models for Code Generation: The Practitioners Perspective
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
Optimizing Large Language Model Hyperparameters for Code Generation
por: Arora, Chetan, et al.
Publicado: (2024)
por: Arora, Chetan, et al.
Publicado: (2024)
Aligning Requirement for Large Language Model's Code Generation
por: Tian, Zhao, et al.
Publicado: (2025)
por: Tian, Zhao, et al.
Publicado: (2025)
Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation
por: Sun, Zhihong, et al.
Publicado: (2025)
por: Sun, Zhihong, et al.
Publicado: (2025)
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities
por: Wang, Hanbin, et al.
Publicado: (2025)
por: Wang, Hanbin, et al.
Publicado: (2025)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
por: Das, Gunjan, et al.
Publicado: (2025)
por: Das, Gunjan, et al.
Publicado: (2025)
Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
por: Mächtle, Felix, et al.
Publicado: (2026)
por: Mächtle, Felix, et al.
Publicado: (2026)
Ejemplares similares
-
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
por: Liu, Jingjing, et al.
Publicado: (2025) -
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
por: Yan, Kaiwen, et al.
Publicado: (2025) -
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
por: Wang, Peiding, et al.
Publicado: (2025) -
Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code
por: Saad, Mootez, et al.
Publicado: (2025) -
Greening Large Language Models of Code
por: Shi, Jieke, et al.
Publicado: (2023)