Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ni, Ziyi, Li, Yifan, Yang, Ning, Shen, Dou, Lv, Pin, Dong, Daxiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tree-of-Code: A Hybrid Approach for Robust Complex Task Planning and Execution
par: Ni, Ziyi, et autres
Publié: (2024)
par: Ni, Ziyi, et autres
Publié: (2024)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
par: Lu, Pengrui, et autres
Publié: (2026)
par: Lu, Pengrui, et autres
Publié: (2026)
RA-Gen: A Controllable Code Generation Framework Using ReAct for Multi-Agent Task Execution
par: Liu, Aofan, et autres
Publié: (2025)
par: Liu, Aofan, et autres
Publié: (2025)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
par: Ni, Ziyi, et autres
Publié: (2025)
par: Ni, Ziyi, et autres
Publié: (2025)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
par: Guo, Chengquan, et autres
Publié: (2024)
par: Guo, Chengquan, et autres
Publié: (2024)
Toward Executable Repository-Level Code Generation via Environment Alignment
par: Pan, Ruwei, et autres
Publié: (2026)
par: Pan, Ruwei, et autres
Publié: (2026)
OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement
par: Zheng, Tianyu, et autres
Publié: (2024)
par: Zheng, Tianyu, et autres
Publié: (2024)
Argus: Resilience-Oriented Safety Assurance Framework for End-to-End ADSs
par: Wang, Dingji, et autres
Publié: (2025)
par: Wang, Dingji, et autres
Publié: (2025)
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
par: Guo, Hanyang, et autres
Publié: (2025)
par: Guo, Hanyang, et autres
Publié: (2025)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
par: Hou, Shuyang, et autres
Publié: (2024)
par: Hou, Shuyang, et autres
Publié: (2024)
Executing as You Generate: Hiding Execution Latency in LLM Code Generation
par: Sun, Zhensu, et autres
Publié: (2026)
par: Sun, Zhensu, et autres
Publié: (2026)
CodeScore: Evaluating Code Generation by Learning Code Execution
par: Dong, Yihong, et autres
Publié: (2023)
par: Dong, Yihong, et autres
Publié: (2023)
Bench4HLS: End-to-End Evaluation of LLMs in High-Level Synthesis Code Generation
par: Khan, M Zafir Sadik, et autres
Publié: (2026)
par: Khan, M Zafir Sadik, et autres
Publié: (2026)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
par: Wu, Fan, et autres
Publié: (2026)
par: Wu, Fan, et autres
Publié: (2026)
How Well Do Large Language Models Serve as End-to-End Secure Code Agents for Python?
par: Gong, Jianian, et autres
Publié: (2024)
par: Gong, Jianian, et autres
Publié: (2024)
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
par: Jiang, Xue, et autres
Publié: (2025)
par: Jiang, Xue, et autres
Publié: (2025)
VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation
par: Ni, Yuansheng, et autres
Publié: (2025)
par: Ni, Yuansheng, et autres
Publié: (2025)
Integrating Symbolic Execution into the Fine-Tuning of Code-Generating LLMs
par: Sakharova, Marina, et autres
Publié: (2025)
par: Sakharova, Marina, et autres
Publié: (2025)
FasterPy: An LLM-based Code Execution Efficiency Optimization Framework
par: Wu, Yue, et autres
Publié: (2025)
par: Wu, Yue, et autres
Publié: (2025)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
par: Guo, JunJia, et autres
Publié: (2026)
par: Guo, JunJia, et autres
Publié: (2026)
MERA Code: A Unified Framework for Evaluating Code Generation Across Tasks
par: Chervyakov, Artem, et autres
Publié: (2025)
par: Chervyakov, Artem, et autres
Publié: (2025)
SWE-Hub: A Unified Production System for Scalable, Executable Software Engineering Tasks
par: Zeng, Yucheng, et autres
Publié: (2026)
par: Zeng, Yucheng, et autres
Publié: (2026)
CodeCoT: Tackling Code Syntax Errors in CoT Reasoning for Code Generation
par: Huang, Dong, et autres
Publié: (2023)
par: Huang, Dong, et autres
Publié: (2023)
CCISolver: End-to-End Detection and Repair of Method-Level Code-Comment Inconsistency
par: Zhong, Renyi, et autres
Publié: (2025)
par: Zhong, Renyi, et autres
Publié: (2025)
Runtime-Structured Task Decomposition for Agentic Coding Systems
par: Asthana, Shubhi, et autres
Publié: (2026)
par: Asthana, Shubhi, et autres
Publié: (2026)
Do Machines and Humans Focus on Similar Code? Exploring Explainability of Large Language Models in Code Summarization
par: Li, Jiliang, et autres
Publié: (2024)
par: Li, Jiliang, et autres
Publié: (2024)
Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
par: Liu, Fang, et autres
Publié: (2024)
par: Liu, Fang, et autres
Publié: (2024)
Selection of Prompt Engineering Techniques for Code Generation through Predicting Code Complexity
par: Wang, Chung-Yu, et autres
Publié: (2024)
par: Wang, Chung-Yu, et autres
Publié: (2024)
Learning to Align Human Code Preferences
par: Yin, Xin, et autres
Publié: (2025)
par: Yin, Xin, et autres
Publié: (2025)
GenCode: A Generic Data Augmentation Framework for Boosting Deep Learning-Based Code Understanding
par: Dong, Zeming, et autres
Publié: (2024)
par: Dong, Zeming, et autres
Publié: (2024)
E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
par: Liu, Jingyao, et autres
Publié: (2025)
par: Liu, Jingyao, et autres
Publié: (2025)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
par: Li, Yikun, et autres
Publié: (2026)
par: Li, Yikun, et autres
Publié: (2026)
Automated Benchmark Generation for Repository-Level Coding Tasks
par: Vergopoulos, Konstantinos, et autres
Publié: (2025)
par: Vergopoulos, Konstantinos, et autres
Publié: (2025)
Task Abstention for Large Language Models in Code Generation
par: Zhou, Yanke, et autres
Publié: (2026)
par: Zhou, Yanke, et autres
Publié: (2026)
Prototype2Code: End-to-end Front-end Code Generation from UI Design Prototypes
par: Xiao, Shuhong, et autres
Publié: (2024)
par: Xiao, Shuhong, et autres
Publié: (2024)
Learning Adaptive Parallel Execution for Efficient Code Localization
par: Xu, Ke, et autres
Publié: (2026)
par: Xu, Ke, et autres
Publié: (2026)
EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
par: Liu, Junwei, et autres
Publié: (2025)
par: Liu, Junwei, et autres
Publié: (2025)
Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
par: Ouyang, Shuyin, et autres
Publié: (2026)
par: Ouyang, Shuyin, et autres
Publié: (2026)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
par: Hu, Ruida, et autres
Publié: (2026)
par: Hu, Ruida, et autres
Publié: (2026)
Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development
par: Tran, Hung, et autres
Publié: (2026)
par: Tran, Hung, et autres
Publié: (2026)
Documents similaires
-
Tree-of-Code: A Hybrid Approach for Robust Complex Task Planning and Execution
par: Ni, Ziyi, et autres
Publié: (2024) -
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
par: Lu, Pengrui, et autres
Publié: (2026) -
RA-Gen: A Controllable Code Generation Framework Using ReAct for Multi-Agent Task Execution
par: Liu, Aofan, et autres
Publié: (2025) -
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
par: Ni, Ziyi, et autres
Publié: (2025) -
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
par: Guo, Chengquan, et autres
Publié: (2024)