FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Xueqing, Xue, Zihan, Yin, Da, Zhou, Shuyan, Chang, Kai-Wei, Peng, Nanyun, Wen, Yeming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WAFFLE: Finetuning Multi-Modal Models for Automated Front-End Development
par: Liang, Shanchao, et autres
Publié: (2024)
par: Liang, Shanchao, et autres
Publié: (2024)
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
par: Han, Hojae, et autres
Publié: (2025)
par: Han, Hojae, et autres
Publié: (2025)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
par: Wu, Xueqing, et autres
Publié: (2024)
par: Wu, Xueqing, et autres
Publié: (2024)
Talk Less, Verify More: Improving LLM Assistants with Semantic Checks and Execution Feedback
par: Sun, Yan, et autres
Publié: (2026)
par: Sun, Yan, et autres
Publié: (2026)
CodeContests+: High-Quality Test Case Generation for Competitive Programming
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Coffee: Boost Your Code LLMs by Fixing Bugs with Feedback
par: Moon, Seungjun, et autres
Publié: (2023)
par: Moon, Seungjun, et autres
Publié: (2023)
E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
par: Liu, Jingyao, et autres
Publié: (2025)
par: Liu, Jingyao, et autres
Publié: (2025)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
par: Guo, JunJia, et autres
Publié: (2026)
par: Guo, JunJia, et autres
Publié: (2026)
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
par: Guo, Hanyang, et autres
Publié: (2025)
par: Guo, Hanyang, et autres
Publié: (2025)
Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler Feedback
par: Bi, Zhangqian, et autres
Publié: (2024)
par: Bi, Zhangqian, et autres
Publié: (2024)
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
par: Liu, Zhilin, et autres
Publié: (2026)
par: Liu, Zhilin, et autres
Publié: (2026)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
par: Deng, Ken, et autres
Publié: (2024)
par: Deng, Ken, et autres
Publié: (2024)
GenX: Mastering Code and Test Generation with Execution Feedback
par: Wang, Nan, et autres
Publié: (2024)
par: Wang, Nan, et autres
Publié: (2024)
Intelligent Front-End Personalization: AI-Driven UI Adaptation
par: Rajhans, Mona
Publié: (2026)
par: Rajhans, Mona
Publié: (2026)
Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development
par: Tran, Hung, et autres
Publié: (2026)
par: Tran, Hung, et autres
Publié: (2026)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
par: Du, Mingzhe, et autres
Publié: (2024)
par: Du, Mingzhe, et autres
Publié: (2024)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
par: Yang, Jie, et autres
Publié: (2026)
par: Yang, Jie, et autres
Publié: (2026)
Is Your Benchmark (Still) Useful? Dynamic Benchmarking for Code Language Models
par: Guan, Batu, et autres
Publié: (2025)
par: Guan, Batu, et autres
Publié: (2025)
Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence
par: Song, Linxin, et autres
Publié: (2026)
par: Song, Linxin, et autres
Publié: (2026)
CodeA11y: Making AI Coding Assistants Useful for Accessible Web Development
par: Mowar, Peya, et autres
Publié: (2025)
par: Mowar, Peya, et autres
Publié: (2025)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
par: Chou, Jason, et autres
Publié: (2025)
par: Chou, Jason, et autres
Publié: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
par: Xie, Yiqing, et autres
Publié: (2024)
par: Xie, Yiqing, et autres
Publié: (2024)
OPAC: The Next Generation Placing an Encore Front End onto a SirsiDynix ILS
par: Marcin, Susan, et autres
Publié: (2008)
par: Marcin, Susan, et autres
Publié: (2008)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
VDebugger: Harnessing Execution Feedback for Debugging Visual Programs
par: Wu, Xueqing, et autres
Publié: (2024)
par: Wu, Xueqing, et autres
Publié: (2024)
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
par: Zhao, Songwen, et autres
Publié: (2025)
par: Zhao, Songwen, et autres
Publié: (2025)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
par: Wang, Sizhe, et autres
Publié: (2025)
par: Wang, Sizhe, et autres
Publié: (2025)
DPO-F+: Aligning Code Repair Feedback with Developers' Preferences
par: Fang, Zihan, et autres
Publié: (2025)
par: Fang, Zihan, et autres
Publié: (2025)
Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback
par: Skopin, Egor, et autres
Publié: (2026)
par: Skopin, Egor, et autres
Publié: (2026)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
par: Huang, Dong, et autres
Publié: (2024)
par: Huang, Dong, et autres
Publié: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026)
par: Wu, Xueqing, et autres
Publié: (2026)
A Low-Code Approach for the Automatic Personalization of Conversational Agents
par: Conrardy, Aaron, et autres
Publié: (2026)
par: Conrardy, Aaron, et autres
Publié: (2026)
TableTalk: Scaffolding Spreadsheet Development with a Language Agent
par: Liang, Jenny T., et autres
Publié: (2025)
par: Liang, Jenny T., et autres
Publié: (2025)
CodeUpdateArena: Benchmarking Knowledge Editing on API Updates
par: Liu, Zeyu Leo, et autres
Publié: (2024)
par: Liu, Zeyu Leo, et autres
Publié: (2024)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Comparing Developer and LLM Biases in Code Evaluation
par: Mittal, Aditya, et autres
Publié: (2026)
par: Mittal, Aditya, et autres
Publié: (2026)
IndustryCode: A Benchmark for Industry Code Generation
par: Zeng, Puyu, et autres
Publié: (2026)
par: Zeng, Puyu, et autres
Publié: (2026)
Documents similaires
-
WAFFLE: Finetuning Multi-Modal Models for Automated Front-End Development
par: Liang, Shanchao, et autres
Publié: (2024) -
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
par: Han, Hojae, et autres
Publié: (2025) -
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
par: Wu, Xueqing, et autres
Publié: (2024) -
Talk Less, Verify More: Improving LLM Assistants with Semantic Checks and Execution Feedback
par: Sun, Yan, et autres
Publié: (2026) -
CodeContests+: High-Quality Test Case Generation for Competitive Programming
par: Wang, Zihan, et autres
Publié: (2025)