FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Hongda, Zhang, Yiwen, Zhao, Bing, Ding, Jingzhe, Liu, Siyao, Liu, Tong, Wang, Dandan, Liu, Yanan, Li, Zhaojian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AutoBench: Automatic Testbench Generation and Evaluation Using LLMs for HDL Design
di: Qiu, Ruidi, et al.
Pubblicazione: (2024)
di: Qiu, Ruidi, et al.
Pubblicazione: (2024)
AL-Bench: A Benchmark for Automatic Logging
di: Tan, Boyin, et al.
Pubblicazione: (2025)
di: Tan, Boyin, et al.
Pubblicazione: (2025)
FullStack Bench: Evaluating LLMs as Full Stack Coders
di: Bytedance-Seed-Foundation-Code-Team, et al.
Pubblicazione: (2024)
di: Bytedance-Seed-Foundation-Code-Team, et al.
Pubblicazione: (2024)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
di: Guo, Hanyang, et al.
Pubblicazione: (2025)
di: Guo, Hanyang, et al.
Pubblicazione: (2025)
SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs
di: Xia, Hongfei, et al.
Pubblicazione: (2025)
di: Xia, Hongfei, et al.
Pubblicazione: (2025)
CorrectBench: Automatic Testbench Generation with Functional Self-Correction using LLMs for HDL Design
di: Qiu, Ruidi, et al.
Pubblicazione: (2024)
di: Qiu, Ruidi, et al.
Pubblicazione: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
di: Chou, Jason, et al.
Pubblicazione: (2025)
di: Chou, Jason, et al.
Pubblicazione: (2025)
JMigBench: A Benchmark for Evaluating LLMs on Source Code Migration (Java 8 to Java 11)
di: Amin, Nishil, et al.
Pubblicazione: (2026)
di: Amin, Nishil, et al.
Pubblicazione: (2026)
Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation
di: Li, Minxiao, et al.
Pubblicazione: (2026)
di: Li, Minxiao, et al.
Pubblicazione: (2026)
Evaluating LLMs Code Reasoning Under Real-World Context
di: Liu, Changshu
Pubblicazione: (2026)
di: Liu, Changshu
Pubblicazione: (2026)
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
A Catalog of Micro Frontends Anti-patterns
di: Silva, Nabson, et al.
Pubblicazione: (2024)
di: Silva, Nabson, et al.
Pubblicazione: (2024)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
di: Liu, Chenxu, et al.
Pubblicazione: (2026)
di: Liu, Chenxu, et al.
Pubblicazione: (2026)
DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation
di: Xiao, Jingyu, et al.
Pubblicazione: (2025)
di: Xiao, Jingyu, et al.
Pubblicazione: (2025)
WEFix: Intelligent Automatic Generation of Explicit Waits for Efficient Web End-to-End Flaky Tests
di: Liu, Xinyue, et al.
Pubblicazione: (2024)
di: Liu, Xinyue, et al.
Pubblicazione: (2024)
A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task
di: Liu, Shuhan, et al.
Pubblicazione: (2026)
di: Liu, Shuhan, et al.
Pubblicazione: (2026)
Hallucination to Consensus: Multi-Agent LLMs for End-to-End JUnit Test Generation
di: Xu, Qinghua, et al.
Pubblicazione: (2025)
di: Xu, Qinghua, et al.
Pubblicazione: (2025)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
FeatureBench: Benchmarking Agentic Coding for Complex Feature Development
di: Zhou, Qixing, et al.
Pubblicazione: (2026)
di: Zhou, Qixing, et al.
Pubblicazione: (2026)
Investigating Benefits and Limitations of Migrating to a Micro-Frontends Architecture
di: Antunes, Fabio, et al.
Pubblicazione: (2024)
di: Antunes, Fabio, et al.
Pubblicazione: (2024)
Bench4HLS: End-to-End Evaluation of LLMs in High-Level Synthesis Code Generation
di: Khan, M Zafir Sadik, et al.
Pubblicazione: (2026)
di: Khan, M Zafir Sadik, et al.
Pubblicazione: (2026)
EcoAssist: Embedding Sustainability into AI-Assisted Frontend Development
di: Barrocas, André, et al.
Pubblicazione: (2026)
di: Barrocas, André, et al.
Pubblicazione: (2026)
GDPR-Bench-Android: A Benchmark for Evaluating Automated GDPR Compliance Detection in Android
di: Ran, Huaijin, et al.
Pubblicazione: (2025)
di: Ran, Huaijin, et al.
Pubblicazione: (2025)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
di: Huang, Dong, et al.
Pubblicazione: (2024)
di: Huang, Dong, et al.
Pubblicazione: (2024)
Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development
di: Zeng, Zhengran, et al.
Pubblicazione: (2025)
di: Zeng, Zhengran, et al.
Pubblicazione: (2025)
MigrationBench: Repository-Level Code Migration Benchmark from Java 8
di: Liu, Linbo, et al.
Pubblicazione: (2025)
di: Liu, Linbo, et al.
Pubblicazione: (2025)
AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context
di: Zhang, Lei, et al.
Pubblicazione: (2026)
di: Zhang, Lei, et al.
Pubblicazione: (2026)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development
di: Tran, Hung, et al.
Pubblicazione: (2026)
di: Tran, Hung, et al.
Pubblicazione: (2026)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
di: Yin, Wenjing, et al.
Pubblicazione: (2025)
di: Yin, Wenjing, et al.
Pubblicazione: (2025)
Evaluating LLM-Generated Code: A Benchmark and Developer Study
di: Szych, Joanna, et al.
Pubblicazione: (2026)
di: Szych, Joanna, et al.
Pubblicazione: (2026)
OSS-Bench: Benchmark Generator for Coding LLMs
di: Jiang, Yuancheng, et al.
Pubblicazione: (2025)
di: Jiang, Yuancheng, et al.
Pubblicazione: (2025)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
di: Zhang, Zhe, et al.
Pubblicazione: (2025)
di: Zhang, Zhe, et al.
Pubblicazione: (2025)
Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion?
di: Pan, Zhenyu, et al.
Pubblicazione: (2024)
di: Pan, Zhenyu, et al.
Pubblicazione: (2024)
CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
di: Chen, Zaoyu, et al.
Pubblicazione: (2026)
di: Chen, Zaoyu, et al.
Pubblicazione: (2026)
Signal-First Architectures: Rethinking Front-End Reactivity
di: Balasubramanian, Shrinivass Arunachalam
Pubblicazione: (2025)
di: Balasubramanian, Shrinivass Arunachalam
Pubblicazione: (2025)
Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
di: Fu, Kelin, et al.
Pubblicazione: (2025)
di: Fu, Kelin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AutoBench: Automatic Testbench Generation and Evaluation Using LLMs for HDL Design
di: Qiu, Ruidi, et al.
Pubblicazione: (2024) -
AL-Bench: A Benchmark for Automatic Logging
di: Tan, Boyin, et al.
Pubblicazione: (2025) -
FullStack Bench: Evaluating LLMs as Full Stack Coders
di: Bytedance-Seed-Foundation-Code-Team, et al.
Pubblicazione: (2024) -
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
di: Lu, Pengrui, et al.
Pubblicazione: (2026) -
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
di: Guo, Hanyang, et al.
Pubblicazione: (2025)