UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jung, Sam, Garcinuno, Agustin, Mateega, Spencer |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics
par: Srivastava, Abhay, et autres
Publié: (2025)
par: Srivastava, Abhay, et autres
Publié: (2025)
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
par: Mateega, Spencer, et autres
Publié: (2025)
par: Mateega, Spencer, et autres
Publié: (2025)
IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks
par: Mateega, Spencer, et autres
Publié: (2026)
par: Mateega, Spencer, et autres
Publié: (2026)
AppSelectBench: Application-Level Tool Selection Benchmark
par: Chen, Tianyi, et autres
Publié: (2025)
par: Chen, Tianyi, et autres
Publié: (2025)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
par: Xue, Xiangyuan, et autres
Publié: (2024)
par: Xue, Xiangyuan, et autres
Publié: (2024)
DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
par: Kim, Hyunjun, et autres
Publié: (2025)
par: Kim, Hyunjun, et autres
Publié: (2025)
FunctionChat-Bench: Comprehensive Evaluation of Language Models' Generative Capabilities in Korean Tool-use Dialogs
par: Lee, Shinbok, et autres
Publié: (2024)
par: Lee, Shinbok, et autres
Publié: (2024)
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
par: Karger, Ezra, et autres
Publié: (2024)
par: Karger, Ezra, et autres
Publié: (2024)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
par: Que, Haoran, et autres
Publié: (2024)
par: Que, Haoran, et autres
Publié: (2024)
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
par: Singh, Harman, et autres
Publié: (2024)
par: Singh, Harman, et autres
Publié: (2024)
MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions
par: Huang, Zeyu, et autres
Publié: (2025)
par: Huang, Zeyu, et autres
Publié: (2025)
MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models
par: Song, Hoyun, et autres
Publié: (2026)
par: Song, Hoyun, et autres
Publié: (2026)
BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and Semantic Parsing
par: Roy, Subhro, et autres
Publié: (2022)
par: Roy, Subhro, et autres
Publié: (2022)
BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
Do These LLM Benchmarks Agree? Fixing Benchmark Evaluation with BenchBench
par: Perlitz, Yotam, et autres
Publié: (2024)
par: Perlitz, Yotam, et autres
Publié: (2024)
ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities
par: Lu, Jiarui, et autres
Publié: (2024)
par: Lu, Jiarui, et autres
Publié: (2024)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
par: Jiang, Zhuohang, et autres
Publié: (2025)
par: Jiang, Zhuohang, et autres
Publié: (2025)
FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain
par: Afzal, Anum, et autres
Publié: (2025)
par: Afzal, Anum, et autres
Publié: (2025)
RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems
par: Lin, Jingru, et autres
Publié: (2025)
par: Lin, Jingru, et autres
Publié: (2025)
LCTG Bench: LLM Controlled Text Generation Benchmark
par: Kurihara, Kentaro, et autres
Publié: (2025)
par: Kurihara, Kentaro, et autres
Publié: (2025)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
par: Lin, Zhiyu, et autres
Publié: (2025)
par: Lin, Zhiyu, et autres
Publié: (2025)
M4GT-Bench: Evaluation Benchmark for Black-Box Machine-Generated Text Detection
par: Wang, Yuxia, et autres
Publié: (2024)
par: Wang, Yuxia, et autres
Publié: (2024)
ChatBench: From Static Benchmarks to Human-AI Evaluation
par: Chang, Serina, et autres
Publié: (2025)
par: Chang, Serina, et autres
Publié: (2025)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
par: Lee, Young-Jun, et autres
Publié: (2025)
par: Lee, Young-Jun, et autres
Publié: (2025)
DentalBench: Benchmarking and Advancing LLMs Capability for Bilingual Dentistry Understanding
par: Zhu, Hengchuan, et autres
Publié: (2025)
par: Zhu, Hengchuan, et autres
Publié: (2025)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
par: Lin, Guan-Ting, et autres
Publié: (2025)
par: Lin, Guan-Ting, et autres
Publié: (2025)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
par: Guo, Zhicheng, et autres
Publié: (2024)
par: Guo, Zhicheng, et autres
Publié: (2024)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
par: Wang, Pei, et autres
Publié: (2024)
par: Wang, Pei, et autres
Publié: (2024)
BenchBench: Benchmarking Automated Benchmark Generation
par: Zheng, Yandan, et autres
Publié: (2026)
par: Zheng, Yandan, et autres
Publié: (2026)
MCiteBench: A Multimodal Benchmark for Generating Text with Citations
par: Hu, Caiyu, et autres
Publié: (2025)
par: Hu, Caiyu, et autres
Publié: (2025)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
par: Shin, Jisu, et autres
Publié: (2025)
par: Shin, Jisu, et autres
Publié: (2025)
FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability
par: Xia, Congying, et autres
Publié: (2024)
par: Xia, Congying, et autres
Publié: (2024)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
par: Zbeeb, Mohammad, et autres
Publié: (2025)
par: Zbeeb, Mohammad, et autres
Publié: (2025)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
par: Li, Jianling, et autres
Publié: (2025)
par: Li, Jianling, et autres
Publié: (2025)
PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
Understanding the Effects of Noise in Text-to-SQL: An Examination of the BIRD-Bench Benchmark
par: Wretblad, Niklas, et autres
Publié: (2024)
par: Wretblad, Niklas, et autres
Publié: (2024)
Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs
par: Son, Guijin, et autres
Publié: (2026)
par: Son, Guijin, et autres
Publié: (2026)
TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents
par: Bariah, Lina, et autres
Publié: (2026)
par: Bariah, Lina, et autres
Publié: (2026)
Documents similaires
-
Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics
par: Srivastava, Abhay, et autres
Publié: (2025) -
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
par: Mateega, Spencer, et autres
Publié: (2025) -
IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks
par: Mateega, Spencer, et autres
Publié: (2026) -
AppSelectBench: Application-Level Tool Selection Benchmark
par: Chen, Tianyi, et autres
Publié: (2025) -
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
par: Xue, Xiangyuan, et autres
Publié: (2024)