MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development
Fuente:
arXiv
Saved in:
| Main Authors: | Fakorede, Moshood A., Upadhyay, Krishna, Siddique, A. B., Farooq, Umar |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Understanding Bugs in Quantum Simulators: An Empirical Study
by: Upadhyay, Krishna, et al.
Published: (2026)
by: Upadhyay, Krishna, et al.
Published: (2026)
Understanding and Detecting Platform-Specific Violations in Android Auto Apps
by: Fakorede, Moshood, et al.
Published: (2025)
by: Fakorede, Moshood, et al.
Published: (2025)
What Users Value and Critique: Large-Scale Analysis of User Feedback on AI-Powered Mobile Apps
by: Chhetri, Vinaik, et al.
Published: (2025)
by: Chhetri, Vinaik, et al.
Published: (2025)
Assessing and Enhancing Quantum Readiness in Mobile Apps
by: Strauss, Joseph, et al.
Published: (2025)
by: Strauss, Joseph, et al.
Published: (2025)
A Large-Scale Study on the Development and Issues of Multi-Agent AI Systems
by: Liu, Daniel, et al.
Published: (2026)
by: Liu, Daniel, et al.
Published: (2026)
Understanding Robustness of Model Editing in Code LLMs
by: Chhetri, Vinaik, et al.
Published: (2025)
by: Chhetri, Vinaik, et al.
Published: (2025)
Analyzing the Evolution and Maintenance of Quantum Software Repositories
by: Upadhyay, Krishna, et al.
Published: (2025)
by: Upadhyay, Krishna, et al.
Published: (2025)
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
by: Kumarappan, Adarsh, et al.
Published: (2026)
by: Kumarappan, Adarsh, et al.
Published: (2026)
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
by: Raghavendra, Mohit, et al.
Published: (2026)
by: Raghavendra, Mohit, et al.
Published: (2026)
DeputyDev -- AI Powered Developer Assistant: Breaking the Code Review Logjam through Contextual AI to Boost Developer Productivity
by: Khare, Vishal, et al.
Published: (2025)
by: Khare, Vishal, et al.
Published: (2025)
EnvBench: A Benchmark for Automated Environment Setup
by: Eliseeva, Aleksandra, et al.
Published: (2025)
by: Eliseeva, Aleksandra, et al.
Published: (2025)
OSS-Bench: Benchmark Generator for Coding LLMs
by: Jiang, Yuancheng, et al.
Published: (2025)
by: Jiang, Yuancheng, et al.
Published: (2025)
Towards MLOps: A DevOps Tools Recommender System for Machine Learning System
by: Shah, Pir Sami Ullah, et al.
Published: (2024)
by: Shah, Pir Sami Ullah, et al.
Published: (2024)
ThrowBench: Benchmarking LLMs by Predicting Runtime Exceptions
by: Prenner, Julian Aron, et al.
Published: (2025)
by: Prenner, Julian Aron, et al.
Published: (2025)
AICD Bench: A Challenging Benchmark for AI-Generated Code Detection
by: Orel, Daniil, et al.
Published: (2026)
by: Orel, Daniil, et al.
Published: (2026)
SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?
by: Tian, Muxin, et al.
Published: (2026)
by: Tian, Muxin, et al.
Published: (2026)
MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion
by: Feng, Yunfei, et al.
Published: (2026)
by: Feng, Yunfei, et al.
Published: (2026)
AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion Generation
by: Pulavarthi, Vaishnavi, et al.
Published: (2024)
by: Pulavarthi, Vaishnavi, et al.
Published: (2024)
Towards Trustworthy AI Software Development Assistance
by: Maninger, Daniel, et al.
Published: (2023)
by: Maninger, Daniel, et al.
Published: (2023)
Looking into Black Box Code Language Models
by: Haider, Muhammad Umair, et al.
Published: (2024)
by: Haider, Muhammad Umair, et al.
Published: (2024)
SoundnessBench: A Soundness Benchmark for Neural Network Verifiers
by: Zhou, Xingjian, et al.
Published: (2024)
by: Zhou, Xingjian, et al.
Published: (2024)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
by: Lu, Pengrui, et al.
Published: (2026)
by: Lu, Pengrui, et al.
Published: (2026)
Embedded DevOps: A Survey on the Application of DevOps Practices in Embedded Software and Firmware Development
by: Katapara, Parthiv, et al.
Published: (2025)
by: Katapara, Parthiv, et al.
Published: (2025)
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
by: Khatry, Anirudh, et al.
Published: (2025)
by: Khatry, Anirudh, et al.
Published: (2025)
Risk Management for Mitigating Benchmark Failure Modes: BenchRisk
by: McGregor, Sean, et al.
Published: (2025)
by: McGregor, Sean, et al.
Published: (2025)
Deep-Bench: Deep Learning Benchmark Dataset for Code Generation
by: Daghighfarsoodeh, Alireza, et al.
Published: (2025)
by: Daghighfarsoodeh, Alireza, et al.
Published: (2025)
MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation
by: Shbita, Basel, et al.
Published: (2025)
by: Shbita, Basel, et al.
Published: (2025)
CSR-Bench: Benchmarking LLM Agents in Deployment of Computer Science Research Repositories
by: Xiao, Yijia, et al.
Published: (2025)
by: Xiao, Yijia, et al.
Published: (2025)
CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance
by: Pai, Kunal, et al.
Published: (2025)
by: Pai, Kunal, et al.
Published: (2025)
RepairBench: Leaderboard of Frontier Models for Program Repair
by: Silva, André, et al.
Published: (2024)
by: Silva, André, et al.
Published: (2024)
TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications
by: Gajjar, Pranshav, et al.
Published: (2026)
by: Gajjar, Pranshav, et al.
Published: (2026)
DafnyBench: A Benchmark for Formal Software Verification
by: Loughridge, Chloe, et al.
Published: (2024)
by: Loughridge, Chloe, et al.
Published: (2024)
GiveMeLabeledIssues: An Open Source Issue Recommendation System
by: Vargovich, Joseph, et al.
Published: (2023)
by: Vargovich, Joseph, et al.
Published: (2023)
SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments
by: Arora, Avi, et al.
Published: (2025)
by: Arora, Avi, et al.
Published: (2025)
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
by: Li, Linyi, et al.
Published: (2024)
by: Li, Linyi, et al.
Published: (2024)
CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?
by: Bhargava, Vaishnavi, et al.
Published: (2024)
by: Bhargava, Vaishnavi, et al.
Published: (2024)
SWE-Exp: Experience-Driven Software Issue Resolution
by: Chen, Silin, et al.
Published: (2025)
by: Chen, Silin, et al.
Published: (2025)
When Bugs Linger: A Study of Anomalous Resolution Time Outliers and Their Themes
by: Patil, Avinash
Published: (2025)
by: Patil, Avinash
Published: (2025)
SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
by: Zhang, Jing, et al.
Published: (2025)
by: Zhang, Jing, et al.
Published: (2025)
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
by: Ahmed, Toufique, et al.
Published: (2024)
by: Ahmed, Toufique, et al.
Published: (2024)
Similar Items
-
Understanding Bugs in Quantum Simulators: An Empirical Study
by: Upadhyay, Krishna, et al.
Published: (2026) -
Understanding and Detecting Platform-Specific Violations in Android Auto Apps
by: Fakorede, Moshood, et al.
Published: (2025) -
What Users Value and Critique: Large-Scale Analysis of User Feedback on AI-Powered Mobile Apps
by: Chhetri, Vinaik, et al.
Published: (2025) -
Assessing and Enhancing Quantum Readiness in Mobile Apps
by: Strauss, Joseph, et al.
Published: (2025) -
A Large-Scale Study on the Development and Issues of Multi-Agent AI Systems
by: Liu, Daniel, et al.
Published: (2026)