FineState-Bench: A Comprehensive Benchmark for Fine-Grained State Control in GUI Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Fengxian, Yang, Jingpu, Song, Zirui, Wang, Yuanxi, Cui, Zhexuan, Li, Yuke, Jiang, Qian, Fang, Miao, Chen, Xiuying |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting
par: Ji, Fengxian, et autres
Publié: (2026)
par: Ji, Fengxian, et autres
Publié: (2026)
TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards
par: Cui, Mingxuan, et autres
Publié: (2026)
par: Cui, Mingxuan, et autres
Publié: (2026)
ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
par: Ji, Fengxian, et autres
Publié: (2026)
par: Ji, Fengxian, et autres
Publié: (2026)
Agent-Based Anti-Jamming Techniques for UAV Communications in Adversarial Environments: A Comprehensive Survey
par: Yang, Jingpu, et autres
Publié: (2025)
par: Yang, Jingpu, et autres
Publié: (2025)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
par: Weng, Zixuan, et autres
Publié: (2026)
par: Weng, Zixuan, et autres
Publié: (2026)
STEPWISE-CODEX-Bench: Evaluating Complex Multi-Function Comprehension and Fine-Grained Execution Reasoning
par: Yan, Kaiwen, et autres
Publié: (2025)
par: Yan, Kaiwen, et autres
Publié: (2025)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
par: Li, Youquan, et autres
Publié: (2024)
par: Li, Youquan, et autres
Publié: (2024)
ProBench: Benchmarking GUI Agents with Accurate Process Information
par: Yang, Leyang, et autres
Publié: (2025)
par: Yang, Leyang, et autres
Publié: (2025)
Efficient Reinforcement Learning via Decoupling Exploration and Utilization
par: Yang, Jingpu, et autres
Publié: (2023)
par: Yang, Jingpu, et autres
Publié: (2023)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
par: Chen, Yelin, et autres
Publié: (2026)
par: Chen, Yelin, et autres
Publié: (2026)
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
par: Chen, Shi, et autres
Publié: (2026)
par: Chen, Shi, et autres
Publié: (2026)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
par: Li, Yang, et autres
Publié: (2026)
par: Li, Yang, et autres
Publié: (2026)
Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
par: Liu, Guangyi, et autres
Publié: (2026)
par: Liu, Guangyi, et autres
Publié: (2026)
PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation
par: Chen, Xin-Sheng, et autres
Publié: (2026)
par: Chen, Xin-Sheng, et autres
Publié: (2026)
PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
par: Nie, Hongyi, et autres
Publié: (2026)
par: Nie, Hongyi, et autres
Publié: (2026)
Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers
par: Wang, Yuxia, et autres
Publié: (2023)
par: Wang, Yuxia, et autres
Publié: (2023)
CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation
par: Yuan, Ruifeng, et autres
Publié: (2026)
par: Yuan, Ruifeng, et autres
Publié: (2026)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
par: Wu, Qinzhuo, et autres
Publié: (2026)
par: Wu, Qinzhuo, et autres
Publié: (2026)
Geolocation with Real Human Gameplay Data: A Large-Scale Dataset and Human-Like Reasoning Framework
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models
par: Islam, Mohammed Saidul, et autres
Publié: (2026)
par: Islam, Mohammed Saidul, et autres
Publié: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values
par: Dong, Haonan, et autres
Publié: (2026)
par: Dong, Haonan, et autres
Publié: (2026)
MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents
par: Qiao, Chuhan, et autres
Publié: (2026)
par: Qiao, Chuhan, et autres
Publié: (2026)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
par: Tang, Liujian, et autres
Publié: (2025)
par: Tang, Liujian, et autres
Publié: (2025)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
par: Lai, Peichao, et autres
Publié: (2025)
par: Lai, Peichao, et autres
Publié: (2025)
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
par: Liu, Dayong, et autres
Publié: (2025)
par: Liu, Dayong, et autres
Publié: (2025)
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
par: Zhang, Zhong, et autres
Publié: (2025)
par: Zhang, Zhong, et autres
Publié: (2025)
M3MAD-Bench: Are Multi-Agent Debates Really Effective Across Domains and Modalities?
par: Li, Ao, et autres
Publié: (2026)
par: Li, Ao, et autres
Publié: (2026)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
par: Liu, Zhiqiang, et autres
Publié: (2025)
par: Liu, Zhiqiang, et autres
Publié: (2025)
SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment
par: Wu, Dapeng, et autres
Publié: (2026)
par: Wu, Dapeng, et autres
Publié: (2026)
IncompeBench: A Permissively Licensed, Fine-Grained Benchmark for Music Information Retrieval
par: Clavié, Benjamin, et autres
Publié: (2026)
par: Clavié, Benjamin, et autres
Publié: (2026)
MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
par: Im, Youngmin, et autres
Publié: (2025)
par: Im, Youngmin, et autres
Publié: (2025)
AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild
par: Sun, Jiazheng, et autres
Publié: (2026)
par: Sun, Jiazheng, et autres
Publié: (2026)
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
par: Yang, Jingqi, et autres
Publié: (2025)
par: Yang, Jingqi, et autres
Publié: (2025)
Frequency Point Game Environment for UAVs via Expert Knowledge and Large Language Model
par: Yang, Jingpu, et autres
Publié: (2025)
par: Yang, Jingpu, et autres
Publié: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
EyePCR: A Comprehensive Benchmark for Fine-Grained Perception, Knowledge Comprehension and Clinical Reasoning in Ophthalmic Surgery
par: Wang, Gui, et autres
Publié: (2025)
par: Wang, Gui, et autres
Publié: (2025)
Documents similaires
-
FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting
par: Ji, Fengxian, et autres
Publié: (2026) -
TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards
par: Cui, Mingxuan, et autres
Publié: (2026) -
ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
par: Ji, Fengxian, et autres
Publié: (2026) -
Agent-Based Anti-Jamming Techniques for UAV Communications in Adversarial Environments: A Comprehensive Survey
par: Yang, Jingpu, et autres
Publié: (2025) -
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
par: Weng, Zixuan, et autres
Publié: (2026)