GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Mu, Jian, Zhang, Chaoyun, Ni, Chiming, Wang, Lu, Qiao, Bo, Mathur, Kartik, Wu, Qianhui, Xie, Yuhang, Ma, Xiaojun, Zhou, Mengyu, Qin, Si, Li, Liqun, Kang, Yu, Ma, Minghua, Lin, Qingwei, Rajmohan, Saravan, Zhang, Dongmei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UFO3: Weaving the Digital Agent Galaxy
por: Zhang, Chaoyun, et al.
Publicado: (2025)
por: Zhang, Chaoyun, et al.
Publicado: (2025)
API Agents vs. GUI Agents: Divergence and Convergence
por: Zhang, Chaoyun, et al.
Publicado: (2025)
por: Zhang, Chaoyun, et al.
Publicado: (2025)
From Task to Tutorial: An Automated GUI Framework for Excel Tutorial Document and Video Creation
por: Xie, Yuhang, et al.
Publicado: (2025)
por: Xie, Yuhang, et al.
Publicado: (2025)
Large Language Model-Brained GUI Agents: A Survey
por: Zhang, Chaoyun, et al.
Publicado: (2024)
por: Zhang, Chaoyun, et al.
Publicado: (2024)
Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection
por: Liu, Jun, et al.
Publicado: (2024)
por: Liu, Jun, et al.
Publicado: (2024)
UFO: A UI-Focused Agent for Windows OS Interaction
por: Zhang, Chaoyun, et al.
Publicado: (2024)
por: Zhang, Chaoyun, et al.
Publicado: (2024)
Everything of Thoughts: Defying the Law of Penrose Triangle for Thought Generation
por: Ding, Ruomeng, et al.
Publicado: (2023)
por: Ding, Ruomeng, et al.
Publicado: (2023)
VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model
por: Zheng, Jiani, et al.
Publicado: (2025)
por: Zheng, Jiani, et al.
Publicado: (2025)
From Reasoning to Answer: Empirical, Attention-Based and Mechanistic Insights into Distilled DeepSeek R1 Models
por: Zhang, Jue, et al.
Publicado: (2025)
por: Zhang, Jue, et al.
Publicado: (2025)
Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention
por: Liao, Mengqi, et al.
Publicado: (2026)
por: Liao, Mengqi, et al.
Publicado: (2026)
Text2Grad: Reinforcement Learning from Natural Language Feedback
por: Wang, Hanyang, et al.
Publicado: (2025)
por: Wang, Hanyang, et al.
Publicado: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
por: Wu, Qianhui, et al.
Publicado: (2025)
por: Wu, Qianhui, et al.
Publicado: (2025)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
por: Sun, Lihao, et al.
Publicado: (2026)
por: Sun, Lihao, et al.
Publicado: (2026)
UFO2: The Desktop AgentOS
por: Zhang, Chaoyun, et al.
Publicado: (2025)
por: Zhang, Chaoyun, et al.
Publicado: (2025)
StepFly: Agentic Troubleshooting Guide Automation for Incident Diagnosis
por: Mao, Jiayi, et al.
Publicado: (2025)
por: Mao, Jiayi, et al.
Publicado: (2025)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
por: Liao, Mengqi, et al.
Publicado: (2025)
por: Liao, Mengqi, et al.
Publicado: (2025)
AllHands: Ask Me Anything on Large-scale Verbatim Feedback via Large Language Models
por: Zhang, Chaoyun, et al.
Publicado: (2024)
por: Zhang, Chaoyun, et al.
Publicado: (2024)
DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
por: Ma, Ming, et al.
Publicado: (2025)
por: Ma, Ming, et al.
Publicado: (2025)
An Empirical Study of Production Incidents in Generative AI Cloud Services
por: Yan, Haoran, et al.
Publicado: (2025)
por: Yan, Haoran, et al.
Publicado: (2025)
Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems
por: Zhao, Chenyu, et al.
Publicado: (2025)
por: Zhao, Chenyu, et al.
Publicado: (2025)
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
por: Tan, Rongyuan, et al.
Publicado: (2026)
por: Tan, Rongyuan, et al.
Publicado: (2026)
TaskWeaver: A Code-First Agent Framework
por: Qiao, Bo, et al.
Publicado: (2023)
por: Qiao, Bo, et al.
Publicado: (2023)
ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation
por: He, Minghua, et al.
Publicado: (2025)
por: He, Minghua, et al.
Publicado: (2025)
WebXSkill: Skill Learning for Autonomous Web Agents
por: Wang, Zhaoyang, et al.
Publicado: (2026)
por: Wang, Zhaoyang, et al.
Publicado: (2026)
Why does Prediction Accuracy Decrease over Time? Uncertain Positive Learning for Cloud Failure Prediction
por: Li, Haozhe, et al.
Publicado: (2024)
por: Li, Haozhe, et al.
Publicado: (2024)
Revisiting VAE for Unsupervised Time Series Anomaly Detection: A Frequency Perspective
por: Wang, Zexin, et al.
Publicado: (2024)
por: Wang, Zexin, et al.
Publicado: (2024)
MEETING DELEGATE: Benchmarking LLMs on Attending Meetings on Our Behalf
por: Hu, Lingxiang, et al.
Publicado: (2025)
por: Hu, Lingxiang, et al.
Publicado: (2025)
Call Me When Necessary: LLMs can Efficiently and Faithfully Reason over Structured Environments
por: Cheng, Sitao, et al.
Publicado: (2024)
por: Cheng, Sitao, et al.
Publicado: (2024)
RuAG: Learned-rule-augmented Generation for Large Language Models
por: Zhang, Yudi, et al.
Publicado: (2024)
por: Zhang, Yudi, et al.
Publicado: (2024)
Privacy in Action: Towards Realistic Privacy Mitigation and Evaluation for LLM-Powered Agents
por: Wang, Shouju, et al.
Publicado: (2025)
por: Wang, Shouju, et al.
Publicado: (2025)
CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents
por: Fu, Wenjie, et al.
Publicado: (2026)
por: Fu, Wenjie, et al.
Publicado: (2026)
Computer-Using World Model
por: Guan, Yiming, et al.
Publicado: (2026)
por: Guan, Yiming, et al.
Publicado: (2026)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
por: Zhao, Yu, et al.
Publicado: (2025)
por: Zhao, Yu, et al.
Publicado: (2025)
Deoxys: A Causal Inference Engine for Unhealthy Node Mitigation in Large-scale Cloud Infrastructure
por: Zhang, Chaoyun, et al.
Publicado: (2024)
por: Zhang, Chaoyun, et al.
Publicado: (2024)
A Tale of Two Graphs: Separating Knowledge Exploration from Outline Structure for Open-Ended Deep Research
por: Shi, Zhuofan, et al.
Publicado: (2026)
por: Shi, Zhuofan, et al.
Publicado: (2026)
Navigating the Unknown: A Chat-Based Collaborative Interface for Personalized Exploratory Tasks
por: Peng, Yingzhe, et al.
Publicado: (2024)
por: Peng, Yingzhe, et al.
Publicado: (2024)
The Vision of Autonomic Computing: Can LLMs Make It a Reality?
por: Zhang, Zhiyang, et al.
Publicado: (2024)
por: Zhang, Zhiyang, et al.
Publicado: (2024)
Thread: A Logic-Based Data Organization Paradigm for How-To Question Answering with Retrieval Augmented Generation
por: An, Kaikai, et al.
Publicado: (2024)
por: An, Kaikai, et al.
Publicado: (2024)
Automated Root Causing of Cloud Incidents using In-Context Learning with GPT-4
por: Zhang, Xuchao, et al.
Publicado: (2024)
por: Zhang, Xuchao, et al.
Publicado: (2024)
A Benchmark for Language Models in Real-World System Building
por: Jin, Weilin, et al.
Publicado: (2026)
por: Jin, Weilin, et al.
Publicado: (2026)
Ejemplares similares
-
UFO3: Weaving the Digital Agent Galaxy
por: Zhang, Chaoyun, et al.
Publicado: (2025) -
API Agents vs. GUI Agents: Divergence and Convergence
por: Zhang, Chaoyun, et al.
Publicado: (2025) -
From Task to Tutorial: An Automated GUI Framework for Excel Tutorial Document and Video Creation
por: Xie, Yuhang, et al.
Publicado: (2025) -
Large Language Model-Brained GUI Agents: A Survey
por: Zhang, Chaoyun, et al.
Publicado: (2024) -
Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection
por: Liu, Jun, et al.
Publicado: (2024)