GUICourse: From General Vision Language Models to Versatile GUI Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Wentong, Cui, Junbo, Hu, Jinyi, Qin, Yujia, Fang, Junjie, Zhao, Yue, Wang, Chongyi, Liu, Jun, Chen, Guirong, Huo, Yupeng, Yao, Yuan, Lin, Yankai, Liu, Zhiyuan, Sun, Maosong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rational Decision-Making Agent with Internalized Utility Judgment
di: Ye, Yining, et al.
Pubblicazione: (2023)
di: Ye, Yining, et al.
Pubblicazione: (2023)
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
di: Zhang, Zhong, et al.
Pubblicazione: (2025)
di: Zhang, Zhong, et al.
Pubblicazione: (2025)
Large Language Model-based Human-Agent Collaboration for Complex Task Solving
di: Feng, Xueyang, et al.
Pubblicazione: (2024)
di: Feng, Xueyang, et al.
Pubblicazione: (2024)
Representation Learning for Natural Language Processing
di: Liu, Zhiyuan, et al.
Pubblicazione: (2020)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2020)
Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
di: Hu, Jinyi, et al.
Pubblicazione: (2023)
di: Hu, Jinyi, et al.
Pubblicazione: (2023)
Tell Me More! Towards Implicit User Intention Understanding of Language Model Driven Agents
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Proactive Agent: Shifting LLM Agents from Reactive Responses to Active Assistance
di: Lu, Yaxi, et al.
Pubblicazione: (2024)
di: Lu, Yaxi, et al.
Pubblicazione: (2024)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
di: Qin, Yujia, et al.
Pubblicazione: (2025)
di: Qin, Yujia, et al.
Pubblicazione: (2025)
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
di: Li, Yishan, et al.
Pubblicazione: (2026)
di: Li, Yishan, et al.
Pubblicazione: (2026)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
LEGENT: Open Platform for Embodied Agents
di: Cheng, Zhili, et al.
Pubblicazione: (2024)
di: Cheng, Zhili, et al.
Pubblicazione: (2024)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
di: Yu, Shi, et al.
Pubblicazione: (2024)
di: Yu, Shi, et al.
Pubblicazione: (2024)
AgentRM: Enhancing Agent Generalization with Reward Modeling
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
States Hidden in Hidden States: LLMs Emerge Discrete State Representations Implicitly
di: Chen, Junhao, et al.
Pubblicazione: (2024)
di: Chen, Junhao, et al.
Pubblicazione: (2024)
Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System
di: Chen, Weize, et al.
Pubblicazione: (2024)
di: Chen, Weize, et al.
Pubblicazione: (2024)
SpiritSight Agent: Advanced GUI Agent with One Look
di: Huang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Huang, Zhiyuan, et al.
Pubblicazione: (2025)
DebugBench: Evaluating Debugging Capability of Large Language Models
di: Tian, Runchu, et al.
Pubblicazione: (2024)
di: Tian, Runchu, et al.
Pubblicazione: (2024)
UniMem: Towards a Unified View of Long-Context Large Language Models
di: Fang, Junjie, et al.
Pubblicazione: (2024)
di: Fang, Junjie, et al.
Pubblicazione: (2024)
DeskVision: Large Scale Desktop Region Captioning for Advanced GUI Agents
di: Xu, Yibin, et al.
Pubblicazione: (2025)
di: Xu, Yibin, et al.
Pubblicazione: (2025)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
H-Neurons: On the Existence, Impact, and Origin of Hallucination-Associated Neurons in LLMs
di: Gao, Cheng, et al.
Pubblicazione: (2025)
di: Gao, Cheng, et al.
Pubblicazione: (2025)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
Exploring the Benefit of Activation Sparsity in Pre-training
di: Zhang, Zhengyan, et al.
Pubblicazione: (2024)
di: Zhang, Zhengyan, et al.
Pubblicazione: (2024)
Reliable Conversational Agents under ASP Control that Understand Natural Language
di: Zeng, Yankai
Pubblicazione: (2025)
di: Zeng, Yankai
Pubblicazione: (2025)
History-Aware Reasoning for GUI Agents
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
Uncertainty-Instructed Structure Injection for Generalizable HD Map Construction
di: Liu, Xiaolu, et al.
Pubblicazione: (2025)
di: Liu, Xiaolu, et al.
Pubblicazione: (2025)
MGMap: Mask-Guided Learning for Online Vectorized HD Map Construction
di: Liu, Xiaolu, et al.
Pubblicazione: (2024)
di: Liu, Xiaolu, et al.
Pubblicazione: (2024)
CatMemo at the FinLLM Challenge Task: Fine-Tuning Large Language Models using Data Fusion in Financial Applications
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
di: Xu, Haiyang, et al.
Pubblicazione: (2026)
di: Xu, Haiyang, et al.
Pubblicazione: (2026)
PersLLM: A Personified Training Approach for Large Language Models
di: Zeng, Zheni, et al.
Pubblicazione: (2024)
di: Zeng, Zheni, et al.
Pubblicazione: (2024)
Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence
di: Chen, Weize, et al.
Pubblicazione: (2024)
di: Chen, Weize, et al.
Pubblicazione: (2024)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
di: Wang, Haoming, et al.
Pubblicazione: (2025)
di: Wang, Haoming, et al.
Pubblicazione: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
Exploring Format Consistency for Instruction Tuning
di: Liang, Shihao, et al.
Pubblicazione: (2023)
di: Liang, Shihao, et al.
Pubblicazione: (2023)
Simulating Dispute Mediation with LLM-Based Agents for Legal Research
di: Chen, Junjie, et al.
Pubblicazione: (2025)
di: Chen, Junjie, et al.
Pubblicazione: (2025)
UIPro: Unleashing Superior Interaction Capability For GUI Agents
di: Li, Hongxin, et al.
Pubblicazione: (2025)
di: Li, Hongxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Rational Decision-Making Agent with Internalized Utility Judgment
di: Ye, Yining, et al.
Pubblicazione: (2023) -
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
di: Zhang, Zhong, et al.
Pubblicazione: (2025) -
Large Language Model-based Human-Agent Collaboration for Complex Task Solving
di: Feng, Xueyang, et al.
Pubblicazione: (2024) -
Representation Learning for Natural Language Processing
di: Liu, Zhiyuan, et al.
Pubblicazione: (2020) -
Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution
di: Qian, Cheng, et al.
Pubblicazione: (2024)