OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Zhiyong, Wu, Zhenyu, Xu, Fangzhi, Wang, Yian, Sun, Qiushi, Jia, Chengyou, Cheng, Kanzhi, Ding, Zichen, Chen, Liheng, Liang, Paul Pu, Qiao, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
di: Sun, Qiushi, et al.
Pubblicazione: (2024)
di: Sun, Qiushi, et al.
Pubblicazione: (2024)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent
di: Yang, Bowen, et al.
Pubblicazione: (2026)
di: Yang, Bowen, et al.
Pubblicazione: (2026)
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
di: Cheng, Kanzhi, et al.
Pubblicazione: (2026)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2026)
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models
di: Xu, Fangzhi, et al.
Pubblicazione: (2024)
di: Xu, Fangzhi, et al.
Pubblicazione: (2024)
OS-Kairos: Adaptive Interaction for MLLM-Powered GUI Agents
di: Cheng, Pengzhou, et al.
Pubblicazione: (2025)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2025)
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
di: Zhang, Jiwen, et al.
Pubblicazione: (2024)
di: Zhang, Jiwen, et al.
Pubblicazione: (2024)
GUI Agents with Foundation Models: A Comprehensive Survey
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
VeriSafe Agent: Safeguarding Mobile GUI Agent via Logic-based Action Verification
di: Lee, Jungjae, et al.
Pubblicazione: (2025)
di: Lee, Jungjae, et al.
Pubblicazione: (2025)
LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects
di: Liu, Guangyi, et al.
Pubblicazione: (2025)
di: Liu, Guangyi, et al.
Pubblicazione: (2025)
OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?
di: Chen, Xuetian, et al.
Pubblicazione: (2025)
di: Chen, Xuetian, et al.
Pubblicazione: (2025)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
di: Tang, Liujian, et al.
Pubblicazione: (2025)
di: Tang, Liujian, et al.
Pubblicazione: (2025)
GUI Agents: A Survey
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
Beyond Clicking:A Step Towards Generalist GUI Grounding via Text Dragging
di: Liao, Zeyi, et al.
Pubblicazione: (2025)
di: Liao, Zeyi, et al.
Pubblicazione: (2025)
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
di: Wu, Zongru, et al.
Pubblicazione: (2025)
di: Wu, Zongru, et al.
Pubblicazione: (2025)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
di: Wu, Zongru, et al.
Pubblicazione: (2025)
di: Wu, Zongru, et al.
Pubblicazione: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
di: Nong, Songqin, et al.
Pubblicazione: (2025)
di: Nong, Songqin, et al.
Pubblicazione: (2025)
The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes
di: Gebreegziabher, Simret Araya, et al.
Pubblicazione: (2026)
di: Gebreegziabher, Simret Araya, et al.
Pubblicazione: (2026)
Advancing Social Intelligence in AI Agents: Technical Challenges and Open Questions
di: Mathur, Leena, et al.
Pubblicazione: (2024)
di: Mathur, Leena, et al.
Pubblicazione: (2024)
LearnAct: Few-Shot Mobile GUI Agent with a Unified Demonstration Benchmark
di: Liu, Guangyi, et al.
Pubblicazione: (2025)
di: Liu, Guangyi, et al.
Pubblicazione: (2025)
A Survey on (M)LLM-Based GUI Agents
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
di: Henry, Felix, et al.
Pubblicazione: (2026)
di: Henry, Felix, et al.
Pubblicazione: (2026)
Exploring the Feasibility of Multimodal Chatbot AI as Copilot in Pathology Diagnostics: Generalist Model's Pitfall
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
History-Aware Reasoning for GUI Agents
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
UIPro: Unleashing Superior Interaction Capability For GUI Agents
di: Li, Hongxin, et al.
Pubblicazione: (2025)
di: Li, Hongxin, et al.
Pubblicazione: (2025)
SpiritSight Agent: Advanced GUI Agent with One Look
di: Huang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Huang, Zhiyuan, et al.
Pubblicazione: (2025)
Characterizing Unintended Consequences in Human-GUI Agent Collaboration for Web Browsing
di: Zhang, Shuning, et al.
Pubblicazione: (2025)
di: Zhang, Shuning, et al.
Pubblicazione: (2025)
Toward a Human-Centered Evaluation Framework for Trustworthy LLM-Powered GUI Agents
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
The Obvious Invisible Threat: LLM-Powered GUI Agents' Vulnerability to Fine-Print Injections
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
Advancing GUI for Generative AI: Charting the Design Space of Human-AI Interactions through Task Creativity and Complexity
di: Ding, Zijian
Pubblicazione: (2024)
di: Ding, Zijian
Pubblicazione: (2024)
API Agents vs. GUI Agents: Divergence and Convergence
di: Zhang, Chaoyun, et al.
Pubblicazione: (2025)
di: Zhang, Chaoyun, et al.
Pubblicazione: (2025)
Large Language Model-Brained GUI Agents: A Survey
di: Zhang, Chaoyun, et al.
Pubblicazione: (2024)
di: Zhang, Chaoyun, et al.
Pubblicazione: (2024)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
di: Qin, Yujia, et al.
Pubblicazione: (2025)
di: Qin, Yujia, et al.
Pubblicazione: (2025)
Beyond Chat and Clicks: GUI Agents for In-Situ Assistance via Live Interface Transformation
di: Hao, Pan, et al.
Pubblicazione: (2026)
di: Hao, Pan, et al.
Pubblicazione: (2026)
Dark Patterns Meet GUI Agents: LLM Agent Susceptibility to Manipulative Interfaces and the Role of Human Oversight
di: Tang, Jingyu, et al.
Pubblicazione: (2025)
di: Tang, Jingyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
di: Sun, Qiushi, et al.
Pubblicazione: (2024) -
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024) -
OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent
di: Yang, Bowen, et al.
Pubblicazione: (2026) -
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025) -
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
di: Luo, Run, et al.
Pubblicazione: (2025)