Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Yuhao, Tang, Liang, Li, Shuxian, Huo, Yukang, Duan, Tiaonan, Huang, Kaer, Jing, Yanzhe, Yan, Yiqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
di: Pei, Siqi, et al.
Pubblicazione: (2026)
di: Pei, Siqi, et al.
Pubblicazione: (2026)
Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection
di: Tang, Liang, et al.
Pubblicazione: (2026)
di: Tang, Liang, et al.
Pubblicazione: (2026)
When Continue Learning Meets Multimodal Large Language Model: A Survey
di: Huo, Yukang, et al.
Pubblicazione: (2025)
di: Huo, Yukang, et al.
Pubblicazione: (2025)
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
di: Li, Jiahao, et al.
Pubblicazione: (2025)
di: Li, Jiahao, et al.
Pubblicazione: (2025)
Computational Trichromacy Reconstruction: Empowering the Color-Vision Deficient to Recognize Colors Using Augmented Reality
di: Zhu, Yuhao, et al.
Pubblicazione: (2024)
di: Zhu, Yuhao, et al.
Pubblicazione: (2024)
EffOWT: Transfer Visual Language Models to Open-World Tracking Efficiently and Effectively
di: Wang, Bingyang, et al.
Pubblicazione: (2025)
di: Wang, Bingyang, et al.
Pubblicazione: (2025)
Empowering Segmentation Ability to Multi-modal Large Language Models
di: Yang, Yuqi, et al.
Pubblicazione: (2024)
di: Yang, Yuqi, et al.
Pubblicazione: (2024)
Rethink Predicting the Optical Flow with the Kinetics Perspective
di: Cheng, Yuhao, et al.
Pubblicazione: (2024)
di: Cheng, Yuhao, et al.
Pubblicazione: (2024)
ACTrack: Adding Spatio-Temporal Condition for Visual Object Tracking
di: Han, Yushan, et al.
Pubblicazione: (2024)
di: Han, Yushan, et al.
Pubblicazione: (2024)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
di: Tang, Hao, et al.
Pubblicazione: (2026)
di: Tang, Hao, et al.
Pubblicazione: (2026)
Attacking Vision-Language Computer Agents via Pop-ups
di: Zhang, Yanzhe, et al.
Pubblicazione: (2024)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2024)
UI-Evol: Automatic Knowledge Evolving for Computer Use Agents
di: Zhang, Ziyun, et al.
Pubblicazione: (2025)
di: Zhang, Ziyun, et al.
Pubblicazione: (2025)
Multi-Agent Computer Use
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing
di: Huang, Nisha, et al.
Pubblicazione: (2025)
di: Huang, Nisha, et al.
Pubblicazione: (2025)
Real-Time Reasoning Agents in Evolving Environments
di: Wen, Yule, et al.
Pubblicazione: (2025)
di: Wen, Yule, et al.
Pubblicazione: (2025)
GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
MMedAgent: Learning to Use Medical Tools with Multi-modal Agent
di: Li, Binxu, et al.
Pubblicazione: (2024)
di: Li, Binxu, et al.
Pubblicazione: (2024)
AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
di: Cheng, Junhao, et al.
Pubblicazione: (2024)
di: Cheng, Junhao, et al.
Pubblicazione: (2024)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
di: Hong, Haodong, et al.
Pubblicazione: (2024)
di: Hong, Haodong, et al.
Pubblicazione: (2024)
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
di: Huang, Xuan, et al.
Pubblicazione: (2024)
di: Huang, Xuan, et al.
Pubblicazione: (2024)
Empowering Working Memory for Large Language Model Agents
di: Guo, Jing, et al.
Pubblicazione: (2023)
di: Guo, Jing, et al.
Pubblicazione: (2023)
From Following to Understanding: Investigating the Role of Reflective Prompts in AR-Guided Tasks to Promote Task Understanding
di: Zhang, Nandi, et al.
Pubblicazione: (2025)
di: Zhang, Nandi, et al.
Pubblicazione: (2025)
VoCo-LLaMA: Towards Vision Compression with Large Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
Interpreting Multi-band Galaxy Observations with Large Language Model-Based Agents
di: Sun, Zechang, et al.
Pubblicazione: (2024)
di: Sun, Zechang, et al.
Pubblicazione: (2024)
Empowering Large Language Model Agents through Action Learning
di: Zhao, Haiteng, et al.
Pubblicazione: (2024)
di: Zhao, Haiteng, et al.
Pubblicazione: (2024)
Learning Evolving Latent Strategies for Multi-Agent Language Systems without Model Fine-Tuning
di: Tang, Wenlong
Pubblicazione: (2025)
di: Tang, Wenlong
Pubblicazione: (2025)
GraphAgent: Agentic Graph Language Assistant
di: Yang, Yuhao, et al.
Pubblicazione: (2024)
di: Yang, Yuhao, et al.
Pubblicazione: (2024)
A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis
di: Liu, Jiachen, et al.
Pubblicazione: (2025)
di: Liu, Jiachen, et al.
Pubblicazione: (2025)
Empowering Denoising Sequential Recommendation with Large Language Model Embeddings
di: Wu, Tongzhou, et al.
Pubblicazione: (2025)
di: Wu, Tongzhou, et al.
Pubblicazione: (2025)
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration
di: Liu, Zijun, et al.
Pubblicazione: (2023)
di: Liu, Zijun, et al.
Pubblicazione: (2023)
Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling
di: Luo, Zizhang, et al.
Pubblicazione: (2026)
di: Luo, Zizhang, et al.
Pubblicazione: (2026)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
di: Song, Wenhui, et al.
Pubblicazione: (2025)
di: Song, Wenhui, et al.
Pubblicazione: (2025)
WildGHand: Learning Anti-Perturbation Gaussian Hand Avatars from Monocular In-the-Wild Videos
di: Li, Hanhui, et al.
Pubblicazione: (2026)
di: Li, Hanhui, et al.
Pubblicazione: (2026)
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
di: Xing, Yifei, et al.
Pubblicazione: (2024)
di: Xing, Yifei, et al.
Pubblicazione: (2024)
Efficient Multi-modal Large Language Models via Visual Token Grouping
di: Huang, Minbin, et al.
Pubblicazione: (2024)
di: Huang, Minbin, et al.
Pubblicazione: (2024)
Visual Hallucinations of Multi-modal Large Language Models
di: Huang, Wen, et al.
Pubblicazione: (2024)
di: Huang, Wen, et al.
Pubblicazione: (2024)
OS-Marathon: Benchmarking Computer-Use Agents on Long-Horizon Repetitive Tasks
di: Wu, Jing, et al.
Pubblicazione: (2026)
di: Wu, Jing, et al.
Pubblicazione: (2026)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
di: Pei, Siqi, et al.
Pubblicazione: (2026) -
Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection
di: Tang, Liang, et al.
Pubblicazione: (2026) -
When Continue Learning Meets Multimodal Large Language Model: A Survey
di: Huo, Yukang, et al.
Pubblicazione: (2025) -
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
di: Li, Jiahao, et al.
Pubblicazione: (2025) -
Computational Trichromacy Reconstruction: Empowering the Color-Vision Deficient to Recognize Colors Using Augmented Reality
di: Zhu, Yuhao, et al.
Pubblicazione: (2024)