GUI Agents: A Survey
Fuente:
arXiv
Guardado en:
| Autores principales: | Nguyen, Dang, Chen, Jian, Wang, Yu, Wu, Gang, Park, Namyong, Hu, Zhengmian, Lyu, Hanjia, Wu, Junda, Aponte, Ryan, Xia, Yu, Li, Xintong, Shi, Jing, Chen, Hongjie, Lai, Viet Dac, Xie, Zhouhang, Kim, Sungchul, Zhang, Ruiyi, Yu, Tong, Tanjim, Mehrab, Ahmed, Nesreen K., Mathur, Puneet, Yoon, Seunghyun, Yao, Lina, Kveton, Branislav, Kil, Jihyung, Nguyen, Thien Huu, Bui, Trung, Zhou, Tianyi, Rossi, Ryan A., Dernoncourt, Franck |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Selection to Generation: A Survey of LLM-based Active Learning
por: Xia, Yu, et al.
Publicado: (2025)
por: Xia, Yu, et al.
Publicado: (2025)
Bias and Fairness in Large Language Models: A Survey
por: Gallegos, Isabel O., et al.
Publicado: (2023)
por: Gallegos, Isabel O., et al.
Publicado: (2023)
MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces
por: Luera, Reuben A., et al.
Publicado: (2025)
por: Luera, Reuben A., et al.
Publicado: (2025)
Reasoning-Based Personalized Generation for Users with Sparse Data
por: Ni, Bo, et al.
Publicado: (2026)
por: Ni, Bo, et al.
Publicado: (2026)
Active Learning for Direct Preference Optimization
por: Kveton, Branislav, et al.
Publicado: (2025)
por: Kveton, Branislav, et al.
Publicado: (2025)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
por: Gallegos, Isabel O., et al.
Publicado: (2024)
por: Gallegos, Isabel O., et al.
Publicado: (2024)
Partial Policy Gradients for RL in LLMs
por: Mathur, Puneet, et al.
Publicado: (2026)
por: Mathur, Puneet, et al.
Publicado: (2026)
Anticipatory Planning for Multimodal AI Agents
por: Liang, Yongyuan, et al.
Publicado: (2026)
por: Liang, Yongyuan, et al.
Publicado: (2026)
A Survey of Small Language Models
por: Van Nguyen, Chien, et al.
Publicado: (2024)
por: Van Nguyen, Chien, et al.
Publicado: (2024)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
por: Lee, Daeun, et al.
Publicado: (2025)
por: Lee, Daeun, et al.
Publicado: (2025)
Exploring Rewriting Approaches for Different Conversational Tasks
por: Tanjim, Md Mehrab, et al.
Publicado: (2025)
por: Tanjim, Md Mehrab, et al.
Publicado: (2025)
DynaSaur: Large Language Agents Beyond Predefined Actions
por: Nguyen, Dang, et al.
Publicado: (2024)
por: Nguyen, Dang, et al.
Publicado: (2024)
Personalized Multimodal Large Language Models: A Survey
por: Wu, Junda, et al.
Publicado: (2024)
por: Wu, Junda, et al.
Publicado: (2024)
MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
por: Tanjim, Md Mehrab, et al.
Publicado: (2026)
por: Tanjim, Md Mehrab, et al.
Publicado: (2026)
A Survey on LLM-based Conversational User Simulation
por: Ni, Bo, et al.
Publicado: (2026)
por: Ni, Bo, et al.
Publicado: (2026)
Taipan: Efficient and Expressive State Space Language Models with Selective Attention
por: Van Nguyen, Chien, et al.
Publicado: (2024)
por: Van Nguyen, Chien, et al.
Publicado: (2024)
Diversify-verify-adapt: Efficient and Robust Retrieval-Augmented Ambiguous Question Answering
por: In, Yeonjun, et al.
Publicado: (2024)
por: In, Yeonjun, et al.
Publicado: (2024)
Personalization of Large Language Models: A Survey
por: Zhang, Zhehao, et al.
Publicado: (2024)
por: Zhang, Zhehao, et al.
Publicado: (2024)
Lizard: An Efficient Linearization Framework for Large Language Models
por: Van Nguyen, Chien, et al.
Publicado: (2025)
por: Van Nguyen, Chien, et al.
Publicado: (2025)
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
por: Zhou, Shijie, et al.
Publicado: (2025)
por: Zhou, Shijie, et al.
Publicado: (2025)
Towards Agentic Recommender Systems in the Era of Multimodal Large Language Models
por: Huang, Chengkai, et al.
Publicado: (2025)
por: Huang, Chengkai, et al.
Publicado: (2025)
LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models
por: Man, Hieu, et al.
Publicado: (2025)
por: Man, Hieu, et al.
Publicado: (2025)
X-Reflect: Cross-Reflection Prompting for Multimodal Recommendation
por: Lyu, Hanjia, et al.
Publicado: (2024)
por: Lyu, Hanjia, et al.
Publicado: (2024)
A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality
por: Elmoghany, Mohamed, et al.
Publicado: (2025)
por: Elmoghany, Mohamed, et al.
Publicado: (2025)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
por: Mukherjee, Subhojyoti, et al.
Publicado: (2025)
por: Mukherjee, Subhojyoti, et al.
Publicado: (2025)
A Personalized Conversational Benchmark: Towards Simulating Personalized Conversations
por: Li, Li, et al.
Publicado: (2025)
por: Li, Li, et al.
Publicado: (2025)
Large Generative Graph Models
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions
por: Elmoghany, Mohamed, et al.
Publicado: (2026)
por: Elmoghany, Mohamed, et al.
Publicado: (2026)
VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding
por: Chen, Jian, et al.
Publicado: (2025)
por: Chen, Jian, et al.
Publicado: (2025)
SlimLM: An Efficient Small Language Model for On-Device Document Assistance
por: Pham, Thang M., et al.
Publicado: (2024)
por: Pham, Thang M., et al.
Publicado: (2024)
Identifying Speakers in Dialogue Transcripts: A Text-based Approach Using Pretrained Language Models
por: Nguyen, Minh, et al.
Publicado: (2024)
por: Nguyen, Minh, et al.
Publicado: (2024)
Knowledge-Aware Query Expansion with Large Language Models for Textual and Relational Retrieval
por: Xia, Yu, et al.
Publicado: (2024)
por: Xia, Yu, et al.
Publicado: (2024)
GLEMOS: Benchmark for Instantaneous Graph Learning Model Selection
por: Park, Namyong, et al.
Publicado: (2024)
por: Park, Namyong, et al.
Publicado: (2024)
GRS-QA -- Graph Reasoning-Structured Question Answering Dataset
por: Pahilajani, Anish, et al.
Publicado: (2024)
por: Pahilajani, Anish, et al.
Publicado: (2024)
Personalized Graph-Based Retrieval for Large Language Models
por: Au, Steven, et al.
Publicado: (2025)
por: Au, Steven, et al.
Publicado: (2025)
Interactive Visualization Recommendation with Hier-SUCB
por: Hu, Songwen, et al.
Publicado: (2025)
por: Hu, Songwen, et al.
Publicado: (2025)
VipAct: Visual-Perception Enhancement via Specialized VLM Agent Collaboration and Tool-use
por: Zhang, Zhehao, et al.
Publicado: (2024)
por: Zhang, Zhehao, et al.
Publicado: (2024)
ChartCitor: Multi-Agent Framework for Fine-Grained Chart Visual Attribution
por: Goswami, Kanika, et al.
Publicado: (2025)
por: Goswami, Kanika, et al.
Publicado: (2025)
PlotEdit: Natural Language-Driven Accessible Chart Editing in PDFs via Multimodal LLM Agents
por: Goswami, Kanika, et al.
Publicado: (2025)
por: Goswami, Kanika, et al.
Publicado: (2025)
PlotGen: Multi-Agent LLM-based Scientific Data Visualization via Multimodal Feedback
por: Goswami, Kanika, et al.
Publicado: (2025)
por: Goswami, Kanika, et al.
Publicado: (2025)
Ejemplares similares
-
From Selection to Generation: A Survey of LLM-based Active Learning
por: Xia, Yu, et al.
Publicado: (2025) -
Bias and Fairness in Large Language Models: A Survey
por: Gallegos, Isabel O., et al.
Publicado: (2023) -
MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces
por: Luera, Reuben A., et al.
Publicado: (2025) -
Reasoning-Based Personalized Generation for Users with Sparse Data
por: Ni, Bo, et al.
Publicado: (2026) -
Active Learning for Direct Preference Optimization
por: Kveton, Branislav, et al.
Publicado: (2025)