ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xiaoce, Zhang, Guibin, Li, Junzhe, Tu, Jinzhe, Li, Chun, Li, Ming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
par: Li, Yuankai, et autres
Publié: (2026)
par: Li, Yuankai, et autres
Publié: (2026)
LaMMA-P: Generalizable Multi-Agent Long-Horizon Task Allocation and Planning with LM-Driven PDDL Planner
par: Zhang, Xiaopan, et autres
Publié: (2024)
par: Zhang, Xiaopan, et autres
Publié: (2024)
CommCP: Efficient Multi-Agent Coordination via LLM-Based Communication with Conformal Prediction
par: Zhang, Xiaopan, et autres
Publié: (2026)
par: Zhang, Xiaopan, et autres
Publié: (2026)
Picking the Right Specialist: Attentive Neural Process-based Selection of Task-Specialized Models as Tools for Agentic Healthcare Systems
par: Saha, Pramit, et autres
Publié: (2026)
par: Saha, Pramit, et autres
Publié: (2026)
Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent System
par: Su, Haoyang, et autres
Publié: (2024)
par: Su, Haoyang, et autres
Publié: (2024)
Spatio-Temporal Graph Dual-Attention Network for Multi-Agent Prediction and Tracking
par: Li, Jiachen, et autres
Publié: (2021)
par: Li, Jiachen, et autres
Publié: (2021)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
par: Song, Mingyang, et autres
Publié: (2026)
par: Song, Mingyang, et autres
Publié: (2026)
ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows
par: Pellicer, Alvaro Lopez, et autres
Publié: (2026)
par: Pellicer, Alvaro Lopez, et autres
Publié: (2026)
RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration
par: Chen, Xiuyuan, et autres
Publié: (2025)
par: Chen, Xiuyuan, et autres
Publié: (2025)
CMP: Cooperative Motion Prediction with Multi-Agent Communication
par: Wang, Zehao, et autres
Publié: (2024)
par: Wang, Zehao, et autres
Publié: (2024)
FEAT: A Multi-Agent Forensic AI System with Domain-Adapted Large Language Model for Automated Cause-of-Death Analysis
par: Shen, Chen, et autres
Publié: (2025)
par: Shen, Chen, et autres
Publié: (2025)
LongVideoAgent: Multi-Agent Reasoning with Long Videos
par: Liu, Runtao, et autres
Publié: (2025)
par: Liu, Runtao, et autres
Publié: (2025)
MATRIX: Multi-Agent Trajectory Generation with Diverse Contexts
par: Xu, Zhuo, et autres
Publié: (2024)
par: Xu, Zhuo, et autres
Publié: (2024)
UniOcc: A Unified Benchmark for Occupancy Forecasting and Prediction in Autonomous Driving
par: Wang, Yuping, et autres
Publié: (2025)
par: Wang, Yuping, et autres
Publié: (2025)
Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
par: Wu, Shengguang, et autres
Publié: (2025)
par: Wu, Shengguang, et autres
Publié: (2025)
Multi-Agent Dynamic Relational Reasoning for Social Robot Navigation
par: Li, Jiachen, et autres
Publié: (2024)
par: Li, Jiachen, et autres
Publié: (2024)
CaPo: Cooperative Plan Optimization for Efficient Embodied Multi-Agent Cooperation
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
GenCellAgent: Generalizable, Training-Free Cellular Image Segmentation via Large Language Model Agents
par: Yu, Xi, et autres
Publié: (2025)
par: Yu, Xi, et autres
Publié: (2025)
A Multi-Agent System Enables Versatile Information Extraction from the Chemical Literature
par: Chen, Yufan, et autres
Publié: (2025)
par: Chen, Yufan, et autres
Publié: (2025)
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
par: Cai, Shaofei, et autres
Publié: (2025)
par: Cai, Shaofei, et autres
Publié: (2025)
See it. Say it. Sorted: Agentic System for Compositional Diagram Generation
par: Zhang, Hantao, et autres
Publié: (2025)
par: Zhang, Hantao, et autres
Publié: (2025)
MedChat: A Multi-Agent Framework for Multimodal Diagnosis with Large Language Models
par: Liu, Philip R., et autres
Publié: (2025)
par: Liu, Philip R., et autres
Publié: (2025)
Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers
par: Dai, Pengyu, et autres
Publié: (2026)
par: Dai, Pengyu, et autres
Publié: (2026)
COMBO: Compositional World Models for Embodied Multi-Agent Cooperation
par: Zhang, Hongxin, et autres
Publié: (2024)
par: Zhang, Hongxin, et autres
Publié: (2024)
StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration
par: Hu, Panwen, et autres
Publié: (2024)
par: Hu, Panwen, et autres
Publié: (2024)
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
par: Lu, Quanfeng, et autres
Publié: (2025)
par: Lu, Quanfeng, et autres
Publié: (2025)
EmboTeam: Grounding LLM Reasoning into Reactive Behavior Trees via PDDL for Embodied Multi-Robot Collaboration
par: Zeng, Haishan, et autres
Publié: (2026)
par: Zeng, Haishan, et autres
Publié: (2026)
VLM-Guided Iterative Refinement for Surgical Image Segmentation with Foundation Models
par: Lou, Ange, et autres
Publié: (2026)
par: Lou, Ange, et autres
Publié: (2026)
From Perception to Action: Spatial AI Agents and World Models
par: Felicia, Gloria, et autres
Publié: (2026)
par: Felicia, Gloria, et autres
Publié: (2026)
Agentic-J: An AI Agent for Biological Microscopy Image Analysis
par: Johanns, Lukas, et autres
Publié: (2026)
par: Johanns, Lukas, et autres
Publié: (2026)
MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling
par: Wang, Qian, et autres
Publié: (2025)
par: Wang, Qian, et autres
Publié: (2025)
An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing
par: Zuo, Lianrui, et autres
Publié: (2026)
par: Zuo, Lianrui, et autres
Publié: (2026)
GPS-MTM: Capturing Pattern of Normalcy in GPS-Trajectories with self-supervised learning
par: Garg, Umang, et autres
Publié: (2025)
par: Garg, Umang, et autres
Publié: (2025)
Visual Reasoning Agent: Robust Vision Systems in Remote Sensing via Inference-Time Scaling
par: Yu, Chung-En Johnny, et autres
Publié: (2025)
par: Yu, Chung-En Johnny, et autres
Publié: (2025)
StarCraftImage: A Dataset For Prototyping Spatial Reasoning Methods For Multi-Agent Environments
par: Kulinski, Sean, et autres
Publié: (2024)
par: Kulinski, Sean, et autres
Publié: (2024)
Agent Planning with World Knowledge Model
par: Qiao, Shuofei, et autres
Publié: (2024)
par: Qiao, Shuofei, et autres
Publié: (2024)
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
par: Wang, Zehao, et autres
Publié: (2026)
par: Wang, Zehao, et autres
Publié: (2026)
InnoGym: Benchmarking the Innovation Potential of AI Agents
par: Zhang, Jintian, et autres
Publié: (2025)
par: Zhang, Jintian, et autres
Publié: (2025)
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Documents similaires
-
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
par: Li, Yuankai, et autres
Publié: (2026) -
LaMMA-P: Generalizable Multi-Agent Long-Horizon Task Allocation and Planning with LM-Driven PDDL Planner
par: Zhang, Xiaopan, et autres
Publié: (2024) -
CommCP: Efficient Multi-Agent Coordination via LLM-Based Communication with Conformal Prediction
par: Zhang, Xiaopan, et autres
Publié: (2026) -
Picking the Right Specialist: Attentive Neural Process-based Selection of Task-Specialized Models as Tools for Agentic Healthcare Systems
par: Saha, Pramit, et autres
Publié: (2026) -
Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent System
par: Su, Haoyang, et autres
Publié: (2024)