Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Zhou, Zhou, Bowen, Wang, Qi, Feng, Shuwen, Xiao, Jingyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
par: Zhou, Bowen, et autres
Publié: (2026)
par: Zhou, Bowen, et autres
Publié: (2026)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026)
par: Sha, Lin, et autres
Publié: (2026)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
par: Li, Jiaao, et autres
Publié: (2025)
par: Li, Jiaao, et autres
Publié: (2025)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
par: Zhou, Yuqi, et autres
Publié: (2025)
par: Zhou, Yuqi, et autres
Publié: (2025)
Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions
par: Szczepanski, Michal, et autres
Publié: (2025)
par: Szczepanski, Michal, et autres
Publié: (2025)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
par: Ju, Shaobo, et autres
Publié: (2026)
par: Ju, Shaobo, et autres
Publié: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
par: Li, Ao, et autres
Publié: (2025)
par: Li, Ao, et autres
Publié: (2025)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
par: Wang, Xiaoce, et autres
Publié: (2026)
par: Wang, Xiaoce, et autres
Publié: (2026)
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
par: Lu, Zhuqiang, et autres
Publié: (2024)
par: Lu, Zhuqiang, et autres
Publié: (2024)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
par: Sun, Yuchen, et autres
Publié: (2025)
par: Sun, Yuchen, et autres
Publié: (2025)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
par: Zhao, Heng, et autres
Publié: (2026)
par: Zhao, Heng, et autres
Publié: (2026)
Adversarially-Refined VQ-GAN with Dense Motion Tokenization for Spatio-Temporal Heatmaps
par: Maldonado, Gabriel, et autres
Publié: (2025)
par: Maldonado, Gabriel, et autres
Publié: (2025)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
par: Han, Yuhang, et autres
Publié: (2026)
par: Han, Yuhang, et autres
Publié: (2026)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026)
par: Li, Geng, et autres
Publié: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
par: Jin, Xinqi, et autres
Publié: (2025)
par: Jin, Xinqi, et autres
Publié: (2025)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
par: Gao, Hong, et autres
Publié: (2025)
par: Gao, Hong, et autres
Publié: (2025)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
par: Hyun, Jeongseok, et autres
Publié: (2025)
par: Hyun, Jeongseok, et autres
Publié: (2025)
Human-Centric Video Anomaly Detection Through Spatio-Temporal Pose Tokenization and Transformer
par: Noghre, Ghazal Alinezhad, et autres
Publié: (2024)
par: Noghre, Ghazal Alinezhad, et autres
Publié: (2024)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts
par: Wu, Peng, et autres
Publié: (2024)
par: Wu, Peng, et autres
Publié: (2024)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
par: Ye, Xianhang, et autres
Publié: (2025)
par: Ye, Xianhang, et autres
Publié: (2025)
4D-GSW: Kinematic-Aware Spatio-Temporal Consistent Watermarking for 4D Gaussian Splatting
par: Zhou, Sifan, et autres
Publié: (2026)
par: Zhou, Sifan, et autres
Publié: (2026)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
par: Li, Yuankai, et autres
Publié: (2026)
par: Li, Yuankai, et autres
Publié: (2026)
Temporal Aware Pruning for Efficient Diffusion-based Video Generation
par: Li, Sheng, et autres
Publié: (2026)
par: Li, Sheng, et autres
Publié: (2026)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
par: Xu, Qi'ao, et autres
Publié: (2025)
par: Xu, Qi'ao, et autres
Publié: (2025)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
par: He, Jialuo, et autres
Publié: (2026)
par: He, Jialuo, et autres
Publié: (2026)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
par: Liu, Ziyan, et autres
Publié: (2025)
par: Liu, Ziyan, et autres
Publié: (2025)
Grounding-Aware Token Pruning: Recovering from Drastic Performance Drops in Visual Grounding Caused by Pruning
par: Chien, Tzu-Chun, et autres
Publié: (2025)
par: Chien, Tzu-Chun, et autres
Publié: (2025)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025)
par: Zhang, Qizhe, et autres
Publié: (2025)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
par: Chi, Tien-Yu, et autres
Publié: (2025)
par: Chi, Tien-Yu, et autres
Publié: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
par: Lee, Dong-Jae, et autres
Publié: (2026)
par: Lee, Dong-Jae, et autres
Publié: (2026)
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
par: Jiang, Yutao, et autres
Publié: (2025)
par: Jiang, Yutao, et autres
Publié: (2025)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
par: Huang, YiJie, et autres
Publié: (2026)
par: Huang, YiJie, et autres
Publié: (2026)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
par: Li, Daiqiang, et autres
Publié: (2026)
par: Li, Daiqiang, et autres
Publié: (2026)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
par: Wu, Qianhui, et autres
Publié: (2025)
par: Wu, Qianhui, et autres
Publié: (2025)
History-Aware Reasoning for GUI Agents
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
Documents similaires
-
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
par: Zhou, Bowen, et autres
Publié: (2026) -
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026) -
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
par: Li, Jiaao, et autres
Publié: (2025) -
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
par: Zhou, Yuqi, et autres
Publié: (2025) -
Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions
par: Szczepanski, Michal, et autres
Publié: (2025)