Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Zhou, Zhou, Bowen, Wang, Qi, Feng, Shuwen, Xiao, Jingyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
di: Sha, Lin, et al.
Pubblicazione: (2026)
di: Sha, Lin, et al.
Pubblicazione: (2026)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
di: Li, Jiaao, et al.
Pubblicazione: (2025)
di: Li, Jiaao, et al.
Pubblicazione: (2025)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions
di: Szczepanski, Michal, et al.
Pubblicazione: (2025)
di: Szczepanski, Michal, et al.
Pubblicazione: (2025)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
di: Wang, Xiaoce, et al.
Pubblicazione: (2026)
di: Wang, Xiaoce, et al.
Pubblicazione: (2026)
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
di: Lu, Zhuqiang, et al.
Pubblicazione: (2024)
di: Lu, Zhuqiang, et al.
Pubblicazione: (2024)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
di: Zhao, Heng, et al.
Pubblicazione: (2026)
di: Zhao, Heng, et al.
Pubblicazione: (2026)
Adversarially-Refined VQ-GAN with Dense Motion Tokenization for Spatio-Temporal Heatmaps
di: Maldonado, Gabriel, et al.
Pubblicazione: (2025)
di: Maldonado, Gabriel, et al.
Pubblicazione: (2025)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
di: Han, Yuhang, et al.
Pubblicazione: (2026)
di: Han, Yuhang, et al.
Pubblicazione: (2026)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
di: Li, Geng, et al.
Pubblicazione: (2026)
di: Li, Geng, et al.
Pubblicazione: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
di: Gao, Hong, et al.
Pubblicazione: (2025)
di: Gao, Hong, et al.
Pubblicazione: (2025)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
di: Hyun, Jeongseok, et al.
Pubblicazione: (2025)
di: Hyun, Jeongseok, et al.
Pubblicazione: (2025)
Human-Centric Video Anomaly Detection Through Spatio-Temporal Pose Tokenization and Transformer
di: Noghre, Ghazal Alinezhad, et al.
Pubblicazione: (2024)
di: Noghre, Ghazal Alinezhad, et al.
Pubblicazione: (2024)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
di: Wang, Xiao, et al.
Pubblicazione: (2026)
di: Wang, Xiao, et al.
Pubblicazione: (2026)
Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts
di: Wu, Peng, et al.
Pubblicazione: (2024)
di: Wu, Peng, et al.
Pubblicazione: (2024)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
4D-GSW: Kinematic-Aware Spatio-Temporal Consistent Watermarking for 4D Gaussian Splatting
di: Zhou, Sifan, et al.
Pubblicazione: (2026)
di: Zhou, Sifan, et al.
Pubblicazione: (2026)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
di: Li, Yuankai, et al.
Pubblicazione: (2026)
di: Li, Yuankai, et al.
Pubblicazione: (2026)
Temporal Aware Pruning for Efficient Diffusion-based Video Generation
di: Li, Sheng, et al.
Pubblicazione: (2026)
di: Li, Sheng, et al.
Pubblicazione: (2026)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
Grounding-Aware Token Pruning: Recovering from Drastic Performance Drops in Visual Grounding Caused by Pruning
di: Chien, Tzu-Chun, et al.
Pubblicazione: (2025)
di: Chien, Tzu-Chun, et al.
Pubblicazione: (2025)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
di: Zhang, Qizhe, et al.
Pubblicazione: (2025)
di: Zhang, Qizhe, et al.
Pubblicazione: (2025)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
di: Chi, Tien-Yu, et al.
Pubblicazione: (2025)
di: Chi, Tien-Yu, et al.
Pubblicazione: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
di: Jiang, Yutao, et al.
Pubblicazione: (2025)
di: Jiang, Yutao, et al.
Pubblicazione: (2025)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
di: Huang, YiJie, et al.
Pubblicazione: (2026)
di: Huang, YiJie, et al.
Pubblicazione: (2026)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
di: Li, Daiqiang, et al.
Pubblicazione: (2026)
di: Li, Daiqiang, et al.
Pubblicazione: (2026)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
di: Arif, Kazi Hasan Ibn, et al.
Pubblicazione: (2024)
di: Arif, Kazi Hasan Ibn, et al.
Pubblicazione: (2024)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
History-Aware Reasoning for GUI Agents
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
di: Zhou, Bowen, et al.
Pubblicazione: (2026) -
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
di: Sha, Lin, et al.
Pubblicazione: (2026) -
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
di: Li, Jiaao, et al.
Pubblicazione: (2025) -
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
di: Zhou, Yuqi, et al.
Pubblicazione: (2025) -
Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions
di: Szczepanski, Michal, et al.
Pubblicazione: (2025)