PaceVGGT: Pre-Alternating-Attention Token Pruning for Visual Geometry Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Haotang, Qi, Zhenyu, Wang, Shaohan Henry, Peng, Kebin, Wang, Zi, Guo, Qing, He, Sen, Yang, Huanrui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MSSSeg: Learning Multi-Scale Structural Complexity for Self-Supervised Segmentation
par: Li, Haotang, et autres
Publié: (2025)
par: Li, Haotang, et autres
Publié: (2025)
PhysDepth: Plug-and-Play Physical Refinement for Monocular Depth Estimation in Challenging Environments
par: Peng, Kebin, et autres
Publié: (2024)
par: Peng, Kebin, et autres
Publié: (2024)
Harnessing Large Language Model for Virtual Reality Exploration Testing: A Case Study
par: Qi, Zhenyu, et autres
Publié: (2025)
par: Qi, Zhenyu, et autres
Publié: (2025)
UWB-PostureGuard: A Privacy-Preserving RF Sensing System for Continuous Ergonomic Sitting Posture Monitoring
par: Li, Haotang, et autres
Publié: (2025)
par: Li, Haotang, et autres
Publié: (2025)
UWB-Fat: Non-Intrusive Body Fat Measurement Using Commodity Ultra-Wideband Radar
par: Li, Haotang, et autres
Publié: (2026)
par: Li, Haotang, et autres
Publié: (2026)
TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention
par: Huang, David, et autres
Publié: (2026)
par: Huang, David, et autres
Publié: (2026)
VGGT: Visual Geometry Grounded Transformer
par: Wang, Jianyuan, et autres
Publié: (2025)
par: Wang, Jianyuan, et autres
Publié: (2025)
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
par: Sun, Xiangyu, et autres
Publié: (2026)
par: Sun, Xiangyu, et autres
Publié: (2026)
FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention
par: Wang, Zipeng, et autres
Publié: (2025)
par: Wang, Zipeng, et autres
Publié: (2025)
Isolating Recurring Execution-Dependent Abnormal Patterns on NISQ Quantum Devices
par: Qi, Zhenyu, et autres
Publié: (2026)
par: Qi, Zhenyu, et autres
Publié: (2026)
HD-VGGT: High-Resolution Visual Geometry Transformer
par: Chen, Tianrun, et autres
Publié: (2026)
par: Chen, Tianrun, et autres
Publié: (2026)
Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer
par: Deng, Tianchen, et autres
Publié: (2025)
par: Deng, Tianchen, et autres
Publié: (2025)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
par: Peng, Haosong, et autres
Publié: (2025)
par: Peng, Haosong, et autres
Publié: (2025)
LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
par: Shu, Zhijian, et autres
Publié: (2025)
par: Shu, Zhijian, et autres
Publié: (2025)
InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
par: Yuan, Shuai, et autres
Publié: (2026)
par: Yuan, Shuai, et autres
Publié: (2026)
FastVGGT: Training-Free Acceleration of Visual Geometry Transformer
par: Shen, You, et autres
Publié: (2025)
par: Shen, You, et autres
Publié: (2025)
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction
par: Hu, Yu, et autres
Publié: (2025)
par: Hu, Yu, et autres
Publié: (2025)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
par: Wu, Xianfeng, et autres
Publié: (2025)
par: Wu, Xianfeng, et autres
Publié: (2025)
Multi-LLM Orchestration for High-Quality Code Generation: Exploiting Complementary Model Strengths
par: Chen, Huashan, et autres
Publié: (2025)
par: Chen, Huashan, et autres
Publié: (2025)
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
par: Liu, Xuanyi, et autres
Publié: (2026)
par: Liu, Xuanyi, et autres
Publié: (2026)
StereoVGGT: A Training-Free Visual Geometry Transformer for Stereo Vision
par: Chen, Ziyang, et autres
Publié: (2026)
par: Chen, Ziyang, et autres
Publié: (2026)
Still Camouflage, Moving Illusion: View-Induced Trajectory Manipulation in Autonomous Driving
par: Ju, Shuo, et autres
Publié: (2026)
par: Ju, Shuo, et autres
Publié: (2026)
Zero-TPrune: Zero-Shot Token Pruning through Leveraging of the Attention Graph in Pre-Trained Transformers
par: Wang, Hongjie, et autres
Publié: (2023)
par: Wang, Hongjie, et autres
Publié: (2023)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
par: Zhang, Qizhe, et autres
Publié: (2024)
par: Zhang, Qizhe, et autres
Publié: (2024)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
par: Jin, Xinqi, et autres
Publié: (2025)
par: Jin, Xinqi, et autres
Publié: (2025)
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
par: Lee, Jungho, et autres
Publié: (2025)
par: Lee, Jungho, et autres
Publié: (2025)
DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving
par: Jia, Xiaosong, et autres
Publié: (2025)
par: Jia, Xiaosong, et autres
Publié: (2025)
AVGGT: Rethinking Global Attention for Accelerating VGGT
par: Sun, Xianbing, et autres
Publié: (2025)
par: Sun, Xianbing, et autres
Publié: (2025)
VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection
par: Cao, Yang, et autres
Publié: (2026)
par: Cao, Yang, et autres
Publié: (2026)
Unveiling Code Clone Patterns in Open Source VR Software: An Empirical Study
par: Chen, Huashan, et autres
Publié: (2025)
par: Chen, Huashan, et autres
Publié: (2025)
Geometry-Guided 3D Visual Token Pruning for Video-Language Models
par: Li, Han, et autres
Publié: (2026)
par: Li, Han, et autres
Publié: (2026)
FrameVGGT: Geometry-Aligned Frame-Level Memory for Bounded Streaming VGGT
par: Xu, Zhisong, et autres
Publié: (2026)
par: Xu, Zhisong, et autres
Publié: (2026)
GPA-VGGT:Adapting VGGT to Large Scale Localization by Self-Supervised Learning with Geometry and Physics Aware Loss
par: Xu, Yangfan, et autres
Publié: (2026)
par: Xu, Yangfan, et autres
Publié: (2026)
HTTM: Head-wise Temporal Token Merging for Faster VGGT
par: Wang, Weitian, et autres
Publié: (2025)
par: Wang, Weitian, et autres
Publié: (2025)
Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory
par: Deng, Tianchen, et autres
Publié: (2026)
par: Deng, Tianchen, et autres
Publié: (2026)
Context-Aware Token Pruning and Discriminative Selective Attention for Transformer Tracking
par: Kugarajeevan, Janani, et autres
Publié: (2025)
par: Kugarajeevan, Janani, et autres
Publié: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
par: Liu, Jizhihui, et autres
Publié: (2025)
par: Liu, Jizhihui, et autres
Publié: (2025)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
par: Zhang, Weichen, et autres
Publié: (2025)
par: Zhang, Weichen, et autres
Publié: (2025)
SmartTrim: Adaptive Tokens and Attention Pruning for Efficient Vision-Language Models
par: Wang, Zekun, et autres
Publié: (2023)
par: Wang, Zekun, et autres
Publié: (2023)
VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
par: Gao, Yulu, et autres
Publié: (2026)
par: Gao, Yulu, et autres
Publié: (2026)
Documents similaires
-
MSSSeg: Learning Multi-Scale Structural Complexity for Self-Supervised Segmentation
par: Li, Haotang, et autres
Publié: (2025) -
PhysDepth: Plug-and-Play Physical Refinement for Monocular Depth Estimation in Challenging Environments
par: Peng, Kebin, et autres
Publié: (2024) -
Harnessing Large Language Model for Virtual Reality Exploration Testing: A Case Study
par: Qi, Zhenyu, et autres
Publié: (2025) -
UWB-PostureGuard: A Privacy-Preserving RF Sensing System for Continuous Ergonomic Sitting Posture Monitoring
par: Li, Haotang, et autres
Publié: (2025) -
UWB-Fat: Non-Intrusive Body Fat Measurement Using Commodity Ultra-Wideband Radar
par: Li, Haotang, et autres
Publié: (2026)