Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Hancheng, Yu, Chong, Ye, Peng, Xia, Renqiu, Tang, Yansong, Lu, Jiwen, Chen, Tao, Zhang, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
par: Cao, Jianjian, et autres
Publié: (2024)
par: Cao, Jianjian, et autres
Publié: (2024)
StructChart: On the Schema, Metric, and Augmentation for Visual Chart Understanding
par: Xia, Renqiu, et autres
Publié: (2023)
par: Xia, Renqiu, et autres
Publié: (2023)
Training-Free Adaptive Diffusion with Bounded Difference Approximation Strategy
par: Ye, Hancheng, et autres
Publié: (2024)
par: Ye, Hancheng, et autres
Publié: (2024)
Enhanced Sparsification via Stimulative Training
par: Tang, Shengji, et autres
Publié: (2024)
par: Tang, Shengji, et autres
Publié: (2024)
ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning
par: Xia, Renqiu, et autres
Publié: (2024)
par: Xia, Renqiu, et autres
Publié: (2024)
VoCo-LLaMA: Towards Vision Compression with Large Language Models
par: Ye, Xubing, et autres
Publié: (2024)
par: Ye, Xubing, et autres
Publié: (2024)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
Q-VLM: Post-training Quantization for Large Vision-Language Models
par: Wang, Changyuan, et autres
Publié: (2024)
par: Wang, Changyuan, et autres
Publié: (2024)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
par: Xia, Renqiu, et autres
Publié: (2024)
par: Xia, Renqiu, et autres
Publié: (2024)
SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations
par: Yan, Xiangchao, et autres
Publié: (2023)
par: Yan, Xiangchao, et autres
Publié: (2023)
On the Evaluation and Refinement of Vision-Language Instruction Tuning Datasets
par: Liao, Ning, et autres
Publié: (2023)
par: Liao, Ning, et autres
Publié: (2023)
BridgeNet: Comprehensive and Effective Feature Interactions via Bridge Feature for Multi-task Dense Predictions
par: Zhang, Jingdong, et autres
Publié: (2023)
par: Zhang, Jingdong, et autres
Publié: (2023)
GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation
par: Zhang, Chubin, et autres
Publié: (2024)
par: Zhang, Chubin, et autres
Publié: (2024)
SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
S2HPruner: Soft-to-Hard Distillation Bridges the Discretization Gap in Pruning
par: Lin, Weihao, et autres
Publié: (2024)
par: Lin, Weihao, et autres
Publié: (2024)
JPEG Compliant Compression for Both Human and Machine, A Report
par: Ye, Linfeng
Publié: (2025)
par: Ye, Linfeng
Publié: (2025)
ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation
par: Lu, Guanxing, et autres
Publié: (2024)
par: Lu, Guanxing, et autres
Publié: (2024)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
par: Ye, Xubing, et autres
Publié: (2024)
par: Ye, Xubing, et autres
Publié: (2024)
CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos
par: Zhang, Chubin, et autres
Publié: (2026)
par: Zhang, Chubin, et autres
Publié: (2026)
Towards Accurate Post-training Quantization for Diffusion Models
par: Wang, Changyuan, et autres
Publié: (2023)
par: Wang, Changyuan, et autres
Publié: (2023)
FlowIE: Efficient Image Enhancement via Rectified Flow
par: Zhu, Yixuan, et autres
Publié: (2024)
par: Zhu, Yixuan, et autres
Publié: (2024)
DPMesh: Exploiting Diffusion Prior for Occluded Human Mesh Recovery
par: Zhu, Yixuan, et autres
Publié: (2024)
par: Zhu, Yixuan, et autres
Publié: (2024)
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
par: Zhu, Deyi, et autres
Publié: (2026)
par: Zhu, Deyi, et autres
Publié: (2026)
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
par: Fang, Zhengyao, et autres
Publié: (2026)
par: Fang, Zhengyao, et autres
Publié: (2026)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
par: Zou, Dongyun, et autres
Publié: (2026)
par: Zou, Dongyun, et autres
Publié: (2026)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
par: Zeng, Fanhu, et autres
Publié: (2025)
par: Zeng, Fanhu, et autres
Publié: (2025)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
par: Dong, Jiajun, et autres
Publié: (2025)
par: Dong, Jiajun, et autres
Publié: (2025)
VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer
par: Tang, Xikai, et autres
Publié: (2025)
par: Tang, Xikai, et autres
Publié: (2025)
LOGO: A Long-Form Video Dataset for Group Action Quality Assessment
par: Zhang, Shiyi, et autres
Publié: (2024)
par: Zhang, Shiyi, et autres
Publié: (2024)
Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation
par: Bai, Sule, et autres
Publié: (2024)
par: Bai, Sule, et autres
Publié: (2024)
Learning Dual-Level Deformable Implicit Representation for Real-World Scale Arbitrary Super-Resolution
par: Li, Zhiheng, et autres
Publié: (2024)
par: Li, Zhiheng, et autres
Publié: (2024)
Narrative Action Evaluation with Prompt-Guided Multimodal Interaction
par: Zhang, Shiyi, et autres
Publié: (2024)
par: Zhang, Shiyi, et autres
Publié: (2024)
DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving
par: Jia, Xiaosong, et autres
Publié: (2025)
par: Jia, Xiaosong, et autres
Publié: (2025)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
par: Su, Zunhai, et autres
Publié: (2026)
par: Su, Zunhai, et autres
Publié: (2026)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
par: Su, Zunhai, et autres
Publié: (2026)
par: Su, Zunhai, et autres
Publié: (2026)
Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Test-time Sparsity for Extreme Fast Action Diffusion
par: Ji, Kangye, et autres
Publié: (2026)
par: Ji, Kangye, et autres
Publié: (2026)
Vision Transformers with Self-Distilled Registers
par: Chen, Yinjie, et autres
Publié: (2025)
par: Chen, Yinjie, et autres
Publié: (2025)
The Inductive Bottleneck: Data-Driven Emergence of Representational Sparsity in Vision Transformers
par: Awadhiya, Kanishk
Publié: (2025)
par: Awadhiya, Kanishk
Publié: (2025)
On the Provable Importance of Gradients for Language-Assisted Image Clustering
par: Peng, Bo, et autres
Publié: (2025)
par: Peng, Bo, et autres
Publié: (2025)
Documents similaires
-
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
par: Cao, Jianjian, et autres
Publié: (2024) -
StructChart: On the Schema, Metric, and Augmentation for Visual Chart Understanding
par: Xia, Renqiu, et autres
Publié: (2023) -
Training-Free Adaptive Diffusion with Bounded Difference Approximation Strategy
par: Ye, Hancheng, et autres
Publié: (2024) -
Enhanced Sparsification via Stimulative Training
par: Tang, Shengji, et autres
Publié: (2024) -
ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning
par: Xia, Renqiu, et autres
Publié: (2024)