Slicing Vision Transformer for Flexible Inference
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yitian, Coskun, Huseyin, Ma, Xu, Wang, Huan, Ma, Ke, Xi, Chen, Hu, Derek Hao, Fu, Yun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Accessing Vision Foundation Models via ImageNet-1K
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
MTS-DMAE: Dual-Masked Autoencoder for Unsupervised Multivariate Time Series Representation Learning
by: Xu, Yi, et al.
Published: (2025)
by: Xu, Yi, et al.
Published: (2025)
Don't Judge by the Look: Towards Motion Coherent Video Representation
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings
by: Peng, Yunxiang, et al.
Published: (2026)
by: Peng, Yunxiang, et al.
Published: (2026)
Attention Transfer Is Not Universally Effective for Vision Transformers
by: Qin, Huaiyuan, et al.
Published: (2026)
by: Qin, Huaiyuan, et al.
Published: (2026)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
by: Zhang, Haoyue, et al.
Published: (2025)
by: Zhang, Haoyue, et al.
Published: (2025)
AsCAN: Asymmetric Convolution-Attention Networks for Efficient Recognition and Generation
by: Kag, Anil, et al.
Published: (2024)
by: Kag, Anil, et al.
Published: (2024)
Rotary Position Embedding for Vision Transformer
by: Heo, Byeongho, et al.
Published: (2024)
by: Heo, Byeongho, et al.
Published: (2024)
Hyperspectral Unmixing Under Endmember Variability: A Variational Inference Framework
by: Li, Yuening, et al.
Published: (2024)
by: Li, Yuening, et al.
Published: (2024)
ReMem: Mutual Information-Aware Fine-tuning of Pretrained Vision Transformers for Effective Knowledge Distillation
by: Dong, Chengyu, et al.
Published: (2025)
by: Dong, Chengyu, et al.
Published: (2025)
Using MLIR Transform to Design Sliced Convolution Algorithm
by: Ferrari, Victor, et al.
Published: (2025)
by: Ferrari, Victor, et al.
Published: (2025)
Oscillation-Reduced MXFP4 Training for Vision Transformers
by: Chen, Yuxiang, et al.
Published: (2025)
by: Chen, Yuxiang, et al.
Published: (2025)
Stable Vision Concept Transformers for Medical Diagnosis
by: Hu, Lijie, et al.
Published: (2025)
by: Hu, Lijie, et al.
Published: (2025)
SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device
by: Wu, Yushu, et al.
Published: (2024)
by: Wu, Yushu, et al.
Published: (2024)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
by: Ma, Xu, et al.
Published: (2026)
by: Ma, Xu, et al.
Published: (2026)
CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models
by: Wang, Qinsi, et al.
Published: (2025)
by: Wang, Qinsi, et al.
Published: (2025)
A Study on Inference Latency for Vision Transformers on Mobile Devices
by: Li, Zhuojin, et al.
Published: (2025)
by: Li, Zhuojin, et al.
Published: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
by: Zhang, Mingyuan, et al.
Published: (2025)
by: Zhang, Mingyuan, et al.
Published: (2025)
ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers
by: Hsu, Chih-Chung, et al.
Published: (2026)
by: Hsu, Chih-Chung, et al.
Published: (2026)
A Flexible 2.5D Medical Image Segmentation Approach with In-Slice and Cross-Slice Attention
by: Kumar, Amarjeet, et al.
Published: (2024)
by: Kumar, Amarjeet, et al.
Published: (2024)
Ask the Expert: Collaborative Inference for Vision Transformers with Near-Edge Accelerators
by: Liu, Hao, et al.
Published: (2026)
by: Liu, Hao, et al.
Published: (2026)
Max-Sliced Wasserstein Distance and its use for GANs
by: Deshpande, Ishan, et al.
Published: (2019)
by: Deshpande, Ishan, et al.
Published: (2019)
Protego: Detecting Adversarial Examples for Vision Transformers via Intrinsic Capabilities
by: Wu, Jialin, et al.
Published: (2025)
by: Wu, Jialin, et al.
Published: (2025)
SliceVision-F2I: A Synthetic Feature-to-Image Dataset for Visual Pattern Representation on Network Slices
by: Rafi, Md. Abid Hasan, et al.
Published: (2025)
by: Rafi, Md. Abid Hasan, et al.
Published: (2025)
Adaptive Transformer Attention and Multi-Scale Fusion for Spine 3D Segmentation
by: Xiang, Yanlin, et al.
Published: (2025)
by: Xiang, Yanlin, et al.
Published: (2025)
Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model
by: Ma, Huan, et al.
Published: (2024)
by: Ma, Huan, et al.
Published: (2024)
LetheViT: Selective Machine Unlearning for Vision Transformers via Attention-Guided Contrastive Learning
by: Tong, Yujia, et al.
Published: (2025)
by: Tong, Yujia, et al.
Published: (2025)
Fleximo: Towards Flexible Text-to-Human Motion Video Generation
by: Zhang, Yuhang, et al.
Published: (2024)
by: Zhang, Yuhang, et al.
Published: (2024)
Elastic Attention Cores for Scalable Vision Transformers
by: Song, Alan Z., et al.
Published: (2026)
by: Song, Alan Z., et al.
Published: (2026)
Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models
by: Han, Xu, et al.
Published: (2024)
by: Han, Xu, et al.
Published: (2024)
Weakly Supervised Segmentation of Vertebral Bodies with Iterative Slice-propagation
by: Peng, Shiqi, et al.
Published: (2024)
by: Peng, Shiqi, et al.
Published: (2024)
Power-scaled Bayesian Inference with Score-based Generative Models
by: Erdinc, Huseyin Tuna, et al.
Published: (2025)
by: Erdinc, Huseyin Tuna, et al.
Published: (2025)
Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference
by: Ahmed, Sk Miraj, et al.
Published: (2026)
by: Ahmed, Sk Miraj, et al.
Published: (2026)
Beyond ImageNet: Understanding Cross-Dataset Robustness of Lightweight Vision Models
by: Zhang, Weidong, et al.
Published: (2025)
by: Zhang, Weidong, et al.
Published: (2025)
S-GRPO: Unified Post-Training for Large Vision-Language Models
by: Yan, Yuming, et al.
Published: (2026)
by: Yan, Yuming, et al.
Published: (2026)
Fine-grained Hierarchical Crop Type Classification from Integrated Hyperspectral EnMAP Data and Multispectral Sentinel-2 Time Series: A Large-scale Dataset and Dual-stream Transformer Method
by: Li, Wenyuan, et al.
Published: (2025)
by: Li, Wenyuan, et al.
Published: (2025)
Bag of Design Choices for Inference of High-Resolution Masked Generative Transformer
by: Shao, Shitong, et al.
Published: (2024)
by: Shao, Shitong, et al.
Published: (2024)
Efficient Slice Anomaly Detection Network for 3D Brain MRI Volume
by: Zhang, Zeduo, et al.
Published: (2024)
by: Zhang, Zeduo, et al.
Published: (2024)
OOSTraj: Out-of-Sight Trajectory Prediction With Vision-Positioning Denoising
by: Zhang, Haichao, et al.
Published: (2024)
by: Zhang, Haichao, et al.
Published: (2024)
HQViT: Hybrid Quantum Vision Transformer for Image Classification
by: Zhang, Hui, et al.
Published: (2025)
by: Zhang, Hui, et al.
Published: (2025)
Similar Items
-
Accessing Vision Foundation Models via ImageNet-1K
by: Zhang, Yitian, et al.
Published: (2024) -
MTS-DMAE: Dual-Masked Autoencoder for Unsupervised Multivariate Time Series Representation Learning
by: Xu, Yi, et al.
Published: (2025) -
Don't Judge by the Look: Towards Motion Coherent Video Representation
by: Zhang, Yitian, et al.
Published: (2024) -
Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings
by: Peng, Yunxiang, et al.
Published: (2026) -
Attention Transfer Is Not Universally Effective for Vision Transformers
by: Qin, Huaiyuan, et al.
Published: (2026)