Slicing Vision Transformer for Flexible Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yitian, Coskun, Huseyin, Ma, Xu, Wang, Huan, Ma, Ke, Xi, Chen, Hu, Derek Hao, Fu, Yun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accessing Vision Foundation Models via ImageNet-1K
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
MTS-DMAE: Dual-Masked Autoencoder for Unsupervised Multivariate Time Series Representation Learning
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
Don't Judge by the Look: Towards Motion Coherent Video Representation
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings
di: Peng, Yunxiang, et al.
Pubblicazione: (2026)
di: Peng, Yunxiang, et al.
Pubblicazione: (2026)
Attention Transfer Is Not Universally Effective for Vision Transformers
di: Qin, Huaiyuan, et al.
Pubblicazione: (2026)
di: Qin, Huaiyuan, et al.
Pubblicazione: (2026)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
AsCAN: Asymmetric Convolution-Attention Networks for Efficient Recognition and Generation
di: Kag, Anil, et al.
Pubblicazione: (2024)
di: Kag, Anil, et al.
Pubblicazione: (2024)
Rotary Position Embedding for Vision Transformer
di: Heo, Byeongho, et al.
Pubblicazione: (2024)
di: Heo, Byeongho, et al.
Pubblicazione: (2024)
Hyperspectral Unmixing Under Endmember Variability: A Variational Inference Framework
di: Li, Yuening, et al.
Pubblicazione: (2024)
di: Li, Yuening, et al.
Pubblicazione: (2024)
ReMem: Mutual Information-Aware Fine-tuning of Pretrained Vision Transformers for Effective Knowledge Distillation
di: Dong, Chengyu, et al.
Pubblicazione: (2025)
di: Dong, Chengyu, et al.
Pubblicazione: (2025)
Using MLIR Transform to Design Sliced Convolution Algorithm
di: Ferrari, Victor, et al.
Pubblicazione: (2025)
di: Ferrari, Victor, et al.
Pubblicazione: (2025)
Oscillation-Reduced MXFP4 Training for Vision Transformers
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
Stable Vision Concept Transformers for Medical Diagnosis
di: Hu, Lijie, et al.
Pubblicazione: (2025)
di: Hu, Lijie, et al.
Pubblicazione: (2025)
SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device
di: Wu, Yushu, et al.
Pubblicazione: (2024)
di: Wu, Yushu, et al.
Pubblicazione: (2024)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
di: Ma, Xu, et al.
Pubblicazione: (2026)
di: Ma, Xu, et al.
Pubblicazione: (2026)
CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models
di: Wang, Qinsi, et al.
Pubblicazione: (2025)
di: Wang, Qinsi, et al.
Pubblicazione: (2025)
A Study on Inference Latency for Vision Transformers on Mobile Devices
di: Li, Zhuojin, et al.
Pubblicazione: (2025)
di: Li, Zhuojin, et al.
Pubblicazione: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers
di: Hsu, Chih-Chung, et al.
Pubblicazione: (2026)
di: Hsu, Chih-Chung, et al.
Pubblicazione: (2026)
A Flexible 2.5D Medical Image Segmentation Approach with In-Slice and Cross-Slice Attention
di: Kumar, Amarjeet, et al.
Pubblicazione: (2024)
di: Kumar, Amarjeet, et al.
Pubblicazione: (2024)
Ask the Expert: Collaborative Inference for Vision Transformers with Near-Edge Accelerators
di: Liu, Hao, et al.
Pubblicazione: (2026)
di: Liu, Hao, et al.
Pubblicazione: (2026)
Max-Sliced Wasserstein Distance and its use for GANs
di: Deshpande, Ishan, et al.
Pubblicazione: (2019)
di: Deshpande, Ishan, et al.
Pubblicazione: (2019)
Protego: Detecting Adversarial Examples for Vision Transformers via Intrinsic Capabilities
di: Wu, Jialin, et al.
Pubblicazione: (2025)
di: Wu, Jialin, et al.
Pubblicazione: (2025)
SliceVision-F2I: A Synthetic Feature-to-Image Dataset for Visual Pattern Representation on Network Slices
di: Rafi, Md. Abid Hasan, et al.
Pubblicazione: (2025)
di: Rafi, Md. Abid Hasan, et al.
Pubblicazione: (2025)
Adaptive Transformer Attention and Multi-Scale Fusion for Spine 3D Segmentation
di: Xiang, Yanlin, et al.
Pubblicazione: (2025)
di: Xiang, Yanlin, et al.
Pubblicazione: (2025)
Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model
di: Ma, Huan, et al.
Pubblicazione: (2024)
di: Ma, Huan, et al.
Pubblicazione: (2024)
LetheViT: Selective Machine Unlearning for Vision Transformers via Attention-Guided Contrastive Learning
di: Tong, Yujia, et al.
Pubblicazione: (2025)
di: Tong, Yujia, et al.
Pubblicazione: (2025)
Fleximo: Towards Flexible Text-to-Human Motion Video Generation
di: Zhang, Yuhang, et al.
Pubblicazione: (2024)
di: Zhang, Yuhang, et al.
Pubblicazione: (2024)
Elastic Attention Cores for Scalable Vision Transformers
di: Song, Alan Z., et al.
Pubblicazione: (2026)
di: Song, Alan Z., et al.
Pubblicazione: (2026)
Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models
di: Han, Xu, et al.
Pubblicazione: (2024)
di: Han, Xu, et al.
Pubblicazione: (2024)
Weakly Supervised Segmentation of Vertebral Bodies with Iterative Slice-propagation
di: Peng, Shiqi, et al.
Pubblicazione: (2024)
di: Peng, Shiqi, et al.
Pubblicazione: (2024)
Power-scaled Bayesian Inference with Score-based Generative Models
di: Erdinc, Huseyin Tuna, et al.
Pubblicazione: (2025)
di: Erdinc, Huseyin Tuna, et al.
Pubblicazione: (2025)
Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference
di: Ahmed, Sk Miraj, et al.
Pubblicazione: (2026)
di: Ahmed, Sk Miraj, et al.
Pubblicazione: (2026)
Beyond ImageNet: Understanding Cross-Dataset Robustness of Lightweight Vision Models
di: Zhang, Weidong, et al.
Pubblicazione: (2025)
di: Zhang, Weidong, et al.
Pubblicazione: (2025)
S-GRPO: Unified Post-Training for Large Vision-Language Models
di: Yan, Yuming, et al.
Pubblicazione: (2026)
di: Yan, Yuming, et al.
Pubblicazione: (2026)
Fine-grained Hierarchical Crop Type Classification from Integrated Hyperspectral EnMAP Data and Multispectral Sentinel-2 Time Series: A Large-scale Dataset and Dual-stream Transformer Method
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
Bag of Design Choices for Inference of High-Resolution Masked Generative Transformer
di: Shao, Shitong, et al.
Pubblicazione: (2024)
di: Shao, Shitong, et al.
Pubblicazione: (2024)
Efficient Slice Anomaly Detection Network for 3D Brain MRI Volume
di: Zhang, Zeduo, et al.
Pubblicazione: (2024)
di: Zhang, Zeduo, et al.
Pubblicazione: (2024)
OOSTraj: Out-of-Sight Trajectory Prediction With Vision-Positioning Denoising
di: Zhang, Haichao, et al.
Pubblicazione: (2024)
di: Zhang, Haichao, et al.
Pubblicazione: (2024)
HQViT: Hybrid Quantum Vision Transformer for Image Classification
di: Zhang, Hui, et al.
Pubblicazione: (2025)
di: Zhang, Hui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Accessing Vision Foundation Models via ImageNet-1K
di: Zhang, Yitian, et al.
Pubblicazione: (2024) -
MTS-DMAE: Dual-Masked Autoencoder for Unsupervised Multivariate Time Series Representation Learning
di: Xu, Yi, et al.
Pubblicazione: (2025) -
Don't Judge by the Look: Towards Motion Coherent Video Representation
di: Zhang, Yitian, et al.
Pubblicazione: (2024) -
Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings
di: Peng, Yunxiang, et al.
Pubblicazione: (2026) -
Attention Transfer Is Not Universally Effective for Vision Transformers
di: Qin, Huaiyuan, et al.
Pubblicazione: (2026)