Faster Inference of Integer SWIN Transformer by Removing the GELU Activation
Fuente:
arXiv
Guardado en:
| Autores principales: | Tayaranian, Mohammadreza, Mozafari, Seyyed Hasan, Clark, James J., Meyer, Brett, Gross, Warren |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Automatic Pruning of Fine-tuning Datasets for Transformer-based Language Models
por: Tayaranian, Mohammadreza, et al.
Publicado: (2024)
por: Tayaranian, Mohammadreza, et al.
Publicado: (2024)
AdCorDA: Classifier Refinement via Adversarial Correction and Domain Adaptation
por: Shen, Lulan, et al.
Publicado: (2024)
por: Shen, Lulan, et al.
Publicado: (2024)
Robustness to distribution shifts of compressed networks for edge devices
por: Shen, Lulan, et al.
Publicado: (2024)
por: Shen, Lulan, et al.
Publicado: (2024)
SKGE-SWIN: End-To-End Autonomous Vehicle Waypoint Prediction and Navigation Using Skip Stage Swin Transformer
por: Kartiman, Fachri Najm Noer, et al.
Publicado: (2025)
por: Kartiman, Fachri Najm Noer, et al.
Publicado: (2025)
BD-KD: Balancing the Divergences for Online Knowledge Distillation
por: Amara, Ibtihel, et al.
Publicado: (2022)
por: Amara, Ibtihel, et al.
Publicado: (2022)
Improving 3D Few-Shot Segmentation with Inference-Time Pseudo-Labeling
por: Mozafari, Mohammad, et al.
Publicado: (2024)
por: Mozafari, Mohammad, et al.
Publicado: (2024)
Lifting the Veil on Visual Information Flow in MLLMs: Unlocking Pathways to Faster Inference
por: Yin, Hao, et al.
Publicado: (2025)
por: Yin, Hao, et al.
Publicado: (2025)
Reflection Removal through Efficient Adaptation of Diffusion Transformers
por: Zakarin, Daniyar, et al.
Publicado: (2025)
por: Zakarin, Daniyar, et al.
Publicado: (2025)
IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision Transformers
por: Kim, Gihwan, et al.
Publicado: (2025)
por: Kim, Gihwan, et al.
Publicado: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
HEAL-SWIN: A Vision Transformer On The Sphere
por: Carlsson, Oscar, et al.
Publicado: (2023)
por: Carlsson, Oscar, et al.
Publicado: (2023)
Flying By ML -- CNN Inversion of Affine Transforms
por: Van Warren, L.
Publicado: (2023)
por: Van Warren, L.
Publicado: (2023)
I-Segmenter: Integer-Only Vision Transformer for Efficient Semantic Segmentation
por: Sassoon, Jordan, et al.
Publicado: (2025)
por: Sassoon, Jordan, et al.
Publicado: (2025)
Domain Generalized Recaptured Screen Image Identification Using SWIN Transformer
por: Mehta, Preeti, et al.
Publicado: (2024)
por: Mehta, Preeti, et al.
Publicado: (2024)
Restoring Neural Network Plasticity for Faster Transfer Learning
por: Coetzer, Xander, et al.
Publicado: (2026)
por: Coetzer, Xander, et al.
Publicado: (2026)
Faster Parameter-Efficient Tuning with Token Redundancy Reduction
por: Kim, Kwonyoung, et al.
Publicado: (2025)
por: Kim, Kwonyoung, et al.
Publicado: (2025)
Efficient Masked Attention Transformer for Few-Shot Classification and Segmentation
por: Carrión-Ojeda, Dustin, et al.
Publicado: (2025)
por: Carrión-Ojeda, Dustin, et al.
Publicado: (2025)
Efficient Partitioning Vision Transformer on Edge Devices for Distributed Inference
por: Liu, Xiang, et al.
Publicado: (2024)
por: Liu, Xiang, et al.
Publicado: (2024)
StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization
por: Gaur, Gopalji, et al.
Publicado: (2025)
por: Gaur, Gopalji, et al.
Publicado: (2025)
ViT-2SPN: Vision Transformer-based Dual-Stream Self-Supervised Pretraining Networks for Retinal OCT Classification
por: Saraei, Mohammadreza, et al.
Publicado: (2025)
por: Saraei, Mohammadreza, et al.
Publicado: (2025)
Better Supervised Fine-tuning for VQA: Integer-Only Loss
por: Qian, Baihong, et al.
Publicado: (2025)
por: Qian, Baihong, et al.
Publicado: (2025)
VITAL: Interactive Few-Shot Imitation Learning via Visual Human-in-the-Loop Corrections
por: Kasaei, Hamidreza, et al.
Publicado: (2024)
por: Kasaei, Hamidreza, et al.
Publicado: (2024)
Can Cross-Layer Transcoders Replace Vision Transformer Activations? An Interpretable Perspective on Vision
por: Chatzoudis, Gerasimos, et al.
Publicado: (2026)
por: Chatzoudis, Gerasimos, et al.
Publicado: (2026)
Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation
por: Ye, Zilyu, et al.
Publicado: (2024)
por: Ye, Zilyu, et al.
Publicado: (2024)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
por: Qharabagh, Muhammad Fetrat, et al.
Publicado: (2024)
por: Qharabagh, Muhammad Fetrat, et al.
Publicado: (2024)
AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference
por: Huang, Kai, et al.
Publicado: (2025)
por: Huang, Kai, et al.
Publicado: (2025)
PrimeComposer: Faster Progressively Combined Diffusion for Image Composition with Attention Steering
por: Wang, Yibin, et al.
Publicado: (2024)
por: Wang, Yibin, et al.
Publicado: (2024)
MobileVLM V2: Faster and Stronger Baseline for Vision Language Model
por: Chu, Xiangxiang, et al.
Publicado: (2024)
por: Chu, Xiangxiang, et al.
Publicado: (2024)
TransCAD: A Hierarchical Transformer for CAD Sequence Inference from Point Clouds
por: Dupont, Elona, et al.
Publicado: (2024)
por: Dupont, Elona, et al.
Publicado: (2024)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
por: Arif, Kazi Hasan Ibn, et al.
Publicado: (2024)
por: Arif, Kazi Hasan Ibn, et al.
Publicado: (2024)
A Responsible Face Recognition Approach for Small and Mid-Scale Systems Through Personalized Neural Networks
por: Groß, Sebastian, et al.
Publicado: (2025)
por: Groß, Sebastian, et al.
Publicado: (2025)
Vision Eagle Attention: a new lens for advancing image classification
por: Hasan, Mahmudul
Publicado: (2024)
por: Hasan, Mahmudul
Publicado: (2024)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
por: Jiang, Hao, et al.
Publicado: (2025)
por: Jiang, Hao, et al.
Publicado: (2025)
FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
por: Zhang, Zherui, et al.
Publicado: (2025)
por: Zhang, Zherui, et al.
Publicado: (2025)
Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers
por: Turri, Evelyn, et al.
Publicado: (2026)
por: Turri, Evelyn, et al.
Publicado: (2026)
Latent Feature-Guided Diffusion Models for Shadow Removal
por: Mei, Kangfu, et al.
Publicado: (2023)
por: Mei, Kangfu, et al.
Publicado: (2023)
AI-Powered Facial Mask Removal Is Not Suitable For Identification
por: Cooper, Emily A, et al.
Publicado: (2026)
por: Cooper, Emily A, et al.
Publicado: (2026)
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
por: Clark, Christopher, et al.
Publicado: (2026)
por: Clark, Christopher, et al.
Publicado: (2026)
Fusion of Deep Learning and GIS for Advanced Remote Sensing Image Analysis
por: Afroosheh, Sajjad, et al.
Publicado: (2024)
por: Afroosheh, Sajjad, et al.
Publicado: (2024)
PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference
por: Fang, Jiarui, et al.
Publicado: (2024)
por: Fang, Jiarui, et al.
Publicado: (2024)
Ejemplares similares
-
Automatic Pruning of Fine-tuning Datasets for Transformer-based Language Models
por: Tayaranian, Mohammadreza, et al.
Publicado: (2024) -
AdCorDA: Classifier Refinement via Adversarial Correction and Domain Adaptation
por: Shen, Lulan, et al.
Publicado: (2024) -
Robustness to distribution shifts of compressed networks for edge devices
por: Shen, Lulan, et al.
Publicado: (2024) -
SKGE-SWIN: End-To-End Autonomous Vehicle Waypoint Prediction and Navigation Using Skip Stage Swin Transformer
por: Kartiman, Fachri Najm Noer, et al.
Publicado: (2025) -
BD-KD: Balancing the Divergences for Online Knowledge Distillation
por: Amara, Ibtihel, et al.
Publicado: (2022)