SFMViT: SlowFast Meet ViT in Chaotic World
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Jiaying, Wen, Jiajun, Liu, Mengyuan, Liu, Jinfu, Yin, Baiqiao, Li, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HDBN: A Novel Hybrid Dual-branch Network for Robust Skeleton-based Action Recognition
por: Liu, Jinfu, et al.
Publicado: (2024)
por: Liu, Jinfu, et al.
Publicado: (2024)
SemiPL: A Semi-supervised Method for Event Sound Source Localization
por: Li, Yue, et al.
Publicado: (2024)
por: Li, Yue, et al.
Publicado: (2024)
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
por: Hong, Yining, et al.
Publicado: (2024)
por: Hong, Yining, et al.
Publicado: (2024)
WhisperNetV2: SlowFast Siamese Network For Lip-Based Biometrics
por: Zakeri, Abdollah, et al.
Publicado: (2024)
por: Zakeri, Abdollah, et al.
Publicado: (2024)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
por: Xu, Xuwei, et al.
Publicado: (2023)
por: Xu, Xuwei, et al.
Publicado: (2023)
Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs
por: Shah, Arya, et al.
Publicado: (2025)
por: Shah, Arya, et al.
Publicado: (2025)
Sub-token ViT Embedding via Stochastic Resonance Transformers
por: Lao, Dong, et al.
Publicado: (2023)
por: Lao, Dong, et al.
Publicado: (2023)
ViT-Lens: Towards Omni-modal Representations
por: Lei, Weixian, et al.
Publicado: (2023)
por: Lei, Weixian, et al.
Publicado: (2023)
DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning
por: Tong, Yujia, et al.
Publicado: (2025)
por: Tong, Yujia, et al.
Publicado: (2025)
HydraViT: Stacking Heads for a Scalable ViT
por: Haberer, Janek, et al.
Publicado: (2024)
por: Haberer, Janek, et al.
Publicado: (2024)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
por: Hu, Youbing, et al.
Publicado: (2024)
por: Hu, Youbing, et al.
Publicado: (2024)
MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition
por: Kim, Ye-eun, et al.
Publicado: (2025)
por: Kim, Ye-eun, et al.
Publicado: (2025)
CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs
por: Ramachandran, Akshat, et al.
Publicado: (2024)
por: Ramachandran, Akshat, et al.
Publicado: (2024)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
por: Hu, Youbing, et al.
Publicado: (2025)
por: Hu, Youbing, et al.
Publicado: (2025)
Knowledge Distillation in YOLOX-ViT for Side-Scan Sonar Object Detection
por: Aubard, Martin, et al.
Publicado: (2024)
por: Aubard, Martin, et al.
Publicado: (2024)
Hybrid CNN-ViT Framework for Motion-Blurred Scene Text Restoration
por: Rashid, Umar, et al.
Publicado: (2025)
por: Rashid, Umar, et al.
Publicado: (2025)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
por: Wei, Guoyizhe, et al.
Publicado: (2025)
por: Wei, Guoyizhe, et al.
Publicado: (2025)
SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging
por: Zeng, Haijin, et al.
Publicado: (2025)
por: Zeng, Haijin, et al.
Publicado: (2025)
Filtered-ViT: A Robust Defense Against Multiple Adversarial Patch Attacks
por: Khanal, Aja, et al.
Publicado: (2025)
por: Khanal, Aja, et al.
Publicado: (2025)
VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs
por: Wang, Xiyao, et al.
Publicado: (2026)
por: Wang, Xiyao, et al.
Publicado: (2026)
An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models
por: Hu, Zizhao, et al.
Publicado: (2024)
por: Hu, Zizhao, et al.
Publicado: (2024)
Slot-VLM: SlowFast Slots for Video-Language Modeling
por: Xu, Jiaqi, et al.
Publicado: (2024)
por: Xu, Jiaqi, et al.
Publicado: (2024)
ViTs are Everywhere: A Comprehensive Study Showcasing Vision Transformers in Different Domain
por: Mia, Md Sohag, et al.
Publicado: (2023)
por: Mia, Md Sohag, et al.
Publicado: (2023)
Implicit to Explicit Entropy Regularization: Benchmarking ViT Fine-tuning under Noisy Labels
por: Marrium, Maria, et al.
Publicado: (2024)
por: Marrium, Maria, et al.
Publicado: (2024)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
por: Shi, Huihong, et al.
Publicado: (2024)
por: Shi, Huihong, et al.
Publicado: (2024)
DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition
por: Lin, Jiaying, et al.
Publicado: (2026)
por: Lin, Jiaying, et al.
Publicado: (2026)
Training-Free Acceleration of ViTs with Delayed Spatial Merging
por: Heo, Jung Hwan, et al.
Publicado: (2023)
por: Heo, Jung Hwan, et al.
Publicado: (2023)
Octic Vision Transformers: Quicker ViTs Through Equivariance
por: Nordström, David, et al.
Publicado: (2025)
por: Nordström, David, et al.
Publicado: (2025)
DiffPoint: Single and Multi-view Point Cloud Reconstruction with ViT Based Diffusion Model
por: Feng, Yu, et al.
Publicado: (2024)
por: Feng, Yu, et al.
Publicado: (2024)
How Can Multimodal Remote Sensing Datasets Transform Classification via SpatialNet-ViT?
por: Kashyap, Gautam Siddharth, et al.
Publicado: (2025)
por: Kashyap, Gautam Siddharth, et al.
Publicado: (2025)
Tiny-ViT: A Compact Vision Transformer for Efficient and Explainable Potato Leaf Disease Classification
por: Mia, Shakil, et al.
Publicado: (2026)
por: Mia, Shakil, et al.
Publicado: (2026)
IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision Transformers
por: Kim, Gihwan, et al.
Publicado: (2025)
por: Kim, Gihwan, et al.
Publicado: (2025)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
por: Li, Zhengang, et al.
Publicado: (2024)
por: Li, Zhengang, et al.
Publicado: (2024)
MobilePlantViT: A Mobile-friendly Hybrid ViT for Generalized Plant Disease Image Classification
por: Tonmoy, Moshiur Rahman, et al.
Publicado: (2025)
por: Tonmoy, Moshiur Rahman, et al.
Publicado: (2025)
Case-Enhanced Vision Transformer: Improving Explanations of Image Similarity with a ViT-based Similarity Metric
por: Zhao, Ziwei, et al.
Publicado: (2024)
por: Zhao, Ziwei, et al.
Publicado: (2024)
ConcatPlexer: Additional Dim1 Batching for Faster ViTs
por: Han, Donghoon, et al.
Publicado: (2023)
por: Han, Donghoon, et al.
Publicado: (2023)
H-CNN-ViT: A Hierarchical Gated Attention Multi-Branch Model for Bladder Cancer Recurrence Prediction
por: Li, Xueyang, et al.
Publicado: (2025)
por: Li, Xueyang, et al.
Publicado: (2025)
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
por: Wang, Zhibo, et al.
Publicado: (2026)
por: Wang, Zhibo, et al.
Publicado: (2026)
Communication Efficient Split Learning of ViTs with Attention-based Double Compression
por: Alvetreti, Federico, et al.
Publicado: (2025)
por: Alvetreti, Federico, et al.
Publicado: (2025)
RePaViT: Scalable Vision Transformer Acceleration via Structural Reparameterization on Feedforward Network Layers
por: Xu, Xuwei, et al.
Publicado: (2025)
por: Xu, Xuwei, et al.
Publicado: (2025)
Ejemplares similares
-
HDBN: A Novel Hybrid Dual-branch Network for Robust Skeleton-based Action Recognition
por: Liu, Jinfu, et al.
Publicado: (2024) -
SemiPL: A Semi-supervised Method for Event Sound Source Localization
por: Li, Yue, et al.
Publicado: (2024) -
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
por: Hong, Yining, et al.
Publicado: (2024) -
WhisperNetV2: SlowFast Siamese Network For Lip-Based Biometrics
por: Zakeri, Abdollah, et al.
Publicado: (2024) -
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
por: Xu, Xuwei, et al.
Publicado: (2023)