An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
Fuente:
arXiv
Saved in:
| Main Authors: | Gao, Jin, Lin, Shubo, Wang, Shaoru, Kou, Yutong, Li, Zeming, Li, Liang, Zhang, Congxuan, Zhang, Xiaoqin, Wang, Yizheng, Hu, Weiming |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking
by: Lin, Shubo, et al.
Published: (2024)
by: Lin, Shubo, et al.
Published: (2024)
MI-DETR: A Strong Baseline for Moving Infrared Small Target Detection with Bio-Inspired Motion Integration
by: Liu, Nian, et al.
Published: (2026)
by: Liu, Nian, et al.
Published: (2026)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
by: Lu, Yifan, et al.
Published: (2025)
by: Lu, Yifan, et al.
Published: (2025)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
by: Liu, Haowei, et al.
Published: (2024)
by: Liu, Haowei, et al.
Published: (2024)
Image Recognition with Online Lightweight Vision Transformer: A Survey
by: Zhang, Zherui, et al.
Published: (2025)
by: Zhang, Zherui, et al.
Published: (2025)
Centered Masking for Language-Image Pre-Training
by: Liang, Mingliang, et al.
Published: (2024)
by: Liang, Mingliang, et al.
Published: (2024)
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
by: Chen, Zewen, et al.
Published: (2024)
by: Chen, Zewen, et al.
Published: (2024)
Lightweight Change Detection in Heterogeneous Remote Sensing Images with Online All-Integer Pruning Training
by: Zhang, Chengyang, et al.
Published: (2024)
by: Zhang, Chengyang, et al.
Published: (2024)
Real-time Monocular Depth Estimation on Embedded Systems
by: Feng, Cheng, et al.
Published: (2023)
by: Feng, Cheng, et al.
Published: (2023)
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
by: Wu, Meihan, et al.
Published: (2024)
by: Wu, Meihan, et al.
Published: (2024)
MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
by: Wu, Biao, et al.
Published: (2024)
by: Wu, Biao, et al.
Published: (2024)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
by: Baraldi, Lorenzo, et al.
Published: (2023)
by: Baraldi, Lorenzo, et al.
Published: (2023)
Pre-Training Graph Contrastive Masked Autoencoders are Strong Distillers for EEG
by: Wei, Xinxu, et al.
Published: (2024)
by: Wei, Xinxu, et al.
Published: (2024)
Recent Progress on 3D Printing of Lightweight Metal Thin‐Walled Structures
by: Priyanka Vivegananthan, et al.
Published: (2024)
by: Priyanka Vivegananthan, et al.
Published: (2024)
MedFLIP: Medical Vision-and-Language Self-supervised Fast Pre-Training with Masked Autoencoder
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
Masked AutoDecoder is Effective Multi-Task Vision Generalist
by: Qiu, Han, et al.
Published: (2024)
by: Qiu, Han, et al.
Published: (2024)
CST Anti-UAV: A Thermal Infrared Benchmark for Tiny UAV Tracking in Complex Scenes
by: Xie, Bin, et al.
Published: (2025)
by: Xie, Bin, et al.
Published: (2025)
Variable Cubic Function Positive Feedback Islanding Detection Algorithm
by: Fei Yan, et al.
Published: (2026)
by: Fei Yan, et al.
Published: (2026)
Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images
by: Tan, Jen Hong
Published: (2024)
by: Tan, Jen Hong
Published: (2024)
Markovian Pre-Trained Transformer for Next-Item Recommendation
by: Xu, Cong, et al.
Published: (2026)
by: Xu, Cong, et al.
Published: (2026)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
by: Gao, Shanghua, et al.
Published: (2023)
by: Gao, Shanghua, et al.
Published: (2023)
Temperature Effect on Microstructure Evolution and Mechanical Properties of Fe–28Mn–8Al–1C Lightweight Steel via Supersonic Fine Particle Bombardment
by: Yi Xiong, et al.
Published: (2024)
by: Yi Xiong, et al.
Published: (2024)
MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
by: Zheng, Xuhui, et al.
Published: (2025)
by: Zheng, Xuhui, et al.
Published: (2025)
MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling
by: Lin, Shubo, et al.
Published: (2026)
by: Lin, Shubo, et al.
Published: (2026)
Exploring Prediction Targets in Masked Pre-Training for Speech Foundation Models
by: Chen, Li-Wei, et al.
Published: (2024)
by: Chen, Li-Wei, et al.
Published: (2024)
2M-NER: Contrastive Learning for Multilingual and Multimodal NER with Language and Modal Fusion
by: Wang, Dongsheng, et al.
Published: (2024)
by: Wang, Dongsheng, et al.
Published: (2024)
MaskMol: Knowledge-guided Molecular Image Pre-Training Framework for Activity Cliffs with Pixel Masking
by: Cheng, Zhixiang, et al.
Published: (2025)
by: Cheng, Zhixiang, et al.
Published: (2025)
S^2-Transformer for Mask-Aware Hyperspectral Image Reconstruction
by: Wang, Jiamian, et al.
Published: (2022)
by: Wang, Jiamian, et al.
Published: (2022)
Collaborative Low-Rank Adaptation for Pre-Trained Vision Transformers
by: Liu, Zheng, et al.
Published: (2025)
by: Liu, Zheng, et al.
Published: (2025)
Efficient Attention via Pre-Scoring: Prioritizing Informative Keys in Transformers
by: Li, Zhexiang, et al.
Published: (2025)
by: Li, Zhexiang, et al.
Published: (2025)
Lightweight Vision Transformer with Window and Spatial Attention for Food Image Classification
by: Gao, Xinle, et al.
Published: (2025)
by: Gao, Xinle, et al.
Published: (2025)
MiM: Mask in Mask Self-Supervised Pre-Training for 3D Medical Image Analysis
by: Zhuang, Jiaxin, et al.
Published: (2024)
by: Zhuang, Jiaxin, et al.
Published: (2024)
MaskMol: Knowledge-guided Molecular Image Pre-Training Framework for Activity Cliffs
by: Cheng, Zhixiang, et al.
Published: (2024)
by: Cheng, Zhixiang, et al.
Published: (2024)
Pre-training on High Definition X-ray Images: An Experimental Study
by: Wang, Xiao, et al.
Published: (2024)
by: Wang, Xiao, et al.
Published: (2024)
Extinction of guided light induced by coupled spiral meta-atom resonators at arbitrary order exceptional points
by: Zhang, Chengzhi, et al.
Published: (2024)
by: Zhang, Chengzhi, et al.
Published: (2024)
IPAD-CLIP: Teaching CLIP to Detect Image Local Perceptual Artifacts
by: Wang, Juan, et al.
Published: (2026)
by: Wang, Juan, et al.
Published: (2026)
Strong optical nonreciprocity in a photonic crystal composed of spinning cylinders
by: Li, Hengzhi, et al.
Published: (2026)
by: Li, Hengzhi, et al.
Published: (2026)
Graph Pre-Training Models Are Strong Anomaly Detectors
by: Cheng, Jiashun, et al.
Published: (2024)
by: Cheng, Jiashun, et al.
Published: (2024)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
by: Liu, Jiarun, et al.
Published: (2024)
by: Liu, Jiarun, et al.
Published: (2024)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
by: Li, Wenyu, et al.
Published: (2025)
by: Li, Wenyu, et al.
Published: (2025)
Similar Items
-
SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking
by: Lin, Shubo, et al.
Published: (2024) -
MI-DETR: A Strong Baseline for Moving Infrared Small Target Detection with Bio-Inspired Motion Integration
by: Liu, Nian, et al.
Published: (2026) -
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
by: Lu, Yifan, et al.
Published: (2025) -
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
by: Liu, Haowei, et al.
Published: (2024) -
Image Recognition with Online Lightweight Vision Transformer: A Survey
by: Zhang, Zherui, et al.
Published: (2025)