OCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit Imaging
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Zihao, De Wilde, Philippe |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Revisiting Class-Incremental Learning with Pre-Trained Models: Generalizability and Adaptivity are All You Need
par: Zhou, Da-Wei, et autres
Publié: (2023)
par: Zhou, Da-Wei, et autres
Publié: (2023)
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
par: Liu, Che, et autres
Publié: (2023)
par: Liu, Che, et autres
Publié: (2023)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
par: Qi, Yayun, et autres
Publié: (2024)
par: Qi, Yayun, et autres
Publié: (2024)
Split Adaptation for Pre-trained Vision Transformers
par: Wang, Lixu, et autres
Publié: (2025)
par: Wang, Lixu, et autres
Publié: (2025)
Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images
par: Tan, Jen Hong
Publié: (2024)
par: Tan, Jen Hong
Publié: (2024)
D4C: Data-Free Quantization for Contrastive Language-Image Pre-training Models
par: Zhang, Wenlun, et autres
Publié: (2025)
par: Zhang, Wenlun, et autres
Publié: (2025)
Masked Generative Transformer Is What You Need for Image Editing
par: Chow, Wei, et autres
Publié: (2026)
par: Chow, Wei, et autres
Publié: (2026)
A Single Graph Convolution Is All You Need: Efficient Grayscale Image Classification
par: Fein-Ashley, Jacob, et autres
Publié: (2024)
par: Fein-Ashley, Jacob, et autres
Publié: (2024)
Do Pre-trained Models Benefit Equally in Continual Learning?
par: Lee, Kuan-Ying, et autres
Publié: (2022)
par: Lee, Kuan-Ying, et autres
Publié: (2022)
CliffordNet: All You Need is Geometric Algebra
par: Ji, Zhongping
Publié: (2026)
par: Ji, Zhongping
Publié: (2026)
Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision Transformers
par: Yang, Sheng, et autres
Publié: (2024)
par: Yang, Sheng, et autres
Publié: (2024)
Is Hyperbolic Space All You Need for Medical Anomaly Detection?
par: Gonzalez-Jimenez, Alvaro, et autres
Publié: (2025)
par: Gonzalez-Jimenez, Alvaro, et autres
Publié: (2025)
Camouflaged Image Synthesis Is All You Need to Boost Camouflaged Detection
par: Zhang, Haichao, et autres
Publié: (2023)
par: Zhang, Haichao, et autres
Publié: (2023)
Pre-training Vision Transformers with Formula-driven Supervised Learning
par: Kataoka, Hirokatsu, et autres
Publié: (2022)
par: Kataoka, Hirokatsu, et autres
Publié: (2022)
GrootVL: Tree Topology is All You Need in State Space Model
par: Xiao, Yicheng, et autres
Publié: (2024)
par: Xiao, Yicheng, et autres
Publié: (2024)
Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps
par: Kim, Jeeyung, et autres
Publié: (2024)
par: Kim, Jeeyung, et autres
Publié: (2024)
How Does the Spatial Distribution of Pre-training Data Affect Geospatial Foundation Models?
par: Purohit, Mirali, et autres
Publié: (2025)
par: Purohit, Mirali, et autres
Publié: (2025)
VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones
par: Shen, Lefei, et autres
Publié: (2025)
par: Shen, Lefei, et autres
Publié: (2025)
Multimodal Autoregressive Pre-training of Large Vision Encoders
par: Fini, Enrico, et autres
Publié: (2024)
par: Fini, Enrico, et autres
Publié: (2024)
Cross-Validation Is All You Need: A Statistical Approach To Label Noise Estimation
par: Chen, Jianan, et autres
Publié: (2023)
par: Chen, Jianan, et autres
Publié: (2023)
Vision Transformer Finetuning Benefits from Non-Smooth Components
par: Odonnat, Ambroise, et autres
Publié: (2026)
par: Odonnat, Ambroise, et autres
Publié: (2026)
Good Data Is All Imitation Learning Needs
par: Samadi, Amir, et autres
Publié: (2024)
par: Samadi, Amir, et autres
Publié: (2024)
Multi-modal Vision Pre-training for Medical Image Analysis
par: Rui, Shaohao, et autres
Publié: (2024)
par: Rui, Shaohao, et autres
Publié: (2024)
Is Intermediate Fusion All You Need for UAV-based Collaborative Perception?
par: Hao, Jiuwu, et autres
Publié: (2025)
par: Hao, Jiuwu, et autres
Publié: (2025)
Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models
par: Nguyen, Dang, et autres
Publié: (2025)
par: Nguyen, Dang, et autres
Publié: (2025)
Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models
par: Han, Xu, et autres
Publié: (2024)
par: Han, Xu, et autres
Publié: (2024)
Not All Attention Heads Are What You Need: Refining CLIP's Image Representation with Attention Ablation
par: Lin, Feng, et autres
Publié: (2025)
par: Lin, Feng, et autres
Publié: (2025)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
par: Shi, Jiang-Xin, et autres
Publié: (2024)
par: Shi, Jiang-Xin, et autres
Publié: (2024)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
par: Ding, Yuhe, et autres
Publié: (2024)
par: Ding, Yuhe, et autres
Publié: (2024)
IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training
par: Liu, Che, et autres
Publié: (2023)
par: Liu, Che, et autres
Publié: (2023)
Learning without Forgetting for Vision-Language Models
par: Zhou, Da-Wei, et autres
Publié: (2023)
par: Zhou, Da-Wei, et autres
Publié: (2023)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
par: Shuai, Zitao, et autres
Publié: (2024)
par: Shuai, Zitao, et autres
Publié: (2024)
VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving
par: Zhang, Haiming, et autres
Publié: (2024)
par: Zhang, Haiming, et autres
Publié: (2024)
Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders
par: Kuo, Shang-Jui Ray, et autres
Publié: (2026)
par: Kuo, Shang-Jui Ray, et autres
Publié: (2026)
DPAdapter: Improving Differentially Private Deep Learning through Noise Tolerance Pre-training
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
SITS-DECO: A Generative Decoder Is All You Need For Multitask Satellite Image Time Series Modelling
par: Barrett, Samuel J., et autres
Publié: (2025)
par: Barrett, Samuel J., et autres
Publié: (2025)
Is Retain Set All You Need in Machine Unlearning? Restoring Performance of Unlearned Models with Out-Of-Distribution Images
par: Bonato, Jacopo, et autres
Publié: (2024)
par: Bonato, Jacopo, et autres
Publié: (2024)
Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers
par: Wang, Lirui, et autres
Publié: (2024)
par: Wang, Lirui, et autres
Publié: (2024)
Documents similaires
-
Revisiting Class-Incremental Learning with Pre-Trained Models: Generalizability and Adaptivity are All You Need
par: Zhou, Da-Wei, et autres
Publié: (2023) -
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
par: Liu, Che, et autres
Publié: (2023) -
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
par: Qi, Yayun, et autres
Publié: (2024) -
Split Adaptation for Pre-trained Vision Transformers
par: Wang, Lixu, et autres
Publié: (2025) -
Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images
par: Tan, Jen Hong
Publié: (2024)