Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shepherd, Maxwell |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AdapterTune: Zero-Initialized Low-Rank Adapters for Frozen Vision Transformers
par: Khazem, Salim
Publié: (2026)
par: Khazem, Salim
Publié: (2026)
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
par: Li, Yi, et autres
Publié: (2026)
par: Li, Yi, et autres
Publié: (2026)
Frozen Forecasting: A Unified Evaluation
par: Walker, Jacob C, et autres
Publié: (2025)
par: Walker, Jacob C, et autres
Publié: (2025)
Inference-Path Optimization via Circuit Duplication in Frozen Visual Transformers for Marine Species Classification
par: Rost, Thomas Manuel
Publié: (2026)
par: Rost, Thomas Manuel
Publié: (2026)
Convolutional Neural Nets vs Vision Transformers: A SpaceNet Case Study with Balanced vs Imbalanced Regimes
par: Gothi, Akshar
Publié: (2025)
par: Gothi, Akshar
Publié: (2025)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
par: Pang, Ziqi, et autres
Publié: (2023)
par: Pang, Ziqi, et autres
Publié: (2023)
DenseTRF: Texture-Aware Unsupervised Representation Adaptation for Surgical Scene Dense Prediction
par: Liao, Guiqiu, et autres
Publié: (2026)
par: Liao, Guiqiu, et autres
Publié: (2026)
DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets
par: Rangwani, Harsh, et autres
Publié: (2024)
par: Rangwani, Harsh, et autres
Publié: (2024)
LVD-2M: A Long-take Video Dataset with Temporally Dense Captions
par: Xiong, Tianwei, et autres
Publié: (2024)
par: Xiong, Tianwei, et autres
Publié: (2024)
Can Visual Encoder Learn to See Arrows?
par: Terashita, Naoyuki, et autres
Publié: (2025)
par: Terashita, Naoyuki, et autres
Publié: (2025)
Gaze-Informed Vision Transformers: Predicting Driving Decisions Under Uncertainty
par: Koorathota, Sharath, et autres
Publié: (2023)
par: Koorathota, Sharath, et autres
Publié: (2023)
Vertical LoRA: Dense Expectation-Maximization Interpretation of Transformers
par: Fu, Zhuolin
Publié: (2024)
par: Fu, Zhuolin
Publié: (2024)
Semantic Compositions Enhance Vision-Language Contrastive Learning
par: Aladago, Maxwell, et autres
Publié: (2024)
par: Aladago, Maxwell, et autres
Publié: (2024)
RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models
par: Moshtaghi, Mehdi, et autres
Publié: (2025)
par: Moshtaghi, Mehdi, et autres
Publié: (2025)
Parameter Reduction Improves Vision Transformers: A Comparative Study of Sharing and Width Reduction
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
ALERT Open Dataset and Input-Size-Agnostic Vision Transformer for Driver Activity Recognition using IR-UWB
par: Park, Jeongjun, et autres
Publié: (2025)
par: Park, Jeongjun, et autres
Publié: (2025)
Case Study: Transformer-Based Solution for the Automatic Digitization of Gas Plants
par: Bailo, I., et autres
Publié: (2025)
par: Bailo, I., et autres
Publié: (2025)
A3-FPN: Asymptotic Content-Aware Pyramid Attention Network for Dense Visual Prediction
par: Qin, Meng'en, et autres
Publié: (2026)
par: Qin, Meng'en, et autres
Publié: (2026)
Using Synthetic Images to Augment Small Medical Image Datasets
par: Vu, Minh H., et autres
Publié: (2025)
par: Vu, Minh H., et autres
Publié: (2025)
COVID19 Prediction Based On CT Scans Of Lungs Using DenseNet Architecture
par: Sanyal, Deborup
Publié: (2025)
par: Sanyal, Deborup
Publié: (2025)
EGA: Adapting Frozen Encoders for Vector Search with Bounded Out-of-Distribution Degradation
par: Zhao, Dongfang
Publié: (2026)
par: Zhao, Dongfang
Publié: (2026)
Improving Interpretation Faithfulness for Vision Transformers
par: Hu, Lijie, et autres
Publié: (2023)
par: Hu, Lijie, et autres
Publié: (2023)
Block-Recurrent Dynamics in Vision Transformers
par: Jacobs, Mozes, et autres
Publié: (2025)
par: Jacobs, Mozes, et autres
Publié: (2025)
VariViT: A Vision Transformer for Variable Image Sizes
par: Varma, Aswathi, et autres
Publié: (2026)
par: Varma, Aswathi, et autres
Publié: (2026)
A Survey of the Self Supervised Learning Mechanisms for Vision Transformers
par: Khan, Asifullah, et autres
Publié: (2024)
par: Khan, Asifullah, et autres
Publié: (2024)
Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning
par: Dalvi, Abhishek, et autres
Publié: (2026)
par: Dalvi, Abhishek, et autres
Publié: (2026)
Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training
par: Saha, Rohan, et autres
Publié: (2024)
par: Saha, Rohan, et autres
Publié: (2024)
Modelling and Simulation of Neuromorphic Datasets for Anomaly Detection in Computer Vision
par: Middleton, Mike, et autres
Publié: (2026)
par: Middleton, Mike, et autres
Publié: (2026)
Continual Adaptation of Vision Transformers for Federated Learning
par: Halbe, Shaunak, et autres
Publié: (2023)
par: Halbe, Shaunak, et autres
Publié: (2023)
Mechanisms of Non-Monotonic Scaling in Vision Transformers
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
Discovering Influential Neuron Path in Vision Transformers
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
DiffiT: Diffusion Vision Transformers for Image Generation
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
ADAPT to Robustify Prompt Tuning Vision Transformers
par: Eskandar, Masih, et autres
Publié: (2024)
par: Eskandar, Masih, et autres
Publié: (2024)
Accelerating Vision Transformers with Adaptive Patch Sizes
par: Choudhury, Rohan, et autres
Publié: (2025)
par: Choudhury, Rohan, et autres
Publié: (2025)
Class-Discriminative Attention Maps for Vision Transformers
par: Brocki, Lennart, et autres
Publié: (2023)
par: Brocki, Lennart, et autres
Publié: (2023)
Dataset Distillation for Pre-Trained Self-Supervised Vision Models
par: Cazenavette, George, et autres
Publié: (2025)
par: Cazenavette, George, et autres
Publié: (2025)
An Interpretable Implicit-Based Approach for Modeling Local Spatial Effects: A Case Study of Global Gross Primary Productivity
par: Du, Siqi, et autres
Publié: (2025)
par: Du, Siqi, et autres
Publié: (2025)
Generative Dataset Distillation: Balancing Global Structure and Local Details
par: Li, Longzhen, et autres
Publié: (2024)
par: Li, Longzhen, et autres
Publié: (2024)
Intriguing Equivalence Structures of the Embedding Space of Vision Transformers
par: Salman, Shaeke, et autres
Publié: (2024)
par: Salman, Shaeke, et autres
Publié: (2024)
Oscillation-Reduced MXFP4 Training for Vision Transformers
par: Chen, Yuxiang, et autres
Publié: (2025)
par: Chen, Yuxiang, et autres
Publié: (2025)
Documents similaires
-
AdapterTune: Zero-Initialized Low-Rank Adapters for Frozen Vision Transformers
par: Khazem, Salim
Publié: (2026) -
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
par: Li, Yi, et autres
Publié: (2026) -
Frozen Forecasting: A Unified Evaluation
par: Walker, Jacob C, et autres
Publié: (2025) -
Inference-Path Optimization via Circuit Duplication in Frozen Visual Transformers for Marine Species Classification
par: Rost, Thomas Manuel
Publié: (2026) -
Convolutional Neural Nets vs Vision Transformers: A SpaceNet Case Study with Balanced vs Imbalanced Regimes
par: Gothi, Akshar
Publié: (2025)