QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Le, Binh M., Xu, Shaoyuan, Fu, Jinmiao, Huang, Zhishen, Li, Moyan, Guo, Yanhui, Li, Hongdong, Ramasinghe, Sameera, Wang, Bryan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs
par: Shah, Arya, et autres
Publié: (2025)
par: Shah, Arya, et autres
Publié: (2025)
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
par: Zhong, Yunshan, et autres
Publié: (2023)
par: Zhong, Yunshan, et autres
Publié: (2023)
Intriguing Frequency Interpretation of Adversarial Robustness for CNNs and ViTs
par: Chen, Lu, et autres
Publié: (2025)
par: Chen, Lu, et autres
Publié: (2025)
STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs
par: Chattopadhyay, Nandish, et autres
Publié: (2026)
par: Chattopadhyay, Nandish, et autres
Publié: (2026)
CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs
par: Ramachandran, Akshat, et autres
Publié: (2024)
par: Ramachandran, Akshat, et autres
Publié: (2024)
U-REPA: Aligning Diffusion U-Nets to ViTs
par: Tian, Yuchuan, et autres
Publié: (2025)
par: Tian, Yuchuan, et autres
Publié: (2025)
Elastic ViTs from Pretrained Models without Retraining
par: Simoncini, Walter, et autres
Publié: (2025)
par: Simoncini, Walter, et autres
Publié: (2025)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
par: Liu, Jiani, et autres
Publié: (2025)
par: Liu, Jiani, et autres
Publié: (2025)
Pretrained ViTs Yield Versatile Representations For Medical Images
par: Matsoukas, Christos, et autres
Publié: (2023)
par: Matsoukas, Christos, et autres
Publié: (2023)
Q-Tuning: Queue-based Prompt Tuning for Lifelong Few-shot Language Learning
par: Guo, Yanhui, et autres
Publié: (2024)
par: Guo, Yanhui, et autres
Publié: (2024)
VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs
par: Wang, Xiyao, et autres
Publié: (2026)
par: Wang, Xiyao, et autres
Publié: (2026)
Colinearity Decay: Training Quantization-Friendly ViTs with Outlier Decay
par: Tong, Jin, et autres
Publié: (2026)
par: Tong, Jin, et autres
Publié: (2026)
DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs
par: Kim, Donghyun, et autres
Publié: (2024)
par: Kim, Donghyun, et autres
Publié: (2024)
Training-Free Acceleration of ViTs with Delayed Spatial Merging
par: Heo, Jung Hwan, et autres
Publié: (2023)
par: Heo, Jung Hwan, et autres
Publié: (2023)
Octic Vision Transformers: Quicker ViTs Through Equivariance
par: Nordström, David, et autres
Publié: (2025)
par: Nordström, David, et autres
Publié: (2025)
Token Cropr: Faster ViTs for Quite a Few Tasks
par: Bergner, Benjamin, et autres
Publié: (2024)
par: Bergner, Benjamin, et autres
Publié: (2024)
Adapting Pretrained ViTs with Convolution Injector for Visuo-Motor Control
par: Hwang, Dongyoon, et autres
Publié: (2024)
par: Hwang, Dongyoon, et autres
Publié: (2024)
Unsupervised Object Localization in the Era of Self-Supervised ViTs: A Survey
par: Siméoni, Oriane, et autres
Publié: (2023)
par: Siméoni, Oriane, et autres
Publié: (2023)
ConcatPlexer: Additional Dim1 Batching for Faster ViTs
par: Han, Donghoon, et autres
Publié: (2023)
par: Han, Donghoon, et autres
Publié: (2023)
EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation
par: Liu, Longfei, et autres
Publié: (2026)
par: Liu, Longfei, et autres
Publié: (2026)
Parameter Efficient Fine-tuning of Self-supervised ViTs without Catastrophic Forgetting
par: Bafghi, Reza Akbarian, et autres
Publié: (2024)
par: Bafghi, Reza Akbarian, et autres
Publié: (2024)
ViT Registers and Fractal ViT
par: Chou, Jason Chuan-Chih, et autres
Publié: (2026)
par: Chou, Jason Chuan-Chih, et autres
Publié: (2026)
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
par: Wang, Zhibo, et autres
Publié: (2026)
par: Wang, Zhibo, et autres
Publié: (2026)
Communication Efficient Split Learning of ViTs with Attention-based Double Compression
par: Alvetreti, Federico, et autres
Publié: (2025)
par: Alvetreti, Federico, et autres
Publié: (2025)
Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP
par: Balasubramanian, Sriram, et autres
Publié: (2024)
par: Balasubramanian, Sriram, et autres
Publié: (2024)
ViTs are Everywhere: A Comprehensive Study Showcasing Vision Transformers in Different Domain
par: Mia, Md Sohag, et autres
Publié: (2023)
par: Mia, Md Sohag, et autres
Publié: (2023)
Exploring the Synergies of Hybrid CNNs and ViTs Architectures for Computer Vision: A survey
par: Yunusa, Haruna, et autres
Publié: (2024)
par: Yunusa, Haruna, et autres
Publié: (2024)
Causality $\neq$ Decodability, and Vice Versa: Lessons from Interpreting Counting ViTs
par: Huang, Lianghuan, et autres
Publié: (2025)
par: Huang, Lianghuan, et autres
Publié: (2025)
Trading Positional Complexity vs. Deepness in Coordinate Networks
par: Zheng, Jianqiao, et autres
Publié: (2022)
par: Zheng, Jianqiao, et autres
Publié: (2022)
AFIDAF: Alternating Fourier and Image Domain Adaptive Filters as an Efficient Alternative to Attention in ViTs
par: Zheng, Yunling, et autres
Publié: (2024)
par: Zheng, Yunling, et autres
Publié: (2024)
Which Direction to Choose? An Analysis on the Representation Power of Self-Supervised ViTs in Downstream Tasks
par: Kaltampanidis, Yannis, et autres
Publié: (2025)
par: Kaltampanidis, Yannis, et autres
Publié: (2025)
From Activation to Initialization: Scaling Insights for Optimizing Neural Fields
par: Saratchandran, Hemanth, et autres
Publié: (2024)
par: Saratchandran, Hemanth, et autres
Publié: (2024)
VI3NR: Variance Informed Initialization for Implicit Neural Representations
par: Koneputugodage, Chamin Hewa, et autres
Publié: (2025)
par: Koneputugodage, Chamin Hewa, et autres
Publié: (2025)
CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization
par: Hou, Xinhai, et autres
Publié: (2025)
par: Hou, Xinhai, et autres
Publié: (2025)
Register and [CLS] tokens yield a decoupling of local and global features in large ViTs
par: Lappe, Alexander, et autres
Publié: (2025)
par: Lappe, Alexander, et autres
Publié: (2025)
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
par: Wang, Ao, et autres
Publié: (2023)
par: Wang, Ao, et autres
Publié: (2023)
UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register
par: Qiu, Congpei, et autres
Publié: (2026)
par: Qiu, Congpei, et autres
Publié: (2026)
ViTs for Action Classification in Videos: An Approach to Risky Tackle Detection in American Football Practice Videos
par: Zaidi, Syed Ahsan Masud, et autres
Publié: (2026)
par: Zaidi, Syed Ahsan Masud, et autres
Publié: (2026)
SAFE: a SAR Feature Extractor based on self-supervised learning and masked Siamese ViTs
par: Muzeau, Max, et autres
Publié: (2024)
par: Muzeau, Max, et autres
Publié: (2024)
Refining Datapath for Microscaling ViTs
par: Xiao, Can, et autres
Publié: (2025)
par: Xiao, Can, et autres
Publié: (2025)
Documents similaires
-
Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs
par: Shah, Arya, et autres
Publié: (2025) -
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
par: Zhong, Yunshan, et autres
Publié: (2023) -
Intriguing Frequency Interpretation of Adversarial Robustness for CNNs and ViTs
par: Chen, Lu, et autres
Publié: (2025) -
STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs
par: Chattopadhyay, Nandish, et autres
Publié: (2026) -
CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs
par: Ramachandran, Akshat, et autres
Publié: (2024)