Guardado en:
| Autores principales: | Li, Yifan, Li, Xin, Li, Tianqin, He, Wenbin, Kong, Yu, Ren, Liu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2506.03433 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
por: Li, Yifan, et al.
Publicado: (2026)
por: Li, Yifan, et al.
Publicado: (2026)
Unleashing Vision Foundation Models for Coronary Artery Segmentation: Parallel ViT-CNN Encoding and Variational Fusion
por: Dong, Caixia, et al.
Publicado: (2025)
por: Dong, Caixia, et al.
Publicado: (2025)
ViT$^3$: Unlocking Test-Time Training in Vision
por: Han, Dongchen, et al.
Publicado: (2025)
por: Han, Dongchen, et al.
Publicado: (2025)
Communication Efficient Split Learning of ViTs with Attention-based Double Compression
por: Alvetreti, Federico, et al.
Publicado: (2025)
por: Alvetreti, Federico, et al.
Publicado: (2025)
ViT-5: Vision Transformers for The Mid-2020s
por: Wang, Feng, et al.
Publicado: (2026)
por: Wang, Feng, et al.
Publicado: (2026)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
por: Zhu, Chen, et al.
Publicado: (2025)
por: Zhu, Chen, et al.
Publicado: (2025)
Learning More by Seeing Less: Structure First Learning for Efficient, Transferable, and Human-Aligned Vision
por: Li, Tianqin, et al.
Publicado: (2025)
por: Li, Tianqin, et al.
Publicado: (2025)
CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications
por: Zhang, Tianfang, et al.
Publicado: (2024)
por: Zhang, Tianfang, et al.
Publicado: (2024)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
por: Hu, Youbing, et al.
Publicado: (2024)
por: Hu, Youbing, et al.
Publicado: (2024)
VAT: Vision Action Transformer by Unlocking Full Representation of ViT
por: Li, Wenhao, et al.
Publicado: (2025)
por: Li, Wenhao, et al.
Publicado: (2025)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
por: Yao, Ting, et al.
Publicado: (2024)
por: Yao, Ting, et al.
Publicado: (2024)
SSVQ: Unleashing the Potential of Vector Quantization with Sign-Splitting
por: Li, Shuaiting, et al.
Publicado: (2025)
por: Li, Shuaiting, et al.
Publicado: (2025)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
por: Xu, Xuwei, et al.
Publicado: (2023)
por: Xu, Xuwei, et al.
Publicado: (2023)
HydraViT: Stacking Heads for a Scalable ViT
por: Haberer, Janek, et al.
Publicado: (2024)
por: Haberer, Janek, et al.
Publicado: (2024)
PEANO-ViT: Power-Efficient Approximations of Non-Linearities in Vision Transformers
por: Sadeghi, Mohammad Erfan, et al.
Publicado: (2024)
por: Sadeghi, Mohammad Erfan, et al.
Publicado: (2024)
Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction
por: Chen, Weiming, et al.
Publicado: (2026)
por: Chen, Weiming, et al.
Publicado: (2026)
ERVD: An Efficient and Robust ViT-Based Distillation Framework for Remote Sensing Image Retrieval
por: Dong, Le, et al.
Publicado: (2024)
por: Dong, Le, et al.
Publicado: (2024)
ADFQ-ViT: Activation-Distribution-Friendly Post-Training Quantization for Vision Transformers
por: Jiang, Yanfeng, et al.
Publicado: (2024)
por: Jiang, Yanfeng, et al.
Publicado: (2024)
MPTQ-ViT: Mixed-Precision Post-Training Quantization for Vision Transformer
por: Tai, Yu-Shan, et al.
Publicado: (2024)
por: Tai, Yu-Shan, et al.
Publicado: (2024)
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
por: Ibtehaz, Nabil, et al.
Publicado: (2024)
por: Ibtehaz, Nabil, et al.
Publicado: (2024)
Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains
por: Li, Qiankun, et al.
Publicado: (2025)
por: Li, Qiankun, et al.
Publicado: (2025)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
por: Hu, Youbing, et al.
Publicado: (2025)
por: Hu, Youbing, et al.
Publicado: (2025)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
por: Yuan, Zhengqing, et al.
Publicado: (2024)
por: Yuan, Zhengqing, et al.
Publicado: (2024)
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
por: Pan, Chenbin, et al.
Publicado: (2025)
por: Pan, Chenbin, et al.
Publicado: (2025)
EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation
por: Liu, Longfei, et al.
Publicado: (2026)
por: Liu, Longfei, et al.
Publicado: (2026)
Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models
por: Rafaeli, Osher, et al.
Publicado: (2026)
por: Rafaeli, Osher, et al.
Publicado: (2026)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
por: Ma, Xiaochen, et al.
Publicado: (2023)
por: Ma, Xiaochen, et al.
Publicado: (2023)
S2R-ViT for Multi-Agent Cooperative Perception: Bridging the Gap from Simulation to Reality
por: Li, Jinlong, et al.
Publicado: (2023)
por: Li, Jinlong, et al.
Publicado: (2023)
ViT-EnsembleAttack: Augmenting Ensemble Models for Stronger Adversarial Transferability in Vision Transformers
por: Cao, Hanwen, et al.
Publicado: (2025)
por: Cao, Hanwen, et al.
Publicado: (2025)
SFMViT: SlowFast Meet ViT in Chaotic World
por: Lin, Jiaying, et al.
Publicado: (2024)
por: Lin, Jiaying, et al.
Publicado: (2024)
Deeper Inside Deep ViT
por: Hong, Sungrae
Publicado: (2025)
por: Hong, Sungrae
Publicado: (2025)
ViT-Explainer: An Interactive Walkthrough of the Vision Transformer Pipeline
por: Hernandez, Juan Manuel, et al.
Publicado: (2026)
por: Hernandez, Juan Manuel, et al.
Publicado: (2026)
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
por: Zhong, Yunshan, et al.
Publicado: (2023)
por: Zhong, Yunshan, et al.
Publicado: (2023)
Your ViT is Secretly an Image Segmentation Model
por: Kerssies, Tommie, et al.
Publicado: (2025)
por: Kerssies, Tommie, et al.
Publicado: (2025)
DeNAS-ViT: Data Efficient NAS-Optimized Vision Transformer for Ultrasound Image Segmentation
por: Chen, Renqi, et al.
Publicado: (2024)
por: Chen, Renqi, et al.
Publicado: (2024)
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
por: Xia, Chunlong, et al.
Publicado: (2024)
por: Xia, Chunlong, et al.
Publicado: (2024)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
por: Li, Zhengang, et al.
Publicado: (2024)
por: Li, Zhengang, et al.
Publicado: (2024)
Sub-token ViT Embedding via Stochastic Resonance Transformers
por: Lao, Dong, et al.
Publicado: (2023)
por: Lao, Dong, et al.
Publicado: (2023)
ViT-FIQA: Assessing Face Image Quality using Vision Transformers
por: Atzori, Andrea, et al.
Publicado: (2025)
por: Atzori, Andrea, et al.
Publicado: (2025)
Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting
por: Yu, Qiyang, et al.
Publicado: (2025)
por: Yu, Qiyang, et al.
Publicado: (2025)
Ejemplares similares
-
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
por: Li, Yifan, et al.
Publicado: (2026) -
Unleashing Vision Foundation Models for Coronary Artery Segmentation: Parallel ViT-CNN Encoding and Variational Fusion
por: Dong, Caixia, et al.
Publicado: (2025) -
ViT$^3$: Unlocking Test-Time Training in Vision
por: Han, Dongchen, et al.
Publicado: (2025) -
Communication Efficient Split Learning of ViTs with Attention-based Double Compression
por: Alvetreti, Federico, et al.
Publicado: (2025) -
ViT-5: Vision Transformers for The Mid-2020s
por: Wang, Feng, et al.
Publicado: (2026)