Improve Contrastive Clustering Performance by Multiple Fusing-Augmenting ViT Blocks
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Cheng, Zhou, Shuisheng, Peng, Fengjiao, Sheng, Jin, Ye, Feng, Dong, Yinli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MLG-Stereo: ViT Based Stereo Matching with Multi-Stage Local-Global Enhancement
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
di: Zhu, Chen, et al.
Pubblicazione: (2025)
di: Zhu, Chen, et al.
Pubblicazione: (2025)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
di: Hu, Youbing, et al.
Pubblicazione: (2025)
di: Hu, Youbing, et al.
Pubblicazione: (2025)
CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
di: Yuan, Zhengqing, et al.
Pubblicazione: (2024)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2024)
RepViT: Revisiting Mobile CNN From ViT Perspective
di: Wang, Ao, et al.
Pubblicazione: (2023)
di: Wang, Ao, et al.
Pubblicazione: (2023)
Deeper Inside Deep ViT
di: Hong, Sungrae
Pubblicazione: (2025)
di: Hong, Sungrae
Pubblicazione: (2025)
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
di: Zhong, Yunshan, et al.
Pubblicazione: (2023)
di: Zhong, Yunshan, et al.
Pubblicazione: (2023)
Mobile U-ViT: Revisiting large kernel and U-shaped ViT for efficient medical image segmentation
di: Tang, Fenghe, et al.
Pubblicazione: (2025)
di: Tang, Fenghe, et al.
Pubblicazione: (2025)
ViT$^3$: Unlocking Test-Time Training in Vision
di: Han, Dongchen, et al.
Pubblicazione: (2025)
di: Han, Dongchen, et al.
Pubblicazione: (2025)
Hyb-KAN ViT: Hybrid Kolmogorov-Arnold Networks Augmented Vision Transformer
di: Dey, Sainath, et al.
Pubblicazione: (2025)
di: Dey, Sainath, et al.
Pubblicazione: (2025)
Arena: A Patch-of-Interest ViT Inference Acceleration System for Edge-Assisted Video Analytics
di: Peng, Haosong, et al.
Pubblicazione: (2024)
di: Peng, Haosong, et al.
Pubblicazione: (2024)
DeS3: Adaptive Attention-driven Self and Soft Shadow Removal using ViT Similarity
di: Jin, Yeying, et al.
Pubblicazione: (2022)
di: Jin, Yeying, et al.
Pubblicazione: (2022)
One-Shot Multilingual Font Generation Via ViT
di: Wang, Zhiheng, et al.
Pubblicazione: (2024)
di: Wang, Zhiheng, et al.
Pubblicazione: (2024)
UniCT Depth: Event-Image Fusion Based Monocular Depth Estimation with Convolution-Compensated ViT Dual SA Block
di: Jing, Luoxi, et al.
Pubblicazione: (2025)
di: Jing, Luoxi, et al.
Pubblicazione: (2025)
Make Your ViT-based Multi-view 3D Detectors Faster via Token Compression
di: Zhang, Dingyuan, et al.
Pubblicazione: (2024)
di: Zhang, Dingyuan, et al.
Pubblicazione: (2024)
Colinearity Decay: Training Quantization-Friendly ViTs with Outlier Decay
di: Tong, Jin, et al.
Pubblicazione: (2026)
di: Tong, Jin, et al.
Pubblicazione: (2026)
MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition
di: Kim, Ye-eun, et al.
Pubblicazione: (2025)
di: Kim, Ye-eun, et al.
Pubblicazione: (2025)
STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs
di: Chattopadhyay, Nandish, et al.
Pubblicazione: (2026)
di: Chattopadhyay, Nandish, et al.
Pubblicazione: (2026)
Rethinking Random Masking in Self-Distillation on ViT
di: Seong, Jihyeon, et al.
Pubblicazione: (2025)
di: Seong, Jihyeon, et al.
Pubblicazione: (2025)
YOLO-Former: YOLO Shakes Hand With ViT
di: Khoramdel, Javad, et al.
Pubblicazione: (2024)
di: Khoramdel, Javad, et al.
Pubblicazione: (2024)
Your ViT is Secretly an Image Segmentation Model
di: Kerssies, Tommie, et al.
Pubblicazione: (2025)
di: Kerssies, Tommie, et al.
Pubblicazione: (2025)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference
di: Li, Ye, et al.
Pubblicazione: (2024)
di: Li, Ye, et al.
Pubblicazione: (2024)
ViTCAE: ViT-based Class-conditioned Autoencoder
di: Jebraeeli, Vahid, et al.
Pubblicazione: (2025)
di: Jebraeeli, Vahid, et al.
Pubblicazione: (2025)
ViT-EnsembleAttack: Augmenting Ensemble Models for Stronger Adversarial Transferability in Vision Transformers
di: Cao, Hanwen, et al.
Pubblicazione: (2025)
di: Cao, Hanwen, et al.
Pubblicazione: (2025)
UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register
di: Qiu, Congpei, et al.
Pubblicazione: (2026)
di: Qiu, Congpei, et al.
Pubblicazione: (2026)
Case-Enhanced Vision Transformer: Improving Explanations of Image Similarity with a ViT-based Similarity Metric
di: Zhao, Ziwei, et al.
Pubblicazione: (2024)
di: Zhao, Ziwei, et al.
Pubblicazione: (2024)
Dynamic Tuning Towards Parameter and Inference Efficiency for ViT Adaptation
di: Zhao, Wangbo, et al.
Pubblicazione: (2024)
di: Zhao, Wangbo, et al.
Pubblicazione: (2024)
Filtered-ViT: A Robust Defense Against Multiple Adversarial Patch Attacks
di: Khanal, Aja, et al.
Pubblicazione: (2025)
di: Khanal, Aja, et al.
Pubblicazione: (2025)
ERVD: An Efficient and Robust ViT-Based Distillation Framework for Remote Sensing Image Retrieval
di: Dong, Le, et al.
Pubblicazione: (2024)
di: Dong, Le, et al.
Pubblicazione: (2024)
U-REPA: Aligning Diffusion U-Nets to ViTs
di: Tian, Yuchuan, et al.
Pubblicazione: (2025)
di: Tian, Yuchuan, et al.
Pubblicazione: (2025)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
di: Liu, Jiani, et al.
Pubblicazione: (2025)
di: Liu, Jiani, et al.
Pubblicazione: (2025)
Vanilla ViT for Automotive Point Cloud Semantic Segmentation
di: Puy, Gilles, et al.
Pubblicazione: (2026)
di: Puy, Gilles, et al.
Pubblicazione: (2026)
Applying ViT in Generalized Few-shot Semantic Segmentation
di: Geng, Liyuan, et al.
Pubblicazione: (2024)
di: Geng, Liyuan, et al.
Pubblicazione: (2024)
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
di: Ibtehaz, Nabil, et al.
Pubblicazione: (2024)
di: Ibtehaz, Nabil, et al.
Pubblicazione: (2024)
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
di: Xia, Chunlong, et al.
Pubblicazione: (2024)
di: Xia, Chunlong, et al.
Pubblicazione: (2024)
Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs
di: Shah, Arya, et al.
Pubblicazione: (2025)
di: Shah, Arya, et al.
Pubblicazione: (2025)
DiffPoint: Single and Multi-view Point Cloud Reconstruction with ViT Based Diffusion Model
di: Feng, Yu, et al.
Pubblicazione: (2024)
di: Feng, Yu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MLG-Stereo: ViT Based Stereo Matching with Multi-Stage Local-Global Enhancement
di: Zhang, Haoyu, et al.
Pubblicazione: (2026) -
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026) -
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
di: Zhu, Chen, et al.
Pubblicazione: (2025) -
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
di: Hu, Youbing, et al.
Pubblicazione: (2025) -
CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)