Towards Robust Vision Transformer via Masked Adaptive Ensemble
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Fudong, Lou, Jiadong, Yuan, Xu, Tzeng, Nian-Feng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dropout Prompt Learning: Towards Robust and Adaptive Vision-Language Models
por: Chen, Biao, et al.
Publicado: (2025)
por: Chen, Biao, et al.
Publicado: (2025)
Two-stage Vision Transformers and Hard Masking offer Robust Object Representations
por: Aniraj, Ananthu, et al.
Publicado: (2025)
por: Aniraj, Ananthu, et al.
Publicado: (2025)
AmPLe: Supporting Vision-Language Models via Adaptive-Debiased Ensemble Multi-Prompt Learning
por: Song, Fei, et al.
Publicado: (2025)
por: Song, Fei, et al.
Publicado: (2025)
An Open and Large-Scale Dataset for Multi-Modal Climate Change-aware Crop Yield Predictions
por: Lin, Fudong, et al.
Publicado: (2024)
por: Lin, Fudong, et al.
Publicado: (2024)
Domain Adaptive Skin Lesion Classification via Conformal Ensemble of Vision Transformers
por: Zoravar, Mehran, et al.
Publicado: (2025)
por: Zoravar, Mehran, et al.
Publicado: (2025)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
por: Demidov, Dmitry, et al.
Publicado: (2023)
por: Demidov, Dmitry, et al.
Publicado: (2023)
AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers
por: Liu, Dong, et al.
Publicado: (2026)
por: Liu, Dong, et al.
Publicado: (2026)
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
por: Wu, Meihan, et al.
Publicado: (2024)
por: Wu, Meihan, et al.
Publicado: (2024)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
por: Dong, Wei, et al.
Publicado: (2024)
por: Dong, Wei, et al.
Publicado: (2024)
Masked Latent Transformer with the Random Masking Ratio to Advance the Diagnosis of Dental Fluorosis
por: Wu, Yun, et al.
Publicado: (2024)
por: Wu, Yun, et al.
Publicado: (2024)
Rethinking Causal Mask Attention for Vision-Language Inference
por: Pei, Xiaohuan, et al.
Publicado: (2025)
por: Pei, Xiaohuan, et al.
Publicado: (2025)
MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining
por: Liu, Yunze, et al.
Publicado: (2024)
por: Liu, Yunze, et al.
Publicado: (2024)
Cross-Task Multi-Branch Vision Transformer for Facial Expression and Mask Wearing Classification
por: Zhu, Armando, et al.
Publicado: (2024)
por: Zhu, Armando, et al.
Publicado: (2024)
Robust Multiple Description Neural Video Codec with Masked Transformer for Dynamic and Noisy Networks
por: Hu, Xinyue, et al.
Publicado: (2024)
por: Hu, Xinyue, et al.
Publicado: (2024)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
Construction Site Scaffolding Completeness Detection Based on Mask R-CNN and Hough Transform
por: Lin, Pei-Hsin, et al.
Publicado: (2025)
por: Lin, Pei-Hsin, et al.
Publicado: (2025)
UMSPU: Universal Multi-Size Phase Unwrapping via Mutual Self-Distillation and Adaptive Boosting Ensemble Segmenters
por: Du, Lintong, et al.
Publicado: (2024)
por: Du, Lintong, et al.
Publicado: (2024)
Adaptive Layer Selection for Efficient Vision Transformer Fine-Tuning
por: Devoto, Alessio, et al.
Publicado: (2024)
por: Devoto, Alessio, et al.
Publicado: (2024)
AT-SNN: Adaptive Tokens for Vision Transformer on Spiking Neural Network
por: Kang, Donghwa, et al.
Publicado: (2024)
por: Kang, Donghwa, et al.
Publicado: (2024)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
por: Pham, Chau, et al.
Publicado: (2024)
por: Pham, Chau, et al.
Publicado: (2024)
Vision Transformer-Conditioned UNet for Domain-Adaptive Semantic Segmentation
por: Ortega, Joel Valdivia, et al.
Publicado: (2026)
por: Ortega, Joel Valdivia, et al.
Publicado: (2026)
SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining
por: Song, Chull Hwan, et al.
Publicado: (2024)
por: Song, Chull Hwan, et al.
Publicado: (2024)
Dynamic Attention Mechanism in Spatiotemporal Memory Networks for Object Tracking
por: Zhou, Meng, et al.
Publicado: (2025)
por: Zhou, Meng, et al.
Publicado: (2025)
MIMIR: Masked Image Modeling for Mutual Information-based Adversarial Robustness
por: Xu, Xiaoyun, et al.
Publicado: (2023)
por: Xu, Xiaoyun, et al.
Publicado: (2023)
SPARO: Selective Attention for Robust and Compositional Transformer Encodings for Vision
por: Vani, Ankit, et al.
Publicado: (2024)
por: Vani, Ankit, et al.
Publicado: (2024)
UrFound: Towards Universal Retinal Foundation Models via Knowledge-Guided Masked Modeling
por: Yu, Kai, et al.
Publicado: (2024)
por: Yu, Kai, et al.
Publicado: (2024)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
por: Oh, Changdae, et al.
Publicado: (2023)
por: Oh, Changdae, et al.
Publicado: (2023)
Robust Ensemble Person Re-Identification via Orthogonal Fusion with Occlusion Handling
por: Ferdous, Syeda Nyma, et al.
Publicado: (2024)
por: Ferdous, Syeda Nyma, et al.
Publicado: (2024)
TransNeXt: Robust Foveal Visual Perception for Vision Transformers
por: Shi, Dai
Publicado: (2023)
por: Shi, Dai
Publicado: (2023)
OmniHands: Towards Robust 4D Hand Mesh Recovery via A Versatile Transformer
por: Lin, Dixuan, et al.
Publicado: (2024)
por: Lin, Dixuan, et al.
Publicado: (2024)
Emotion Recognition Using Transformers with Masked Learning
por: Min, Seongjae, et al.
Publicado: (2024)
por: Min, Seongjae, et al.
Publicado: (2024)
CertMask: Certifiable Defense Against Adversarial Patches via Theoretically Optimal Mask Coverage
por: Lyu, Xuntao, et al.
Publicado: (2025)
por: Lyu, Xuntao, et al.
Publicado: (2025)
SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer
por: Li, Wenxi, et al.
Publicado: (2025)
por: Li, Wenxi, et al.
Publicado: (2025)
IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer
por: Qiu, Yuhang, et al.
Publicado: (2024)
por: Qiu, Yuhang, et al.
Publicado: (2024)
From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models
por: Khokhar, Pir Bakhsh, et al.
Publicado: (2026)
por: Khokhar, Pir Bakhsh, et al.
Publicado: (2026)
Patch Rebirth: Toward Fast and Transferable Model Inversion of Vision Transformers
por: Heo, Seongsoo, et al.
Publicado: (2025)
por: Heo, Seongsoo, et al.
Publicado: (2025)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
por: Xu, Xuwei, et al.
Publicado: (2023)
por: Xu, Xuwei, et al.
Publicado: (2023)
Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance
por: Feng, Sicong, et al.
Publicado: (2025)
por: Feng, Sicong, et al.
Publicado: (2025)
Robust SAM: On the Adversarial Robustness of Vision Foundation Models
por: Long, Jiahuan, et al.
Publicado: (2025)
por: Long, Jiahuan, et al.
Publicado: (2025)
CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models
por: Lee, Donghee, et al.
Publicado: (2026)
por: Lee, Donghee, et al.
Publicado: (2026)
Ejemplares similares
-
Dropout Prompt Learning: Towards Robust and Adaptive Vision-Language Models
por: Chen, Biao, et al.
Publicado: (2025) -
Two-stage Vision Transformers and Hard Masking offer Robust Object Representations
por: Aniraj, Ananthu, et al.
Publicado: (2025) -
AmPLe: Supporting Vision-Language Models via Adaptive-Debiased Ensemble Multi-Prompt Learning
por: Song, Fei, et al.
Publicado: (2025) -
An Open and Large-Scale Dataset for Multi-Modal Climate Change-aware Crop Yield Predictions
por: Lin, Fudong, et al.
Publicado: (2024) -
Domain Adaptive Skin Lesion Classification via Conformal Ensemble of Vision Transformers
por: Zoravar, Mehran, et al.
Publicado: (2025)