Efficient Vision-Language Pre-training by Cluster Masking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Zihao, Pan, Zixuan, Owens, Andrew |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Masked Diffusion Captioning for Visual Feature Learning
par: Feng, Chao, et autres
Publié: (2025)
par: Feng, Chao, et autres
Publié: (2025)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
par: Zhu, Lei, et autres
Publié: (2025)
par: Zhu, Lei, et autres
Publié: (2025)
Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
par: Ren, Bin, et autres
Publié: (2025)
par: Ren, Bin, et autres
Publié: (2025)
Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
par: Liang, Mingliang, et autres
Publié: (2026)
par: Liang, Mingliang, et autres
Publié: (2026)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
par: Tao, Yiyi, et autres
Publié: (2024)
par: Tao, Yiyi, et autres
Publié: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
par: Chen, Junyi, et autres
Publié: (2023)
par: Chen, Junyi, et autres
Publié: (2023)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
par: Shi, Jiang-Xin, et autres
Publié: (2024)
par: Shi, Jiang-Xin, et autres
Publié: (2024)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
par: Guo, Yangyang, et autres
Publié: (2023)
par: Guo, Yangyang, et autres
Publié: (2023)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
Masked Pre-training Enables Universal Zero-shot Denoiser
par: Ma, Xiaoxiao, et autres
Publié: (2024)
par: Ma, Xiaoxiao, et autres
Publié: (2024)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
par: Wu, Shihan, et autres
Publié: (2024)
par: Wu, Shihan, et autres
Publié: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
par: Tian, Yuxin, et autres
Publié: (2024)
par: Tian, Yuxin, et autres
Publié: (2024)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
par: Zhang, Ziyang, et autres
Publié: (2025)
par: Zhang, Ziyang, et autres
Publié: (2025)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
par: Liu, Jiarun, et autres
Publié: (2024)
par: Liu, Jiarun, et autres
Publié: (2024)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Ye, Wei, et autres
Publié: (2024)
par: Ye, Wei, et autres
Publié: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
par: Gao, Yuan, et autres
Publié: (2024)
par: Gao, Yuan, et autres
Publié: (2024)
Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training
par: Sun, Peng, et autres
Publié: (2026)
par: Sun, Peng, et autres
Publié: (2026)
Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
par: Yan, Xin, et autres
Publié: (2023)
par: Yan, Xin, et autres
Publié: (2023)
Emerging Property of Masked Token for Effective Pre-training
par: Choi, Hyesong, et autres
Publié: (2024)
par: Choi, Hyesong, et autres
Publié: (2024)
Dataset Ownership Verification for Pre-trained Masked Models
par: Xie, Yuechen, et autres
Publié: (2025)
par: Xie, Yuechen, et autres
Publié: (2025)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
par: Ruan, Shouwei, et autres
Publié: (2024)
par: Ruan, Shouwei, et autres
Publié: (2024)
Masked Diffusion as Self-supervised Representation Learner
par: Pan, Zixuan, et autres
Publié: (2023)
par: Pan, Zixuan, et autres
Publié: (2023)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
VILA: On Pre-training for Visual Language Models
par: Lin, Ji, et autres
Publié: (2023)
par: Lin, Ji, et autres
Publié: (2023)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
par: Silva, João Daniel, et autres
Publié: (2024)
par: Silva, João Daniel, et autres
Publié: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
par: Zhou, Wenlve, et autres
Publié: (2024)
par: Zhou, Wenlve, et autres
Publié: (2024)
FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training
par: Cao, Anjia, et autres
Publié: (2024)
par: Cao, Anjia, et autres
Publié: (2024)
Masks and Manuscripts: Advancing Medical Pre-training with End-to-End Masking and Narrative Structuring
par: Gowda, Shreyank N, et autres
Publié: (2024)
par: Gowda, Shreyank N, et autres
Publié: (2024)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Pan-cancer Histopathology WSI Pre-training with Position-aware Masked Autoencoder
par: Wu, Kun, et autres
Publié: (2024)
par: Wu, Kun, et autres
Publié: (2024)
VLP: A Survey on Vision-Language Pre-training
par: Chen, Feilong, et autres
Publié: (2022)
par: Chen, Feilong, et autres
Publié: (2022)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
par: Tang, Longxiang, et autres
Publié: (2024)
par: Tang, Longxiang, et autres
Publié: (2024)
PolarMAE: Efficient Fetal Ultrasound Pre-training via Semantic Screening and Polar-Guided Masking
par: Lv, Meng, et autres
Publié: (2026)
par: Lv, Meng, et autres
Publié: (2026)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
par: Zheng, Haonan, et autres
Publié: (2024)
par: Zheng, Haonan, et autres
Publié: (2024)
3D Scene Graph Guided Vision-Language Pre-training
par: Liu, Hao, et autres
Publié: (2024)
par: Liu, Hao, et autres
Publié: (2024)
Documents similaires
-
Masked Diffusion Captioning for Visual Feature Learning
par: Feng, Chao, et autres
Publié: (2025) -
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
par: Zhu, Lei, et autres
Publié: (2025) -
Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
par: Ren, Bin, et autres
Publié: (2025) -
Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
par: Liang, Mingliang, et autres
Publié: (2026) -
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)