Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Mingliang, Liu, Zhuoran, de Vries, Arjen P., Larson, Martha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
Centered Masking for Language-Image Pre-Training
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
por: Wei, Zihao, et al.
Publicado: (2024)
por: Wei, Zihao, et al.
Publicado: (2024)
Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models
por: Guo, Boyang, et al.
Publicado: (2026)
por: Guo, Boyang, et al.
Publicado: (2026)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
por: Zheng, Haonan, et al.
Publicado: (2024)
por: Zheng, Haonan, et al.
Publicado: (2024)
VLMine: Long-Tail Data Mining with Vision Language Models
por: Ye, Mao, et al.
Publicado: (2024)
por: Ye, Mao, et al.
Publicado: (2024)
MedCutMix: A Data-Centric Approach to Improve Radiology Vision-Language Pre-training with Disease Awareness
por: Wang, Sinuo, et al.
Publicado: (2025)
por: Wang, Sinuo, et al.
Publicado: (2025)
Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model
por: Cai, Chaoxiang, et al.
Publicado: (2025)
por: Cai, Chaoxiang, et al.
Publicado: (2025)
Long-Tailed Object Detection Pre-training: Dynamic Rebalancing Contrastive Learning with Dual Reconstruction
por: Duan, Chen-Long, et al.
Publicado: (2024)
por: Duan, Chen-Long, et al.
Publicado: (2024)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
por: Tao, Yiyi, et al.
Publicado: (2024)
por: Tao, Yiyi, et al.
Publicado: (2024)
Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation
por: Zhang, Dingwen, et al.
Publicado: (2024)
por: Zhang, Dingwen, et al.
Publicado: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
por: Tian, Yuxin, et al.
Publicado: (2024)
por: Tian, Yuxin, et al.
Publicado: (2024)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
por: Yang, Fan, et al.
Publicado: (2024)
por: Yang, Fan, et al.
Publicado: (2024)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
por: Guo, Yangyang, et al.
Publicado: (2023)
por: Guo, Yangyang, et al.
Publicado: (2023)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
por: Chen, Junyi, et al.
Publicado: (2023)
por: Chen, Junyi, et al.
Publicado: (2023)
Long-Tailed Recognition on Binary Networks by Calibrating A Pre-trained Model
por: Kim, Jihun, et al.
Publicado: (2024)
por: Kim, Jihun, et al.
Publicado: (2024)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
3D Scene Graph Guided Vision-Language Pre-training
por: Liu, Hao, et al.
Publicado: (2024)
por: Liu, Hao, et al.
Publicado: (2024)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
por: Wu, Shihan, et al.
Publicado: (2024)
por: Wu, Shihan, et al.
Publicado: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
por: Gao, Yuan, et al.
Publicado: (2024)
por: Gao, Yuan, et al.
Publicado: (2024)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
por: Yan, Xin, et al.
Publicado: (2023)
por: Yan, Xin, et al.
Publicado: (2023)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
por: Liu, Che, et al.
Publicado: (2024)
por: Liu, Che, et al.
Publicado: (2024)
CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model
por: Hou, Shihao, et al.
Publicado: (2025)
por: Hou, Shihao, et al.
Publicado: (2025)
FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training
por: Cao, Anjia, et al.
Publicado: (2024)
por: Cao, Anjia, et al.
Publicado: (2024)
DreamLIP: Language-Image Pre-training with Long Captions
por: Zheng, Kecheng, et al.
Publicado: (2024)
por: Zheng, Kecheng, et al.
Publicado: (2024)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
por: Silva, João Daniel, et al.
Publicado: (2024)
por: Silva, João Daniel, et al.
Publicado: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
por: Zhou, Wenlve, et al.
Publicado: (2024)
por: Zhou, Wenlve, et al.
Publicado: (2024)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
por: Ding, Yuhe, et al.
Publicado: (2024)
por: Ding, Yuhe, et al.
Publicado: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
por: Ruan, Shouwei, et al.
Publicado: (2024)
por: Ruan, Shouwei, et al.
Publicado: (2024)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
por: Fhima, Jonathan, et al.
Publicado: (2024)
por: Fhima, Jonathan, et al.
Publicado: (2024)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Ye, Wei, et al.
Publicado: (2024)
por: Ye, Wei, et al.
Publicado: (2024)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
por: Tang, Longxiang, et al.
Publicado: (2024)
por: Tang, Longxiang, et al.
Publicado: (2024)
Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
por: Ren, Bin, et al.
Publicado: (2025)
por: Ren, Bin, et al.
Publicado: (2025)
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
por: Liu, Che, et al.
Publicado: (2023)
por: Liu, Che, et al.
Publicado: (2023)
Identifying Hard Noise in Long-Tailed Sample Distribution
por: Yi, Xuanyu, et al.
Publicado: (2022)
por: Yi, Xuanyu, et al.
Publicado: (2022)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023)
por: Ma, Shuailei, et al.
Publicado: (2023)
Ejemplares similares
-
Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training
por: Liang, Mingliang, et al.
Publicado: (2024) -
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
por: Liang, Mingliang, et al.
Publicado: (2024) -
Centered Masking for Language-Image Pre-Training
por: Liang, Mingliang, et al.
Publicado: (2024) -
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
por: Shi, Jiang-Xin, et al.
Publicado: (2024) -
Efficient Vision-Language Pre-training by Cluster Masking
por: Wei, Zihao, et al.
Publicado: (2024)