Scaling Pre-training to One Hundred Billion Data for Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xiao, Alabdulmohsin, Ibrahim, Salz, Daniel, Li, Zhe, Rong, Keran, Zhai, Xiaohua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
No Filter: Cultural and Socioeconomic Diversity in Contrastive Vision-Language Models
di: Pouget, Angéline, et al.
Pubblicazione: (2024)
di: Pouget, Angéline, et al.
Pubblicazione: (2024)
Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2023)
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2023)
LocCa: Visual Pretraining with Location-aware Captioners
di: Wan, Bo, et al.
Pubblicazione: (2024)
di: Wan, Bo, et al.
Pubblicazione: (2024)
SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
di: Tschannen, Michael, et al.
Pubblicazione: (2025)
di: Tschannen, Michael, et al.
Pubblicazione: (2025)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
Recursive Inference Scaling: A Winning Path to Scalable Inference in Language and Multimodal Systems
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2025)
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2025)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Continual Forgetting for Pre-trained Vision Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
3D Scene Graph Guided Vision-Language Pre-training
di: Liu, Hao, et al.
Pubblicazione: (2024)
di: Liu, Hao, et al.
Pubblicazione: (2024)
One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models
di: Fang, Hao, et al.
Pubblicazione: (2024)
di: Fang, Hao, et al.
Pubblicazione: (2024)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
di: Hu, Panwen, et al.
Pubblicazione: (2024)
di: Hu, Panwen, et al.
Pubblicazione: (2024)
Scaling Learned Image Compression Models up to 1 Billion
di: Li, Yuqi, et al.
Pubblicazione: (2025)
di: Li, Yuqi, et al.
Pubblicazione: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
Split Adaptation for Pre-trained Vision Transformers
di: Wang, Lixu, et al.
Pubblicazione: (2025)
di: Wang, Lixu, et al.
Pubblicazione: (2025)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language Models
di: Li, Lin, et al.
Pubblicazione: (2024)
di: Li, Lin, et al.
Pubblicazione: (2024)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
Steering Vision-Language Pre-trained Models for Incremental Face Presentation Attack Detection
di: Li, Haoze, et al.
Pubblicazione: (2025)
di: Li, Haoze, et al.
Pubblicazione: (2025)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
di: Gao, Yuan, et al.
Pubblicazione: (2024)
di: Gao, Yuan, et al.
Pubblicazione: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
di: Tian, Yuxin, et al.
Pubblicazione: (2024)
di: Tian, Yuxin, et al.
Pubblicazione: (2024)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
di: Yan, Xin, et al.
Pubblicazione: (2023)
di: Yan, Xin, et al.
Pubblicazione: (2023)
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
di: Chen, Xuezheng, et al.
Pubblicazione: (2025)
di: Chen, Xuezheng, et al.
Pubblicazione: (2025)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
Scaling up Multimodal Pre-training for Sign Language Understanding
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
Scaling Diffusion Transformers to 16 Billion Parameters
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
Do Pre-trained Vision-Language Models Encode Object States?
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
di: Chen, Wei, et al.
Pubblicazione: (2024)
di: Chen, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
No Filter: Cultural and Socioeconomic Diversity in Contrastive Vision-Language Models
di: Pouget, Angéline, et al.
Pubblicazione: (2024) -
Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2023) -
LocCa: Visual Pretraining with Location-aware Captioners
di: Wan, Bo, et al.
Pubblicazione: (2024) -
SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
di: Tschannen, Michael, et al.
Pubblicazione: (2025) -
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
di: Wu, Jiannan, et al.
Pubblicazione: (2024)