CLIP with Quality Captions: A Strong Pretraining for Vision Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Vasu, Pavan Kumar Anasosalu, Pouransari, Hadi, Faghri, Fartash, Tuzel, Oncel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2023)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2023)
MobileCLIP2: Improving Multi-Modal Reinforced Training
por: Faghri, Fartash, et al.
Publicado: (2025)
por: Faghri, Fartash, et al.
Publicado: (2025)
SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding
por: Wang, Haoxiang, et al.
Publicado: (2023)
por: Wang, Haoxiang, et al.
Publicado: (2023)
FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations
por: Hsieh, Cheng-Yu, et al.
Publicado: (2025)
por: Hsieh, Cheng-Yu, et al.
Publicado: (2025)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
TiC-CLIP: Continual Training of CLIP Models
por: Garg, Saurabh, et al.
Publicado: (2023)
por: Garg, Saurabh, et al.
Publicado: (2023)
FastVLM: Efficient Vision Encoding for Vision Language Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
VSAS-Bench: Real-Time Evaluation of Visual Streaming Assistant Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2026)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2026)
Proxy-FDA: Proxy-based Feature Distribution Alignment for Fine-tuning Vision Foundation Models without Forgetting
por: Huang, Chen, et al.
Publicado: (2025)
por: Huang, Chen, et al.
Publicado: (2025)
Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions
por: Hsieh, Yu-Guan, et al.
Publicado: (2024)
por: Hsieh, Yu-Guan, et al.
Publicado: (2024)
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
por: Mehta, Sachin, et al.
Publicado: (2024)
por: Mehta, Sachin, et al.
Publicado: (2024)
Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum
por: Pouransari, Hadi, et al.
Publicado: (2024)
por: Pouransari, Hadi, et al.
Publicado: (2024)
TiC-LM: A Web-Scale Benchmark for Time-Continual LLM Pretraining
por: Li, Jeffrey, et al.
Publicado: (2025)
por: Li, Jeffrey, et al.
Publicado: (2025)
Pretraining with hierarchical memories: separating long-tail and common knowledge
por: Pouransari, Hadi, et al.
Publicado: (2025)
por: Pouransari, Hadi, et al.
Publicado: (2025)
RayRoPE: Projective Ray Positional Encoding for Multi-view Attention
por: Wu, Yu, et al.
Publicado: (2026)
por: Wu, Yu, et al.
Publicado: (2026)
Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks
por: Luo, Yaxin, et al.
Publicado: (2026)
por: Luo, Yaxin, et al.
Publicado: (2026)
MAM-CLIP: Vision-Language Pretraining on Mammography Atlases for BI-RADS Classification
por: Gulluk, Halil Ibrahim, et al.
Publicado: (2026)
por: Gulluk, Halil Ibrahim, et al.
Publicado: (2026)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
por: Lavoie, Samuel, et al.
Publicado: (2024)
por: Lavoie, Samuel, et al.
Publicado: (2024)
Pretrained Image-Text Models are Secretly Video Captioners
por: Zhang, Chunhui, et al.
Publicado: (2025)
por: Zhang, Chunhui, et al.
Publicado: (2025)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
por: Lai, Zhengfeng, et al.
Publicado: (2023)
por: Lai, Zhengfeng, et al.
Publicado: (2023)
Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks
por: Shandilya, Utkarsh, et al.
Publicado: (2025)
por: Shandilya, Utkarsh, et al.
Publicado: (2025)
Captured by Captions: On Memorization and its Mitigation in CLIP Models
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining
por: Shechter, Mikey, et al.
Publicado: (2025)
por: Shechter, Mikey, et al.
Publicado: (2025)
FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition
por: Huang, Xiaohu, et al.
Publicado: (2024)
por: Huang, Xiaohu, et al.
Publicado: (2024)
From Pixels to Prose: A Large Dataset of Dense Image Captions
por: Singla, Vasu, et al.
Publicado: (2024)
por: Singla, Vasu, et al.
Publicado: (2024)
GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining
por: Mohan, Deen Dayal, et al.
Publicado: (2026)
por: Mohan, Deen Dayal, et al.
Publicado: (2026)
RankCLIP: Ranking-Consistent Language-Image Pretraining
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
HyperCLIP: Adapting Vision-Language models with Hypernetworks
por: Akinwande, Victor, et al.
Publicado: (2024)
por: Akinwande, Victor, et al.
Publicado: (2024)
Object-level Self-Distillation for Vision Pretraining
por: Hızlı, Çağlar, et al.
Publicado: (2025)
por: Hızlı, Çağlar, et al.
Publicado: (2025)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
por: Yang, Chenglin, et al.
Publicado: (2023)
por: Yang, Chenglin, et al.
Publicado: (2023)
A Study on Self-Supervised Pretraining for Vision Problems in Gastrointestinal Endoscopy
por: Sanderson, Edward, et al.
Publicado: (2024)
por: Sanderson, Edward, et al.
Publicado: (2024)
Linear Alignment of Vision-language Models for Image Captioning
por: Paischer, Fabian, et al.
Publicado: (2023)
por: Paischer, Fabian, et al.
Publicado: (2023)
BioCLIP: A Vision Foundation Model for the Tree of Life
por: Stevens, Samuel, et al.
Publicado: (2023)
por: Stevens, Samuel, et al.
Publicado: (2023)
AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models
por: Metzen, Jan Hendrik, et al.
Publicado: (2023)
por: Metzen, Jan Hendrik, et al.
Publicado: (2023)
DeCLIP: Decoding CLIP representations for deepfake localization
por: Smeu, Stefan, et al.
Publicado: (2024)
por: Smeu, Stefan, et al.
Publicado: (2024)
Negative Label Guided OOD Detection with Pretrained Vision-Language Models
por: Jiang, Xue, et al.
Publicado: (2024)
por: Jiang, Xue, et al.
Publicado: (2024)
Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP
por: Xu, Zhongxing, et al.
Publicado: (2024)
por: Xu, Zhongxing, et al.
Publicado: (2024)
Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts
por: Esfandiari, Yasin, et al.
Publicado: (2025)
por: Esfandiari, Yasin, et al.
Publicado: (2025)
FastCLIP: A Suite of Optimization Techniques to Accelerate CLIP Training with Limited Resources
por: Wei, Xiyuan, et al.
Publicado: (2024)
por: Wei, Xiyuan, et al.
Publicado: (2024)
SGW-based Multi-Task Learning in Vision Tasks
por: Zhang, Ruiyuan, et al.
Publicado: (2024)
por: Zhang, Ruiyuan, et al.
Publicado: (2024)
Ejemplares similares
-
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2023) -
MobileCLIP2: Improving Multi-Modal Reinforced Training
por: Faghri, Fartash, et al.
Publicado: (2025) -
SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding
por: Wang, Haoxiang, et al.
Publicado: (2023) -
FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations
por: Hsieh, Cheng-Yu, et al.
Publicado: (2025) -
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)