Embedding Geometries of Contrastive Language-Image Pre-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Chou, Jason Chuan-Chih, Alam, Nahid |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Centered Masking for Language-Image Pre-Training
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
Contrastive Localized Language-Image Pre-Training
di: Chen, Hong-You, et al.
Pubblicazione: (2024)
di: Chen, Hong-You, et al.
Pubblicazione: (2024)
A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)
di: Tu, Weijie, et al.
Pubblicazione: (2024)
di: Tu, Weijie, et al.
Pubblicazione: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Probabilistic Language-Image Pre-Training
di: Chun, Sanghyuk, et al.
Pubblicazione: (2024)
di: Chun, Sanghyuk, et al.
Pubblicazione: (2024)
DOCCI: Descriptions of Connected and Contrasting Images
di: Onoe, Yasumasa, et al.
Pubblicazione: (2024)
di: Onoe, Yasumasa, et al.
Pubblicazione: (2024)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images
di: Wu, Shengguang, et al.
Pubblicazione: (2025)
di: Wu, Shengguang, et al.
Pubblicazione: (2025)
Source-Free Domain Adaptation Guided by Vision and Vision-Language Pre-Training
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
di: Wan, David, et al.
Pubblicazione: (2024)
di: Wan, David, et al.
Pubblicazione: (2024)
Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval
di: Li, Siting, et al.
Pubblicazione: (2025)
di: Li, Siting, et al.
Pubblicazione: (2025)
Including Facial Expressions in Contextual Embeddings for Sign Language Generation
di: Viegas, Carla, et al.
Pubblicazione: (2022)
di: Viegas, Carla, et al.
Pubblicazione: (2022)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights
di: Wen, Xin, et al.
Pubblicazione: (2024)
di: Wen, Xin, et al.
Pubblicazione: (2024)
SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network
di: Lv, Changze, et al.
Pubblicazione: (2023)
di: Lv, Changze, et al.
Pubblicazione: (2023)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
di: Qi, Yayun, et al.
Pubblicazione: (2024)
di: Qi, Yayun, et al.
Pubblicazione: (2024)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
di: Filvantorkaman, Melika, et al.
Pubblicazione: (2026)
di: Filvantorkaman, Melika, et al.
Pubblicazione: (2026)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
S-GRPO: Unified Post-Training for Large Vision-Language Models
di: Yan, Yuming, et al.
Pubblicazione: (2026)
di: Yan, Yuming, et al.
Pubblicazione: (2026)
Pre-trained Language Models Do Not Help Auto-regressive Text-to-Image Generation
di: Zhang, Yuhui, et al.
Pubblicazione: (2023)
di: Zhang, Yuhui, et al.
Pubblicazione: (2023)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
di: Song, Yuhang, et al.
Pubblicazione: (2024)
di: Song, Yuhang, et al.
Pubblicazione: (2024)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
di: Meng, Debin, et al.
Pubblicazione: (2025)
di: Meng, Debin, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
D4C: Data-Free Quantization for Contrastive Language-Image Pre-training Models
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
Residual-based Language Models are Free Boosters for Biomedical Imaging
di: Lai, Zhixin, et al.
Pubblicazione: (2024)
di: Lai, Zhixin, et al.
Pubblicazione: (2024)
Release of Pre-Trained Models for the Japanese Language
di: Sawada, Kei, et al.
Pubblicazione: (2024)
di: Sawada, Kei, et al.
Pubblicazione: (2024)
MedFLIP: Medical Vision-and-Language Self-supervised Fast Pre-Training with Masked Autoencoder
di: Li, Lei, et al.
Pubblicazione: (2024)
di: Li, Lei, et al.
Pubblicazione: (2024)
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
Similarity-Dissimilarity Loss for Multi-label Supervised Contrastive Learning
di: Huang, Guangming, et al.
Pubblicazione: (2024)
di: Huang, Guangming, et al.
Pubblicazione: (2024)
Fine-Grained Classification: Connecting Metadata via Cross-Contrastive Pre-Training
di: Mamtani, Sumit, et al.
Pubblicazione: (2025)
di: Mamtani, Sumit, et al.
Pubblicazione: (2025)
AdFair-CLIP: Adversarial Fair Contrastive Language-Image Pre-training for Chest X-rays
di: Yi, Chenlang, et al.
Pubblicazione: (2025)
di: Yi, Chenlang, et al.
Pubblicazione: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
di: Wang, Zekun, et al.
Pubblicazione: (2025)
di: Wang, Zekun, et al.
Pubblicazione: (2025)
Continual Learning with Pre-Trained Models: A Survey
di: Zhou, Da-Wei, et al.
Pubblicazione: (2024)
di: Zhou, Da-Wei, et al.
Pubblicazione: (2024)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
Follow-Up Differential Descriptions: Language Models Resolve Ambiguities for Image Classification
di: Esfandiarpoor, Reza, et al.
Pubblicazione: (2023)
di: Esfandiarpoor, Reza, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Centered Masking for Language-Image Pre-Training
di: Liang, Mingliang, et al.
Pubblicazione: (2024) -
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
di: Chen, Yangyi, et al.
Pubblicazione: (2025) -
Contrastive Localized Language-Image Pre-Training
di: Chen, Hong-You, et al.
Pubblicazione: (2024) -
A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)
di: Tu, Weijie, et al.
Pubblicazione: (2024) -
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)