PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest
Fuente:
arXiv
Saved in:
| Main Authors: | Beal, Josh, Kim, Eric, Rao, Jinfeng, Wu, Rex, Kislyuk, Dmitry, Rosenberg, Charles |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Pinterest Canvas: Large-Scale Image Generation at Pinterest
by: Wang, Yu, et al.
Published: (2026)
by: Wang, Yu, et al.
Published: (2026)
Large-scale Reinforcement Learning for Diffusion Models
by: Zhang, Yinan, et al.
Published: (2024)
by: Zhang, Yinan, et al.
Published: (2024)
PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing
by: Mahadev, Rohan, et al.
Published: (2026)
by: Mahadev, Rohan, et al.
Published: (2026)
Visual Product Graph: Bridging Visual Products And Composite Images For End-to-End Style Recommendations
by: Du, Yue Li, et al.
Published: (2025)
by: Du, Yue Li, et al.
Published: (2025)
MTMD: A Multi-Task Multi-Domain Framework for Unified Ad Lightweight Ranking at Pinterest
by: Yang, Xiao, et al.
Published: (2025)
by: Yang, Xiao, et al.
Published: (2025)
CLIP-Decoder : ZeroShot Multilabel Classification using Multimodal CLIP Aligned Representation
by: Ali, Muhammad, et al.
Published: (2024)
by: Ali, Muhammad, et al.
Published: (2024)
Parameter-efficient Tuning of Large-scale Multimodal Foundation Model
by: Wang, Haixin, et al.
Published: (2023)
by: Wang, Haixin, et al.
Published: (2023)
DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation
by: Xiong, Zhitong, et al.
Published: (2025)
by: Xiong, Zhitong, et al.
Published: (2025)
MoralCLIP: Contrastive Alignment of Vision-and-Language Representations with Moral Foundations Theory
by: Condez, Ana Carolina, et al.
Published: (2025)
by: Condez, Ana Carolina, et al.
Published: (2025)
Targeted Forgetting of Image Subgroups in CLIP Models
by: Zhang, Zeliang, et al.
Published: (2025)
by: Zhang, Zeliang, et al.
Published: (2025)
Visual Representation Alignment for Multimodal Large Language Models
by: Yoon, Heeji, et al.
Published: (2025)
by: Yoon, Heeji, et al.
Published: (2025)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
by: Wei, Zhixiang, et al.
Published: (2025)
by: Wei, Zhixiang, et al.
Published: (2025)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
by: Wang, Zehan, et al.
Published: (2024)
by: Wang, Zehan, et al.
Published: (2024)
Multimodal Multilabel Classification by CLIP
by: Guo, Yanming
Published: (2024)
by: Guo, Yanming
Published: (2024)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
by: Lan, Mengcheng, et al.
Published: (2024)
by: Lan, Mengcheng, et al.
Published: (2024)
Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge
by: Chen, Ruiming, et al.
Published: (2025)
by: Chen, Ruiming, et al.
Published: (2025)
EditCLIP: Representation Learning for Image Editing
by: Wang, Qian, et al.
Published: (2025)
by: Wang, Qian, et al.
Published: (2025)
Leveraging CLIP Encoder for Multimodal Emotion Recognition
by: Song, Yehun, et al.
Published: (2025)
by: Song, Yehun, et al.
Published: (2025)
CLIP-IT: CLIP-based Pairing for Histology Images Classification
by: Karimian, Banafsheh, et al.
Published: (2025)
by: Karimian, Banafsheh, et al.
Published: (2025)
Finding 3D Scene Analogies with Multimodal Foundation Models
by: Kim, Junho, et al.
Published: (2025)
by: Kim, Junho, et al.
Published: (2025)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
by: Nawaz, Umair, et al.
Published: (2024)
by: Nawaz, Umair, et al.
Published: (2024)
MU-MAE: Multimodal Masked Autoencoders-Based One-Shot Learning
by: Liu, Rex, et al.
Published: (2024)
by: Liu, Rex, et al.
Published: (2024)
CLIP-like Model as a Foundational Density Ratio Estimator
by: Uchiyama, Fumiya, et al.
Published: (2025)
by: Uchiyama, Fumiya, et al.
Published: (2025)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
by: Li, Chen, et al.
Published: (2025)
by: Li, Chen, et al.
Published: (2025)
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning
by: Wang, Yaxiong, et al.
Published: (2024)
by: Wang, Yaxiong, et al.
Published: (2024)
BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive Learning
by: Liang, Siyuan, et al.
Published: (2023)
by: Liang, Siyuan, et al.
Published: (2023)
DesignCLIP: Multimodal Learning with CLIP for Design Patent Understanding
by: Wang, Zhu, et al.
Published: (2025)
by: Wang, Zhu, et al.
Published: (2025)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
by: Liu, Fan, et al.
Published: (2023)
by: Liu, Fan, et al.
Published: (2023)
CLIP-FSAC++: Few-Shot Anomaly Classification with Anomaly Descriptor Based on CLIP
by: Zuo, Zuo, et al.
Published: (2024)
by: Zuo, Zuo, et al.
Published: (2024)
BioCLIP: A Vision Foundation Model for the Tree of Life
by: Stevens, Samuel, et al.
Published: (2023)
by: Stevens, Samuel, et al.
Published: (2023)
SPACE-CLIP: Spatial Perception via Adaptive CLIP Embeddings for Monocular Depth Estimation
by: Cho, Taewan, et al.
Published: (2026)
by: Cho, Taewan, et al.
Published: (2026)
RWKV-CLIP: A Robust Vision-Language Representation Learner
by: Gu, Tiancheng, et al.
Published: (2024)
by: Gu, Tiancheng, et al.
Published: (2024)
CLIP-VQDiffusion : Langauge Free Training of Text To Image generation using CLIP and vector quantized diffusion model
by: Han, Seungdae, et al.
Published: (2024)
by: Han, Seungdae, et al.
Published: (2024)
Multimodal CLIP Inference for Meta-Few-Shot Image Classification
by: Ferragu, Constance, et al.
Published: (2024)
by: Ferragu, Constance, et al.
Published: (2024)
BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning
by: Liang, Siyuan, et al.
Published: (2026)
by: Liang, Siyuan, et al.
Published: (2026)
GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection
by: Guo, Yingying, et al.
Published: (2026)
by: Guo, Yingying, et al.
Published: (2026)
DiffCLIP: Few-shot Language-driven Multimodal Classifier
by: Zhang, Jiaqing, et al.
Published: (2024)
by: Zhang, Jiaqing, et al.
Published: (2024)
Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding
by: Truong, Thanh-Dat, et al.
Published: (2025)
by: Truong, Thanh-Dat, et al.
Published: (2025)
GenCLIP: Generalizing CLIP Prompts for Zero-shot Anomaly Detection
by: Kim, Donghyeong, et al.
Published: (2025)
by: Kim, Donghyeong, et al.
Published: (2025)
Insect-Foundation: A Foundation Model and Large-scale 1M Dataset for Visual Insect Understanding
by: Nguyen, Hoang-Quan, et al.
Published: (2023)
by: Nguyen, Hoang-Quan, et al.
Published: (2023)
Similar Items
-
Pinterest Canvas: Large-Scale Image Generation at Pinterest
by: Wang, Yu, et al.
Published: (2026) -
Large-scale Reinforcement Learning for Diffusion Models
by: Zhang, Yinan, et al.
Published: (2024) -
PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing
by: Mahadev, Rohan, et al.
Published: (2026) -
Visual Product Graph: Bridging Visual Products And Composite Images For End-to-End Style Recommendations
by: Du, Yue Li, et al.
Published: (2025) -
MTMD: A Multi-Task Multi-Domain Framework for Unified Ad Lightweight Ranking at Pinterest
by: Yang, Xiao, et al.
Published: (2025)