Improving Visual Recommendation on E-commerce Platforms Using Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yada, Yuki, Akiyama, Sho, Watanabe, Ryo, Ueno, Yuta, Shido, Yusuke, Rusli, Andre |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Zero-Shot Retrieval for Scalable Visual Search in a Two-Sided Marketplace
by: Rusli, Andre, et al.
Published: (2025)
by: Rusli, Andre, et al.
Published: (2025)
Towards Better Search with Domain-Aware Text Embeddings for C2C Marketplaces
by: Rusli, Andre, et al.
Published: (2025)
by: Rusli, Andre, et al.
Published: (2025)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
by: Meng, GuangHao, et al.
Published: (2025)
by: Meng, GuangHao, et al.
Published: (2025)
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
by: Sun, Xinyu, et al.
Published: (2026)
by: Sun, Xinyu, et al.
Published: (2026)
News Recommendation with Category Description by a Large Language Model
by: Yada, Yuki, et al.
Published: (2024)
by: Yada, Yuki, et al.
Published: (2024)
A Fashion Item Recommendation Model in Hyperbolic Space
by: Shimizu, Ryotaro, et al.
Published: (2024)
by: Shimizu, Ryotaro, et al.
Published: (2024)
A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback
by: Khaertdinov, Bulat, et al.
Published: (2025)
by: Khaertdinov, Bulat, et al.
Published: (2025)
Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations
by: De Nadai, Marco, et al.
Published: (2025)
by: De Nadai, Marco, et al.
Published: (2025)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
by: Zhu, Yingjian, et al.
Published: (2026)
by: Zhu, Yingjian, et al.
Published: (2026)
Accurate and Scalable Multimodal Pathology Retrieval via Attentive Vision-Language Alignment
by: Wang, Hongyi, et al.
Published: (2025)
by: Wang, Hongyi, et al.
Published: (2025)
Leveraging Large Language Models to Enhance Personalized Recommendations in E-commerce
by: Xu, Wei, et al.
Published: (2024)
by: Xu, Wei, et al.
Published: (2024)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
by: Wang, Yifan, et al.
Published: (2025)
by: Wang, Yifan, et al.
Published: (2025)
Interactive Garment Recommendation with User in the Loop
by: Becattini, Federico, et al.
Published: (2024)
by: Becattini, Federico, et al.
Published: (2024)
KiseKloset for Fashion Retrieval and Recommendation
by: Phan-Nguyen, Thanh-Tung, et al.
Published: (2025)
by: Phan-Nguyen, Thanh-Tung, et al.
Published: (2025)
Learning Positional Attention for Sequential Recommendation
by: Luo, Fan, et al.
Published: (2024)
by: Luo, Fan, et al.
Published: (2024)
Modality-Balanced Learning for Multimedia Recommendation
by: Zhang, Jinghao, et al.
Published: (2024)
by: Zhang, Jinghao, et al.
Published: (2024)
Visual Zero-Shot E-Commerce Product Attribute Value Extraction
by: Gong, Jiaying, et al.
Published: (2025)
by: Gong, Jiaying, et al.
Published: (2025)
Music Recommendation Based on Facial Emotion Recognition
by: B, Rajesh, et al.
Published: (2024)
by: B, Rajesh, et al.
Published: (2024)
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
by: Fu, Chenghan, et al.
Published: (2025)
by: Fu, Chenghan, et al.
Published: (2025)
PixRec: Leveraging Visual Context for Next-Item Prediction in Sequential Recommendation
by: Chakrabarty, Sayak, et al.
Published: (2026)
by: Chakrabarty, Sayak, et al.
Published: (2026)
Implementation of Recommendation Algorithm based on Recommendation Sessions in E-commerce IT System
by: Malinowski, Michał
Published: (2024)
by: Malinowski, Michał
Published: (2024)
LLM-Enhanced Multimodal Fusion for Cross-Domain Sequential Recommendation
by: Wu, Wangyu, et al.
Published: (2025)
by: Wu, Wangyu, et al.
Published: (2025)
Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation
by: Fu, Junchen, et al.
Published: (2024)
by: Fu, Junchen, et al.
Published: (2024)
RAGAR: Retrieval Augmented Personalized Image Generation Guided by Recommendation
by: Ling, Run, et al.
Published: (2025)
by: Ling, Run, et al.
Published: (2025)
IISAN: Efficiently Adapting Multimodal Representation for Sequential Recommendation with Decoupled PEFT
by: Fu, Junchen, et al.
Published: (2024)
by: Fu, Junchen, et al.
Published: (2024)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
by: Giahi, Ramin, et al.
Published: (2025)
by: Giahi, Ramin, et al.
Published: (2025)
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
by: Deng, Jiaqi, et al.
Published: (2025)
by: Deng, Jiaqi, et al.
Published: (2025)
MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding
by: Zhang, Daoze, et al.
Published: (2025)
by: Zhang, Daoze, et al.
Published: (2025)
NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval
by: Liu, Zhuchenyang, et al.
Published: (2026)
by: Liu, Zhuchenyang, et al.
Published: (2026)
Visual Product Search Benchmark
by: Govindappa, Karthik Sulthanpete
Published: (2026)
by: Govindappa, Karthik Sulthanpete
Published: (2026)
LotusFilter: Fast Diverse Nearest Neighbor Search via a Learned Cutoff Table
by: Matsui, Yusuke
Published: (2025)
by: Matsui, Yusuke
Published: (2025)
A Multi-Stage Hybrid Framework for Automated Interpretation of Multi-View Engineering Drawings Using Vision Language Model
by: Khan, Muhammad Tayyab, et al.
Published: (2025)
by: Khan, Muhammad Tayyab, et al.
Published: (2025)
Heterogeneous Graph-based Framework with Disentangled Representations Learning for Multi-target Cross Domain Recommendation
by: Liu, Xiaopeng, et al.
Published: (2024)
by: Liu, Xiaopeng, et al.
Published: (2024)
MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding
by: Wu, Junxian, et al.
Published: (2026)
by: Wu, Junxian, et al.
Published: (2026)
MealRec: Multi-granularity Sequential Modeling via Hierarchical Diffusion Models for Micro-Video Recommendation
by: Dong, Xinxin, et al.
Published: (2026)
by: Dong, Xinxin, et al.
Published: (2026)
RAVEN: Multitask Retrieval Augmented Vision-Language Learning
by: Rao, Varun Nagaraj, et al.
Published: (2024)
by: Rao, Varun Nagaraj, et al.
Published: (2024)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
by: Jiang, Haoyu, et al.
Published: (2024)
by: Jiang, Haoyu, et al.
Published: (2024)
MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding
by: Nie, Zhanheng, et al.
Published: (2025)
by: Nie, Zhanheng, et al.
Published: (2025)
Geometric Analysis of Self-Supervised Vision Representations for Semantic Image Retrieval
by: Rodríguez-Betancourt, Esteban, et al.
Published: (2026)
by: Rodríguez-Betancourt, Esteban, et al.
Published: (2026)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
by: Xu, Mingjun, et al.
Published: (2025)
by: Xu, Mingjun, et al.
Published: (2025)
Similar Items
-
Zero-Shot Retrieval for Scalable Visual Search in a Two-Sided Marketplace
by: Rusli, Andre, et al.
Published: (2025) -
Towards Better Search with Domain-Aware Text Embeddings for C2C Marketplaces
by: Rusli, Andre, et al.
Published: (2025) -
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
by: Meng, GuangHao, et al.
Published: (2025) -
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
by: Sun, Xinyu, et al.
Published: (2026) -
News Recommendation with Category Description by a Large Language Model
by: Yada, Yuki, et al.
Published: (2024)