Personalization Toolkit: Training Free Personalization of Large Vision Language Models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Seifi, Soroush, Dorovatas, Vaggelis, Cassinelli, Matteo, Despinoy, Fabien, Reino, Daniel Olmeda, Aljundi, Rahaf
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866915963388035072
author Seifi, Soroush
Dorovatas, Vaggelis
Cassinelli, Matteo
Despinoy, Fabien
Reino, Daniel Olmeda
Aljundi, Rahaf
author_facet Seifi, Soroush
Dorovatas, Vaggelis
Cassinelli, Matteo
Despinoy, Fabien
Reino, Daniel Olmeda
Aljundi, Rahaf
contents Personalization of Large Vision-Language Models (LVLMs) involves customizing models to recognize specific users or object instances and to generate contextually tailored responses. Existing approaches rely on time-consuming training for each item, making them impractical for real-world deployment, as reflected in current personalization benchmarks limited to object-centric single-concept evaluations. In this paper, we present a novel training-free approach to LVLM personalization called \ours. We introduce a comprehensive, real-world benchmark designed to rigorously evaluate various aspects of the personalization task. \ours leverages pre-trained vision foundation models to extract distinctive features, applies retrieval-augmented generation (RAG) techniques to identify instances within visual inputs, and employs visual prompting strategies to guide model outputs. Our model-agnostic vision toolkit enables efficient and flexible multi-concept personalization across both images and videos, without any additional training. We achieve state-of-the-art results, surpassing existing training-based methods.
format Preprint
id arxiv_https___arxiv_org_abs_2502_02452
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Personalization Toolkit: Training Free Personalization of Large Vision Language Models
Seifi, Soroush
Dorovatas, Vaggelis
Cassinelli, Matteo
Despinoy, Fabien
Reino, Daniel Olmeda
Aljundi, Rahaf
Computer Vision and Pattern Recognition
Personalization of Large Vision-Language Models (LVLMs) involves customizing models to recognize specific users or object instances and to generate contextually tailored responses. Existing approaches rely on time-consuming training for each item, making them impractical for real-world deployment, as reflected in current personalization benchmarks limited to object-centric single-concept evaluations. In this paper, we present a novel training-free approach to LVLM personalization called \ours. We introduce a comprehensive, real-world benchmark designed to rigorously evaluate various aspects of the personalization task. \ours leverages pre-trained vision foundation models to extract distinctive features, applies retrieval-augmented generation (RAG) techniques to identify instances within visual inputs, and employs visual prompting strategies to guide model outputs. Our model-agnostic vision toolkit enables efficient and flexible multi-concept personalization across both images and videos, without any additional training. We achieve state-of-the-art results, surpassing existing training-based methods.
title Personalization Toolkit: Training Free Personalization of Large Vision Language Models
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2502.02452