Small-Large Collaboration: Training-efficient Concept Personalization for Large VLM using a Meta Personalized Small VLM
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Sihan, Ji, Huitong, Lu, Shaolin, Chen, Jiayi, Xu, Binxiao, Lu, Ming, Zhang, Yuanxing, Dong, Wenhui, Zhang, Wentao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
by: An, Ruichuan, et al.
Published: (2025)
by: An, Ruichuan, et al.
Published: (2025)
Jarvis: Towards Personalized AI Assistant via Personal KV-Cache Retrieval
by: Xu, Binxiao, et al.
Published: (2025)
by: Xu, Binxiao, et al.
Published: (2025)
Aligning VLM Assistants with Personalized Situated Cognition
by: Li, Yongqi, et al.
Published: (2025)
by: Li, Yongqi, et al.
Published: (2025)
PersonaVLM: Long-Term Personalized Multimodal LLMs
by: Nie, Chang, et al.
Published: (2026)
by: Nie, Chang, et al.
Published: (2026)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
by: An, Ruichuan, et al.
Published: (2025)
by: An, Ruichuan, et al.
Published: (2025)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
by: An, Ruichuan, et al.
Published: (2024)
by: An, Ruichuan, et al.
Published: (2024)
UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
by: An, Ruichuan, et al.
Published: (2025)
by: An, Ruichuan, et al.
Published: (2025)
M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions
by: Feng, Junyu, et al.
Published: (2026)
by: Feng, Junyu, et al.
Published: (2026)
A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs
by: Zhao, Wangbo, et al.
Published: (2024)
by: Zhao, Wangbo, et al.
Published: (2024)
Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning
by: Shen, Zijun, et al.
Published: (2026)
by: Shen, Zijun, et al.
Published: (2026)
MyVLM: Personalizing VLMs for User-Specific Queries
by: Alaluf, Yuval, et al.
Published: (2024)
by: Alaluf, Yuval, et al.
Published: (2024)
Multilingual VLM Training: Adapting an English-Trained VLM to French
by: Lahmi, Jules, et al.
Published: (2025)
by: Lahmi, Jules, et al.
Published: (2025)
The Pervasive Blind Spot: Benchmarking VLM Inference Risks on Everyday Personal Videos
by: Zhang, Shuning, et al.
Published: (2025)
by: Zhang, Shuning, et al.
Published: (2025)
Q-VLM: Post-training Quantization for Large Vision-Language Models
by: Wang, Changyuan, et al.
Published: (2024)
by: Wang, Changyuan, et al.
Published: (2024)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching
by: Chang, Zewei, et al.
Published: (2025)
by: Chang, Zewei, et al.
Published: (2025)
Large VLM-based Stylized Sports Captioning
by: Dhar, Sauptik, et al.
Published: (2025)
by: Dhar, Sauptik, et al.
Published: (2025)
AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning
by: Xu, Binxiao, et al.
Published: (2026)
by: Xu, Binxiao, et al.
Published: (2026)
VLM-KD: Knowledge Distillation from VLM for Long-Tail Visual Recognition
by: Zhang, Zaiwei, et al.
Published: (2024)
by: Zhang, Zaiwei, et al.
Published: (2024)
edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer
by: Qian, Chen, et al.
Published: (2025)
by: Qian, Chen, et al.
Published: (2025)
PerPilot: Personalizing VLM-based Mobile Agents via Memory and Exploration
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
Enhancing Video Transformers for Action Understanding with VLM-aided Training
by: Lu, Hui, et al.
Published: (2024)
by: Lu, Hui, et al.
Published: (2024)
GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
by: Wei, Tong, et al.
Published: (2025)
by: Wei, Tong, et al.
Published: (2025)
VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing
by: Pan, Guanyuan, et al.
Published: (2026)
by: Pan, Guanyuan, et al.
Published: (2026)
Spa-VLM: Stealthy Poisoning Attacks on RAG-based VLM
by: Yu, Lei, et al.
Published: (2025)
by: Yu, Lei, et al.
Published: (2025)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
by: Ji, Yatai, et al.
Published: (2024)
by: Ji, Yatai, et al.
Published: (2024)
Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation
by: Sun, Mingyang, et al.
Published: (2025)
by: Sun, Mingyang, et al.
Published: (2025)
Forecasting Gold Volatility in an Uncertain Environment: The Roles of Large and Small Shock Sizes
by: Li Zhang, et al.
Published: (2025)
by: Li Zhang, et al.
Published: (2025)
PRIME: Large Language Model Personalization with Cognitive Dual-Memory and Personalized Thought Process
by: Zhang, Xinliang Frederick, et al.
Published: (2025)
by: Zhang, Xinliang Frederick, et al.
Published: (2025)
UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
by: Bai, Chengyu, et al.
Published: (2025)
by: Bai, Chengyu, et al.
Published: (2025)
FedVLM: Scalable Personalized Vision-Language Models through Federated Learning
by: Mitra, Arkajyoti, et al.
Published: (2025)
by: Mitra, Arkajyoti, et al.
Published: (2025)
CogVLM: Visual Expert for Pretrained Language Models
by: Wang, Weihan, et al.
Published: (2023)
by: Wang, Weihan, et al.
Published: (2023)
Learning Dynamics of VLM Finetuning
by: Zhang, Jusheng, et al.
Published: (2025)
by: Zhang, Jusheng, et al.
Published: (2025)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
by: Singh, Aditya Kumar, et al.
Published: (2026)
by: Singh, Aditya Kumar, et al.
Published: (2026)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
by: Cai, Kaitong, et al.
Published: (2025)
by: Cai, Kaitong, et al.
Published: (2025)
SafeCoT: Improving VLM Safety with Minimal Reasoning
by: Ma, Jiachen, et al.
Published: (2025)
by: Ma, Jiachen, et al.
Published: (2025)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
by: Jiang, Chaoya, et al.
Published: (2025)
by: Jiang, Chaoya, et al.
Published: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
by: Wang, Zekun, et al.
Published: (2025)
by: Wang, Zekun, et al.
Published: (2025)
Prospect Personalized Recommendation on Large Language Model-based Agent Platform
by: Zhang, Jizhi, et al.
Published: (2024)
by: Zhang, Jizhi, et al.
Published: (2024)
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
by: Zhang, Di, et al.
Published: (2024)
by: Zhang, Di, et al.
Published: (2024)
Similar Items
-
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
by: An, Ruichuan, et al.
Published: (2025) -
Jarvis: Towards Personalized AI Assistant via Personal KV-Cache Retrieval
by: Xu, Binxiao, et al.
Published: (2025) -
Aligning VLM Assistants with Personalized Situated Cognition
by: Li, Yongqi, et al.
Published: (2025) -
PersonaVLM: Long-Term Personalized Multimodal LLMs
by: Nie, Chang, et al.
Published: (2026) -
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
by: An, Ruichuan, et al.
Published: (2025)