Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Hongsheng, Ji, Zhong, Liu, Jingren, Pang, Yanwei, Han, Jungong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Interpretable Few-Shot Image Classification via Prototypical Concept-Guided Mixture of LoRA Experts
by: Ji, Zhong, et al.
Published: (2025)
by: Ji, Zhong, et al.
Published: (2025)
A Fresh Look at Generalized Category Discovery through Non-negative Matrix Factorization
by: Ji, Zhong, et al.
Published: (2024)
by: Ji, Zhong, et al.
Published: (2024)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
by: Wang, Sudong, et al.
Published: (2025)
by: Wang, Sudong, et al.
Published: (2025)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
by: Li, Sijie, et al.
Published: (2026)
by: Li, Sijie, et al.
Published: (2026)
iEBAKER: Improved Remote Sensing Image-Text Retrieval Framework via Eliminate Before Align and Keyword Explicit Reasoning
by: Zhang, Yan, et al.
Published: (2025)
by: Zhang, Yan, et al.
Published: (2025)
Underlying Semantic Diffusion for Effective and Efficient In-Context Learning
by: Ji, Zhong, et al.
Published: (2025)
by: Ji, Zhong, et al.
Published: (2025)
Vision and Language Integration for Domain Generalization
by: Wang, Yanmei, et al.
Published: (2025)
by: Wang, Yanmei, et al.
Published: (2025)
MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models
by: Zhou, Xunlan, et al.
Published: (2026)
by: Zhou, Xunlan, et al.
Published: (2026)
Learning without Forgetting for Vision-Language Models
by: Zhou, Da-Wei, et al.
Published: (2023)
by: Zhou, Da-Wei, et al.
Published: (2023)
Continual Learning with Vision-Language Models via Semantic-Geometry Preservation
by: He, Chiyuan, et al.
Published: (2026)
by: He, Chiyuan, et al.
Published: (2026)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
by: Hao, Tianxiang, et al.
Published: (2023)
by: Hao, Tianxiang, et al.
Published: (2023)
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
by: Liu, Jiajin, et al.
Published: (2026)
by: Liu, Jiajin, et al.
Published: (2026)
Hierarchy-Consistent Learning and Adaptive Loss Balancing for Hierarchical Multi-Label Classification
by: Jiang, Ruobing, et al.
Published: (2025)
by: Jiang, Ruobing, et al.
Published: (2025)
Raformer: Redundancy-Aware Transformer for Video Wire Inpainting
by: Ji, Zhong, et al.
Published: (2024)
by: Ji, Zhong, et al.
Published: (2024)
MMRL: Multi-Modal Representation Learning for Vision-Language Models
by: Guo, Yuncheng, et al.
Published: (2025)
by: Guo, Yuncheng, et al.
Published: (2025)
Optimal Transport Adapter Tuning for Bridging Modality Gaps in Few-Shot Remote Sensing Scene Classification
by: Ji, Zhong, et al.
Published: (2025)
by: Ji, Zhong, et al.
Published: (2025)
Continual Distillation Learning: Knowledge Distillation in Prompt-based Continual Learning
by: Zhang, Qifan, et al.
Published: (2024)
by: Zhang, Qifan, et al.
Published: (2024)
Dual-Stage Invariant Continual Learning under Extreme Visual Sparsity
by: Zhang, Rangya, et al.
Published: (2026)
by: Zhang, Rangya, et al.
Published: (2026)
STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference
by: Guo, Yichen, et al.
Published: (2025)
by: Guo, Yichen, et al.
Published: (2025)
VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones
by: Shen, Lefei, et al.
Published: (2025)
by: Shen, Lefei, et al.
Published: (2025)
Densely Distilling Cumulative Knowledge for Continual Learning
by: Shi, Zenglin, et al.
Published: (2024)
by: Shi, Zenglin, et al.
Published: (2024)
Synthetic Data is an Elegant GIFT for Continual Vision-Language Models
by: Wu, Bin, et al.
Published: (2025)
by: Wu, Bin, et al.
Published: (2025)
Improving Vision-Language-Action Model with Online Reinforcement Learning
by: Guo, Yanjiang, et al.
Published: (2025)
by: Guo, Yanjiang, et al.
Published: (2025)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
by: Farina, Matteo, et al.
Published: (2025)
by: Farina, Matteo, et al.
Published: (2025)
MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data
by: Li, Zongxia, et al.
Published: (2026)
by: Li, Zongxia, et al.
Published: (2026)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
by: Pang, Xingzhou, et al.
Published: (2026)
by: Pang, Xingzhou, et al.
Published: (2026)
Integrating Present and Past in Unsupervised Continual Learning
by: Zhang, Yipeng, et al.
Published: (2024)
by: Zhang, Yipeng, et al.
Published: (2024)
GRMLR: Knowledge-Enhanced Small-Data Learning for Deep-Sea Cold Seep Stage Inference
by: Zhou, Chenxu, et al.
Published: (2026)
by: Zhou, Chenxu, et al.
Published: (2026)
SGW-based Multi-Task Learning in Vision Tasks
by: Zhang, Ruiyuan, et al.
Published: (2024)
by: Zhang, Ruiyuan, et al.
Published: (2024)
Continual Learning in Vision-Language Models via Aligned Model Merging
by: Sokar, Ghada, et al.
Published: (2025)
by: Sokar, Ghada, et al.
Published: (2025)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
by: Ye, Jiabo, et al.
Published: (2024)
by: Ye, Jiabo, et al.
Published: (2024)
Negative Label Guided OOD Detection with Pretrained Vision-Language Models
by: Jiang, Xue, et al.
Published: (2024)
by: Jiang, Xue, et al.
Published: (2024)
Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition
by: Tang, Wei, et al.
Published: (2025)
by: Tang, Wei, et al.
Published: (2025)
NLPrompt: Noise-Label Prompt Learning for Vision-Language Models
by: Pan, Bikang, et al.
Published: (2024)
by: Pan, Bikang, et al.
Published: (2024)
MGPATH: Vision-Language Model with Multi-Granular Prompt Learning for Few-Shot WSI Classification
by: Nguyen, Anh-Tien, et al.
Published: (2025)
by: Nguyen, Anh-Tien, et al.
Published: (2025)
Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
by: Lin, Haitao, et al.
Published: (2026)
by: Lin, Haitao, et al.
Published: (2026)
BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation
by: Chen, Baoyou, et al.
Published: (2026)
by: Chen, Baoyou, et al.
Published: (2026)
View Invariant Learning for Vision-Language Navigation in Continuous Environments
by: Sun, Josh Qixuan, et al.
Published: (2025)
by: Sun, Josh Qixuan, et al.
Published: (2025)
Continual Learning of Achieving Forgetting-free and Positive Knowledge Transfer
by: Wang, Zhi, et al.
Published: (2026)
by: Wang, Zhi, et al.
Published: (2026)
Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models
by: Liu, Yuehao, et al.
Published: (2026)
by: Liu, Yuehao, et al.
Published: (2026)
Similar Items
-
Interpretable Few-Shot Image Classification via Prototypical Concept-Guided Mixture of LoRA Experts
by: Ji, Zhong, et al.
Published: (2025) -
A Fresh Look at Generalized Category Discovery through Non-negative Matrix Factorization
by: Ji, Zhong, et al.
Published: (2024) -
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
by: Wang, Sudong, et al.
Published: (2025) -
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
by: Li, Sijie, et al.
Published: (2026) -
iEBAKER: Improved Remote Sensing Image-Text Retrieval Framework via Eliminate Before Align and Keyword Explicit Reasoning
by: Zhang, Yan, et al.
Published: (2025)