HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Haiyang, Zeng, Fanhu, Xiang, Ziwei, Zhu, Fei, Wang, Da-Han, Zhang, Xu-Yao, Liu, Cheng-Lin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLaVA-c: Continual Improved Visual Instruction Tuning
par: Liu, Wenzhuo, et autres
Publié: (2025)
par: Liu, Wenzhuo, et autres
Publié: (2025)
ModalPrompt: Towards Efficient Multimodal Continual Instruction Tuning with Dual-Modality Guided Prompt
par: Zeng, Fanhu, et autres
Publié: (2024)
par: Zeng, Fanhu, et autres
Publié: (2024)
MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark
par: Guo, Haiyang, et autres
Publié: (2025)
par: Guo, Haiyang, et autres
Publié: (2025)
HiDe-PET: Continual Learning via Hierarchical Decomposition of Parameter-Efficient Tuning
par: Wang, Liyuan, et autres
Publié: (2024)
par: Wang, Liyuan, et autres
Publié: (2024)
Federated Continual Instruction Tuning
par: Guo, Haiyang, et autres
Publié: (2025)
par: Guo, Haiyang, et autres
Publié: (2025)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
par: Zhang, Yuanhan, et autres
Publié: (2024)
par: Zhang, Yuanhan, et autres
Publié: (2024)
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
par: Liu, Xianjie, et autres
Publié: (2025)
par: Liu, Xianjie, et autres
Publié: (2025)
LLaVA-Docent: Instruction Tuning with Multimodal Large Language Model to Support Art Appreciation Education
par: Lee, Unggi, et autres
Publié: (2024)
par: Lee, Unggi, et autres
Publié: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
par: Sun, Shenghuan, et autres
Publié: (2024)
par: Sun, Shenghuan, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
par: Chaubey, Ashutosh, et autres
Publié: (2025)
par: Chaubey, Ashutosh, et autres
Publié: (2025)
LLaVA-Critic: Learning to Evaluate Multimodal Models
par: Xiong, Tianyi, et autres
Publié: (2024)
par: Xiong, Tianyi, et autres
Publié: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
par: Liang, Han, et autres
Publié: (2024)
par: Liang, Han, et autres
Publié: (2024)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
par: Huang, Runhui, et autres
Publié: (2024)
par: Huang, Runhui, et autres
Publié: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)
par: Yan, Dawei, et autres
Publié: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
par: Zheng, Pengcheng, et autres
Publié: (2026)
par: Zheng, Pengcheng, et autres
Publié: (2026)
DESIRE: Dynamic Knowledge Consolidation for Rehearsal-Free Continual Learning
par: Guo, Haiyang, et autres
Publié: (2024)
par: Guo, Haiyang, et autres
Publié: (2024)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
par: Chay-intr, T., et autres
Publié: (2025)
par: Chay-intr, T., et autres
Publié: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
par: Andersland, Michael
Publié: (2024)
par: Andersland, Michael
Publié: (2024)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding
par: Sun, Boyuan, et autres
Publié: (2025)
par: Sun, Boyuan, et autres
Publié: (2025)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)
par: Shu, Fangxun, et autres
Publié: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
par: Shi, Wenhao, et autres
Publié: (2024)
par: Shi, Wenhao, et autres
Publié: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
par: Zhang, Yi-Fan, et autres
Publié: (2024)
par: Zhang, Yi-Fan, et autres
Publié: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
par: An, Xiang, et autres
Publié: (2025)
par: An, Xiang, et autres
Publié: (2025)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
par: Huang, Wenxuan, et autres
Publié: (2024)
par: Huang, Wenxuan, et autres
Publié: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
par: Cocchi, Federico, et autres
Publié: (2025)
par: Cocchi, Federico, et autres
Publié: (2025)
LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning
par: Zhang, Dewen, et autres
Publié: (2025)
par: Zhang, Dewen, et autres
Publié: (2025)
LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models
par: Zhao, Hengyuan, et autres
Publié: (2025)
par: Zhao, Hengyuan, et autres
Publié: (2025)
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models
par: Guo, Haiyang, et autres
Publié: (2026)
par: Guo, Haiyang, et autres
Publié: (2026)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models
par: Hu, Xinmiao, et autres
Publié: (2025)
par: Hu, Xinmiao, et autres
Publié: (2025)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
par: Liang, Yuci, et autres
Publié: (2024)
par: Liang, Yuci, et autres
Publié: (2024)
Documents similaires
-
LLaVA-c: Continual Improved Visual Instruction Tuning
par: Liu, Wenzhuo, et autres
Publié: (2025) -
ModalPrompt: Towards Efficient Multimodal Continual Instruction Tuning with Dual-Modality Guided Prompt
par: Zeng, Fanhu, et autres
Publié: (2024) -
MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark
par: Guo, Haiyang, et autres
Publié: (2025) -
HiDe-PET: Continual Learning via Hierarchical Decomposition of Parameter-Efficient Tuning
par: Wang, Liyuan, et autres
Publié: (2024) -
Federated Continual Instruction Tuning
par: Guo, Haiyang, et autres
Publié: (2025)