Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yuehao, Guan, Shanyan, Zhang, Weijia, Shang, Xuanming, Ge, Yanhao, Li, Wei, Ma, Chao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing
by: Liu, Yuehao, et al.
Published: (2026)
by: Liu, Yuehao, et al.
Published: (2026)
Guiding a Diffusion Model by Swapping Its Tokens
by: Zhang, Weijia, et al.
Published: (2026)
by: Zhang, Weijia, et al.
Published: (2026)
Neural Material Adaptor for Visual Grounding of Intrinsic Dynamics
by: Cao, Junyi, et al.
Published: (2024)
by: Cao, Junyi, et al.
Published: (2024)
HybridBooth: Hybrid Prompt Inversion for Efficient Subject-Driven Generation
by: Guan, Shanyan, et al.
Published: (2024)
by: Guan, Shanyan, et al.
Published: (2024)
NeoWorld: Neural Simulation of Explorable Virtual Worlds via Progressive 3D Unfolding
by: Zhao, Yanpeng, et al.
Published: (2025)
by: Zhao, Yanpeng, et al.
Published: (2025)
RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations
by: Ge, Yanhao, et al.
Published: (2026)
by: Ge, Yanhao, et al.
Published: (2026)
Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
by: Ci, En, et al.
Published: (2025)
by: Ci, En, et al.
Published: (2025)
Cross-Architecture Distillation Made Simple with Redundancy Suppression
by: Zhang, Weijia, et al.
Published: (2025)
by: Zhang, Weijia, et al.
Published: (2025)
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
by: Zhao, Chen, et al.
Published: (2025)
by: Zhao, Chen, et al.
Published: (2025)
VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset
by: Chen, Zhizhou, et al.
Published: (2026)
by: Chen, Zhizhou, et al.
Published: (2026)
PostEdit: Posterior Sampling for Efficient Zero-Shot Image Editing
by: Tian, Feng, et al.
Published: (2024)
by: Tian, Feng, et al.
Published: (2024)
Grounding Everything in Tokens for Multimodal Large Language Models
by: Ren, Xiangxuan, et al.
Published: (2025)
by: Ren, Xiangxuan, et al.
Published: (2025)
QuadMamba: Learning Quadtree-based Selective Scan for Visual State Space Model
by: Xie, Fei, et al.
Published: (2024)
by: Xie, Fei, et al.
Published: (2024)
Measuring Epistemic Humility in Multimodal Large Language Models
by: Tong, Bingkui, et al.
Published: (2025)
by: Tong, Bingkui, et al.
Published: (2025)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
by: Cao, Qinglong, et al.
Published: (2026)
by: Cao, Qinglong, et al.
Published: (2026)
Learning from Streaming Video with Orthogonal Gradients
by: Han, Tengda, et al.
Published: (2025)
by: Han, Tengda, et al.
Published: (2025)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
by: Jiang, Jingjing, et al.
Published: (2025)
by: Jiang, Jingjing, et al.
Published: (2025)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
by: Shen, Leyang, et al.
Published: (2024)
by: Shen, Leyang, et al.
Published: (2024)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
by: Wu, Mingrui, et al.
Published: (2024)
by: Wu, Mingrui, et al.
Published: (2024)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
by: Wen, Zichen, et al.
Published: (2025)
by: Wen, Zichen, et al.
Published: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
by: Yang, Shuai, et al.
Published: (2024)
by: Yang, Shuai, et al.
Published: (2024)
iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models
by: Cui, Xuezhi, et al.
Published: (2026)
by: Cui, Xuezhi, et al.
Published: (2026)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
by: Ge, Mengying, et al.
Published: (2024)
by: Ge, Mengying, et al.
Published: (2024)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
Safety of Multimodal Large Language Models on Images and Texts
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models
by: Hu, Qingqiao, et al.
Published: (2025)
by: Hu, Qingqiao, et al.
Published: (2025)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
by: Huang, Xiaoshuang, et al.
Published: (2024)
by: Huang, Xiaoshuang, et al.
Published: (2024)
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
by: Tong, Xinyang, et al.
Published: (2024)
by: Tong, Xinyang, et al.
Published: (2024)
CP-VoteNet: Contrastive Prototypical VoteNet for Few-Shot Point Cloud Object Detection
by: Li, Xuejing, et al.
Published: (2024)
by: Li, Xuejing, et al.
Published: (2024)
FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models
by: Zhang, Zhikai, et al.
Published: (2024)
by: Zhang, Zhikai, et al.
Published: (2024)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
by: Jiang, Chaoya, et al.
Published: (2023)
by: Jiang, Chaoya, et al.
Published: (2023)
Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization
by: Li, Jinlong, et al.
Published: (2024)
by: Li, Jinlong, et al.
Published: (2024)
Boosting Multimodal Learning via Disentangled Gradient Learning
by: Wei, Shicai, et al.
Published: (2025)
by: Wei, Shicai, et al.
Published: (2025)
Private Gradient Estimation is Useful for Generative Modeling
by: Liu, Bochao, et al.
Published: (2023)
by: Liu, Bochao, et al.
Published: (2023)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
by: Li, Bohao, et al.
Published: (2024)
by: Li, Bohao, et al.
Published: (2024)
MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning
by: Wang, Chenyu, et al.
Published: (2024)
by: Wang, Chenyu, et al.
Published: (2024)
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models
by: Guo, Haiyang, et al.
Published: (2026)
by: Guo, Haiyang, et al.
Published: (2026)
DINO-RotateMatch: A Rotation-Aware Deep Framework for Robust Image Matching in Large-Scale 3D Reconstruction
by: Zhang, Kaichen, et al.
Published: (2025)
by: Zhang, Kaichen, et al.
Published: (2025)
Improving Multimodal Large Language Models Using Continual Learning
by: Srivastava, Shikhar, et al.
Published: (2024)
by: Srivastava, Shikhar, et al.
Published: (2024)
MLLM-CL: Continual Learning for Multimodal Large Language Models
by: Zhao, Hongbo, et al.
Published: (2025)
by: Zhao, Hongbo, et al.
Published: (2025)
Similar Items
-
ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing
by: Liu, Yuehao, et al.
Published: (2026) -
Guiding a Diffusion Model by Swapping Its Tokens
by: Zhang, Weijia, et al.
Published: (2026) -
Neural Material Adaptor for Visual Grounding of Intrinsic Dynamics
by: Cao, Junyi, et al.
Published: (2024) -
HybridBooth: Hybrid Prompt Inversion for Efficient Subject-Driven Generation
by: Guan, Shanyan, et al.
Published: (2024) -
NeoWorld: Neural Simulation of Explorable Virtual Worlds via Progressive 3D Unfolding
by: Zhao, Yanpeng, et al.
Published: (2025)