SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Reza, Md Kaykobad, Patil, Ameya, Ayrapetian, Edward, Asif, M. Salman |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robust Multimodal Learning via Cross-Modal Proxy Tokens
par: Reza, Md Kaykobad, et autres
Publié: (2025)
par: Reza, Md Kaykobad, et autres
Publié: (2025)
MMP: Towards Robust Multi-Modal Learning with Masked Modality Projection
par: Nezakati, Niki, et autres
Publié: (2024)
par: Nezakati, Niki, et autres
Publié: (2024)
MMSFormer: Multimodal Transformer for Material and Semantic Segmentation
par: Reza, Md Kaykobad, et autres
Publié: (2023)
par: Reza, Md Kaykobad, et autres
Publié: (2023)
Robust Multimodal Learning with Missing Modalities via Parameter-Efficient Adaptation
par: Reza, Md Kaykobad, et autres
Publié: (2023)
par: Reza, Md Kaykobad, et autres
Publié: (2023)
DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++
par: Kabir, Shahriar, et autres
Publié: (2026)
par: Kabir, Shahriar, et autres
Publié: (2026)
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024)
par: Dziadzio, Sebastian, et autres
Publié: (2024)
Subspace-Boosted Model Merging
par: Skorobogat, Ronald, et autres
Publié: (2025)
par: Skorobogat, Ronald, et autres
Publié: (2025)
FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models
par: Huang, Chenyu, et autres
Publié: (2026)
par: Huang, Chenyu, et autres
Publié: (2026)
Bridging Domains through Subspace-Aware Model Merging
par: Chaves, Levy, et autres
Publié: (2026)
par: Chaves, Levy, et autres
Publié: (2026)
Transform-Dependent Adversarial Attacks
par: Tan, Yaoteng, et autres
Publié: (2024)
par: Tan, Yaoteng, et autres
Publié: (2024)
Logic-RAG: Augmenting Large Multimodal Models with Visual-Spatial Knowledge for Road Scene Understanding
par: Kabir, Imran, et autres
Publié: (2025)
par: Kabir, Imran, et autres
Publié: (2025)
Improving Multimodal Large Language Models Using Continual Learning
par: Srivastava, Shikhar, et autres
Publié: (2024)
par: Srivastava, Shikhar, et autres
Publié: (2024)
FLAVARS: A Multimodal Foundational Language and Vision Alignment Model for Remote Sensing
par: Corley, Isaac, et autres
Publié: (2025)
par: Corley, Isaac, et autres
Publié: (2025)
Large Convolutional Model Tuning via Filter Subspace
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
Improved Alignment of Modalities in Large Vision Language Models
par: Jangra, Kartik, et autres
Publié: (2025)
par: Jangra, Kartik, et autres
Publié: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models
par: Alam, Md Tanvirul
Publié: (2026)
par: Alam, Md Tanvirul
Publié: (2026)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
par: Salman, Shaeke, et autres
Publié: (2024)
par: Salman, Shaeke, et autres
Publié: (2024)
DC-Merge: Improving Model Merging with Directional Consistency
par: Zhang, Han-Chen, et autres
Publié: (2026)
par: Zhang, Han-Chen, et autres
Publié: (2026)
Merging and Disentangling Views in Visual Reinforcement Learning for Robotic Manipulation
par: Almuzairee, Abdulaziz, et autres
Publié: (2025)
par: Almuzairee, Abdulaziz, et autres
Publié: (2025)
SSAM: Self-Supervised Association Modeling for Test-Time Adaption
par: Wang, Yaxiong, et autres
Publié: (2025)
par: Wang, Yaxiong, et autres
Publié: (2025)
AdaMerging: Adaptive Model Merging for Multi-Task Learning
par: Yang, Enneng, et autres
Publié: (2023)
par: Yang, Enneng, et autres
Publié: (2023)
EMR-Merging: Tuning-Free High-Performance Model Merging
par: Huang, Chenyu, et autres
Publié: (2024)
par: Huang, Chenyu, et autres
Publié: (2024)
Promptception: How Sensitive Are Large Multimodal Models to Prompts?
par: Ismithdeen, Mohamed Insaf, et autres
Publié: (2025)
par: Ismithdeen, Mohamed Insaf, et autres
Publié: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Introducing Visual Perception Token into Multimodal Large Language Model
par: Yu, Runpeng, et autres
Publié: (2025)
par: Yu, Runpeng, et autres
Publié: (2025)
Parameter-efficient Multi-Task and Multi-Domain Learning using Factorized Tensor Networks
par: Garg, Yash, et autres
Publié: (2023)
par: Garg, Yash, et autres
Publié: (2023)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
par: Miao, Yanting, et autres
Publié: (2026)
par: Miao, Yanting, et autres
Publié: (2026)
SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling
par: Lendering, Camile, et autres
Publié: (2026)
par: Lendering, Camile, et autres
Publié: (2026)
Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropy
par: Jeong, Wooseong, et autres
Publié: (2026)
par: Jeong, Wooseong, et autres
Publié: (2026)
Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
par: Jennings, Roy H., et autres
Publié: (2025)
par: Jennings, Roy H., et autres
Publié: (2025)
Saliency-Aware Model Merging
par: Park, Jungin, et autres
Publié: (2026)
par: Park, Jungin, et autres
Publié: (2026)
Large-Scale Riemannian Meta-Optimization via Subspace Adaptation
par: Yu, Peilin, et autres
Publié: (2025)
par: Yu, Peilin, et autres
Publié: (2025)
X-VILA: Cross-Modality Alignment for Large Language Model
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area
par: Li, Junxian, et autres
Publié: (2024)
par: Li, Junxian, et autres
Publié: (2024)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
par: Sun, Zhihao, et autres
Publié: (2024)
par: Sun, Zhihao, et autres
Publié: (2024)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
par: Cai, Chengyi, et autres
Publié: (2026)
par: Cai, Chengyi, et autres
Publié: (2026)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
par: Wang, Enguang, et autres
Publié: (2026)
par: Wang, Enguang, et autres
Publié: (2026)
Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis
par: Trinci, Tomaso, et autres
Publié: (2026)
par: Trinci, Tomaso, et autres
Publié: (2026)
WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
par: Zhou, Runjie, et autres
Publié: (2026)
par: Zhou, Runjie, et autres
Publié: (2026)
Documents similaires
-
Robust Multimodal Learning via Cross-Modal Proxy Tokens
par: Reza, Md Kaykobad, et autres
Publié: (2025) -
MMP: Towards Robust Multi-Modal Learning with Masked Modality Projection
par: Nezakati, Niki, et autres
Publié: (2024) -
MMSFormer: Multimodal Transformer for Material and Semantic Segmentation
par: Reza, Md Kaykobad, et autres
Publié: (2023) -
Robust Multimodal Learning with Missing Modalities via Parameter-Efficient Adaptation
par: Reza, Md Kaykobad, et autres
Publié: (2023) -
DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++
par: Kabir, Shahriar, et autres
Publié: (2026)