Model Merging to Maintain Language-Only Performance in Developmentally Plausible Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Takmaz, Ece, Bylinina, Lisa, Dotlacil, Jakub |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Correlates of Image Memorability in Vision Encoders: Activations, Attention Entropy, Patch Uniformity and Autoencoder Losses
par: Takmaz, Ece, et autres
Publié: (2025)
par: Takmaz, Ece, et autres
Publié: (2025)
Decoding Emotions in Abstract Art: Cognitive Plausibility of CLIP in Recognizing Color-Emotion Associations
par: Widhoelzl, Hanna-Sophia, et autres
Publié: (2024)
par: Widhoelzl, Hanna-Sophia, et autres
Publié: (2024)
Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication
par: Merlo, Filippo, et autres
Publié: (2025)
par: Merlo, Filippo, et autres
Publié: (2025)
Describing Images $\textit{Fast and Slow}$: Quantifying and Predicting the Variation in Human Signals during Visuo-Linguistic Processes
par: Takmaz, Ece, et autres
Publié: (2024)
par: Takmaz, Ece, et autres
Publié: (2024)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
par: Du, Yiyang, et autres
Publié: (2025)
par: Du, Yiyang, et autres
Publié: (2025)
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024)
par: Dziadzio, Sebastian, et autres
Publié: (2024)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
par: Liu, Xinxin, et autres
Publié: (2026)
par: Liu, Xinxin, et autres
Publié: (2026)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
par: Moll, Johannes, et autres
Publié: (2025)
par: Moll, Johannes, et autres
Publié: (2025)
Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging
par: Fu, Zihang, et autres
Publié: (2026)
par: Fu, Zihang, et autres
Publié: (2026)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
par: Kamoi, Ryo, et autres
Publié: (2024)
par: Kamoi, Ryo, et autres
Publié: (2024)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
par: Liu, Wenjie, et autres
Publié: (2026)
par: Liu, Wenjie, et autres
Publié: (2026)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Do Multimodal Large Language Models Understand Welding?
par: Khvatskii, Grigorii, et autres
Publié: (2025)
par: Khvatskii, Grigorii, et autres
Publié: (2025)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
par: Li, Yun, et autres
Publié: (2025)
par: Li, Yun, et autres
Publié: (2025)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
par: Chen, Liangyu, et autres
Publié: (2025)
par: Chen, Liangyu, et autres
Publié: (2025)
Optimizing Multimodal Language Models through Attention-based Interpretability
par: Sergeev, Alexander, et autres
Publié: (2025)
par: Sergeev, Alexander, et autres
Publié: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
par: Nazir, Maham, et autres
Publié: (2026)
par: Nazir, Maham, et autres
Publié: (2026)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
You Only Scan Once: Efficient Multi-dimension Sequential Modeling with LightNet
par: Qin, Zhen, et autres
Publié: (2024)
par: Qin, Zhen, et autres
Publié: (2024)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
par: Xing, Bohao, et autres
Publié: (2025)
par: Xing, Bohao, et autres
Publié: (2025)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
par: Zhan, Xiaoyu, et autres
Publié: (2025)
par: Zhan, Xiaoyu, et autres
Publié: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
par: Sasagawa, Keito, et autres
Publié: (2025)
par: Sasagawa, Keito, et autres
Publié: (2025)
UniChange: Unifying Change Detection with Multimodal Large Language Model
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
par: Tu, Yahan, et autres
Publié: (2024)
par: Tu, Yahan, et autres
Publié: (2024)
Exploring Multimodal Large Language Models for Radiology Report Error-checking
par: Wu, Jinge, et autres
Publié: (2023)
par: Wu, Jinge, et autres
Publié: (2023)
Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models
par: Zhu, Minjie, et autres
Publié: (2024)
par: Zhu, Minjie, et autres
Publié: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
par: Kim, Mingyeong, et autres
Publié: (2026)
par: Kim, Mingyeong, et autres
Publié: (2026)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
par: Xu, Mengya, et autres
Publié: (2025)
par: Xu, Mengya, et autres
Publié: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
par: HyperAI Team, et autres
Publié: (2025)
par: HyperAI Team, et autres
Publié: (2025)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
par: Zhang, Zefeng, et autres
Publié: (2025)
par: Zhang, Zefeng, et autres
Publié: (2025)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
par: Liu, Jianyu, et autres
Publié: (2025)
par: Liu, Jianyu, et autres
Publié: (2025)
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
par: Elhenawy, Mohammed, et autres
Publié: (2025)
par: Elhenawy, Mohammed, et autres
Publié: (2025)
Documents similaires
-
Correlates of Image Memorability in Vision Encoders: Activations, Attention Entropy, Patch Uniformity and Autoencoder Losses
par: Takmaz, Ece, et autres
Publié: (2025) -
Decoding Emotions in Abstract Art: Cognitive Plausibility of CLIP in Recognizing Color-Emotion Associations
par: Widhoelzl, Hanna-Sophia, et autres
Publié: (2024) -
Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication
par: Merlo, Filippo, et autres
Publié: (2025) -
Describing Images $\textit{Fast and Slow}$: Quantifying and Predicting the Variation in Human Signals during Visuo-Linguistic Processes
par: Takmaz, Ece, et autres
Publié: (2024) -
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
par: Du, Yiyang, et autres
Publié: (2025)