Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Enneng, Shen, Li, Guo, Guibing, Wang, Xingwei, Cao, Xiaochun, Zhang, Jie, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AdaMerging: Adaptive Model Merging for Multi-Task Learning
von: Yang, Enneng, et al.
Veröffentlicht: (2023)
von: Yang, Enneng, et al.
Veröffentlicht: (2023)
Representation Surgery for Multi-Task Model Merging
von: Yang, Enneng, et al.
Veröffentlicht: (2024)
von: Yang, Enneng, et al.
Veröffentlicht: (2024)
SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery
von: Yang, Enneng, et al.
Veröffentlicht: (2024)
von: Yang, Enneng, et al.
Veröffentlicht: (2024)
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
von: Shen, Li, et al.
Veröffentlicht: (2024)
von: Shen, Li, et al.
Veröffentlicht: (2024)
RobustMerge: Parameter-Efficient Model Merging for MLLMs with Direction Robustness
von: Zeng, Fanhu, et al.
Veröffentlicht: (2025)
von: Zeng, Fanhu, et al.
Veröffentlicht: (2025)
Linking Perception, Confidence and Accuracy in MLLMs
von: Du, Yuetian, et al.
Veröffentlicht: (2026)
von: Du, Yuetian, et al.
Veröffentlicht: (2026)
D$^{3}$ToM: Decider-Guided Dynamic Token Merging for Accelerating Diffusion MLLMs
von: Chang, Shuochen, et al.
Veröffentlicht: (2025)
von: Chang, Shuochen, et al.
Veröffentlicht: (2025)
Unhackable Temporal Rewarding for Scalable Video MLLMs
von: Yu, En, et al.
Veröffentlicht: (2025)
von: Yu, En, et al.
Veröffentlicht: (2025)
Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations
von: Li, Shuo, et al.
Veröffentlicht: (2025)
von: Li, Shuo, et al.
Veröffentlicht: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay
von: Zhang, Jun, et al.
Veröffentlicht: (2024)
von: Zhang, Jun, et al.
Veröffentlicht: (2024)
From Text to Pixel: Advancing Long-Context Understanding in MLLMs
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG
von: Wang, Wenbin, et al.
Veröffentlicht: (2025)
von: Wang, Wenbin, et al.
Veröffentlicht: (2025)
An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
von: Wu, Daiqing, et al.
Veröffentlicht: (2025)
von: Wu, Daiqing, et al.
Veröffentlicht: (2025)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
von: Du, Yiyang, et al.
Veröffentlicht: (2025)
von: Du, Yiyang, et al.
Veröffentlicht: (2025)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
von: Guo, Pinxue, et al.
Veröffentlicht: (2025)
von: Guo, Pinxue, et al.
Veröffentlicht: (2025)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
von: Wu, Hao, et al.
Veröffentlicht: (2026)
von: Wu, Hao, et al.
Veröffentlicht: (2026)
Model Merging to Maintain Language-Only Performance in Developmentally Plausible Multimodal Models
von: Takmaz, Ece, et al.
Veröffentlicht: (2025)
von: Takmaz, Ece, et al.
Veröffentlicht: (2025)
Evolutionary Negative Module Pruning for Better LoRA Merging
von: Cao, Anda, et al.
Veröffentlicht: (2026)
von: Cao, Anda, et al.
Veröffentlicht: (2026)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
von: He, Xingwei, et al.
Veröffentlicht: (2024)
von: He, Xingwei, et al.
Veröffentlicht: (2024)
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
von: Li, Chaoyu, et al.
Veröffentlicht: (2025)
von: Li, Chaoyu, et al.
Veröffentlicht: (2025)
Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation
von: Kim, Jungeun, et al.
Veröffentlicht: (2024)
von: Kim, Jungeun, et al.
Veröffentlicht: (2024)
RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees
von: Xu, Yichen, et al.
Veröffentlicht: (2026)
von: Xu, Yichen, et al.
Veröffentlicht: (2026)
Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs
von: Huang, Jen-Tse, et al.
Veröffentlicht: (2025)
von: Huang, Jen-Tse, et al.
Veröffentlicht: (2025)
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
von: Wang, Yuhao, et al.
Veröffentlicht: (2024)
von: Wang, Yuhao, et al.
Veröffentlicht: (2024)
Exploring the Design Space of Visual Context Representation in Video MLLMs
von: Du, Yifan, et al.
Veröffentlicht: (2024)
von: Du, Yifan, et al.
Veröffentlicht: (2024)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
von: Fang, I-Sheng, et al.
Veröffentlicht: (2025)
von: Fang, I-Sheng, et al.
Veröffentlicht: (2025)
Can MLLMs Understand the Deep Implication Behind Chinese Images?
von: Zhang, Chenhao, et al.
Veröffentlicht: (2024)
von: Zhang, Chenhao, et al.
Veröffentlicht: (2024)
Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality
von: Qian, Kai, et al.
Veröffentlicht: (2026)
von: Qian, Kai, et al.
Veröffentlicht: (2026)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
von: Yu, Tianyu, et al.
Veröffentlicht: (2023)
von: Yu, Tianyu, et al.
Veröffentlicht: (2023)
AdaTask: A Task-aware Adaptive Learning Rate Approach to Multi-task Learning
von: Yang, Enneng, et al.
Veröffentlicht: (2022)
von: Yang, Enneng, et al.
Veröffentlicht: (2022)
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
von: Zhang, Jiarui, et al.
Veröffentlicht: (2025)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2025)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
von: Zheng, Naishan, et al.
Veröffentlicht: (2025)
von: Zheng, Naishan, et al.
Veröffentlicht: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs
von: Yeh, Chun-Hsiao, et al.
Veröffentlicht: (2025)
von: Yeh, Chun-Hsiao, et al.
Veröffentlicht: (2025)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
von: Wang, Junyang, et al.
Veröffentlicht: (2023)
von: Wang, Junyang, et al.
Veröffentlicht: (2023)
GRIT: Teaching MLLMs to Think with Images
von: Fan, Yue, et al.
Veröffentlicht: (2025)
von: Fan, Yue, et al.
Veröffentlicht: (2025)
Multi-Task Model Merging via Adaptive Weight Disentanglement
von: Xiong, Feng, et al.
Veröffentlicht: (2024)
von: Xiong, Feng, et al.
Veröffentlicht: (2024)
Merging Multi-Task Models via Weight-Ensembling Mixture of Experts
von: Tang, Anke, et al.
Veröffentlicht: (2024)
von: Tang, Anke, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
AdaMerging: Adaptive Model Merging for Multi-Task Learning
von: Yang, Enneng, et al.
Veröffentlicht: (2023) -
Representation Surgery for Multi-Task Model Merging
von: Yang, Enneng, et al.
Veröffentlicht: (2024) -
SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery
von: Yang, Enneng, et al.
Veröffentlicht: (2024) -
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
von: Shen, Li, et al.
Veröffentlicht: (2024) -
RobustMerge: Parameter-Efficient Model Merging for MLLMs with Direction Robustness
von: Zeng, Fanhu, et al.
Veröffentlicht: (2025)