Gespeichert in:
| Hauptverfasser: | Huang, Yiran, Thede, Lukas, Mancini, Massimiliano, Xu, Wenjia, Akata, Zeynep |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2507.20749 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency
von: Huang, Yiran, et al.
Veröffentlicht: (2026)
von: Huang, Yiran, et al.
Veröffentlicht: (2026)
Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers
von: Huang, Yiran, et al.
Veröffentlicht: (2026)
von: Huang, Yiran, et al.
Veröffentlicht: (2026)
Vision-by-Language for Training-Free Compositional Image Retrieval
von: Karthik, Shyamgopal, et al.
Veröffentlicht: (2023)
von: Karthik, Shyamgopal, et al.
Veröffentlicht: (2023)
WikiBigEdit: Understanding the Limits of Lifelong Knowledge Editing in LLMs
von: Thede, Lukas, et al.
Veröffentlicht: (2025)
von: Thede, Lukas, et al.
Veröffentlicht: (2025)
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
von: Thede, Lukas, et al.
Veröffentlicht: (2024)
von: Thede, Lukas, et al.
Veröffentlicht: (2024)
ETHER: Efficient Finetuning of Large-Scale Models with Hyperplane Reflections
von: Bini, Massimo, et al.
Veröffentlicht: (2024)
von: Bini, Massimo, et al.
Veröffentlicht: (2024)
Beyond the final layer: Attentive multilayer fusion for vision transformers
von: Ciernik, Laure, et al.
Veröffentlicht: (2026)
von: Ciernik, Laure, et al.
Veröffentlicht: (2026)
Revealing and Reducing Gender Biases in Vision and Language Assistants (VLAs)
von: Girrbach, Leander, et al.
Veröffentlicht: (2024)
von: Girrbach, Leander, et al.
Veröffentlicht: (2024)
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model
von: Roth, Karsten, et al.
Veröffentlicht: (2023)
von: Roth, Karsten, et al.
Veröffentlicht: (2023)
A Systematic Study of In-the-Wild Model Merging for Large Language Models
von: Hitit, Oğuz Kağan, et al.
Veröffentlicht: (2025)
von: Hitit, Oğuz Kağan, et al.
Veröffentlicht: (2025)
Context-Aware Multimodal Pretraining
von: Roth, Karsten, et al.
Veröffentlicht: (2024)
von: Roth, Karsten, et al.
Veröffentlicht: (2024)
DeLoRA: Decoupling Angles and Strength in Low-rank Adaptation
von: Bini, Massimo, et al.
Veröffentlicht: (2025)
von: Bini, Massimo, et al.
Veröffentlicht: (2025)
How to Merge Your Multimodal Models Over Time?
von: Dziadzio, Sebastian, et al.
Veröffentlicht: (2024)
von: Dziadzio, Sebastian, et al.
Veröffentlicht: (2024)
Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
von: Girrbach, Leander, et al.
Veröffentlicht: (2025)
von: Girrbach, Leander, et al.
Veröffentlicht: (2025)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
von: Lin, Junyan, et al.
Veröffentlicht: (2024)
von: Lin, Junyan, et al.
Veröffentlicht: (2024)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
von: Zhong, Weihong, et al.
Veröffentlicht: (2024)
von: Zhong, Weihong, et al.
Veröffentlicht: (2024)
A Practitioner's Guide to Continual Multimodal Pretraining
von: Roth, Karsten, et al.
Veröffentlicht: (2024)
von: Roth, Karsten, et al.
Veröffentlicht: (2024)
From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs
von: Wu, Boyong, et al.
Veröffentlicht: (2026)
von: Wu, Boyong, et al.
Veröffentlicht: (2026)
MemLoRA: Distilling Expert Adapters for On-Device Memory Systems
von: Bini, Massimo, et al.
Veröffentlicht: (2025)
von: Bini, Massimo, et al.
Veröffentlicht: (2025)
Sparse Autoencoders are Topic Models
von: Girrbach, Leander, et al.
Veröffentlicht: (2025)
von: Girrbach, Leander, et al.
Veröffentlicht: (2025)
A Large Scale Analysis of Gender Biases in Text-to-Image Generative Models
von: Girrbach, Leander, et al.
Veröffentlicht: (2025)
von: Girrbach, Leander, et al.
Veröffentlicht: (2025)
Investigating Persuasion Techniques in Arabic: An Empirical Study Leveraging Large Language Models
von: Alzahrani, Abdurahmman, et al.
Veröffentlicht: (2024)
von: Alzahrani, Abdurahmman, et al.
Veröffentlicht: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
von: Xu, Mengya, et al.
Veröffentlicht: (2025)
von: Xu, Mengya, et al.
Veröffentlicht: (2025)
APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings
von: Spohn, Philipp, et al.
Veröffentlicht: (2026)
von: Spohn, Philipp, et al.
Veröffentlicht: (2026)
SemioLLM: Evaluating Large Language Models for Diagnostic Reasoning from Unstructured Clinical Narratives in Epilepsy
von: Dani, Meghal, et al.
Veröffentlicht: (2024)
von: Dani, Meghal, et al.
Veröffentlicht: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
von: De Min, Thomas, et al.
Veröffentlicht: (2026)
von: De Min, Thomas, et al.
Veröffentlicht: (2026)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
Vision-centric Token Compression in Large Language Model
von: Xing, Ling, et al.
Veröffentlicht: (2025)
von: Xing, Ling, et al.
Veröffentlicht: (2025)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
von: Gigant, Théo, et al.
Veröffentlicht: (2025)
von: Gigant, Théo, et al.
Veröffentlicht: (2025)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
von: Xu, Shilin, et al.
Veröffentlicht: (2024)
von: Xu, Shilin, et al.
Veröffentlicht: (2024)
Model Composition for Multimodal Large Language Models
von: Chen, Chi, et al.
Veröffentlicht: (2024)
von: Chen, Chi, et al.
Veröffentlicht: (2024)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
von: Pan, Xichen, et al.
Veröffentlicht: (2023)
von: Pan, Xichen, et al.
Veröffentlicht: (2023)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
von: Liu, Zhuchenyang, et al.
Veröffentlicht: (2026)
von: Liu, Zhuchenyang, et al.
Veröffentlicht: (2026)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
von: Deniz, Omer Faruk, et al.
Veröffentlicht: (2026)
von: Deniz, Omer Faruk, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency
von: Huang, Yiran, et al.
Veröffentlicht: (2026) -
Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers
von: Huang, Yiran, et al.
Veröffentlicht: (2026) -
Vision-by-Language for Training-Free Compositional Image Retrieval
von: Karthik, Shyamgopal, et al.
Veröffentlicht: (2023) -
WikiBigEdit: Understanding the Limits of Lifelong Knowledge Editing in LLMs
von: Thede, Lukas, et al.
Veröffentlicht: (2025) -
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
von: Thede, Lukas, et al.
Veröffentlicht: (2024)