MMRL: Multi-Modal Representation Learning for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Yuncheng, Gu, Xiaodong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
Multi-Modal Adapter for Vision-Language Models
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
Quantifying Cross-Modality Memorization in Vision-Language Models
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
Improved Alignment of Modalities in Large Vision Language Models
di: Jangra, Kartik, et al.
Pubblicazione: (2025)
di: Jangra, Kartik, et al.
Pubblicazione: (2025)
Cross-Modal Adapter: Parameter-Efficient Transfer Learning Approach for Vision-Language Models
di: Yang, Juncheng, et al.
Pubblicazione: (2024)
di: Yang, Juncheng, et al.
Pubblicazione: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
di: Lin, Xiang, et al.
Pubblicazione: (2025)
di: Lin, Xiang, et al.
Pubblicazione: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
Information Router for Mitigating Modality Dominance in Vision-Language Models
di: Kim, Seulgi, et al.
Pubblicazione: (2026)
di: Kim, Seulgi, et al.
Pubblicazione: (2026)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
di: Yi, Chao, et al.
Pubblicazione: (2024)
di: Yi, Chao, et al.
Pubblicazione: (2024)
pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2025)
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2025)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2026)
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2026)
Benchmarking Vision-Language Contrastive Methods for Medical Representation Learning
di: Roy, Shuvendu, et al.
Pubblicazione: (2024)
di: Roy, Shuvendu, et al.
Pubblicazione: (2024)
Tactile Modality Fusion for Vision-Language-Action Models
di: Morissette, Charlotte, et al.
Pubblicazione: (2026)
di: Morissette, Charlotte, et al.
Pubblicazione: (2026)
Hierarchical Network Fusion for Multi-Modal Electron Micrograph Representation Learning with Foundational Large Language Models
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning
di: Zhang, Hongsheng, et al.
Pubblicazione: (2024)
di: Zhang, Hongsheng, et al.
Pubblicazione: (2024)
DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities
di: Lu, Jueqing, et al.
Pubblicazione: (2025)
di: Lu, Jueqing, et al.
Pubblicazione: (2025)
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
di: Chen, Yang, et al.
Pubblicazione: (2024)
di: Chen, Yang, et al.
Pubblicazione: (2024)
Mind the Gap: Learning Modality-Agnostic Representations with a Cross-Modality UNet
di: Niu, Xin, et al.
Pubblicazione: (2026)
di: Niu, Xin, et al.
Pubblicazione: (2026)
Anchors Aweigh! Sail for Optimal Unified Multi-Modal Representations
di: Jeong, Minoh, et al.
Pubblicazione: (2024)
di: Jeong, Minoh, et al.
Pubblicazione: (2024)
Multi-Modal Instruction-Tuning Small-Scale Language-and-Vision Assistant for Semiconductor Electron Micrograph Analysis
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
di: Berasi, Davide, et al.
Pubblicazione: (2025)
di: Berasi, Davide, et al.
Pubblicazione: (2025)
On the Value of Cross-Modal Misalignment in Multimodal Representation Learning
di: Cai, Yichao, et al.
Pubblicazione: (2025)
di: Cai, Yichao, et al.
Pubblicazione: (2025)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
Déjà Vu Memorization in Vision-Language Models
di: Jayaraman, Bargav, et al.
Pubblicazione: (2024)
di: Jayaraman, Bargav, et al.
Pubblicazione: (2024)
Multilingual Diversity Improves Vision-Language Representations
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
di: Naharas, Nilay, et al.
Pubblicazione: (2025)
di: Naharas, Nilay, et al.
Pubblicazione: (2025)
PROMISE: Prompt-Attentive Hierarchical Contrastive Learning for Robust Cross-Modal Representation with Missing Modalities
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
Supervised Multi-Modal Fission Learning
di: Mao, Lingchao, et al.
Pubblicazione: (2024)
di: Mao, Lingchao, et al.
Pubblicazione: (2024)
Jailbreaking Vision-Language Models Through the Visual Modality
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
MMP: Towards Robust Multi-Modal Learning with Masked Modality Projection
di: Nezakati, Niki, et al.
Pubblicazione: (2024)
di: Nezakati, Niki, et al.
Pubblicazione: (2024)
Resilient Vision-Tabular Multimodal Learning under Modality Missingness
di: Caruso, Camillo Maria, et al.
Pubblicazione: (2026)
di: Caruso, Camillo Maria, et al.
Pubblicazione: (2026)
Learning without Forgetting for Vision-Language Models
di: Zhou, Da-Wei, et al.
Pubblicazione: (2023)
di: Zhou, Da-Wei, et al.
Pubblicazione: (2023)
MGPATH: Vision-Language Model with Multi-Granular Prompt Learning for Few-Shot WSI Classification
di: Nguyen, Anh-Tien, et al.
Pubblicazione: (2025)
di: Nguyen, Anh-Tien, et al.
Pubblicazione: (2025)
Dynamic Scene Understanding from Vision-Language Representations
di: Pruss, Shahaf, et al.
Pubblicazione: (2025)
di: Pruss, Shahaf, et al.
Pubblicazione: (2025)
Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations
di: Jiang, Nick, et al.
Pubblicazione: (2024)
di: Jiang, Nick, et al.
Pubblicazione: (2024)
Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection
di: Fan, Yunfeng, et al.
Pubblicazione: (2023)
di: Fan, Yunfeng, et al.
Pubblicazione: (2023)
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
di: Gu, Zijian, et al.
Pubblicazione: (2025)
di: Gu, Zijian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models
di: Guo, Yuncheng, et al.
Pubblicazione: (2025) -
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024) -
Multi-Modal Adapter for Vision-Language Models
di: Seputis, Dominykas, et al.
Pubblicazione: (2024) -
Quantifying Cross-Modality Memorization in Vision-Language Models
di: Wen, Yuxin, et al.
Pubblicazione: (2025) -
Improved Alignment of Modalities in Large Vision Language Models
di: Jangra, Kartik, et al.
Pubblicazione: (2025)