The Inter-Intra Modal Measure: A Predictive Lens on Fine-Tuning Outcomes in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Niss, Laura, Vogt-Lowell, Kevin, Tsiligkaridis, Theodoros |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quantified Task Misalignment to Inform PEFT: An Exploration of Domain Generalization and Catastrophic Forgetting in CLIP
par: Niss, Laura, et autres
Publié: (2024)
par: Niss, Laura, et autres
Publié: (2024)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
Multimodal Unsupervised Domain Generalization by Retrieving Across the Modality Gap
par: Liao, Christopher, et autres
Publié: (2024)
par: Liao, Christopher, et autres
Publié: (2024)
Descriptor and Word Soups: Overcoming the Parameter Efficiency Accuracy Tradeoff for Out-of-Distribution Few-shot Learning
par: Liao, Christopher, et autres
Publié: (2023)
par: Liao, Christopher, et autres
Publié: (2023)
MERGETUNE: Continued Fine-Tuning of Vision-Language Models
par: Wang, Wenqing, et autres
Publié: (2026)
par: Wang, Wenqing, et autres
Publié: (2026)
Jointly Modeling Inter- & Intra-Modality Dependencies for Multi-modal Learning
par: Madaan, Divyam, et autres
Publié: (2024)
par: Madaan, Divyam, et autres
Publié: (2024)
Dose Prediction Driven Radiotherapy Paramters Regression via Intra- and Inter-Relation Modeling
par: Cui, Jiaqi, et autres
Publié: (2024)
par: Cui, Jiaqi, et autres
Publié: (2024)
pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
par: Ghiasvand, Sajjad, et autres
Publié: (2025)
par: Ghiasvand, Sajjad, et autres
Publié: (2025)
Is Large-Scale Pretraining the Secret to Good Domain Generalization?
par: Teterwak, Piotr, et autres
Publié: (2024)
par: Teterwak, Piotr, et autres
Publié: (2024)
ERM++: An Improved Baseline for Domain Generalization
par: Teterwak, Piotr, et autres
Publié: (2023)
par: Teterwak, Piotr, et autres
Publié: (2023)
Data-Efficient Fine-Tuning of Vision-Language Models for Diagnosis of Alzheimer's Disease
par: Cheng, Fangqi, et autres
Publié: (2025)
par: Cheng, Fangqi, et autres
Publié: (2025)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
par: Li, Jiayu, et autres
Publié: (2025)
par: Li, Jiayu, et autres
Publié: (2025)
Image-Caption Encoding for Improving Zero-Shot Generalization
par: Yu, Eric Yang, et autres
Publié: (2024)
par: Yu, Eric Yang, et autres
Publié: (2024)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
par: Liu, Yuqi, et autres
Publié: (2025)
par: Liu, Yuqi, et autres
Publié: (2025)
Layer-Specific Fine-Tuning for Improved Negation Handling in Medical Vision-Language Models
par: Abbasi, Ali, et autres
Publié: (2026)
par: Abbasi, Ali, et autres
Publié: (2026)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
par: Oh, Changdae, et autres
Publié: (2023)
par: Oh, Changdae, et autres
Publié: (2023)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
par: Li, Xiao, et autres
Publié: (2025)
par: Li, Xiao, et autres
Publié: (2025)
M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention
par: Yang, Xiaofan, et autres
Publié: (2026)
par: Yang, Xiaofan, et autres
Publié: (2026)
Enhanced Partially Relevant Video Retrieval through Inter- and Intra-Sample Analysis with Coherence Prediction
par: Ren, Junlong, et autres
Publié: (2025)
par: Ren, Junlong, et autres
Publié: (2025)
Inter- and Intra-image Refinement for Few Shot Segmentation
par: Fu, Ourui, et autres
Publié: (2025)
par: Fu, Ourui, et autres
Publié: (2025)
Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models
par: Lin, Zhenxiang, et autres
Publié: (2025)
par: Lin, Zhenxiang, et autres
Publié: (2025)
Debiased Fine-Tuning for Vision-language Models by Prompt Regularization
par: Zhu, Beier, et autres
Publié: (2023)
par: Zhu, Beier, et autres
Publié: (2023)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
par: Guo, Zhenhao, et autres
Publié: (2025)
par: Guo, Zhenhao, et autres
Publié: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025)
par: Yan, Hanqi, et autres
Publié: (2025)
Dynamics Based Neural Encoding with Inter-Intra Region Connectivity
par: Gamal, Mai, et autres
Publié: (2024)
par: Gamal, Mai, et autres
Publié: (2024)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
par: Zheng, Weiying, et autres
Publié: (2025)
par: Zheng, Weiying, et autres
Publié: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
par: Zhang, Mingyuan, et autres
Publié: (2025)
par: Zhang, Mingyuan, et autres
Publié: (2025)
Intra and Inter Parser-Prompted Transformers for Effective Image Restoration
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
PE-CLIP: A Parameter-Efficient Fine-Tuning of Vision Language Models for Dynamic Facial Expression Recognition
par: Saadi, Ibtissam, et autres
Publié: (2025)
par: Saadi, Ibtissam, et autres
Publié: (2025)
Beyond Accuracy Optimization: Computer Vision Losses for Large Language Model Fine-Tuning
par: Cambrin, Daniele Rege, et autres
Publié: (2024)
par: Cambrin, Daniele Rege, et autres
Publié: (2024)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
par: Qi, Zhangyang, et autres
Publié: (2025)
par: Qi, Zhangyang, et autres
Publié: (2025)
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
par: Hai, Jia-Wei, et autres
Publié: (2026)
par: Hai, Jia-Wei, et autres
Publié: (2026)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
par: Peng, Wei, et autres
Publié: (2025)
par: Peng, Wei, et autres
Publié: (2025)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
par: Wu, Xiangyang, et autres
Publié: (2025)
par: Wu, Xiangyang, et autres
Publié: (2025)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
par: Zhao, Yumiao, et autres
Publié: (2024)
par: Zhao, Yumiao, et autres
Publié: (2024)
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
par: Prottasha, Nusrat Jahan, et autres
Publié: (2025)
par: Prottasha, Nusrat Jahan, et autres
Publié: (2025)
FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
par: Hayes, Kevin David, et autres
Publié: (2025)
par: Hayes, Kevin David, et autres
Publié: (2025)
Video Super-Resolution Transformer with Masked Inter&Intra-Frame Attention
par: Zhou, Xingyu, et autres
Publié: (2024)
par: Zhou, Xingyu, et autres
Publié: (2024)
Real-Time Neural Video Compression with Unified Intra and Inter Coding
par: Xiang, Hui, et autres
Publié: (2025)
par: Xiang, Hui, et autres
Publié: (2025)
Documents similaires
-
Quantified Task Misalignment to Inform PEFT: An Exploration of Domain Generalization and Catastrophic Forgetting in CLIP
par: Niss, Laura, et autres
Publié: (2024) -
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
par: Wang, Dianyi, et autres
Publié: (2025) -
Multimodal Unsupervised Domain Generalization by Retrieving Across the Modality Gap
par: Liao, Christopher, et autres
Publié: (2024) -
Descriptor and Word Soups: Overcoming the Parameter Efficiency Accuracy Tradeoff for Out-of-Distribution Few-shot Learning
par: Liao, Christopher, et autres
Publié: (2023) -
MERGETUNE: Continued Fine-Tuning of Vision-Language Models
par: Wang, Wenqing, et autres
Publié: (2026)