Enhancing Cross-Modal Fine-Tuning with Gradually Intermediate Modality Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Cai, Lincan, Li, Shuang, Ma, Wenxuan, Kang, Jingxuan, Xie, Binhui, Sun, Zixun, Zhu, Chengwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Modality Knowledge Alignment for Cross-Modality Transfer
di: Ma, Wenxuan, et al.
Pubblicazione: (2024)
di: Ma, Wenxuan, et al.
Pubblicazione: (2024)
From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based Selection
di: Cai, Lincan, et al.
Pubblicazione: (2025)
di: Cai, Lincan, et al.
Pubblicazione: (2025)
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
di: Hu, Tao, et al.
Pubblicazione: (2026)
di: Hu, Tao, et al.
Pubblicazione: (2026)
Unsupervised Modality-Transferable Video Highlight Detection with Representation Activation Sequence Learning
di: Li, Tingtian, et al.
Pubblicazione: (2024)
di: Li, Tingtian, et al.
Pubblicazione: (2024)
Bayesian Cross-Modal Alignment Learning for Few-Shot Out-of-Distribution Generalization
di: Zhu, Lin, et al.
Pubblicazione: (2025)
di: Zhu, Lin, et al.
Pubblicazione: (2025)
ModalTune: Fine-Tuning Slide-Level Foundation Models with Multi-Modal Information for Multi-task Learning in Digital Pathology
di: Ramanathan, Vishwesh, et al.
Pubblicazione: (2025)
di: Ramanathan, Vishwesh, et al.
Pubblicazione: (2025)
Cross-Modal Few-Shot Learning: a Generative Transfer Learning Framework
di: Yang, Zhengwei, et al.
Pubblicazione: (2024)
di: Yang, Zhengwei, et al.
Pubblicazione: (2024)
On the Value of Cross-Modal Misalignment in Multimodal Representation Learning
di: Cai, Yichao, et al.
Pubblicazione: (2025)
di: Cai, Yichao, et al.
Pubblicazione: (2025)
Cross-Modal Adapter: Parameter-Efficient Transfer Learning Approach for Vision-Language Models
di: Yang, Juncheng, et al.
Pubblicazione: (2024)
di: Yang, Juncheng, et al.
Pubblicazione: (2024)
pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2025)
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2025)
A Generalization Theory of Cross-Modality Distillation with Contrastive Learning
di: Lin, Hangyu, et al.
Pubblicazione: (2024)
di: Lin, Hangyu, et al.
Pubblicazione: (2024)
Mind the Gap: Learning Modality-Agnostic Representations with a Cross-Modality UNet
di: Niu, Xin, et al.
Pubblicazione: (2026)
di: Niu, Xin, et al.
Pubblicazione: (2026)
Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
di: Naharas, Nilay, et al.
Pubblicazione: (2025)
di: Naharas, Nilay, et al.
Pubblicazione: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Conformal Cross-Modal Active Learning
di: Nguyen, Huy Hoang, et al.
Pubblicazione: (2026)
di: Nguyen, Huy Hoang, et al.
Pubblicazione: (2026)
Cross-Modal Coordination Across a Diverse Set of Input Modalities
di: Sánchez, Jorge, et al.
Pubblicazione: (2024)
di: Sánchez, Jorge, et al.
Pubblicazione: (2024)
Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization
di: Wang, Xiaohan, et al.
Pubblicazione: (2025)
di: Wang, Xiaohan, et al.
Pubblicazione: (2025)
CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation
di: Jeon, Inseok, et al.
Pubblicazione: (2026)
di: Jeon, Inseok, et al.
Pubblicazione: (2026)
PROMISE: Prompt-Attentive Hierarchical Contrastive Learning for Robust Cross-Modal Representation with Missing Modalities
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering
di: Li, Xu, et al.
Pubblicazione: (2025)
di: Li, Xu, et al.
Pubblicazione: (2025)
Modality Unified Attack for Omni-Modality Person Re-Identification
di: Bian, Yuan, et al.
Pubblicazione: (2025)
di: Bian, Yuan, et al.
Pubblicazione: (2025)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
Cross-Modal Instructions for Robot Motion Generation
di: Barron, William, et al.
Pubblicazione: (2025)
di: Barron, William, et al.
Pubblicazione: (2025)
CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
Learnable Cross-modal Knowledge Distillation for Multi-modal Learning with Missing Modality
di: Wang, Hu, et al.
Pubblicazione: (2023)
di: Wang, Hu, et al.
Pubblicazione: (2023)
MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality
di: Kim, Kyungwon, et al.
Pubblicazione: (2026)
di: Kim, Kyungwon, et al.
Pubblicazione: (2026)
MolFM-Lite: Multi-Modal Molecular Property Prediction with Conformer Ensemble Attention and Cross-Modal Fusion
di: Shah, Syed Omer, et al.
Pubblicazione: (2026)
di: Shah, Syed Omer, et al.
Pubblicazione: (2026)
Enhancing Multimodal Unified Representations for Cross Modal Generalization
di: Huang, Hai, et al.
Pubblicazione: (2024)
di: Huang, Hai, et al.
Pubblicazione: (2024)
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
Quantifying Cross-Modality Memorization in Vision-Language Models
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
Continual Cross-Modal Generalization
di: Xia, Yan, et al.
Pubblicazione: (2025)
di: Xia, Yan, et al.
Pubblicazione: (2025)
Cross-Modal Domain Adaptation in Brain Disease Diagnosis: Maximum Mean Discrepancy-based Convolutional Neural Networks
di: Zhu, Xuran
Pubblicazione: (2024)
di: Zhu, Xuran
Pubblicazione: (2024)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
di: Fan, Yunfeng, et al.
Pubblicazione: (2023)
di: Fan, Yunfeng, et al.
Pubblicazione: (2023)
Cross-Modal Fine-Tuning of 3D Convolutional Foundation Models for ADHD Classification with Low-Rank Adaptation
di: Kao, Jyun-Ping, et al.
Pubblicazione: (2025)
di: Kao, Jyun-Ping, et al.
Pubblicazione: (2025)
Text-to-Image Cross-Modal Generation: A Systematic Review
di: Żelaszczyk, Maciej, et al.
Pubblicazione: (2024)
di: Żelaszczyk, Maciej, et al.
Pubblicazione: (2024)
Cross-Modal Clinical Knowledge Integration for Mammography Report Generation
di: Zhu, Jiayi, et al.
Pubblicazione: (2026)
di: Zhu, Jiayi, et al.
Pubblicazione: (2026)
Lightweight Facial Landmark Detection in Thermal Images via Multi-Level Cross-Modal Knowledge Transfer
di: Tong, Qiyi, et al.
Pubblicazione: (2025)
di: Tong, Qiyi, et al.
Pubblicazione: (2025)
CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think
di: Sun, Zening, et al.
Pubblicazione: (2026)
di: Sun, Zening, et al.
Pubblicazione: (2026)
Cross-Modal Mapping: Mitigating the Modality Gap for Few-Shot Image Classification
di: Yang, Xi, et al.
Pubblicazione: (2024)
di: Yang, Xi, et al.
Pubblicazione: (2024)
Enhancing CLIP Robustness via Cross-Modality Alignment
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Modality Knowledge Alignment for Cross-Modality Transfer
di: Ma, Wenxuan, et al.
Pubblicazione: (2024) -
From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based Selection
di: Cai, Lincan, et al.
Pubblicazione: (2025) -
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
di: Hu, Tao, et al.
Pubblicazione: (2026) -
Unsupervised Modality-Transferable Video Highlight Detection with Representation Activation Sequence Learning
di: Li, Tingtian, et al.
Pubblicazione: (2024) -
Bayesian Cross-Modal Alignment Learning for Few-Shot Out-of-Distribution Generalization
di: Zhu, Lin, et al.
Pubblicazione: (2025)