Saved in:
| Main Authors: | Tong, Huanyang, Liu, Kai, Kuang, Fangjun, Chen, Huiling |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2605.15736 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
by: Peng, Wei, et al.
Published: (2025)
by: Peng, Wei, et al.
Published: (2025)
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
by: Xiang, Sike, et al.
Published: (2025)
by: Xiang, Sike, et al.
Published: (2025)
Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models
by: Mishra, Shambhavi, et al.
Published: (2024)
by: Mishra, Shambhavi, et al.
Published: (2024)
Anchor-based Robust Finetuning of Vision-Language Models
by: Han, Jinwei, et al.
Published: (2024)
by: Han, Jinwei, et al.
Published: (2024)
MultiMedVision: Multi-Modal Medical Vision Framework
by: Li, Frank, et al.
Published: (2026)
by: Li, Frank, et al.
Published: (2026)
GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models
by: Koleilat, Taha, et al.
Published: (2024)
by: Koleilat, Taha, et al.
Published: (2024)
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
by: Mi, Yachun, et al.
Published: (2025)
by: Mi, Yachun, et al.
Published: (2025)
Few-shot Adaptation of Medical Vision-Language Models
by: Shakeri, Fereshteh, et al.
Published: (2024)
by: Shakeri, Fereshteh, et al.
Published: (2024)
Full Conformal Adaptation of Medical Vision-Language Models
by: Silva-Rodríguez, Julio, et al.
Published: (2025)
by: Silva-Rodríguez, Julio, et al.
Published: (2025)
A Simple and Robust Framework for Cross-Modality Medical Image Segmentation applied to Vision Transformers
by: Bastico, Matteo, et al.
Published: (2023)
by: Bastico, Matteo, et al.
Published: (2023)
Cross-Attentive Multiview Fusion of Vision-Language Embeddings
by: Martins, Tomas Berriel, et al.
Published: (2026)
by: Martins, Tomas Berriel, et al.
Published: (2026)
BiomedXPro: Prompt Optimization for Explainable Diagnosis with Biomedical Vision Language Models
by: Silva, Kaushitha, et al.
Published: (2025)
by: Silva, Kaushitha, et al.
Published: (2025)
Toward Robust Medical Fairness: Debiased Dual-Modal Alignment via Text-Guided Attribute-Disentangled Prompt Learning for Vision-Language Models
by: Xia, Yuexuan, et al.
Published: (2025)
by: Xia, Yuexuan, et al.
Published: (2025)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
by: Feng, Qianhan, et al.
Published: (2024)
by: Feng, Qianhan, et al.
Published: (2024)
T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation
by: Khadka, Pranjal
Published: (2026)
by: Khadka, Pranjal
Published: (2026)
Dual-Projection Fusion for Accurate Upright Panorama Generation in Robotic Vision
by: Shan, Yuhao, et al.
Published: (2025)
by: Shan, Yuhao, et al.
Published: (2025)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
by: Jang, Young Kyun, et al.
Published: (2024)
by: Jang, Young Kyun, et al.
Published: (2024)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
by: Bhaila, Karuna, et al.
Published: (2025)
by: Bhaila, Karuna, et al.
Published: (2025)
On the Robustness of Medical Vision-Language Models: Are they Truly Generalizable?
by: Imam, Raza, et al.
Published: (2025)
by: Imam, Raza, et al.
Published: (2025)
Tactile Modality Fusion for Vision-Language-Action Models
by: Morissette, Charlotte, et al.
Published: (2026)
by: Morissette, Charlotte, et al.
Published: (2026)
Scaling Down to Scale Up: Towards Operationally-Efficient and Deployable Clinical Models via Cross-Modal Low-Rank Adaptation for Medical Vision-Language Models
by: Alzubaidi, Thuraya, et al.
Published: (2025)
by: Alzubaidi, Thuraya, et al.
Published: (2025)
CMAL: A Novel Cross-Modal Associative Learning Framework for Vision-Language Pre-Training
by: Ma, Zhiyuan, et al.
Published: (2024)
by: Ma, Zhiyuan, et al.
Published: (2024)
VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection
by: Taparia, Aditya, et al.
Published: (2025)
by: Taparia, Aditya, et al.
Published: (2025)
CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
by: Lafon, Marc, et al.
Published: (2025)
by: Lafon, Marc, et al.
Published: (2025)
Active Learning via Vision-Language Model Adaptation with Open Data
by: Wang, Tong, et al.
Published: (2025)
by: Wang, Tong, et al.
Published: (2025)
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
by: Dhimoïla, Grégoire, et al.
Published: (2026)
by: Dhimoïla, Grégoire, et al.
Published: (2026)
Quantifying Cross-Modality Memorization in Vision-Language Models
by: Wen, Yuxin, et al.
Published: (2025)
by: Wen, Yuxin, et al.
Published: (2025)
DPA: Dual Prototypes Alignment for Unsupervised Adaptation of Vision-Language Models
by: Ali, Eman, et al.
Published: (2024)
by: Ali, Eman, et al.
Published: (2024)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2024)
by: Wang, Liuyi, et al.
Published: (2024)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
by: Trinh, Quoc-Huy, et al.
Published: (2026)
by: Trinh, Quoc-Huy, et al.
Published: (2026)
Robust Fairness Vision-Language Learning for Medical Image Analysis
by: Bansal, Sparsh, et al.
Published: (2025)
by: Bansal, Sparsh, et al.
Published: (2025)
Cross-Modal Adapter for Vision-Language Retrieval
by: Jiang, Haojun, et al.
Published: (2022)
by: Jiang, Haojun, et al.
Published: (2022)
Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models
by: Nakayama, Aya, et al.
Published: (2025)
by: Nakayama, Aya, et al.
Published: (2025)
LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation
by: Ren, Xiangxuan, et al.
Published: (2025)
by: Ren, Xiangxuan, et al.
Published: (2025)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
by: Cheng, Silin, et al.
Published: (2025)
by: Cheng, Silin, et al.
Published: (2025)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
by: Wang, Chenyu, et al.
Published: (2026)
by: Wang, Chenyu, et al.
Published: (2026)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
by: Du, Mengfei, et al.
Published: (2024)
by: Du, Mengfei, et al.
Published: (2024)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
by: Han, Feng, et al.
Published: (2026)
by: Han, Feng, et al.
Published: (2026)
ControlFusion: A Controllable Image Fusion Framework with Language-Vision Degradation Prompts
by: Tang, Linfeng, et al.
Published: (2025)
by: Tang, Linfeng, et al.
Published: (2025)
Similar Items
-
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
by: Peng, Wei, et al.
Published: (2025) -
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
by: Xiang, Sike, et al.
Published: (2025) -
Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models
by: Mishra, Shambhavi, et al.
Published: (2024) -
Anchor-based Robust Finetuning of Vision-Language Models
by: Han, Jinwei, et al.
Published: (2024) -
MultiMedVision: Multi-Modal Medical Vision Framework
by: Li, Frank, et al.
Published: (2026)