Guardado en:
| Autores principales: | Tong, Huanyang, Liu, Kai, Kuang, Fangjun, Chen, Huiling |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.15736 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
por: Peng, Wei, et al.
Publicado: (2025)
por: Peng, Wei, et al.
Publicado: (2025)
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
por: Xiang, Sike, et al.
Publicado: (2025)
por: Xiang, Sike, et al.
Publicado: (2025)
Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models
por: Mishra, Shambhavi, et al.
Publicado: (2024)
por: Mishra, Shambhavi, et al.
Publicado: (2024)
Anchor-based Robust Finetuning of Vision-Language Models
por: Han, Jinwei, et al.
Publicado: (2024)
por: Han, Jinwei, et al.
Publicado: (2024)
MultiMedVision: Multi-Modal Medical Vision Framework
por: Li, Frank, et al.
Publicado: (2026)
por: Li, Frank, et al.
Publicado: (2026)
GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection
por: Wang, Yu, et al.
Publicado: (2025)
por: Wang, Yu, et al.
Publicado: (2025)
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models
por: Koleilat, Taha, et al.
Publicado: (2024)
por: Koleilat, Taha, et al.
Publicado: (2024)
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
por: Mi, Yachun, et al.
Publicado: (2025)
por: Mi, Yachun, et al.
Publicado: (2025)
Few-shot Adaptation of Medical Vision-Language Models
por: Shakeri, Fereshteh, et al.
Publicado: (2024)
por: Shakeri, Fereshteh, et al.
Publicado: (2024)
Full Conformal Adaptation of Medical Vision-Language Models
por: Silva-Rodríguez, Julio, et al.
Publicado: (2025)
por: Silva-Rodríguez, Julio, et al.
Publicado: (2025)
A Simple and Robust Framework for Cross-Modality Medical Image Segmentation applied to Vision Transformers
por: Bastico, Matteo, et al.
Publicado: (2023)
por: Bastico, Matteo, et al.
Publicado: (2023)
Cross-Attentive Multiview Fusion of Vision-Language Embeddings
por: Martins, Tomas Berriel, et al.
Publicado: (2026)
por: Martins, Tomas Berriel, et al.
Publicado: (2026)
BiomedXPro: Prompt Optimization for Explainable Diagnosis with Biomedical Vision Language Models
por: Silva, Kaushitha, et al.
Publicado: (2025)
por: Silva, Kaushitha, et al.
Publicado: (2025)
Toward Robust Medical Fairness: Debiased Dual-Modal Alignment via Text-Guided Attribute-Disentangled Prompt Learning for Vision-Language Models
por: Xia, Yuexuan, et al.
Publicado: (2025)
por: Xia, Yuexuan, et al.
Publicado: (2025)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
por: Feng, Qianhan, et al.
Publicado: (2024)
por: Feng, Qianhan, et al.
Publicado: (2024)
T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation
por: Khadka, Pranjal
Publicado: (2026)
por: Khadka, Pranjal
Publicado: (2026)
Dual-Projection Fusion for Accurate Upright Panorama Generation in Robotic Vision
por: Shan, Yuhao, et al.
Publicado: (2025)
por: Shan, Yuhao, et al.
Publicado: (2025)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
por: Bhaila, Karuna, et al.
Publicado: (2025)
por: Bhaila, Karuna, et al.
Publicado: (2025)
On the Robustness of Medical Vision-Language Models: Are they Truly Generalizable?
por: Imam, Raza, et al.
Publicado: (2025)
por: Imam, Raza, et al.
Publicado: (2025)
Tactile Modality Fusion for Vision-Language-Action Models
por: Morissette, Charlotte, et al.
Publicado: (2026)
por: Morissette, Charlotte, et al.
Publicado: (2026)
Scaling Down to Scale Up: Towards Operationally-Efficient and Deployable Clinical Models via Cross-Modal Low-Rank Adaptation for Medical Vision-Language Models
por: Alzubaidi, Thuraya, et al.
Publicado: (2025)
por: Alzubaidi, Thuraya, et al.
Publicado: (2025)
CMAL: A Novel Cross-Modal Associative Learning Framework for Vision-Language Pre-Training
por: Ma, Zhiyuan, et al.
Publicado: (2024)
por: Ma, Zhiyuan, et al.
Publicado: (2024)
VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection
por: Taparia, Aditya, et al.
Publicado: (2025)
por: Taparia, Aditya, et al.
Publicado: (2025)
CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
por: Lafon, Marc, et al.
Publicado: (2025)
por: Lafon, Marc, et al.
Publicado: (2025)
Active Learning via Vision-Language Model Adaptation with Open Data
por: Wang, Tong, et al.
Publicado: (2025)
por: Wang, Tong, et al.
Publicado: (2025)
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
por: Dhimoïla, Grégoire, et al.
Publicado: (2026)
por: Dhimoïla, Grégoire, et al.
Publicado: (2026)
Quantifying Cross-Modality Memorization in Vision-Language Models
por: Wen, Yuxin, et al.
Publicado: (2025)
por: Wen, Yuxin, et al.
Publicado: (2025)
DPA: Dual Prototypes Alignment for Unsupervised Adaptation of Vision-Language Models
por: Ali, Eman, et al.
Publicado: (2024)
por: Ali, Eman, et al.
Publicado: (2024)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
Robust Fairness Vision-Language Learning for Medical Image Analysis
por: Bansal, Sparsh, et al.
Publicado: (2025)
por: Bansal, Sparsh, et al.
Publicado: (2025)
Cross-Modal Adapter for Vision-Language Retrieval
por: Jiang, Haojun, et al.
Publicado: (2022)
por: Jiang, Haojun, et al.
Publicado: (2022)
Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models
por: Nakayama, Aya, et al.
Publicado: (2025)
por: Nakayama, Aya, et al.
Publicado: (2025)
LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation
por: Ren, Xiangxuan, et al.
Publicado: (2025)
por: Ren, Xiangxuan, et al.
Publicado: (2025)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
por: Cheng, Silin, et al.
Publicado: (2025)
por: Cheng, Silin, et al.
Publicado: (2025)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
por: Han, Feng, et al.
Publicado: (2026)
por: Han, Feng, et al.
Publicado: (2026)
ControlFusion: A Controllable Image Fusion Framework with Language-Vision Degradation Prompts
por: Tang, Linfeng, et al.
Publicado: (2025)
por: Tang, Linfeng, et al.
Publicado: (2025)
Ejemplares similares
-
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
por: Peng, Wei, et al.
Publicado: (2025) -
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
por: Xiang, Sike, et al.
Publicado: (2025) -
Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models
por: Mishra, Shambhavi, et al.
Publicado: (2024) -
Anchor-based Robust Finetuning of Vision-Language Models
por: Han, Jinwei, et al.
Publicado: (2024) -
MultiMedVision: Multi-Modal Medical Vision Framework
por: Li, Frank, et al.
Publicado: (2026)