Generalizing vision-language models to novel domains: A comprehensive survey
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Xinyao, Li, Jingjing, Li, Fengling, Zhu, Lei, Yang, Yang, Shen, Heng Tao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unified modality separation: A vision-language framework for unsupervised domain adaptation
by: Li, Xinyao, et al.
Published: (2025)
by: Li, Xinyao, et al.
Published: (2025)
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
by: Liu, Chenyv, et al.
Published: (2026)
by: Liu, Chenyv, et al.
Published: (2026)
Agile Multi-Source-Free Domain Adaptation
by: Li, Xinyao, et al.
Published: (2024)
by: Li, Xinyao, et al.
Published: (2024)
Self-adaptive vision-language model for 3D segmentation of pulmonary artery and vein
by: Guo, Xiaotong, et al.
Published: (2025)
by: Guo, Xiaotong, et al.
Published: (2025)
Beyond the Hype: A dispassionate look at vision-language models in medical scenario
by: Nan, Yang, et al.
Published: (2024)
by: Nan, Yang, et al.
Published: (2024)
Thinker: A vision-language foundation model for embodied intelligence
by: Pan, Baiyu, et al.
Published: (2026)
by: Pan, Baiyu, et al.
Published: (2026)
Generalizing Vision-Language Models with Dedicated Prompt Guidance
by: Li, Xinyao, et al.
Published: (2025)
by: Li, Xinyao, et al.
Published: (2025)
Are vision language models robust to uncertain inputs?
by: Wang, Xi, et al.
Published: (2025)
by: Wang, Xi, et al.
Published: (2025)
MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation
by: Xing, Yang, et al.
Published: (2026)
by: Xing, Yang, et al.
Published: (2026)
A benchmark multimodal oro-dental dataset for large vision-language models
by: Lv, Haoxin, et al.
Published: (2025)
by: Lv, Haoxin, et al.
Published: (2025)
A comprehensive survey of oracle character recognition: challenges, benchmarks, and beyond
by: Li, Jing, et al.
Published: (2024)
by: Li, Jing, et al.
Published: (2024)
Quantifying the human visual exposome with vision language models
by: Rominger, Christian, et al.
Published: (2026)
by: Rominger, Christian, et al.
Published: (2026)
What matters when building vision-language models?
by: Laurençon, Hugo, et al.
Published: (2024)
by: Laurençon, Hugo, et al.
Published: (2024)
DiffLoRA: Generating Personalized Low-Rank Adaptation Weights with Diffusion
by: Wu, Yujia, et al.
Published: (2024)
by: Wu, Yujia, et al.
Published: (2024)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
by: Zeng, Haoxi, et al.
Published: (2025)
by: Zeng, Haoxi, et al.
Published: (2025)
MemeBLIP2: A novel lightweight multimodal system to detect harmful memes
by: Liu, Jiaqi, et al.
Published: (2025)
by: Liu, Jiaqi, et al.
Published: (2025)
Split to Merge: Unifying Separated Modalities for Unsupervised Domain Adaptation
by: Li, Xinyao, et al.
Published: (2024)
by: Li, Xinyao, et al.
Published: (2024)
Building and better understanding vision-language models: insights and future directions
by: Laurençon, Hugo, et al.
Published: (2024)
by: Laurençon, Hugo, et al.
Published: (2024)
Hallucination-aware intermediate representation edit in large vision-language models
by: Suo, Wei, et al.
Published: (2026)
by: Suo, Wei, et al.
Published: (2026)
A Unified and General Framework for Continual Learning
by: Wang, Zhenyi, et al.
Published: (2024)
by: Wang, Zhenyi, et al.
Published: (2024)
VLA-Mark: A cross modal watermark for large vision-language alignment model
by: Liu, Shuliang, et al.
Published: (2025)
by: Liu, Shuliang, et al.
Published: (2025)
Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning
by: Li, Shenshen, et al.
Published: (2025)
by: Li, Shenshen, et al.
Published: (2025)
Representation geometry shapes task performance in vision-language modeling for CT enterography
by: Minoccheri, Cristian, et al.
Published: (2026)
by: Minoccheri, Cristian, et al.
Published: (2026)
TMT: Cross-domain Semantic Segmentation with Region-adaptive Transferability Estimation
by: Zhang, Enming, et al.
Published: (2025)
by: Zhang, Enming, et al.
Published: (2025)
Mamba-MOC: A Multicategory Remote Object Counting via State Space Model
by: Liu, Peng, et al.
Published: (2025)
by: Liu, Peng, et al.
Published: (2025)
A Comprehensive Survey of Forgetting in Deep Learning Beyond Continual Learning
by: Wang, Zhenyi, et al.
Published: (2023)
by: Wang, Zhenyi, et al.
Published: (2023)
Towards aligned body representations in vision models
by: Gizdov, Andrey, et al.
Published: (2025)
by: Gizdov, Andrey, et al.
Published: (2025)
RCTrans: Radar-Camera Transformer via Radar Densifier and Sequential Decoder for 3D Object Detection
by: Li, Yiheng, et al.
Published: (2024)
by: Li, Yiheng, et al.
Published: (2024)
Structure-Level Disentangled Diffusion for Few-Shot Chinese Font Generation
by: Li, Jie, et al.
Published: (2026)
by: Li, Jie, et al.
Published: (2026)
Advancing vision-language models in front-end development via data synthesis
by: Ge, Tong, et al.
Published: (2025)
by: Ge, Tong, et al.
Published: (2025)
A multi-scale vision transformer-based multimodal GeoAI model for mapping Arctic permafrost thaw
by: Li, Wenwen, et al.
Published: (2025)
by: Li, Wenwen, et al.
Published: (2025)
From Canteen Food to Daily Meals: Generalizing Food Recognition to More Practical Scenarios
by: Liu, Guoshan, et al.
Published: (2024)
by: Liu, Guoshan, et al.
Published: (2024)
BRAVE: Broadening the visual encoding of vision-language models
by: Kar, Oğuzhan Fatih, et al.
Published: (2024)
by: Kar, Oğuzhan Fatih, et al.
Published: (2024)
CCIS-Diff: A Generative Model with Stable Diffusion Prior for Controlled Colonoscopy Image Synthesis
by: Xie, Yifan, et al.
Published: (2024)
by: Xie, Yifan, et al.
Published: (2024)
Reviving In-domain Fine-tuning Methods for Source-Free Cross-domain Few-shot Learning
by: Zhao, Yaze, et al.
Published: (2026)
by: Zhao, Yaze, et al.
Published: (2026)
Diffusion Prior Interpolation for Flexibility Real-World Face Super-Resolution
by: Yang, Jiarui, et al.
Published: (2024)
by: Yang, Jiarui, et al.
Published: (2024)
Improving vision-language alignment with graph spiking hybrid Networks
by: Zhang, Siyu, et al.
Published: (2025)
by: Zhang, Siyu, et al.
Published: (2025)
Owls are wise and foxes are unfaithful: Uncovering animal stereotypes in vision-language models
by: Aman, Tabinda, et al.
Published: (2025)
by: Aman, Tabinda, et al.
Published: (2025)
TasselNetV4: A vision foundation model for cross-scene, cross-scale, and cross-species plant counting
by: Hu, Xiaonan, et al.
Published: (2025)
by: Hu, Xiaonan, et al.
Published: (2025)
Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis
by: Yu, Yang, et al.
Published: (2026)
by: Yu, Yang, et al.
Published: (2026)
Similar Items
-
Unified modality separation: A vision-language framework for unsupervised domain adaptation
by: Li, Xinyao, et al.
Published: (2025) -
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
by: Liu, Chenyv, et al.
Published: (2026) -
Agile Multi-Source-Free Domain Adaptation
by: Li, Xinyao, et al.
Published: (2024) -
Self-adaptive vision-language model for 3D segmentation of pulmonary artery and vein
by: Guo, Xiaotong, et al.
Published: (2025) -
Beyond the Hype: A dispassionate look at vision-language models in medical scenario
by: Nan, Yang, et al.
Published: (2024)