Vision Language Models: A Survey of 26K Papers
Fuente:
arXiv
Salvato in:
| Autore principale: | Lin, Fengming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vision-Language Models for Vision Tasks: A Survey
di: Zhang, Jingyi, et al.
Pubblicazione: (2023)
di: Zhang, Jingyi, et al.
Pubblicazione: (2023)
A Survey on Efficient Vision-Language Models
di: Shinde, Gaurav, et al.
Pubblicazione: (2025)
di: Shinde, Gaurav, et al.
Pubblicazione: (2025)
Towards Vision-Language Geo-Foundation Model: A Survey
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
di: Han, Xiaofeng, et al.
Pubblicazione: (2025)
di: Han, Xiaofeng, et al.
Pubblicazione: (2025)
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
di: Han, Bin, et al.
Pubblicazione: (2024)
di: Han, Bin, et al.
Pubblicazione: (2024)
HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks
di: Guo, Jingyu, et al.
Pubblicazione: (2026)
di: Guo, Jingyu, et al.
Pubblicazione: (2026)
Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey
di: Liu, Chenyang, et al.
Pubblicazione: (2024)
di: Liu, Chenyang, et al.
Pubblicazione: (2024)
A Survey of Medical Vision-and-Language Applications and Their Techniques
di: Chen, Qi, et al.
Pubblicazione: (2024)
di: Chen, Qi, et al.
Pubblicazione: (2024)
Prompt-based Adaptation in Large-scale Vision Models: A Survey
di: Xiao, Xi, et al.
Pubblicazione: (2025)
di: Xiao, Xi, et al.
Pubblicazione: (2025)
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
di: Wang, Zhaowei, et al.
Pubblicazione: (2026)
di: Wang, Zhaowei, et al.
Pubblicazione: (2026)
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
di: Liu, Daizong, et al.
Pubblicazione: (2024)
di: Liu, Daizong, et al.
Pubblicazione: (2024)
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
di: Ding, Kun, et al.
Pubblicazione: (2024)
di: Ding, Kun, et al.
Pubblicazione: (2024)
Explainability for Vision Foundation Models: A Survey
di: Kazmierczak, Rémi, et al.
Pubblicazione: (2025)
di: Kazmierczak, Rémi, et al.
Pubblicazione: (2025)
Survey on Vision-Language-Action Models
di: Adilkhanov, Adilzhan, et al.
Pubblicazione: (2025)
di: Adilkhanov, Adilzhan, et al.
Pubblicazione: (2025)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Autoregressive Models in Vision: A Survey
di: Xiong, Jing, et al.
Pubblicazione: (2024)
di: Xiong, Jing, et al.
Pubblicazione: (2024)
Diffusion Models in 3D Vision: A Survey
di: Wang, Zhen, et al.
Pubblicazione: (2024)
di: Wang, Zhen, et al.
Pubblicazione: (2024)
Vision Language Models in Autonomous Driving: A Survey and Outlook
di: Zhou, Xingcheng, et al.
Pubblicazione: (2023)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2023)
One missing piece in Vision and Language: A Survey on Comics Understanding
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022)
di: Chen, Feilong, et al.
Pubblicazione: (2022)
A Survey on Hallucination in Large Vision-Language Models
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
A Survey of Representation Learning, Optimization Strategies, and Applications for Omnidirectional Vision
di: Ai, Hao, et al.
Pubblicazione: (2025)
di: Ai, Hao, et al.
Pubblicazione: (2025)
MambaDFuse: A Mamba-based Dual-phase Model for Multi-modality Image Fusion
di: Li, Zhe, et al.
Pubblicazione: (2024)
di: Li, Zhe, et al.
Pubblicazione: (2024)
SEP-YOLO: Fourier-Domain Feature Representation for Transparent Object Instance Segmentation
di: Zhang, Fengming, et al.
Pubblicazione: (2026)
di: Zhang, Fengming, et al.
Pubblicazione: (2026)
From Pixels to Polygons: A Survey of Deep Learning Approaches for Medical Image-to-Mesh Reconstruction
di: Lin, Fengming, et al.
Pubblicazione: (2025)
di: Lin, Fengming, et al.
Pubblicazione: (2025)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
di: Shao, Rui, et al.
Pubblicazione: (2025)
di: Shao, Rui, et al.
Pubblicazione: (2025)
Same or Not? Enhancing Visual Perception in Vision-Language Models
di: Marsili, Damiano, et al.
Pubblicazione: (2025)
di: Marsili, Damiano, et al.
Pubblicazione: (2025)
Vision-Language Models for Edge Networks: A Comprehensive Survey
di: Sharshar, Ahmed, et al.
Pubblicazione: (2025)
di: Sharshar, Ahmed, et al.
Pubblicazione: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation
di: Liu, Fengming, et al.
Pubblicazione: (2026)
di: Liu, Fengming, et al.
Pubblicazione: (2026)
Revisiting Multimodal Positional Encoding in Vision-Language Models
di: Huang, Jie, et al.
Pubblicazione: (2025)
di: Huang, Jie, et al.
Pubblicazione: (2025)
Are We on the Right Way for Evaluating Large Vision-Language Models?
di: Chen, Lin, et al.
Pubblicazione: (2024)
di: Chen, Lin, et al.
Pubblicazione: (2024)
A Survey on Remote Sensing Foundation Models: From Vision to Multimodality
di: Huang, Ziyue, et al.
Pubblicazione: (2025)
di: Huang, Ziyue, et al.
Pubblicazione: (2025)
Computer Vision Model Compression Techniques for Embedded Systems: A Survey
di: Lopes, Alexandre, et al.
Pubblicazione: (2024)
di: Lopes, Alexandre, et al.
Pubblicazione: (2024)
A Survey on the Robustness of Computer Vision Models against Common Corruptions
di: Wang, Shunxin, et al.
Pubblicazione: (2023)
di: Wang, Shunxin, et al.
Pubblicazione: (2023)
Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models
di: Lin, Zhenxiang, et al.
Pubblicazione: (2025)
di: Lin, Zhenxiang, et al.
Pubblicazione: (2025)
Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
di: Jia, Kaidi, et al.
Pubblicazione: (2026)
di: Jia, Kaidi, et al.
Pubblicazione: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
di: Jiang, Sicong, et al.
Pubblicazione: (2025)
di: Jiang, Sicong, et al.
Pubblicazione: (2025)
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
di: Ye, Mang, et al.
Pubblicazione: (2025)
di: Ye, Mang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Vision-Language Models for Vision Tasks: A Survey
di: Zhang, Jingyi, et al.
Pubblicazione: (2023) -
A Survey on Efficient Vision-Language Models
di: Shinde, Gaurav, et al.
Pubblicazione: (2025) -
Towards Vision-Language Geo-Foundation Model: A Survey
di: Zhou, Yue, et al.
Pubblicazione: (2024) -
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
di: Han, Xiaofeng, et al.
Pubblicazione: (2025) -
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
di: Han, Bin, et al.
Pubblicazione: (2024)