VLP: A Survey on Vision-Language Pre-training
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Feilong, Zhang, Duzhen, Han, Minglun, Chen, Xiuyi, Shi, Jing, Xu, Shuang, Xu, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks
por: Zhao, Xuanle, et al.
Publicado: (2025)
por: Zhao, Xuanle, et al.
Publicado: (2025)
Anatomical Structure-Guided Medical Vision-Language Pre-training
por: Li, Qingqiu, et al.
Publicado: (2024)
por: Li, Qingqiu, et al.
Publicado: (2024)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
por: Zhang, Duzhen, et al.
Publicado: (2025)
por: Zhang, Duzhen, et al.
Publicado: (2025)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
por: Xia, Renqiu, et al.
Publicado: (2024)
por: Xia, Renqiu, et al.
Publicado: (2024)
SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics
por: Mahdizadeh, Ailar, et al.
Publicado: (2025)
por: Mahdizadeh, Ailar, et al.
Publicado: (2025)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
por: Qi, Yayun, et al.
Publicado: (2024)
por: Qi, Yayun, et al.
Publicado: (2024)
VLP: Vision Language Planning for Autonomous Driving
por: Pan, Chenbin, et al.
Publicado: (2024)
por: Pan, Chenbin, et al.
Publicado: (2024)
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
por: Jin, Yang, et al.
Publicado: (2024)
por: Jin, Yang, et al.
Publicado: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
Compensating Distribution Drifts in Class-incremental Learning of Pre-trained Vision Transformers
por: Rao, Xuan, et al.
Publicado: (2025)
por: Rao, Xuan, et al.
Publicado: (2025)
Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images
por: Mahanta, Cristina, et al.
Publicado: (2025)
por: Mahanta, Cristina, et al.
Publicado: (2025)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
por: Xu, Hongshen, et al.
Publicado: (2024)
por: Xu, Hongshen, et al.
Publicado: (2024)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
por: Pathak, Surendra, et al.
Publicado: (2026)
por: Pathak, Surendra, et al.
Publicado: (2026)
Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding
por: Pu, Muxin, et al.
Publicado: (2025)
por: Pu, Muxin, et al.
Publicado: (2025)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
por: Chen, Junyi, et al.
Publicado: (2023)
por: Chen, Junyi, et al.
Publicado: (2023)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
por: Miao, Yongzhu, et al.
Publicado: (2023)
por: Miao, Yongzhu, et al.
Publicado: (2023)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
por: Nie, Yunshuang, et al.
Publicado: (2026)
por: Nie, Yunshuang, et al.
Publicado: (2026)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
por: Chen, Yangyi, et al.
Publicado: (2025)
por: Chen, Yangyi, et al.
Publicado: (2025)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
por: Su, Tongkun, et al.
Publicado: (2024)
por: Su, Tongkun, et al.
Publicado: (2024)
Video Understanding with Large Language Models: A Survey
por: Tang, Yolo Y., et al.
Publicado: (2023)
por: Tang, Yolo Y., et al.
Publicado: (2023)
A Survey on Hallucination in Large Vision-Language Models
por: Liu, Hanchao, et al.
Publicado: (2024)
por: Liu, Hanchao, et al.
Publicado: (2024)
Granular Privacy Control for Geolocation with Vision Language Models
por: Mendes, Ethan, et al.
Publicado: (2024)
por: Mendes, Ethan, et al.
Publicado: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
por: Luo, Lingxiao, et al.
Publicado: (2024)
por: Luo, Lingxiao, et al.
Publicado: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
por: Shuai, Zitao, et al.
Publicado: (2024)
por: Shuai, Zitao, et al.
Publicado: (2024)
Autoregressive Models in Vision: A Survey
por: Xiong, Jing, et al.
Publicado: (2024)
por: Xiong, Jing, et al.
Publicado: (2024)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
por: Chang, Yue, et al.
Publicado: (2024)
por: Chang, Yue, et al.
Publicado: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
por: Xu, Jiaqi, et al.
Publicado: (2023)
por: Xu, Jiaqi, et al.
Publicado: (2023)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
por: Jing, Liqiang, et al.
Publicado: (2025)
por: Jing, Liqiang, et al.
Publicado: (2025)
Trajectory Prediction Meets Large Language Models: A Survey
por: Xu, Yi, et al.
Publicado: (2025)
por: Xu, Yi, et al.
Publicado: (2025)
Cerberus: Real-Time Video Anomaly Detection via Cascaded Vision-Language Models
por: Zheng, Yue, et al.
Publicado: (2025)
por: Zheng, Yue, et al.
Publicado: (2025)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
por: Kim, Sanghwan, et al.
Publicado: (2024)
por: Kim, Sanghwan, et al.
Publicado: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
Ejemplares similares
-
TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks
por: Zhao, Xuanle, et al.
Publicado: (2025) -
Anatomical Structure-Guided Medical Vision-Language Pre-training
por: Li, Qingqiu, et al.
Publicado: (2024) -
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
por: Zhang, Duzhen, et al.
Publicado: (2025) -
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
por: Xia, Renqiu, et al.
Publicado: (2024) -
SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics
por: Mahdizadeh, Ailar, et al.
Publicado: (2025)