How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Qi, Yayun, Li, Hongxi, Song, Yiqi, Wu, Xinxiao, Luo, Jiebo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022)
di: Chen, Feilong, et al.
Pubblicazione: (2022)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
A Survey on Hallucination in Large Vision-Language Models
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
di: Zang, Yuan, et al.
Pubblicazione: (2024)
di: Zang, Yuan, et al.
Pubblicazione: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Video Understanding with Large Language Models: A Survey
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
Autoregressive Models in Vision: A Survey
di: Xiong, Jing, et al.
Pubblicazione: (2024)
di: Xiong, Jing, et al.
Pubblicazione: (2024)
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
di: Xiu, Lixin, et al.
Pubblicazione: (2026)
di: Xiu, Lixin, et al.
Pubblicazione: (2026)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks
di: Luo, Yaxin, et al.
Pubblicazione: (2026)
di: Luo, Yaxin, et al.
Pubblicazione: (2026)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
di: Ding, Yuhe, et al.
Pubblicazione: (2024)
di: Ding, Yuhe, et al.
Pubblicazione: (2024)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
di: Chen, Junyi, et al.
Pubblicazione: (2023)
di: Chen, Junyi, et al.
Pubblicazione: (2023)
Anatomical Structure-Guided Medical Vision-Language Pre-training
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models
di: Luo, Jun, et al.
Pubblicazione: (2024)
di: Luo, Jun, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
OCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit Imaging
di: Han, Zihao, et al.
Pubblicazione: (2025)
di: Han, Zihao, et al.
Pubblicazione: (2025)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
Shotluck Holmes: A Family of Efficient Small-Scale Large Language Vision Models For Video Captioning and Summarization
di: Luo, Richard, et al.
Pubblicazione: (2024)
di: Luo, Richard, et al.
Pubblicazione: (2024)
Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images
di: Mahanta, Cristina, et al.
Pubblicazione: (2025)
di: Mahanta, Cristina, et al.
Pubblicazione: (2025)
Matryoshka Query Transformer for Large Vision-Language Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
di: Huang, Jinfa, et al.
Pubblicazione: (2024)
di: Huang, Jinfa, et al.
Pubblicazione: (2024)
Video Summarization using Denoising Diffusion Probabilistic Model
di: Shang, Zirui, et al.
Pubblicazione: (2024)
di: Shang, Zirui, et al.
Pubblicazione: (2024)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
S-GRPO: Unified Post-Training for Large Vision-Language Models
di: Yan, Yuming, et al.
Pubblicazione: (2026)
di: Yan, Yuming, et al.
Pubblicazione: (2026)
TroL: Traversal of Layers for Large Language and Vision Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
Towards Statistical Factuality Guarantee for Large Vision-Language Models
di: Li, Zhuohang, et al.
Pubblicazione: (2025)
di: Li, Zhuohang, et al.
Pubblicazione: (2025)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
di: Groot, Tobias, et al.
Pubblicazione: (2024)
di: Groot, Tobias, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022) -
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
di: Shuai, Zitao, et al.
Pubblicazione: (2024) -
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
di: Nie, Yuxiang, et al.
Pubblicazione: (2025) -
A Survey on Hallucination in Large Vision-Language Models
di: Liu, Hanchao, et al.
Pubblicazione: (2024) -
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)