Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
Fuente:
arXiv
Salvato in:
| Autori principali: | Zang, Yuan, Yun, Tian, Tan, Hao, Bui, Trung, Sun, Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Do Pre-trained Vision-Language Models Encode Object States?
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024)
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
di: Zang, Yuan, et al.
Pubblicazione: (2025)
di: Zang, Yuan, et al.
Pubblicazione: (2025)
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2025)
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2025)
Compensating Distribution Drifts in Class-incremental Learning of Pre-trained Vision Transformers
di: Rao, Xuan, et al.
Pubblicazione: (2025)
di: Rao, Xuan, et al.
Pubblicazione: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022)
di: Chen, Feilong, et al.
Pubblicazione: (2022)
Anatomical Structure-Guided Medical Vision-Language Pre-training
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images
di: Wu, Shengguang, et al.
Pubblicazione: (2025)
di: Wu, Shengguang, et al.
Pubblicazione: (2025)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
PEEB: Part-based Image Classifiers with an Explainable and Editable Language Bottleneck
di: Pham, Thang M., et al.
Pubblicazione: (2024)
di: Pham, Thang M., et al.
Pubblicazione: (2024)
TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention
di: Duan, Jinhao, et al.
Pubblicazione: (2025)
di: Duan, Jinhao, et al.
Pubblicazione: (2025)
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2024)
di: Jin, Yang, et al.
Pubblicazione: (2024)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
di: Du, Yiyang, et al.
Pubblicazione: (2026)
di: Du, Yiyang, et al.
Pubblicazione: (2026)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2025)
di: Woo, Sangmin, et al.
Pubblicazione: (2025)
From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models
di: Bhatia, Mehar, et al.
Pubblicazione: (2024)
di: Bhatia, Mehar, et al.
Pubblicazione: (2024)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
di: Oh, Youngtaek, et al.
Pubblicazione: (2024)
di: Oh, Youngtaek, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
di: Tang, Zicong, et al.
Pubblicazione: (2025)
di: Tang, Zicong, et al.
Pubblicazione: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
di: Lee, Yi-Lun, et al.
Pubblicazione: (2024)
di: Lee, Yi-Lun, et al.
Pubblicazione: (2024)
How Do Vision-Language Models Process Conflicting Information Across Modalities?
di: Hua, Tianze, et al.
Pubblicazione: (2025)
di: Hua, Tianze, et al.
Pubblicazione: (2025)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
Can Vision-Language Models Solve Visual Math Equations?
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024)
di: Su, Tongkun, et al.
Pubblicazione: (2024)
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
di: Wang, Yimu, et al.
Pubblicazione: (2025)
di: Wang, Yimu, et al.
Pubblicazione: (2025)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
di: Wen, Yuxin, et al.
Pubblicazione: (2024)
di: Wen, Yuxin, et al.
Pubblicazione: (2024)
CBVLM: Training-free Explainable Concept-based Large Vision Language Models for Medical Image Classification
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
di: Son, Jaemin, et al.
Pubblicazione: (2025)
di: Son, Jaemin, et al.
Pubblicazione: (2025)
Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images
di: Mahanta, Cristina, et al.
Pubblicazione: (2025)
di: Mahanta, Cristina, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Do Pre-trained Vision-Language Models Encode Object States?
di: Newman, Kaleb, et al.
Pubblicazione: (2024) -
Superpixel Semantics Representation and Pre-training for Vision-Language Task
di: Zhang, Siyu, et al.
Pubblicazione: (2023) -
On Pre-training of Multimodal Language Models Customized for Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024) -
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
di: Nie, Yuxiang, et al.
Pubblicazione: (2025) -
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
di: Zang, Yuan, et al.
Pubblicazione: (2025)