Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Oh, Youngtaek, Cho, Jae Won, Kim, Dong-Jin, Kweon, In So, Kim, Junmo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring the Spectrum of Visio-Linguistic Compositionality and Recognition
par: Oh, Youngtaek, et autres
Publié: (2024)
par: Oh, Youngtaek, et autres
Publié: (2024)
ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search
par: Kim, Myungchul, et autres
Publié: (2026)
par: Kim, Myungchul, et autres
Publié: (2026)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
par: Kim, Sanghwan, et autres
Publié: (2024)
par: Kim, Sanghwan, et autres
Publié: (2024)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
par: Kim, Donghoon, et autres
Publié: (2024)
par: Kim, Donghoon, et autres
Publié: (2024)
MATE: Meet At The Embedding -- Connecting Images with Long Texts
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
par: Lee, Dong-Jae, et autres
Publié: (2026)
par: Lee, Dong-Jae, et autres
Publié: (2026)
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs
par: Qiao, Yuxuan, et autres
Publié: (2024)
par: Qiao, Yuxuan, et autres
Publié: (2024)
MTMMC: A Large-Scale Real-World Multi-Modal Camera Tracking Benchmark
par: Woo, Sanghyun, et autres
Publié: (2024)
par: Woo, Sanghyun, et autres
Publié: (2024)
ImageNet-D: Benchmarking Neural Network Robustness on Diffusion Synthetic Object
par: Zhang, Chenshuang, et autres
Publié: (2024)
par: Zhang, Chenshuang, et autres
Publié: (2024)
Text-to-image Diffusion Models in Generative AI: A Survey
par: Zhang, Chenshuang, et autres
Publié: (2023)
par: Zhang, Chenshuang, et autres
Publié: (2023)
Tone Matters: The Impact of Linguistic Tone on Hallucination in VLMs
par: Hong, Weihao, et autres
Publié: (2026)
par: Hong, Weihao, et autres
Publié: (2026)
Video Inference for Human Mesh Recovery with Vision Transformer
par: Cho, Hanbyel, et autres
Publié: (2025)
par: Cho, Hanbyel, et autres
Publié: (2025)
VLP: A Survey on Vision-Language Pre-training
par: Chen, Feilong, et autres
Publié: (2022)
par: Chen, Feilong, et autres
Publié: (2022)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
par: Kim, Mingyeong, et autres
Publié: (2026)
par: Kim, Mingyeong, et autres
Publié: (2026)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
par: Chen, Junyi, et autres
Publié: (2023)
par: Chen, Junyi, et autres
Publié: (2023)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
par: Patel, Maitreya, et autres
Publié: (2024)
par: Patel, Maitreya, et autres
Publié: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
par: Li, Qingqiu, et autres
Publié: (2024)
par: Li, Qingqiu, et autres
Publié: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
par: Ye, Yaoqin, et autres
Publié: (2024)
par: Ye, Yaoqin, et autres
Publié: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
par: Miao, Yongzhu, et autres
Publié: (2023)
par: Miao, Yongzhu, et autres
Publié: (2023)
Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
par: Cho, Beomsik, et autres
Publié: (2025)
par: Cho, Beomsik, et autres
Publié: (2025)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
par: Cho, Yeongjae, et autres
Publié: (2024)
par: Cho, Yeongjae, et autres
Publié: (2024)
Unlocking the Capabilities of Masked Generative Models for Image Synthesis via Self-Guidance
par: Hur, Jiwan, et autres
Publié: (2024)
par: Hur, Jiwan, et autres
Publié: (2024)
Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images
par: Mahanta, Cristina, et autres
Publié: (2025)
par: Mahanta, Cristina, et autres
Publié: (2025)
Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision
par: Zhang, Chenshuang, et autres
Publié: (2025)
par: Zhang, Chenshuang, et autres
Publié: (2025)
Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
par: Shahgir, Haz Sameen, et autres
Publié: (2026)
par: Shahgir, Haz Sameen, et autres
Publié: (2026)
HyperWalker: Dynamic Hypergraph-Based Deep Diagnosis for Multi-Hop Clinical Modeling across EHR and X-Ray in Medical VLMs
par: Yang, Yuezhe, et autres
Publié: (2026)
par: Yang, Yuezhe, et autres
Publié: (2026)
DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset
par: Lee, Young-Jun, et autres
Publié: (2022)
par: Lee, Young-Jun, et autres
Publié: (2022)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
par: Shen, Yifan, et autres
Publié: (2025)
par: Shen, Yifan, et autres
Publié: (2025)
Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates
par: Ahn, Jaewoo, et autres
Publié: (2025)
par: Ahn, Jaewoo, et autres
Publié: (2025)
Evaluating Linguistic Capabilities of Multimodal LLMs in the Lens of Few-Shot Learning
par: Dogan, Mustafa, et autres
Publié: (2024)
par: Dogan, Mustafa, et autres
Publié: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
par: Zhang, Siyu, et autres
Publié: (2023)
par: Zhang, Siyu, et autres
Publié: (2023)
Stark: Social Long-Term Multi-Modal Conversation with Persona Commonsense Knowledge
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
par: Park, Jonggwon, et autres
Publié: (2025)
par: Park, Jonggwon, et autres
Publié: (2025)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
par: Xia, Renqiu, et autres
Publié: (2024)
par: Xia, Renqiu, et autres
Publié: (2024)
Frequency-Aware Token Reduction for Efficient Vision Transformer
par: Lee, Dong-Jae, et autres
Publié: (2025)
par: Lee, Dong-Jae, et autres
Publié: (2025)
Towards Understanding Dual BN In Hybrid Adversarial Training
par: Zhang, Chenshuang, et autres
Publié: (2024)
par: Zhang, Chenshuang, et autres
Publié: (2024)
Natural Language Inference Improves Compositionality in Vision-Language Models
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
Documents similaires
-
Exploring the Spectrum of Visio-Linguistic Compositionality and Recognition
par: Oh, Youngtaek, et autres
Publié: (2024) -
ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search
par: Kim, Myungchul, et autres
Publié: (2026) -
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
par: Kim, Sanghwan, et autres
Publié: (2024) -
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
par: Kim, Donghoon, et autres
Publié: (2024) -
MATE: Meet At The Embedding -- Connecting Images with Long Texts
par: Jang, Young Kyun, et autres
Publié: (2024)