Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Haowei, Shi, Yaya, Xu, Haiyang, Yuan, Chunfeng, Ye, Qinghao, Li, Chenliang, Yan, Ming, Zhang, Ji, Huang, Fei, Li, Bing, Hu, Weiming |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Ye, Wei, et autres
Publié: (2024)
par: Ye, Wei, et autres
Publié: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
par: Hu, Anwen, et autres
Publié: (2023)
par: Hu, Anwen, et autres
Publié: (2023)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
par: Lu, Yifan, et autres
Publié: (2023)
par: Lu, Yifan, et autres
Publié: (2023)
PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC
par: Liu, Haowei, et autres
Publié: (2025)
par: Liu, Haowei, et autres
Publié: (2025)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
par: Yang, Yuxin, et autres
Publié: (2026)
par: Yang, Yuxin, et autres
Publié: (2026)
Multi-modal Vision Pre-training for Medical Image Analysis
par: Rui, Shaohao, et autres
Publié: (2024)
par: Rui, Shaohao, et autres
Publié: (2024)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
par: Ye, Qinghao, et autres
Publié: (2023)
par: Ye, Qinghao, et autres
Publié: (2023)
PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via Prompts
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
par: Gao, Jin, et autres
Publié: (2024)
par: Gao, Jin, et autres
Publié: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025)
par: Lu, Yifan, et autres
Publié: (2025)
Enhancing LLM Language Adaption through Cross-lingual In-Context Pre-training
par: Wu, Linjuan, et autres
Publié: (2025)
par: Wu, Linjuan, et autres
Publié: (2025)
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
par: Chen, Yuxin, et autres
Publié: (2024)
par: Chen, Yuxin, et autres
Publié: (2024)
MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
par: Wu, Biao, et autres
Publié: (2024)
par: Wu, Biao, et autres
Publié: (2024)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
par: Zhang, Duzhen, et autres
Publié: (2025)
par: Zhang, Duzhen, et autres
Publié: (2025)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
par: Ye, Jiabo, et autres
Publié: (2024)
par: Ye, Jiabo, et autres
Publié: (2024)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
par: Wei, Zihao, et autres
Publié: (2024)
par: Wei, Zihao, et autres
Publié: (2024)
Classification Done Right for Vision-Language Pre-Training
par: Huang, Zilong, et autres
Publié: (2024)
par: Huang, Zilong, et autres
Publié: (2024)
Universal Image Restoration Pre-training via Masked Degradation Classification
par: Hu, JiaKui, et autres
Publié: (2025)
par: Hu, JiaKui, et autres
Publié: (2025)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
par: Ye, Yaoqin, et autres
Publié: (2024)
par: Ye, Yaoqin, et autres
Publié: (2024)
Boosting Vision Semantic Density with Anatomy Normality Modeling for Medical Vision-language Pre-training
par: Cao, Weiwei, et autres
Publié: (2025)
par: Cao, Weiwei, et autres
Publié: (2025)
Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
par: Wanyan, Yuyang, et autres
Publié: (2025)
par: Wanyan, Yuyang, et autres
Publié: (2025)
NFT1000: A Cross-Modal Dataset for Non-Fungible Token Retrieval
par: Wang, Shuxun, et autres
Publié: (2024)
par: Wang, Shuxun, et autres
Publié: (2024)
MaskDiffusion: Exploiting Pre-trained Diffusion Models for Semantic Segmentation
par: Kawano, Yasufumi, et autres
Publié: (2024)
par: Kawano, Yasufumi, et autres
Publié: (2024)
Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment
par: Li, Jiaqing, et autres
Publié: (2026)
par: Li, Jiaqing, et autres
Publié: (2026)
Hide to Guide: Learning via Semantic Masking
par: Liu, Ruitao, et autres
Publié: (2026)
par: Liu, Ruitao, et autres
Publié: (2026)
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
par: Liu, Jiarun, et autres
Publié: (2024)
par: Liu, Jiarun, et autres
Publié: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
par: Chen, Junyi, et autres
Publié: (2023)
par: Chen, Junyi, et autres
Publié: (2023)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
par: Shen, Li-Cheng, et autres
Publié: (2025)
par: Shen, Li-Cheng, et autres
Publié: (2025)
Documents similaires
-
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
par: Liu, Haowei, et autres
Publié: (2024) -
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
par: Liu, Haowei, et autres
Publié: (2024) -
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
par: Jiang, Chaoya, et autres
Publié: (2023) -
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
par: Jiang, Chaoya, et autres
Publié: (2023) -
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Ye, Wei, et autres
Publié: (2024)