Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Haowei, Shi, Yaya, Xu, Haiyang, Yuan, Chunfeng, Ye, Qinghao, Li, Chenliang, Yan, Ming, Zhang, Ji, Huang, Fei, Li, Bing, Hu, Weiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Ye, Wei, et al.
Pubblicazione: (2024)
di: Ye, Wei, et al.
Pubblicazione: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023)
di: Hu, Anwen, et al.
Pubblicazione: (2023)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
di: Lu, Yifan, et al.
Pubblicazione: (2023)
di: Lu, Yifan, et al.
Pubblicazione: (2023)
PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC
di: Liu, Haowei, et al.
Pubblicazione: (2025)
di: Liu, Haowei, et al.
Pubblicazione: (2025)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
Multi-modal Vision Pre-training for Medical Image Analysis
di: Rui, Shaohao, et al.
Pubblicazione: (2024)
di: Rui, Shaohao, et al.
Pubblicazione: (2024)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via Prompts
di: Chen, Zewen, et al.
Pubblicazione: (2024)
di: Chen, Zewen, et al.
Pubblicazione: (2024)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
di: Gao, Jin, et al.
Pubblicazione: (2024)
di: Gao, Jin, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
di: Lu, Yifan, et al.
Pubblicazione: (2025)
di: Lu, Yifan, et al.
Pubblicazione: (2025)
Enhancing LLM Language Adaption through Cross-lingual In-Context Pre-training
di: Wu, Linjuan, et al.
Pubblicazione: (2025)
di: Wu, Linjuan, et al.
Pubblicazione: (2025)
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
di: Wu, Biao, et al.
Pubblicazione: (2024)
di: Wu, Biao, et al.
Pubblicazione: (2024)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
di: Chen, Zewen, et al.
Pubblicazione: (2024)
di: Chen, Zewen, et al.
Pubblicazione: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
Classification Done Right for Vision-Language Pre-Training
di: Huang, Zilong, et al.
Pubblicazione: (2024)
di: Huang, Zilong, et al.
Pubblicazione: (2024)
Universal Image Restoration Pre-training via Masked Degradation Classification
di: Hu, JiaKui, et al.
Pubblicazione: (2025)
di: Hu, JiaKui, et al.
Pubblicazione: (2025)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
Boosting Vision Semantic Density with Anatomy Normality Modeling for Medical Vision-language Pre-training
di: Cao, Weiwei, et al.
Pubblicazione: (2025)
di: Cao, Weiwei, et al.
Pubblicazione: (2025)
Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
di: Wanyan, Yuyang, et al.
Pubblicazione: (2025)
di: Wanyan, Yuyang, et al.
Pubblicazione: (2025)
NFT1000: A Cross-Modal Dataset for Non-Fungible Token Retrieval
di: Wang, Shuxun, et al.
Pubblicazione: (2024)
di: Wang, Shuxun, et al.
Pubblicazione: (2024)
MaskDiffusion: Exploiting Pre-trained Diffusion Models for Semantic Segmentation
di: Kawano, Yasufumi, et al.
Pubblicazione: (2024)
di: Kawano, Yasufumi, et al.
Pubblicazione: (2024)
Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment
di: Li, Jiaqing, et al.
Pubblicazione: (2026)
di: Li, Jiaqing, et al.
Pubblicazione: (2026)
Hide to Guide: Learning via Semantic Masking
di: Liu, Ruitao, et al.
Pubblicazione: (2026)
di: Liu, Ruitao, et al.
Pubblicazione: (2026)
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
di: Chen, Zewen, et al.
Pubblicazione: (2024)
di: Chen, Zewen, et al.
Pubblicazione: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
di: Liu, Jiarun, et al.
Pubblicazione: (2024)
di: Liu, Jiarun, et al.
Pubblicazione: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
di: Zhang, Ming, et al.
Pubblicazione: (2024)
di: Zhang, Ming, et al.
Pubblicazione: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
di: Chen, Junyi, et al.
Pubblicazione: (2023)
di: Chen, Junyi, et al.
Pubblicazione: (2023)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
di: Liu, Haowei, et al.
Pubblicazione: (2024) -
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
di: Liu, Haowei, et al.
Pubblicazione: (2024) -
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
di: Jiang, Chaoya, et al.
Pubblicazione: (2023) -
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
di: Jiang, Chaoya, et al.
Pubblicazione: (2023) -
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Ye, Wei, et al.
Pubblicazione: (2024)