Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
Fuente:
arXiv
Guardado en:
| Autores principales: | Ye, Wei, Jiang, Chaoya, Xu, Haiyang, Ye, Chenhao, Li, Chenliang, Yan, Ming, Zhang, Shikun, Huang, Songhang, Huang, Fei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
por: Jiang, Chaoya, et al.
Publicado: (2024)
por: Jiang, Chaoya, et al.
Publicado: (2024)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
por: Jia, Hongrui, et al.
Publicado: (2024)
por: Jia, Hongrui, et al.
Publicado: (2024)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
por: Jiang, Chaoya, et al.
Publicado: (2025)
por: Jiang, Chaoya, et al.
Publicado: (2025)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
por: Jia, Hongrui, et al.
Publicado: (2025)
por: Jia, Hongrui, et al.
Publicado: (2025)
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
por: Jia, Hongrui, et al.
Publicado: (2026)
por: Jia, Hongrui, et al.
Publicado: (2026)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
por: Jiang, Chaoya, et al.
Publicado: (2024)
por: Jiang, Chaoya, et al.
Publicado: (2024)
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
por: Heng, Yongrui, et al.
Publicado: (2026)
por: Heng, Yongrui, et al.
Publicado: (2026)
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
por: Jia, Hongrui, et al.
Publicado: (2025)
por: Jia, Hongrui, et al.
Publicado: (2025)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
por: Yao, Xin, et al.
Publicado: (2025)
por: Yao, Xin, et al.
Publicado: (2025)
Adaptively Clustering Neighbor Elements for Image-Text Generation
por: Wang, Zihua, et al.
Publicado: (2023)
por: Wang, Zihua, et al.
Publicado: (2023)
Exploiting Pseudo Image Captions for Multimodal Summarization
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
por: Zhang, Peng-Fei, et al.
Publicado: (2025)
por: Zhang, Peng-Fei, et al.
Publicado: (2025)
Universal Adversarial Perturbations for Vision-Language Pre-trained Models
por: Zhang, Peng-Fei, et al.
Publicado: (2024)
por: Zhang, Peng-Fei, et al.
Publicado: (2024)
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
por: Kong, Dehong, et al.
Publicado: (2024)
por: Kong, Dehong, et al.
Publicado: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
por: Wei, Zihao, et al.
Publicado: (2024)
por: Wei, Zihao, et al.
Publicado: (2024)
Efficient and Effective In-context Demonstration Selection with Coreset
por: Wang, Zihua, et al.
Publicado: (2025)
por: Wang, Zihua, et al.
Publicado: (2025)
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
por: Che, Chengan, et al.
Publicado: (2026)
por: Che, Chengan, et al.
Publicado: (2026)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
Classification Done Right for Vision-Language Pre-Training
por: Huang, Zilong, et al.
Publicado: (2024)
por: Huang, Zilong, et al.
Publicado: (2024)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
por: Guo, Yangyang, et al.
Publicado: (2023)
por: Guo, Yangyang, et al.
Publicado: (2023)
Let ViT Speak: Generative Language-Image Pre-training
por: Fang, Yan, et al.
Publicado: (2026)
por: Fang, Yan, et al.
Publicado: (2026)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
por: Yang, Fan, et al.
Publicado: (2024)
por: Yang, Fan, et al.
Publicado: (2024)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
por: Ye, Jiabo, et al.
Publicado: (2024)
por: Ye, Jiabo, et al.
Publicado: (2024)
AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference
por: Huang, Kai, et al.
Publicado: (2025)
por: Huang, Kai, et al.
Publicado: (2025)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
por: Ruan, Shouwei, et al.
Publicado: (2024)
por: Ruan, Shouwei, et al.
Publicado: (2024)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
SimInversion: A Simple Framework for Inversion-Based Text-to-Image Editing
por: Qian, Qi, et al.
Publicado: (2024)
por: Qian, Qi, et al.
Publicado: (2024)
LoTLIP: Improving Language-Image Pre-training for Long Text Understanding
por: Wu, Wei, et al.
Publicado: (2024)
por: Wu, Wei, et al.
Publicado: (2024)
Pre-training Everywhere: Parameter-Efficient Fine-Tuning for Medical Image Analysis via Target Parameter Pre-training
por: Lei, Xingliang, et al.
Publicado: (2024)
por: Lei, Xingliang, et al.
Publicado: (2024)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
por: Yan, Xin, et al.
Publicado: (2023)
por: Yan, Xin, et al.
Publicado: (2023)
Ejemplares similares
-
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Jiang, Chaoya, et al.
Publicado: (2023) -
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
por: Jiang, Chaoya, et al.
Publicado: (2023) -
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
por: Jiang, Chaoya, et al.
Publicado: (2023) -
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
por: Jiang, Chaoya, et al.
Publicado: (2023) -
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
por: Liu, Haowei, et al.
Publicado: (2024)