Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Yangyi, Peng, Hao, Zhang, Tong, Ji, Heng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SOLO: A Single Transformer for Scalable Vision-Language Modeling
von: Chen, Yangyi, et al.
Veröffentlicht: (2024)
von: Chen, Yangyi, et al.
Veröffentlicht: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Centered Masking for Language-Image Pre-Training
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
von: Fu, Deqing, et al.
Veröffentlicht: (2024)
von: Fu, Deqing, et al.
Veröffentlicht: (2024)
Embedding Geometries of Contrastive Language-Image Pre-Training
von: Chou, Jason Chuan-Chih, et al.
Veröffentlicht: (2024)
von: Chou, Jason Chuan-Chih, et al.
Veröffentlicht: (2024)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
von: Li, Xue, et al.
Veröffentlicht: (2025)
von: Li, Xue, et al.
Veröffentlicht: (2025)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
S-GRPO: Unified Post-Training for Large Vision-Language Models
von: Yan, Yuming, et al.
Veröffentlicht: (2026)
von: Yan, Yuming, et al.
Veröffentlicht: (2026)
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
von: Li, Yanghao, et al.
Veröffentlicht: (2025)
von: Li, Yanghao, et al.
Veröffentlicht: (2025)
MedFLIP: Medical Vision-and-Language Self-supervised Fast Pre-Training with Masked Autoencoder
von: Li, Lei, et al.
Veröffentlicht: (2024)
von: Li, Lei, et al.
Veröffentlicht: (2024)
Multimodal Latent Language Modeling with Next-Token Diffusion
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
von: Chen, Junyi, et al.
Veröffentlicht: (2023)
von: Chen, Junyi, et al.
Veröffentlicht: (2023)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
von: Shuai, Zitao, et al.
Veröffentlicht: (2024)
von: Shuai, Zitao, et al.
Veröffentlicht: (2024)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
von: Qi, Yayun, et al.
Veröffentlicht: (2024)
von: Qi, Yayun, et al.
Veröffentlicht: (2024)
A Survey on Hallucination in Large Vision-Language Models
von: Liu, Hanchao, et al.
Veröffentlicht: (2024)
von: Liu, Hanchao, et al.
Veröffentlicht: (2024)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
von: Filvantorkaman, Melika, et al.
Veröffentlicht: (2026)
von: Filvantorkaman, Melika, et al.
Veröffentlicht: (2026)
Contrastive Localized Language-Image Pre-Training
von: Chen, Hong-You, et al.
Veröffentlicht: (2024)
von: Chen, Hong-You, et al.
Veröffentlicht: (2024)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
von: Chen, Yang, et al.
Veröffentlicht: (2024)
von: Chen, Yang, et al.
Veröffentlicht: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
von: Yang, Xu, et al.
Veröffentlicht: (2023)
von: Yang, Xu, et al.
Veröffentlicht: (2023)
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
Source-Free Domain Adaptation Guided by Vision and Vision-Language Pre-Training
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
von: Miranda, Imanol, et al.
Veröffentlicht: (2024)
von: Miranda, Imanol, et al.
Veröffentlicht: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
Calibrated Self-Rewarding Vision Language Models
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification
von: Fieback, Laura, et al.
Veröffentlicht: (2024)
von: Fieback, Laura, et al.
Veröffentlicht: (2024)
Probabilistic Language-Image Pre-Training
von: Chun, Sanghyuk, et al.
Veröffentlicht: (2024)
von: Chun, Sanghyuk, et al.
Veröffentlicht: (2024)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
von: Xia, Peng, et al.
Veröffentlicht: (2024)
von: Xia, Peng, et al.
Veröffentlicht: (2024)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
von: Chen, Peiyuan, et al.
Veröffentlicht: (2024)
von: Chen, Peiyuan, et al.
Veröffentlicht: (2024)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
von: Wang, Zekun, et al.
Veröffentlicht: (2025)
von: Wang, Zekun, et al.
Veröffentlicht: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
von: Ding, Yi, et al.
Veröffentlicht: (2025)
von: Ding, Yi, et al.
Veröffentlicht: (2025)
What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights
von: Wen, Xin, et al.
Veröffentlicht: (2024)
von: Wen, Xin, et al.
Veröffentlicht: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
von: Xia, Peng, et al.
Veröffentlicht: (2024)
von: Xia, Peng, et al.
Veröffentlicht: (2024)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models
von: Luo, Jun, et al.
Veröffentlicht: (2024)
von: Luo, Jun, et al.
Veröffentlicht: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
Enhancing Post-Training Quantization via Future Activation Awareness
von: Lv, Zheqi, et al.
Veröffentlicht: (2026)
von: Lv, Zheqi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SOLO: A Single Transformer for Scalable Vision-Language Modeling
von: Chen, Yangyi, et al.
Veröffentlicht: (2024) -
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
von: Chen, Yangyi, et al.
Veröffentlicht: (2023) -
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
von: Chen, Yangyi, et al.
Veröffentlicht: (2023) -
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
Centered Masking for Language-Image Pre-Training
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)