Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Mingliang, Larson, Martha |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
Centered Masking for Language-Image Pre-Training
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
par: Liang, Mingliang, et autres
Publié: (2026)
par: Liang, Mingliang, et autres
Publié: (2026)
OCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit Imaging
par: Han, Zihao, et autres
Publié: (2025)
par: Han, Zihao, et autres
Publié: (2025)
Efficient Vision-Language Pre-training by Cluster Masking
par: Wei, Zihao, et autres
Publié: (2024)
par: Wei, Zihao, et autres
Publié: (2024)
SeTformer is What You Need for Vision and Language
par: Shamsolmoali, Pourya, et autres
Publié: (2024)
par: Shamsolmoali, Pourya, et autres
Publié: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
par: Zhu, Lei, et autres
Publié: (2025)
par: Zhu, Lei, et autres
Publié: (2025)
Frequency-Guided Masking for Enhanced Vision Self-Supervised Learning
par: Monsefi, Amin Karimi, et autres
Publié: (2024)
par: Monsefi, Amin Karimi, et autres
Publié: (2024)
Masked Generative Transformer Is What You Need for Image Editing
par: Chow, Wei, et autres
Publié: (2026)
par: Chow, Wei, et autres
Publié: (2026)
Text is All You Need for Vision-Language Model Jailbreaking
par: Chen, Yihang, et autres
Publié: (2026)
par: Chen, Yihang, et autres
Publié: (2026)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
par: Liu, Jiarun, et autres
Publié: (2024)
par: Liu, Jiarun, et autres
Publié: (2024)
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
par: Che, Chengan, et autres
Publié: (2026)
par: Che, Chengan, et autres
Publié: (2026)
Multi-View Representation is What You Need for Point-Cloud Pre-Training
par: Yan, Siming, et autres
Publié: (2023)
par: Yan, Siming, et autres
Publié: (2023)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
par: Qi, Yayun, et autres
Publié: (2024)
par: Qi, Yayun, et autres
Publié: (2024)
Dataset Ownership Verification for Pre-trained Masked Models
par: Xie, Yuechen, et autres
Publié: (2025)
par: Xie, Yuechen, et autres
Publié: (2025)
Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting
par: Colombo, Antonio, et autres
Publié: (2026)
par: Colombo, Antonio, et autres
Publié: (2026)
Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
par: Wang, Xiaomeng, et autres
Publié: (2026)
par: Wang, Xiaomeng, et autres
Publié: (2026)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models
par: Yu, Lu, et autres
Publié: (2024)
par: Yu, Lu, et autres
Publié: (2024)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
par: Chen, Junyi, et autres
Publié: (2023)
par: Chen, Junyi, et autres
Publié: (2023)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
par: Fhima, Jonathan, et autres
Publié: (2024)
par: Fhima, Jonathan, et autres
Publié: (2024)
Smart Feature is What You Need
par: Hu, Zhaoxin, et autres
Publié: (2024)
par: Hu, Zhaoxin, et autres
Publié: (2024)
On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations
par: Vice, Jordan, et autres
Publié: (2025)
par: Vice, Jordan, et autres
Publié: (2025)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
par: Ding, Yuhe, et autres
Publié: (2024)
par: Ding, Yuhe, et autres
Publié: (2024)
Learning to See What You Need: Gaze Attention for Multimodal Large Language Models
par: Song, Junha, et autres
Publié: (2026)
par: Song, Junha, et autres
Publié: (2026)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
par: Zheng, Haonan, et autres
Publié: (2024)
par: Zheng, Haonan, et autres
Publié: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language Models
par: Li, Lin, et autres
Publié: (2024)
par: Li, Lin, et autres
Publié: (2024)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
par: Xu, Longwei, et autres
Publié: (2026)
par: Xu, Longwei, et autres
Publié: (2026)
When Does Pruning Benefit Vision Representations?
par: Cassano, Enrico, et autres
Publié: (2025)
par: Cassano, Enrico, et autres
Publié: (2025)
Enhancing Vision-Language Pre-training with Rich Supervisions
par: Gao, Yuan, et autres
Publié: (2024)
par: Gao, Yuan, et autres
Publié: (2024)
MaskDiffusion: Exploiting Pre-trained Diffusion Models for Semantic Segmentation
par: Kawano, Yasufumi, et autres
Publié: (2024)
par: Kawano, Yasufumi, et autres
Publié: (2024)
Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models
par: Magid, Salma Abdel, et autres
Publié: (2024)
par: Magid, Salma Abdel, et autres
Publié: (2024)
A Reality Check of Vision-Language Pre-training in Radiology: Have We Progressed Using Text?
par: Silva-Rodríguez, Julio, et autres
Publié: (2025)
par: Silva-Rodríguez, Julio, et autres
Publié: (2025)
Continual Forgetting for Pre-trained Vision Models
par: Zhao, Hongbo, et autres
Publié: (2024)
par: Zhao, Hongbo, et autres
Publié: (2024)
Integrating Frequency-Domain Representations with Low-Rank Adaptation in Vision-Language Models
par: Khan, Md Azim, et autres
Publié: (2025)
par: Khan, Md Azim, et autres
Publié: (2025)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
Documents similaires
-
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
par: Liang, Mingliang, et autres
Publié: (2024) -
Centered Masking for Language-Image Pre-Training
par: Liang, Mingliang, et autres
Publié: (2024) -
Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
par: Liang, Mingliang, et autres
Publié: (2026) -
OCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit Imaging
par: Han, Zihao, et autres
Publié: (2025) -
Efficient Vision-Language Pre-training by Cluster Masking
par: Wei, Zihao, et autres
Publié: (2024)