Saved in:
| Main Authors: | Li, Mingsheng, Zhang, Lin, Zhu, Mingzhen, Huang, Zilong, Yu, Gang, Fan, Jiayuan, Chen, Tao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2406.11689 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
by: Che, Chengan, et al.
Published: (2026)
by: Che, Chengan, et al.
Published: (2026)
Let ViT Speak: Generative Language-Image Pre-training
by: Fang, Yan, et al.
Published: (2026)
by: Fang, Yan, et al.
Published: (2026)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
by: Lin, Xiao, et al.
Published: (2024)
by: Lin, Xiao, et al.
Published: (2024)
Compressing Multi-Task Model for Autonomous Driving via Pruning and Knowledge Distillation
by: Wang, Jiayuan, et al.
Published: (2025)
by: Wang, Jiayuan, et al.
Published: (2025)
Classification Done Right for Vision-Language Pre-Training
by: Huang, Zilong, et al.
Published: (2024)
by: Huang, Zilong, et al.
Published: (2024)
Flow Distillation Sampling: Regularizing 3D Gaussians with Pre-trained Matching Priors
by: Chen, Lin-Zhuo, et al.
Published: (2025)
by: Chen, Lin-Zhuo, et al.
Published: (2025)
VILA: On Pre-training for Visual Language Models
by: Lin, Ji, et al.
Published: (2023)
by: Lin, Ji, et al.
Published: (2023)
Knowledge Distillation via the Target-aware Transformer
by: Lin, Sihao, et al.
Published: (2022)
by: Lin, Sihao, et al.
Published: (2022)
Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation
by: Sun, Wei, et al.
Published: (2025)
by: Sun, Wei, et al.
Published: (2025)
Student-Oriented Teacher Knowledge Refinement for Knowledge Distillation
by: Shen, Chaomin, et al.
Published: (2024)
by: Shen, Chaomin, et al.
Published: (2024)
Improving Lightweight Weed Detection via Knowledge Distillation
by: Saltık, Ahmet Oğuz, et al.
Published: (2025)
by: Saltık, Ahmet Oğuz, et al.
Published: (2025)
Domain Guidance: A Simple Transfer Approach for a Pre-trained Diffusion Model
by: Zhong, Jincheng, et al.
Published: (2025)
by: Zhong, Jincheng, et al.
Published: (2025)
FreeKD: Knowledge Distillation via Semantic Frequency Prompt
by: Zhang, Yuan, et al.
Published: (2023)
by: Zhang, Yuan, et al.
Published: (2023)
Continual Forgetting for Pre-trained Vision Models
by: Zhao, Hongbo, et al.
Published: (2024)
by: Zhao, Hongbo, et al.
Published: (2024)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
by: Chen, Yitong, et al.
Published: (2025)
by: Chen, Yitong, et al.
Published: (2025)
FedBM: Stealing Knowledge from Pre-trained Language Models for Heterogeneous Federated Learning
by: Zhu, Meilu, et al.
Published: (2025)
by: Zhu, Meilu, et al.
Published: (2025)
$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation
by: Zhu, Yijie, et al.
Published: (2026)
by: Zhu, Yijie, et al.
Published: (2026)
Teacher-Guided Student Self-Knowledge Distillation Using Diffusion Model
by: Wang, Yu, et al.
Published: (2026)
by: Wang, Yu, et al.
Published: (2026)
MS-Mix: Sentiment-Guided Adaptive Augmentation for Multimodal Sentiment Analysis
by: Zhu, Hongyu, et al.
Published: (2025)
by: Zhu, Hongyu, et al.
Published: (2025)
ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model
by: Chen, Yifan, et al.
Published: (2024)
by: Chen, Yifan, et al.
Published: (2024)
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
by: Zhu, Zixin, et al.
Published: (2024)
by: Zhu, Zixin, et al.
Published: (2024)
Generic Knowledge Boosted Pre-training For Remote Sensing Images
by: Huang, Ziyue, et al.
Published: (2024)
by: Huang, Ziyue, et al.
Published: (2024)
Exploiting the Semantic Knowledge of Pre-trained Text-Encoders for Continual Learning
by: Yu, Lu, et al.
Published: (2024)
by: Yu, Lu, et al.
Published: (2024)
Scene123: One Prompt to 3D Scene Generation via Video-Assisted and Consistency-Enhanced MAE
by: Yang, Yiying, et al.
Published: (2024)
by: Yang, Yiying, et al.
Published: (2024)
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
by: Kim, Donggeun, et al.
Published: (2024)
by: Kim, Donggeun, et al.
Published: (2024)
SG-MIM: Structured Knowledge Guided Efficient Pre-training for Dense Prediction
by: Son, Sumin, et al.
Published: (2024)
by: Son, Sumin, et al.
Published: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
by: Ma, Shuailei, et al.
Published: (2023)
by: Ma, Shuailei, et al.
Published: (2023)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
by: Deng, Qiao, et al.
Published: (2024)
by: Deng, Qiao, et al.
Published: (2024)
DreamLIP: Language-Image Pre-training with Long Captions
by: Zheng, Kecheng, et al.
Published: (2024)
by: Zheng, Kecheng, et al.
Published: (2024)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
by: Zhang, Peng-Fei, et al.
Published: (2025)
by: Zhang, Peng-Fei, et al.
Published: (2025)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
by: Xia, Renqiu, et al.
Published: (2024)
by: Xia, Renqiu, et al.
Published: (2024)
UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models
by: Wang, Yimu, et al.
Published: (2025)
by: Wang, Yimu, et al.
Published: (2025)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
by: Yang, Fan, et al.
Published: (2024)
by: Yang, Fan, et al.
Published: (2024)
IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models
by: Wang, Hanting, et al.
Published: (2025)
by: Wang, Hanting, et al.
Published: (2025)
Anatomical Structure-Guided Medical Vision-Language Pre-training
by: Li, Qingqiu, et al.
Published: (2024)
by: Li, Qingqiu, et al.
Published: (2024)
SDPose: Tokenized Pose Estimation via Circulation-Guide Self-Distillation
by: Chen, Sichen, et al.
Published: (2024)
by: Chen, Sichen, et al.
Published: (2024)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
by: Yin, Ziyi, et al.
Published: (2023)
by: Yin, Ziyi, et al.
Published: (2023)
Flow Augmentation and Knowledge Distillation for Lightweight Face Presentation Attack Detection
by: Jabbar, Muhammad Shahid, et al.
Published: (2026)
by: Jabbar, Muhammad Shahid, et al.
Published: (2026)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
by: Tao, Yiyi, et al.
Published: (2024)
by: Tao, Yiyi, et al.
Published: (2024)
Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training
by: Sun, Peng, et al.
Published: (2026)
by: Sun, Peng, et al.
Published: (2026)
Similar Items
-
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
by: Che, Chengan, et al.
Published: (2026) -
Let ViT Speak: Generative Language-Image Pre-training
by: Fang, Yan, et al.
Published: (2026) -
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
by: Lin, Xiao, et al.
Published: (2024) -
Compressing Multi-Task Model for Autonomous Driving via Pruning and Knowledge Distillation
by: Wang, Jiayuan, et al.
Published: (2025) -
Classification Done Right for Vision-Language Pre-Training
by: Huang, Zilong, et al.
Published: (2024)