Salvato in:
| Autori principali: | Chen, Xuezheng, Zou, Zhengbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2508.11011 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
di: Wu, Shihan, et al.
Pubblicazione: (2024)
di: Wu, Shihan, et al.
Pubblicazione: (2024)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
Masked Diffusion Vision-Language Models for Temporal Action Localization
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
di: Chen, Wutao, et al.
Pubblicazione: (2026)
di: Chen, Wutao, et al.
Pubblicazione: (2026)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
di: Verma, Sahil, et al.
Pubblicazione: (2023)
di: Verma, Sahil, et al.
Pubblicazione: (2023)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022)
di: Chen, Feilong, et al.
Pubblicazione: (2022)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Continual Forgetting for Pre-trained Vision Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
di: Gao, Yuan, et al.
Pubblicazione: (2024)
di: Gao, Yuan, et al.
Pubblicazione: (2024)
Using Vision Language Models for Safety Hazard Identification in Construction
di: Adil, Muhammad, et al.
Pubblicazione: (2025)
di: Adil, Muhammad, et al.
Pubblicazione: (2025)
Do Pre-trained Vision-Language Models Encode Object States?
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
di: Zhou, Wenlve, et al.
Pubblicazione: (2024)
di: Zhou, Wenlve, et al.
Pubblicazione: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
di: Che, Chengan, et al.
Pubblicazione: (2026)
di: Che, Chengan, et al.
Pubblicazione: (2026)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
di: Han, Yuhang, et al.
Pubblicazione: (2026)
di: Han, Yuhang, et al.
Pubblicazione: (2026)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
di: Chen, Yitong, et al.
Pubblicazione: (2025)
di: Chen, Yitong, et al.
Pubblicazione: (2025)
Steering Vision-Language Pre-trained Models for Incremental Face Presentation Attack Detection
di: Li, Haoze, et al.
Pubblicazione: (2025)
di: Li, Haoze, et al.
Pubblicazione: (2025)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
di: Tian, Yuxin, et al.
Pubblicazione: (2024)
di: Tian, Yuxin, et al.
Pubblicazione: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
di: Chen, Lan, et al.
Pubblicazione: (2025)
di: Chen, Lan, et al.
Pubblicazione: (2025)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
di: Chen, Mengyuan, et al.
Pubblicazione: (2024)
di: Chen, Mengyuan, et al.
Pubblicazione: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
Multimodal Autoregressive Pre-training of Large Vision Encoders
di: Fini, Enrico, et al.
Pubblicazione: (2024)
di: Fini, Enrico, et al.
Pubblicazione: (2024)
3D Scene Graph Guided Vision-Language Pre-training
di: Liu, Hao, et al.
Pubblicazione: (2024)
di: Liu, Hao, et al.
Pubblicazione: (2024)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
Pre-trained Vision and Language Transformers Are Few-Shot Incremental Learners
di: Park, Keon-Hee, et al.
Pubblicazione: (2024)
di: Park, Keon-Hee, et al.
Pubblicazione: (2024)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
di: Qi, Yayun, et al.
Pubblicazione: (2024)
di: Qi, Yayun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
di: Wu, Shihan, et al.
Pubblicazione: (2024) -
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
di: Yang, Fan, et al.
Pubblicazione: (2024) -
Masked Diffusion Vision-Language Models for Temporal Action Localization
di: Wang, Fengshun, et al.
Pubblicazione: (2026) -
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
di: Chen, Wutao, et al.
Pubblicazione: (2026) -
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
di: Verma, Sahil, et al.
Pubblicazione: (2023)