Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Shijun, Zhang, Xiang, Zhao, Wanqing, Luo, Hangzai, Zhong, Sheng, Peng, Jinye, Fan, Jianping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-modal Attribute Prompting for Vision-Language Models
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
por: Zheng, Hao, et al.
Publicado: (2025)
por: Zheng, Hao, et al.
Publicado: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023)
por: Ma, Shuailei, et al.
Publicado: (2023)
Generalizing Vision-Language Models with Dedicated Prompt Guidance
por: Li, Xinyao, et al.
Publicado: (2025)
por: Li, Xinyao, et al.
Publicado: (2025)
Progressive Multi-modal Conditional Prompt Tuning
por: Qiu, Xiaoyu, et al.
Publicado: (2024)
por: Qiu, Xiaoyu, et al.
Publicado: (2024)
Cascade Prompt Learning for Vision-Language Model Adaptation
por: Wu, Ge, et al.
Publicado: (2024)
por: Wu, Ge, et al.
Publicado: (2024)
Mixture of Prompt Learning for Vision Language Models
por: Du, Yu, et al.
Publicado: (2024)
por: Du, Yu, et al.
Publicado: (2024)
Integrated Structural Prompt Learning for Vision-Language Models
por: Wang, Jiahui, et al.
Publicado: (2025)
por: Wang, Jiahui, et al.
Publicado: (2025)
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models
por: Li, Zheng, et al.
Publicado: (2024)
por: Li, Zheng, et al.
Publicado: (2024)
Revisiting Prompt Pretraining of Vision-Language Models
por: Chen, Zhenyuan, et al.
Publicado: (2024)
por: Chen, Zhenyuan, et al.
Publicado: (2024)
Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2025)
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2025)
Empowering Segmentation Ability to Multi-modal Large Language Models
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts
por: Choi, Sangbum, et al.
Publicado: (2025)
por: Choi, Sangbum, et al.
Publicado: (2025)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
por: Zhang, Yin, et al.
Publicado: (2026)
por: Zhang, Yin, et al.
Publicado: (2026)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
por: Wei, Cong, et al.
Publicado: (2024)
por: Wei, Cong, et al.
Publicado: (2024)
MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models
por: Zhou, Xunlan, et al.
Publicado: (2026)
por: Zhou, Xunlan, et al.
Publicado: (2026)
Adversarial Prompt Distillation for Vision-Language Models
por: Luo, Lin, et al.
Publicado: (2024)
por: Luo, Lin, et al.
Publicado: (2024)
A Closer Look at Conditional Prompt Tuning for Vision-Language Models
por: Zhang, Ji, et al.
Publicado: (2025)
por: Zhang, Ji, et al.
Publicado: (2025)
Vision-Language Consistency Guided Multi-modal Prompt Learning for Blind AI Generated Image Quality Assessment
por: Fu, Jun, et al.
Publicado: (2024)
por: Fu, Jun, et al.
Publicado: (2024)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
por: Wu, Junfeng, et al.
Publicado: (2024)
por: Wu, Junfeng, et al.
Publicado: (2024)
Neutral-Reference Prompting for Vision-Language Models
por: Tian, Senmao, et al.
Publicado: (2026)
por: Tian, Senmao, et al.
Publicado: (2026)
Adapting Segment Anything Model to Multi-modal Salient Object Detection with Semantic Feature Fusion Guidance
por: Wang, Kunpeng, et al.
Publicado: (2024)
por: Wang, Kunpeng, et al.
Publicado: (2024)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
por: Li, Yanwei, et al.
Publicado: (2024)
por: Li, Yanwei, et al.
Publicado: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
por: Miao, Yongzhu, et al.
Publicado: (2023)
por: Miao, Yongzhu, et al.
Publicado: (2023)
Active Prompt Learning in Vision Language Models
por: Bang, Jihwan, et al.
Publicado: (2023)
por: Bang, Jihwan, et al.
Publicado: (2023)
In the Era of Prompt Learning with Vision-Language Models
por: Jha, Ankit
Publicado: (2024)
por: Jha, Ankit
Publicado: (2024)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
por: Cheng, Silin, et al.
Publicado: (2025)
por: Cheng, Silin, et al.
Publicado: (2025)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
por: Zhang, Enming, et al.
Publicado: (2024)
por: Zhang, Enming, et al.
Publicado: (2024)
From Two-Stream to One-Stream: Efficient RGB-T Tracking via Mutual Prompt Learning and Knowledge Distillation
por: Luo, Yang, et al.
Publicado: (2024)
por: Luo, Yang, et al.
Publicado: (2024)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
por: Jeon, Byungwoo, et al.
Publicado: (2026)
por: Jeon, Byungwoo, et al.
Publicado: (2026)
Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance
por: Li, Haipeng, et al.
Publicado: (2026)
por: Li, Haipeng, et al.
Publicado: (2026)
Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models
por: Guo, Boyang, et al.
Publicado: (2026)
por: Guo, Boyang, et al.
Publicado: (2026)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
por: Ma, Qihang, et al.
Publicado: (2025)
por: Ma, Qihang, et al.
Publicado: (2025)
Co-Seg++: Mutual Prompt-Guided Collaborative Learning for Versatile Medical Segmentation
por: Xu, Qing, et al.
Publicado: (2025)
por: Xu, Qing, et al.
Publicado: (2025)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis
por: Zavras, Angelos, et al.
Publicado: (2025)
por: Zavras, Angelos, et al.
Publicado: (2025)
MePT: Multi-Representation Guided Prompt Tuning for Vision-Language Model
por: Wang, Xinyang, et al.
Publicado: (2024)
por: Wang, Xinyang, et al.
Publicado: (2024)
One Model for Two Tasks: Cooperatively Recognizing and Recovering Low-Resolution Scene Text Images by Iterative Mutual Guidance
por: Zhao, Minyi, et al.
Publicado: (2024)
por: Zhao, Minyi, et al.
Publicado: (2024)
Active Prompt Learning with Vision-Language Model Priors
por: Kim, Hoyoung, et al.
Publicado: (2024)
por: Kim, Hoyoung, et al.
Publicado: (2024)
Ejemplares similares
-
Multi-modal Attribute Prompting for Vision-Language Models
por: Liu, Xin, et al.
Publicado: (2024) -
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
por: Zheng, Hao, et al.
Publicado: (2025) -
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023) -
Generalizing Vision-Language Models with Dedicated Prompt Guidance
por: Li, Xinyao, et al.
Publicado: (2025) -
Progressive Multi-modal Conditional Prompt Tuning
por: Qiu, Xiaoyu, et al.
Publicado: (2024)