MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Miao, Yongzhu, Li, Shasha, Tang, Jintao, Wang, Ting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
por: Peng, Wei, et al.
Publicado: (2025)
por: Peng, Wei, et al.
Publicado: (2025)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023)
por: Ma, Shuailei, et al.
Publicado: (2023)
TuneVLSeg: Prompt Tuning Benchmark for Vision-Language Segmentation Models
por: Adhikari, Rabin, et al.
Publicado: (2024)
por: Adhikari, Rabin, et al.
Publicado: (2024)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
por: Liang, Qiao, et al.
Publicado: (2025)
por: Liang, Qiao, et al.
Publicado: (2025)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
VLP: A Survey on Vision-Language Pre-training
por: Chen, Feilong, et al.
Publicado: (2022)
por: Chen, Feilong, et al.
Publicado: (2022)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
por: Liu, Xinyang, et al.
Publicado: (2023)
por: Liu, Xinyang, et al.
Publicado: (2023)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
Enhancing Biomedical Multi-modal Representation Learning with Multi-scale Pre-training and Perturbed Report Discrimination
por: Zhong, Xinliu, et al.
Publicado: (2025)
por: Zhong, Xinliu, et al.
Publicado: (2025)
Anatomical Structure-Guided Medical Vision-Language Pre-training
por: Li, Qingqiu, et al.
Publicado: (2024)
por: Li, Qingqiu, et al.
Publicado: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
por: Kim, Donghoon, et al.
Publicado: (2024)
por: Kim, Donghoon, et al.
Publicado: (2024)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
por: Qi, Yayun, et al.
Publicado: (2024)
por: Qi, Yayun, et al.
Publicado: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
por: Gao, Junyuan, et al.
Publicado: (2025)
por: Gao, Junyuan, et al.
Publicado: (2025)
Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images
por: Mahanta, Cristina, et al.
Publicado: (2025)
por: Mahanta, Cristina, et al.
Publicado: (2025)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
por: Shuai, Zitao, et al.
Publicado: (2024)
por: Shuai, Zitao, et al.
Publicado: (2024)
Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
por: Liang, Zhengyang, et al.
Publicado: (2024)
por: Liang, Zhengyang, et al.
Publicado: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
por: Ohi, Masanari, et al.
Publicado: (2024)
por: Ohi, Masanari, et al.
Publicado: (2024)
MuMA-ToM: Multi-modal Multi-Agent Theory of Mind
por: Shi, Haojun, et al.
Publicado: (2024)
por: Shi, Haojun, et al.
Publicado: (2024)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
por: Li, Yanwei, et al.
Publicado: (2024)
por: Li, Yanwei, et al.
Publicado: (2024)
Text Prompt Injection of Vision Language Models
por: Zhu, Ruizhe
Publicado: (2025)
por: Zhu, Ruizhe
Publicado: (2025)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
por: Xia, Renqiu, et al.
Publicado: (2024)
por: Xia, Renqiu, et al.
Publicado: (2024)
Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
por: Villa, Andrés, et al.
Publicado: (2023)
por: Villa, Andrés, et al.
Publicado: (2023)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
por: Wu, Xuyang, et al.
Publicado: (2024)
por: Wu, Xuyang, et al.
Publicado: (2024)
Beyond Plain Demos: A Demo-centric Anchoring Paradigm for In-Context Learning in Alzheimer's Disease Detection
por: Su, Puzhen, et al.
Publicado: (2025)
por: Su, Puzhen, et al.
Publicado: (2025)
Explicit Knowledge-Guided In-Context Learning for Early Detection of Alzheimer's Disease
por: Su, Puzhen, et al.
Publicado: (2025)
por: Su, Puzhen, et al.
Publicado: (2025)
Beyond Accuracy Optimization: Computer Vision Losses for Large Language Model Fine-Tuning
por: Cambrin, Daniele Rege, et al.
Publicado: (2024)
por: Cambrin, Daniele Rege, et al.
Publicado: (2024)
Vision-centric Token Compression in Large Language Model
por: Xing, Ling, et al.
Publicado: (2025)
por: Xing, Ling, et al.
Publicado: (2025)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
por: Dagan, Gautier, et al.
Publicado: (2024)
por: Dagan, Gautier, et al.
Publicado: (2024)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
por: Luo, Gen, et al.
Publicado: (2024)
por: Luo, Gen, et al.
Publicado: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
por: Liu, Zhihang, et al.
Publicado: (2025)
por: Liu, Zhihang, et al.
Publicado: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
por: Luo, Lingxiao, et al.
Publicado: (2024)
por: Luo, Lingxiao, et al.
Publicado: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
DEAP-3DSAM: Decoder Enhanced and Auto Prompt SAM for 3D Medical Image Segmentation
por: Chen, Fangda, et al.
Publicado: (2025)
por: Chen, Fangda, et al.
Publicado: (2025)
Ejemplares similares
-
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
por: Peng, Wei, et al.
Publicado: (2025) -
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024) -
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023) -
TuneVLSeg: Prompt Tuning Benchmark for Vision-Language Segmentation Models
por: Adhikari, Rabin, et al.
Publicado: (2024) -
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
por: Liang, Qiao, et al.
Publicado: (2025)