Multi-modal Attribute Prompting for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xin, Wu, Jiamin, Yang, and Wenfei, Zhou, Xu, Zhang, Tianzhu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unifying Visual and Vision-Language Tracking via Contrastive Learning
di: Ma, Yinchao, et al.
Pubblicazione: (2024)
di: Ma, Yinchao, et al.
Pubblicazione: (2024)
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
di: Ma, Yinchao, et al.
Pubblicazione: (2025)
di: Ma, Yinchao, et al.
Pubblicazione: (2025)
Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
di: Yang, Shijun, et al.
Pubblicazione: (2025)
di: Yang, Shijun, et al.
Pubblicazione: (2025)
State Space Model Meets Transformer: A New Paradigm for 3D Object Detection
di: Wang, Chuxin, et al.
Pubblicazione: (2025)
di: Wang, Chuxin, et al.
Pubblicazione: (2025)
SMTrack: State-Aware Mamba for Efficient Temporal Modeling in Visual Tracking
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
Instance-Adaptive and Geometric-Aware Keypoint Learning for Category-Level 6D Object Pose Estimation
di: Lin, Xiao, et al.
Pubblicazione: (2024)
di: Lin, Xiao, et al.
Pubblicazione: (2024)
StruMamba3D: Exploring Structural Mamba for Self-supervised Point Cloud Representation Learning
di: Wang, Chuxin, et al.
Pubblicazione: (2025)
di: Wang, Chuxin, et al.
Pubblicazione: (2025)
Exploring Semantic Masked Autoencoder for Self-supervised Point Cloud Understanding
di: Zha, Yixin, et al.
Pubblicazione: (2025)
di: Zha, Yixin, et al.
Pubblicazione: (2025)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
di: Zheng, Hao, et al.
Pubblicazione: (2025)
di: Zheng, Hao, et al.
Pubblicazione: (2025)
ArGue: Attribute-Guided Prompt Tuning for Vision-Language Models
di: Tian, Xinyu, et al.
Pubblicazione: (2023)
di: Tian, Xinyu, et al.
Pubblicazione: (2023)
Learning Shape-Independent Transformation via Spherical Representations for Category-Level Object Pose Estimation
di: Ren, Huan, et al.
Pubblicazione: (2025)
di: Ren, Huan, et al.
Pubblicazione: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
Structure-Aware Correspondence Learning for Relative Pose Estimation
di: Chen, Yihan, et al.
Pubblicazione: (2025)
di: Chen, Yihan, et al.
Pubblicazione: (2025)
DN-4DGS: Denoised Deformable Network with Temporal-Spatial Aggregation for Dynamic Scene Rendering
di: Lu, Jiahao, et al.
Pubblicazione: (2024)
di: Lu, Jiahao, et al.
Pubblicazione: (2024)
Cascade Prompt Learning for Vision-Language Model Adaptation
di: Wu, Ge, et al.
Pubblicazione: (2024)
di: Wu, Ge, et al.
Pubblicazione: (2024)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
di: Hong, Haodong, et al.
Pubblicazione: (2024)
di: Hong, Haodong, et al.
Pubblicazione: (2024)
Plane2Depth: Hierarchical Adaptive Plane Guidance for Monocular Depth Estimation
di: Liu, Li, et al.
Pubblicazione: (2024)
di: Liu, Li, et al.
Pubblicazione: (2024)
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models
di: Li, Zheng, et al.
Pubblicazione: (2024)
di: Li, Zheng, et al.
Pubblicazione: (2024)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
di: Wu, Xuyang, et al.
Pubblicazione: (2024)
di: Wu, Xuyang, et al.
Pubblicazione: (2024)
Evaluating Attribute Comprehension in Large Vision-Language Models
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation
di: Ren, Huan, et al.
Pubblicazione: (2026)
di: Ren, Huan, et al.
Pubblicazione: (2026)
Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
di: Choi, In Chong, et al.
Pubblicazione: (2026)
di: Choi, In Chong, et al.
Pubblicazione: (2026)
Evolving Prompt Adaptation for Vision-Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2026)
di: Zhang, Enming, et al.
Pubblicazione: (2026)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
InPK: Infusing Prior Knowledge into Prompt for Vision-Language Models
di: Zhou, Shuchang, et al.
Pubblicazione: (2025)
di: Zhou, Shuchang, et al.
Pubblicazione: (2025)
Vision-Language Consistency Guided Multi-modal Prompt Learning for Blind AI Generated Image Quality Assessment
di: Fu, Jun, et al.
Pubblicazione: (2024)
di: Fu, Jun, et al.
Pubblicazione: (2024)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
di: Ma, Qihang, et al.
Pubblicazione: (2025)
di: Ma, Qihang, et al.
Pubblicazione: (2025)
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
di: Zhang, Wei, et al.
Pubblicazione: (2024)
di: Zhang, Wei, et al.
Pubblicazione: (2024)
MePT: Multi-Representation Guided Prompt Tuning for Vision-Language Model
di: Wang, Xinyang, et al.
Pubblicazione: (2024)
di: Wang, Xinyang, et al.
Pubblicazione: (2024)
AttriPrompter: Auto-Prompting with Attribute Semantics for Zero-shot Nuclei Detection via Visual-Language Pre-trained Models
di: Wu, Yongjian, et al.
Pubblicazione: (2024)
di: Wu, Yongjian, et al.
Pubblicazione: (2024)
Modeling Variants of Prompts for Vision-Language Models
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
di: Liang, Qiao, et al.
Pubblicazione: (2025)
di: Liang, Qiao, et al.
Pubblicazione: (2025)
Progressive Multi-modal Conditional Prompt Tuning
di: Qiu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Qiu, Xiaoyu, et al.
Pubblicazione: (2024)
Efficient Test-Time Prompt Tuning for Vision-Language Models
di: Zhu, Yuhan, et al.
Pubblicazione: (2024)
di: Zhu, Yuhan, et al.
Pubblicazione: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts
di: Li, Weiran, et al.
Pubblicazione: (2025)
di: Li, Weiran, et al.
Pubblicazione: (2025)
ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts
di: Choi, Sangbum, et al.
Pubblicazione: (2025)
di: Choi, Sangbum, et al.
Pubblicazione: (2025)
Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition
di: He, Wen-Jue, et al.
Pubblicazione: (2025)
di: He, Wen-Jue, et al.
Pubblicazione: (2025)
Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis
di: Bai, Haowen, et al.
Pubblicazione: (2025)
di: Bai, Haowen, et al.
Pubblicazione: (2025)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
di: Jeon, Byungwoo, et al.
Pubblicazione: (2026)
di: Jeon, Byungwoo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Unifying Visual and Vision-Language Tracking via Contrastive Learning
di: Ma, Yinchao, et al.
Pubblicazione: (2024) -
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
di: Ma, Yinchao, et al.
Pubblicazione: (2025) -
Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
di: Yang, Shijun, et al.
Pubblicazione: (2025) -
State Space Model Meets Transformer: A New Paradigm for 3D Object Detection
di: Wang, Chuxin, et al.
Pubblicazione: (2025) -
SMTrack: State-Aware Mamba for Efficient Temporal Modeling in Visual Tracking
di: Ma, Yinchao, et al.
Pubblicazione: (2026)