CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Shao, Maoyuan, Gao, Yutong, Huang, Xinyang, Zhu, Chuang, Sun, Lijuan, Nan, Guoshun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Spotlighter: Revisiting Prompt Tuning from a Representative Mining View
por: Gao, Yutong, et al.
Publicado: (2025)
por: Gao, Yutong, et al.
Publicado: (2025)
CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model
por: Hou, Shihao, et al.
Publicado: (2025)
por: Hou, Shihao, et al.
Publicado: (2025)
IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
LPT: Less-overfitting Prompt Tuning for Vision-Language Model
por: Ding, Chenhao, et al.
Publicado: (2024)
por: Ding, Chenhao, et al.
Publicado: (2024)
Adversarial Prompt Tuning for Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2023)
por: Zhang, Jiaming, et al.
Publicado: (2023)
MePT: Multi-Representation Guided Prompt Tuning for Vision-Language Model
por: Wang, Xinyang, et al.
Publicado: (2024)
por: Wang, Xinyang, et al.
Publicado: (2024)
Historical Test-time Prompt Tuning for Vision Foundation Models
por: Zhang, Jingyi, et al.
Publicado: (2024)
por: Zhang, Jingyi, et al.
Publicado: (2024)
Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin
por: Wang, Yuchen, et al.
Publicado: (2025)
por: Wang, Yuchen, et al.
Publicado: (2025)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
por: Ding, Kun, et al.
Publicado: (2022)
por: Ding, Kun, et al.
Publicado: (2022)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
por: Zhang, Zhifang, et al.
Publicado: (2024)
por: Zhang, Zhifang, et al.
Publicado: (2024)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2025)
por: Zhang, Jiaming, et al.
Publicado: (2025)
CAPT: Category-level Articulation Estimation from a Single Point Cloud Using Transformer
por: Fu, Lian, et al.
Publicado: (2024)
por: Fu, Lian, et al.
Publicado: (2024)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization
por: Cao, Xinye, et al.
Publicado: (2025)
por: Cao, Xinye, et al.
Publicado: (2025)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
por: Peng, Wei, et al.
Publicado: (2025)
por: Peng, Wei, et al.
Publicado: (2025)
LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2024)
por: Zhang, Yabin, et al.
Publicado: (2024)
MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models
por: Lei, Yuqing, et al.
Publicado: (2025)
por: Lei, Yuqing, et al.
Publicado: (2025)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
por: Lan, Long, et al.
Publicado: (2024)
por: Lan, Long, et al.
Publicado: (2024)
FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
por: Zhang, Zherui, et al.
Publicado: (2025)
por: Zhang, Zherui, et al.
Publicado: (2025)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
por: Bhosale, Mahesh, et al.
Publicado: (2026)
por: Bhosale, Mahesh, et al.
Publicado: (2026)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
por: Zhang, Pu, et al.
Publicado: (2025)
por: Zhang, Pu, et al.
Publicado: (2025)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
por: Lee, Seonho, et al.
Publicado: (2025)
por: Lee, Seonho, et al.
Publicado: (2025)
If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems
por: Chang, Jiamin, et al.
Publicado: (2026)
por: Chang, Jiamin, et al.
Publicado: (2026)
Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models
por: Guo, Boyang, et al.
Publicado: (2026)
por: Guo, Boyang, et al.
Publicado: (2026)
Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models
por: Song, Fei, et al.
Publicado: (2025)
por: Song, Fei, et al.
Publicado: (2025)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
por: Liu, Xinyang, et al.
Publicado: (2023)
por: Liu, Xinyang, et al.
Publicado: (2023)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
por: Liu, Xiwei, et al.
Publicado: (2026)
por: Liu, Xiwei, et al.
Publicado: (2026)
Visual Fourier Prompt Tuning
por: Zeng, Runjia, et al.
Publicado: (2024)
por: Zeng, Runjia, et al.
Publicado: (2024)
Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise
por: Gao, Yansheng, et al.
Publicado: (2025)
por: Gao, Yansheng, et al.
Publicado: (2025)
ADAPT to Robustify Prompt Tuning Vision Transformers
por: Eskandar, Masih, et al.
Publicado: (2024)
por: Eskandar, Masih, et al.
Publicado: (2024)
Differentiable Prompt Learning for Vision Language Models
por: Huang, Zhenhan, et al.
Publicado: (2024)
por: Huang, Zhenhan, et al.
Publicado: (2024)
CVPT: Cross Visual Prompt Tuning
por: Huang, Lingyun, et al.
Publicado: (2024)
por: Huang, Lingyun, et al.
Publicado: (2024)
Skill-Conditioned Visual Geolocation for Vision-Language Models
por: Yang, Chenjie, et al.
Publicado: (2026)
por: Yang, Chenjie, et al.
Publicado: (2026)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
por: Liu, Hanqing, et al.
Publicado: (2026)
por: Liu, Hanqing, et al.
Publicado: (2026)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
por: Zheng, Haonan, et al.
Publicado: (2024)
por: Zheng, Haonan, et al.
Publicado: (2024)
PromptDx: Differentiable Prompt Tuning for Multimodal In-Context Alzheimer's Diagnosis
por: Zhong, Lujia, et al.
Publicado: (2026)
por: Zhong, Lujia, et al.
Publicado: (2026)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
por: Li, Xiao, et al.
Publicado: (2025)
por: Li, Xiao, et al.
Publicado: (2025)
Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations
por: Shen, Jinjie, et al.
Publicado: (2025)
por: Shen, Jinjie, et al.
Publicado: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
por: Jiang, Anqing, et al.
Publicado: (2025)
por: Jiang, Anqing, et al.
Publicado: (2025)
Candidate Pseudolabel Learning: Enhancing Vision-Language Models by Prompt Tuning with Unlabeled Data
por: Zhang, Jiahan, et al.
Publicado: (2024)
por: Zhang, Jiahan, et al.
Publicado: (2024)
Ejemplares similares
-
Spotlighter: Revisiting Prompt Tuning from a Representative Mining View
por: Gao, Yutong, et al.
Publicado: (2025) -
CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model
por: Hou, Shihao, et al.
Publicado: (2025) -
IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024) -
LPT: Less-overfitting Prompt Tuning for Vision-Language Model
por: Ding, Chenhao, et al.
Publicado: (2024) -
Adversarial Prompt Tuning for Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2023)