IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ghosal, Soumya Suvra, Basu, Samyadeep, Feizi, Soheil, Manocha, Dinesh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP
par: Balasubramanian, Sriram, et autres
Publié: (2024)
par: Balasubramanian, Sriram, et autres
Publié: (2024)
Rethinking Artistic Copyright Infringements in the Era of Text-to-Image Generative Models
par: Moayeri, Mazda, et autres
Publié: (2024)
par: Moayeri, Mazda, et autres
Publié: (2024)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
PromptRefine: Enhancing Few-Shot Performance on Low-Resource Indic Languages with Example Selection from Related Example Banks
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
IConMark: Robust Interpretable Concept-Based Watermark For AI Images
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025)
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025)
A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models
par: Balasubramanian, Sriram, et autres
Publié: (2025)
par: Balasubramanian, Sriram, et autres
Publié: (2025)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
par: Basu, Samyadeep, et autres
Publié: (2024)
par: Basu, Samyadeep, et autres
Publié: (2024)
Distilling Knowledge from Text-to-Image Generative Models Improves Visio-Linguistic Reasoning in CLIP
par: Basu, Samyadeep, et autres
Publié: (2023)
par: Basu, Samyadeep, et autres
Publié: (2023)
CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment
par: Shao, Maoyuan, et autres
Publié: (2026)
par: Shao, Maoyuan, et autres
Publié: (2026)
GroupCoOp: Group-robust Fine-tuning via Group Prompt Learning
par: Kim, Nayeong, et autres
Publié: (2025)
par: Kim, Nayeong, et autres
Publié: (2025)
How Learnable Grids Recover Fine Detail in Low Dimensions: A Neural Tangent Kernel Analysis of Multigrid Parametric Encodings
par: Audia, Samuel, et autres
Publié: (2025)
par: Audia, Samuel, et autres
Publié: (2025)
SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
par: Zarei, Arman, et autres
Publié: (2025)
par: Zarei, Arman, et autres
Publié: (2025)
Localizing Knowledge in Diffusion Transformers
par: Zarei, Arman, et autres
Publié: (2025)
par: Zarei, Arman, et autres
Publié: (2025)
VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
Adversarial Prompt Tuning for Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2023)
par: Zhang, Jiaming, et autres
Publié: (2023)
LPT: Less-overfitting Prompt Tuning for Vision-Language Model
par: Ding, Chenhao, et autres
Publié: (2024)
par: Ding, Chenhao, et autres
Publié: (2024)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
par: Ding, Kun, et autres
Publié: (2022)
par: Ding, Kun, et autres
Publié: (2022)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
par: Zhang, Zhifang, et autres
Publié: (2024)
par: Zhang, Zhifang, et autres
Publié: (2024)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
par: Li, Jiayu, et autres
Publié: (2025)
par: Li, Jiayu, et autres
Publié: (2025)
Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
par: Zarei, Arman, et autres
Publié: (2024)
par: Zarei, Arman, et autres
Publié: (2024)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
par: Peng, Wei, et autres
Publié: (2025)
par: Peng, Wei, et autres
Publié: (2025)
XCoOp: Explainable Prompt Learning for Computer-Aided Diagnosis via Concept-guided Context Optimization
par: Bie, Yequan, et autres
Publié: (2024)
par: Bie, Yequan, et autres
Publié: (2024)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
par: Lan, Long, et autres
Publié: (2024)
par: Lan, Long, et autres
Publié: (2024)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
par: Zhang, Pu, et autres
Publié: (2025)
par: Zhang, Pu, et autres
Publié: (2025)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
par: Lee, Seonho, et autres
Publié: (2025)
par: Lee, Seonho, et autres
Publié: (2025)
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models
par: Koleilat, Taha, et autres
Publié: (2024)
par: Koleilat, Taha, et autres
Publié: (2024)
On Mechanistic Knowledge Localization in Text-to-Image Generative Models
par: Basu, Samyadeep, et autres
Publié: (2024)
par: Basu, Samyadeep, et autres
Publié: (2024)
Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis
par: Chowdhury, Arpita, et autres
Publié: (2025)
par: Chowdhury, Arpita, et autres
Publié: (2025)
FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
par: Zhang, Zherui, et autres
Publié: (2025)
par: Zhang, Zherui, et autres
Publié: (2025)
Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models
par: Song, Fei, et autres
Publié: (2025)
par: Song, Fei, et autres
Publié: (2025)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
par: Liu, Xiwei, et autres
Publié: (2026)
par: Liu, Xiwei, et autres
Publié: (2026)
Revealing the Ancient Beauty: Digital Reconstruction of Temple Tiles using Computer Vision
par: Basu, Arkaprabha
Publié: (2025)
par: Basu, Arkaprabha
Publié: (2025)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
par: Bhosale, Mahesh, et autres
Publié: (2026)
par: Bhosale, Mahesh, et autres
Publié: (2026)
Adversarial Prompt Distillation for Vision-Language Models
par: Luo, Lin, et autres
Publié: (2024)
par: Luo, Lin, et autres
Publié: (2024)
Evolving Prompt Adaptation for Vision-Language Models
par: Zhang, Enming, et autres
Publié: (2026)
par: Zhang, Enming, et autres
Publié: (2026)
Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models
par: Rasaee, Hamza, et autres
Publié: (2025)
par: Rasaee, Hamza, et autres
Publié: (2025)
Historical Test-time Prompt Tuning for Vision Foundation Models
par: Zhang, Jingyi, et autres
Publié: (2024)
par: Zhang, Jingyi, et autres
Publié: (2024)
ADAPT to Robustify Prompt Tuning Vision Transformers
par: Eskandar, Masih, et autres
Publié: (2024)
par: Eskandar, Masih, et autres
Publié: (2024)
Target Prompting for Information Extraction with Vision Language Model
par: Medhi, Dipankar
Publié: (2024)
par: Medhi, Dipankar
Publié: (2024)
Documents similaires
-
Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP
par: Balasubramanian, Sriram, et autres
Publié: (2024) -
Rethinking Artistic Copyright Infringements in the Era of Text-to-Image Generative Models
par: Moayeri, Mazda, et autres
Publié: (2024) -
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
par: Seth, Ashish, et autres
Publié: (2024) -
PromptRefine: Enhancing Few-Shot Performance on Low-Resource Indic Languages with Example Selection from Related Example Banks
par: Ghosal, Soumya Suvra, et autres
Publié: (2024) -
IConMark: Robust Interpretable Concept-Based Watermark For AI Images
par: Sadasivan, Vinu Sankar, et autres
Publié: (2025)