ZIP: An Efficient Zeroth-order Prompt Tuning for Black-box Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Park, Seonghwan, Jeong, Jaehyeon, Kim, Yongjun, Lee, Jaeho, Lee, Namhoon |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Role of Masking for Efficient Supervised Knowledge Distillation of Vision Transformers
by: Son, Seungwoo, et al.
Published: (2023)
by: Son, Seungwoo, et al.
Published: (2023)
Activation Quantization of Vision Encoders Needs Prefixing Registers
by: Kim, Seunghyeon, et al.
Published: (2025)
by: Kim, Seunghyeon, et al.
Published: (2025)
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
by: Kim, Gahyeon, et al.
Published: (2025)
by: Kim, Gahyeon, et al.
Published: (2025)
AAPL: Adding Attributes to Prompt Learning for Vision-Language Models
by: Kim, Gahyeon, et al.
Published: (2024)
by: Kim, Gahyeon, et al.
Published: (2024)
In Search of a Data Transformation That Accelerates Neural Field Training
by: Seo, Junwon, et al.
Published: (2023)
by: Seo, Junwon, et al.
Published: (2023)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
by: Bae, Jiyun, et al.
Published: (2025)
by: Bae, Jiyun, et al.
Published: (2025)
Instance-Aware Group Quantization for Vision Transformers
by: Moon, Jaehyeon, et al.
Published: (2024)
by: Moon, Jaehyeon, et al.
Published: (2024)
Efficient and Versatile Robust Fine-Tuning of Zero-shot Models
by: Kim, Sungyeon, et al.
Published: (2024)
by: Kim, Sungyeon, et al.
Published: (2024)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
by: Park, Jihwan, et al.
Published: (2025)
by: Park, Jihwan, et al.
Published: (2025)
One-Cycle Structured Pruning via Stability-Driven Subnetwork Search
by: Ghimire, Deepak, et al.
Published: (2025)
by: Ghimire, Deepak, et al.
Published: (2025)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
by: Liu, Xinyang, et al.
Published: (2023)
by: Liu, Xinyang, et al.
Published: (2023)
Discovering and Mitigating Visual Biases through Keyword Explanation
by: Kim, Younghyun, et al.
Published: (2023)
by: Kim, Younghyun, et al.
Published: (2023)
Neural Image Compression with Text-guided Encoding for both Pixel-level and Perceptual Fidelity
by: Lee, Hagyeong, et al.
Published: (2024)
by: Lee, Hagyeong, et al.
Published: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
by: Jie, Shibo, et al.
Published: (2024)
by: Jie, Shibo, et al.
Published: (2024)
Prototypical Distillation and Debiased Tuning for Black-box Unsupervised Domain Adaptation
by: Liang, Jian, et al.
Published: (2024)
by: Liang, Jian, et al.
Published: (2024)
Diffusion-based Data Augmentation and Knowledge Distillation with Generated Soft Labels Solving Data Scarcity Problems of SAR Oil Spill Segmentation
by: Moon, Jaeho, et al.
Published: (2024)
by: Moon, Jaeho, et al.
Published: (2024)
Read Like a Radiologist: Efficient Vision-Language Model for 3D Medical Imaging Interpretation
by: Lee, Changsun, et al.
Published: (2024)
by: Lee, Changsun, et al.
Published: (2024)
Bridging Vision and Language Spaces with Assignment Prediction
by: Park, Jungin, et al.
Published: (2024)
by: Park, Jungin, et al.
Published: (2024)
TempCore: Are Video QA Benchmarks Temporally Grounded? A Frame Selection Sensitivity Analysis and Benchmark
by: Ok, Hyunjong, et al.
Published: (2025)
by: Ok, Hyunjong, et al.
Published: (2025)
CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model
by: Hou, Shihao, et al.
Published: (2025)
by: Hou, Shihao, et al.
Published: (2025)
Depth Prompting for Sensor-Agnostic Depth Estimation
by: Park, Jin-Hwi, et al.
Published: (2024)
by: Park, Jin-Hwi, et al.
Published: (2024)
Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts
by: Brahma, Debarshi, et al.
Published: (2025)
by: Brahma, Debarshi, et al.
Published: (2025)
D-TPT: Dimensional Entropy Maximization for Calibrating Test-Time Prompt Tuning in Vision-Language Models
by: Han, Jisu, et al.
Published: (2025)
by: Han, Jisu, et al.
Published: (2025)
Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models
by: Song, Fei, et al.
Published: (2025)
by: Song, Fei, et al.
Published: (2025)
Prompt Estimation from Prototypes for Federated Prompt Tuning of Vision Transformers
by: Yashwanth, M, et al.
Published: (2025)
by: Yashwanth, M, et al.
Published: (2025)
Attention Guided Alignment in Efficient Vision-Language Models
by: Mahajan, Shweta, et al.
Published: (2025)
by: Mahajan, Shweta, et al.
Published: (2025)
Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding
by: Kim, Tae Hun, et al.
Published: (2026)
by: Kim, Tae Hun, et al.
Published: (2026)
Continuous Object State Recognition for Cooking Robots Using Pre-Trained Vision-Language Models and Black-box Optimization
by: Kawaharazuka, Kento, et al.
Published: (2024)
by: Kawaharazuka, Kento, et al.
Published: (2024)
Neutral-Reference Prompting for Vision-Language Models
by: Tian, Senmao, et al.
Published: (2026)
by: Tian, Senmao, et al.
Published: (2026)
TroL: Traversal of Layers for Large Language and Vision Models
by: Lee, Byung-Kwan, et al.
Published: (2024)
by: Lee, Byung-Kwan, et al.
Published: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
by: Liu, Shihong, et al.
Published: (2023)
by: Liu, Shihong, et al.
Published: (2023)
Bridging Human Oversight and Black-box Driver Assistance: Vision-Language Models for Predictive Alerting in Lane Keeping Assist Systems
by: Wang, Yuhang, et al.
Published: (2025)
by: Wang, Yuhang, et al.
Published: (2025)
Test-Time Training for Visual Foresight Vision-Language-Action Models
by: Park, Sangwu, et al.
Published: (2026)
by: Park, Sangwu, et al.
Published: (2026)
Candidate Pseudolabel Learning: Enhancing Vision-Language Models by Prompt Tuning with Unlabeled Data
by: Zhang, Jiahan, et al.
Published: (2024)
by: Zhang, Jiahan, et al.
Published: (2024)
LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models
by: Zhang, Yabin, et al.
Published: (2024)
by: Zhang, Yabin, et al.
Published: (2024)
Less is More: Efficient Black-box Attribution via Minimal Interpretable Subset Selection
by: Chen, Ruoyu, et al.
Published: (2025)
by: Chen, Ruoyu, et al.
Published: (2025)
Unlearning the Unpromptable: Prompt-free Instance Unlearning in Diffusion Models
by: Lee, Kyungryeol, et al.
Published: (2026)
by: Lee, Kyungryeol, et al.
Published: (2026)
Efficient LLaMA-3.2-Vision by Trimming Cross-attended Visual Features
by: Lee, Jewon, et al.
Published: (2025)
by: Lee, Jewon, et al.
Published: (2025)
NLPrompt: Noise-Label Prompt Learning for Vision-Language Models
by: Pan, Bikang, et al.
Published: (2024)
by: Pan, Bikang, et al.
Published: (2024)
CLEFT: Language-Image Contrastive Learning with Efficient Large Language Model and Prompt Fine-Tuning
by: Du, Yuexi, et al.
Published: (2024)
by: Du, Yuexi, et al.
Published: (2024)
Similar Items
-
The Role of Masking for Efficient Supervised Knowledge Distillation of Vision Transformers
by: Son, Seungwoo, et al.
Published: (2023) -
Activation Quantization of Vision Encoders Needs Prefixing Registers
by: Kim, Seunghyeon, et al.
Published: (2025) -
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
by: Kim, Gahyeon, et al.
Published: (2025) -
AAPL: Adding Attributes to Prompt Learning for Vision-Language Models
by: Kim, Gahyeon, et al.
Published: (2024) -
In Search of a Data Transformation That Accelerates Neural Field Training
by: Seo, Junwon, et al.
Published: (2023)