Connecting the Dots: Collaborative Fine-tuning for Black-Box Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhengbo, Liang, Jian, He, Ran, Wang, Zilei, Tan, Tieniu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Compatible Fine-tuning for Vision-Language Model Updates
par: Wang, Zhengbo, et autres
Publié: (2024)
par: Wang, Zhengbo, et autres
Publié: (2024)
A Hard-to-Beat Baseline for Training-free CLIP-based Adaptation
par: Wang, Zhengbo, et autres
Publié: (2024)
par: Wang, Zhengbo, et autres
Publié: (2024)
Realistic Unsupervised CLIP Fine-tuning with Universal Entropy Optimization
par: Liang, Jian, et autres
Publié: (2023)
par: Liang, Jian, et autres
Publié: (2023)
The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
par: Sheng, Lijun, et autres
Publié: (2025)
par: Sheng, Lijun, et autres
Publié: (2025)
A Comprehensive Survey on Test-Time Adaptation under Distribution Shifts
par: Liang, Jian, et autres
Publié: (2023)
par: Liang, Jian, et autres
Publié: (2023)
LoRA-Pro: Are Low-Rank Adapters Properly Optimized?
par: Wang, Zhengbo, et autres
Publié: (2024)
par: Wang, Zhengbo, et autres
Publié: (2024)
Taming Momentum: Rethinking Optimizer States Through Low-Rank Approximation
par: Wang, Zhengbo, et autres
Publié: (2026)
par: Wang, Zhengbo, et autres
Publié: (2026)
Exploring Vacant Classes in Label-Skewed Federated Learning
par: Guo, Kuangpu, et autres
Publié: (2024)
par: Guo, Kuangpu, et autres
Publié: (2024)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
par: Wu, Junfei, et autres
Publié: (2024)
par: Wu, Junfei, et autres
Publié: (2024)
R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning
par: Sheng, Lijun, et autres
Publié: (2025)
par: Sheng, Lijun, et autres
Publié: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
Adapting Vision-Language Models Without Labels: A Comprehensive Survey
par: Dong, Hao, et autres
Publié: (2025)
par: Dong, Hao, et autres
Publié: (2025)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
par: Wang, Lu, et autres
Publié: (2025)
par: Wang, Lu, et autres
Publié: (2025)
Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization
par: Guan, Jiwei, et autres
Publié: (2026)
par: Guan, Jiwei, et autres
Publié: (2026)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
par: Huang, Han, et autres
Publié: (2024)
par: Huang, Han, et autres
Publié: (2024)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
par: Xie, Chunyu, et autres
Publié: (2025)
par: Xie, Chunyu, et autres
Publié: (2025)
Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models
par: Suzuki, Satoshi, et autres
Publié: (2025)
par: Suzuki, Satoshi, et autres
Publié: (2025)
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
par: Wang, Qian-Wei, et autres
Publié: (2026)
par: Wang, Qian-Wei, et autres
Publié: (2026)
Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails
par: Yang, Yijun, et autres
Publié: (2025)
par: Yang, Yijun, et autres
Publié: (2025)
Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment
par: Li, Jiaqing, et autres
Publié: (2026)
par: Li, Jiaqing, et autres
Publié: (2026)
Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
par: Yang, Kai, et autres
Publié: (2023)
par: Yang, Kai, et autres
Publié: (2023)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
par: Kim, Moo Jin, et autres
Publié: (2025)
par: Kim, Moo Jin, et autres
Publié: (2025)
Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging
par: Guo, Kuangpu, et autres
Publié: (2025)
par: Guo, Kuangpu, et autres
Publié: (2025)
AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models
par: Metzen, Jan Hendrik, et autres
Publié: (2023)
par: Metzen, Jan Hendrik, et autres
Publié: (2023)
To Trust Or Not To Trust Your Vision-Language Model's Prediction
par: Dong, Hao, et autres
Publié: (2025)
par: Dong, Hao, et autres
Publié: (2025)
Pre-Trained Model Recommendation for Downstream Fine-tuning
par: Bai, Jiameng, et autres
Publié: (2024)
par: Bai, Jiameng, et autres
Publié: (2024)
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
Frustratingly Easy Feature Reconstruction for Out-of-Distribution Detection
par: Wang, Yingsheng, et autres
Publié: (2025)
par: Wang, Yingsheng, et autres
Publié: (2025)
ClearSight: Visual Signal Enhancement for Object Hallucination Mitigation in Multimodal Large language Models
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
Aligning Logits Generatively for Principled Black-Box Knowledge Distillation
par: Ma, Jing, et autres
Publié: (2022)
par: Ma, Jing, et autres
Publié: (2022)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
par: Tan, Huajie, et autres
Publié: (2025)
par: Tan, Huajie, et autres
Publié: (2025)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
par: Lian, Chenyu, et autres
Publié: (2025)
par: Lian, Chenyu, et autres
Publié: (2025)
ADBA:Approximation Decision Boundary Approach for Black-Box Adversarial Attacks
par: Wang, Feiyang, et autres
Publié: (2024)
par: Wang, Feiyang, et autres
Publié: (2024)
Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis
par: Li, Chenjun, et autres
Publié: (2025)
par: Li, Chenjun, et autres
Publié: (2025)
Prompting the Unseen: Detecting Hidden Backdoors in Black-Box Models
par: Huang, Zi-Xuan, et autres
Publié: (2024)
par: Huang, Zi-Xuan, et autres
Publié: (2024)
DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction
par: Tang, Hongyi, et autres
Publié: (2026)
par: Tang, Hongyi, et autres
Publié: (2026)
Towards Black-Box Membership Inference Attack for Diffusion Models
par: Li, Jingwei, et autres
Publié: (2024)
par: Li, Jingwei, et autres
Publié: (2024)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
par: Chen, Xinlong, et autres
Publié: (2025)
par: Chen, Xinlong, et autres
Publié: (2025)
Exploring Diffusion Models' Corruption Stage in Few-Shot Fine-tuning and Mitigating with Bayesian Neural Networks
par: Wu, Xiaoyu, et autres
Publié: (2024)
par: Wu, Xiaoyu, et autres
Publié: (2024)
SLCA++: Unleash the Power of Sequential Fine-tuning for Continual Learning with Pre-training
par: Zhang, Gengwei, et autres
Publié: (2024)
par: Zhang, Gengwei, et autres
Publié: (2024)
Documents similaires
-
Towards Compatible Fine-tuning for Vision-Language Model Updates
par: Wang, Zhengbo, et autres
Publié: (2024) -
A Hard-to-Beat Baseline for Training-free CLIP-based Adaptation
par: Wang, Zhengbo, et autres
Publié: (2024) -
Realistic Unsupervised CLIP Fine-tuning with Universal Entropy Optimization
par: Liang, Jian, et autres
Publié: (2023) -
The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
par: Sheng, Lijun, et autres
Publié: (2025) -
A Comprehensive Survey on Test-Time Adaptation under Distribution Shifts
par: Liang, Jian, et autres
Publié: (2023)