Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Mingyuan, Bai, Yue, Wang, Yifan, Huang, Yiyang, Fu, Yun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
by: Gu, Zijian, et al.
Published: (2025)
by: Gu, Zijian, et al.
Published: (2025)
Rethinking Weight Decay for Robust Fine-Tuning of Foundation Models
by: Tian, Junjiao, et al.
Published: (2024)
by: Tian, Junjiao, et al.
Published: (2024)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
by: Zheng, Weiying, et al.
Published: (2025)
by: Zheng, Weiying, et al.
Published: (2025)
Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models
by: Shen, Shufan, et al.
Published: (2025)
by: Shen, Shufan, et al.
Published: (2025)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
by: Liu, Xinyang, et al.
Published: (2023)
by: Liu, Xinyang, et al.
Published: (2023)
Accessing Vision Foundation Models via ImageNet-1K
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
by: Zhou, Yiyang, et al.
Published: (2024)
by: Zhou, Yiyang, et al.
Published: (2024)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
by: Ghosh, Dhruba, et al.
Published: (2026)
by: Ghosh, Dhruba, et al.
Published: (2026)
Transition Models: Rethinking the Generative Learning Objective
by: Wang, Zidong, et al.
Published: (2025)
by: Wang, Zidong, et al.
Published: (2025)
Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
by: Zhang, Zhehan, et al.
Published: (2026)
by: Zhang, Zhehan, et al.
Published: (2026)
Ultrasound Vision-Language Alignment via Contrastive Learning
by: Lyu, Zhuoyang, et al.
Published: (2026)
by: Lyu, Zhuoyang, et al.
Published: (2026)
Parameter-Efficient Fine-Tuning for Pre-Trained Vision Models: A Survey and Benchmark
by: Xin, Yi, et al.
Published: (2024)
by: Xin, Yi, et al.
Published: (2024)
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
by: Hu, Rui, et al.
Published: (2025)
by: Hu, Rui, et al.
Published: (2025)
Calibrated Self-Rewarding Vision Language Models
by: Zhou, Yiyang, et al.
Published: (2024)
by: Zhou, Yiyang, et al.
Published: (2024)
Stable Consistency Tuning: Understanding and Improving Consistency Models
by: Wang, Fu-Yun, et al.
Published: (2024)
by: Wang, Fu-Yun, et al.
Published: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
by: Jie, Shibo, et al.
Published: (2024)
by: Jie, Shibo, et al.
Published: (2024)
pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
by: Ghiasvand, Sajjad, et al.
Published: (2025)
by: Ghiasvand, Sajjad, et al.
Published: (2025)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
by: Xu, Qinwu, et al.
Published: (2026)
by: Xu, Qinwu, et al.
Published: (2026)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
by: Ming, Yifei, et al.
Published: (2023)
by: Ming, Yifei, et al.
Published: (2023)
Data-Free Quantization via Mixed-Precision Compensation without Fine-Tuning
by: Chen, Jun, et al.
Published: (2023)
by: Chen, Jun, et al.
Published: (2023)
Towards Compatible Fine-tuning for Vision-Language Model Updates
by: Wang, Zhengbo, et al.
Published: (2024)
by: Wang, Zhengbo, et al.
Published: (2024)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
by: Yi, Chao, et al.
Published: (2024)
by: Yi, Chao, et al.
Published: (2024)
Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models
by: Xu, Haochuan, et al.
Published: (2025)
by: Xu, Haochuan, et al.
Published: (2025)
Semi-Supervised Fine-Tuning of Vision Foundation Models with Content-Style Decomposition
by: Drozdova, Mariia, et al.
Published: (2024)
by: Drozdova, Mariia, et al.
Published: (2024)
Spectrum-Aware Parameter Efficient Fine-Tuning for Diffusion Models
by: Zhang, Xinxi, et al.
Published: (2024)
by: Zhang, Xinxi, et al.
Published: (2024)
AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning
by: Singh, Guransh
Published: (2026)
by: Singh, Guransh
Published: (2026)
SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
by: Yang, Yifan, et al.
Published: (2025)
by: Yang, Yifan, et al.
Published: (2025)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
by: Yu, Xinlei, et al.
Published: (2025)
by: Yu, Xinlei, et al.
Published: (2025)
Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning
by: Wang, Yuhua, et al.
Published: (2026)
by: Wang, Yuhua, et al.
Published: (2026)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
by: Zhai, Yuexiang, et al.
Published: (2024)
by: Zhai, Yuexiang, et al.
Published: (2024)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
by: Dai, Fengyuan, et al.
Published: (2025)
by: Dai, Fengyuan, et al.
Published: (2025)
CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think
by: Sun, Zening, et al.
Published: (2026)
by: Sun, Zening, et al.
Published: (2026)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
by: Schlarmann, Christian, et al.
Published: (2024)
by: Schlarmann, Christian, et al.
Published: (2024)
Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes
by: Jiang, Yifan, et al.
Published: (2026)
by: Jiang, Yifan, et al.
Published: (2026)
Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
by: Jennings, Roy H., et al.
Published: (2025)
by: Jennings, Roy H., et al.
Published: (2025)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
by: Kim, Moo Jin, et al.
Published: (2025)
by: Kim, Moo Jin, et al.
Published: (2025)
Rethinking Pruning for Vision-Language Models: Strategies for Effective Sparsity and Performance Restoration
by: He, Shwai, et al.
Published: (2024)
by: He, Shwai, et al.
Published: (2024)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
by: Luo, Run, et al.
Published: (2025)
by: Luo, Run, et al.
Published: (2025)
Efficient Fine-Tuning with Domain Adaptation for Privacy-Preserving Vision Transformer
by: Nagamori, Teru, et al.
Published: (2024)
by: Nagamori, Teru, et al.
Published: (2024)
Efficient Fine-Tuning and Concept Suppression for Pruned Diffusion Models
by: Shirkavand, Reza, et al.
Published: (2024)
by: Shirkavand, Reza, et al.
Published: (2024)
Similar Items
-
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
by: Gu, Zijian, et al.
Published: (2025) -
Rethinking Weight Decay for Robust Fine-Tuning of Foundation Models
by: Tian, Junjiao, et al.
Published: (2024) -
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
by: Zheng, Weiying, et al.
Published: (2025) -
Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models
by: Shen, Shufan, et al.
Published: (2025) -
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
by: Liu, Xinyang, et al.
Published: (2023)