MERGETUNE: Continued Fine-Tuning of Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Wenqing, Li, Da, Zhu, Xiatian, Kittler, Josef |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Single Image, Any Face: Generalisable 3D Face Generation
von: Wang, Wenqing, et al.
Veröffentlicht: (2024)
von: Wang, Wenqing, et al.
Veröffentlicht: (2024)
Dynamic Avatar-Scene Rendering from Human-centric Context
von: Wang, Wenqing, et al.
Veröffentlicht: (2025)
von: Wang, Wenqing, et al.
Veröffentlicht: (2025)
Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction
von: Li, Yuanbo, et al.
Veröffentlicht: (2026)
von: Li, Yuanbo, et al.
Veröffentlicht: (2026)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
von: Song, Nan, et al.
Veröffentlicht: (2025)
von: Song, Nan, et al.
Veröffentlicht: (2025)
KANs for Computer Vision: An Experimental Study
von: Mohan, Karthik, et al.
Veröffentlicht: (2024)
von: Mohan, Karthik, et al.
Veröffentlicht: (2024)
Paving the Way for Point Cloud Video Representation Learning Using A PDE Model
von: Huang, Zhuoxu, et al.
Veröffentlicht: (2026)
von: Huang, Zhuoxu, et al.
Veröffentlicht: (2026)
Bayesian Test-Time Adaptation for Vision-Language Models
von: Zhou, Lihua, et al.
Veröffentlicht: (2025)
von: Zhou, Lihua, et al.
Veröffentlicht: (2025)
Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models
von: Li, Yuanbo, et al.
Veröffentlicht: (2026)
von: Li, Yuanbo, et al.
Veröffentlicht: (2026)
Motion Forecasting in Continuous Driving
von: Song, Nan, et al.
Veröffentlicht: (2024)
von: Song, Nan, et al.
Veröffentlicht: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
von: Li, Jiayu, et al.
Veröffentlicht: (2025)
von: Li, Jiayu, et al.
Veröffentlicht: (2025)
Dynamic Subframe Splitting and Spatio-Temporal Motion Entangled Sparse Attention for RGB-E Tracking
von: Shao, Pengcheng, et al.
Veröffentlicht: (2024)
von: Shao, Pengcheng, et al.
Veröffentlicht: (2024)
Debiased Fine-Tuning for Vision-language Models by Prompt Regularization
von: Zhu, Beier, et al.
Veröffentlicht: (2023)
von: Zhu, Beier, et al.
Veröffentlicht: (2023)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
von: Li, Xiao, et al.
Veröffentlicht: (2025)
von: Li, Xiao, et al.
Veröffentlicht: (2025)
Source-Free Domain Adaptation with Vision-Language Prior
von: Tang, Song, et al.
Veröffentlicht: (2026)
von: Tang, Song, et al.
Veröffentlicht: (2026)
Collaborating Vision, Depth, and Thermal Signals for Multi-Modal Tracking: Dataset and Algorithm
von: Zhu, Xue-Feng, et al.
Veröffentlicht: (2025)
von: Zhu, Xue-Feng, et al.
Veröffentlicht: (2025)
Improving Gaussian Splatting with Localized Points Management
von: Yang, Haosen, et al.
Veröffentlicht: (2024)
von: Yang, Haosen, et al.
Veröffentlicht: (2024)
Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer
von: Chang, Da, et al.
Veröffentlicht: (2024)
von: Chang, Da, et al.
Veröffentlicht: (2024)
A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles
von: Xu, Tianyang, et al.
Veröffentlicht: (2025)
von: Xu, Tianyang, et al.
Veröffentlicht: (2025)
Data-Efficient Fine-Tuning of Vision-Language Models for Diagnosis of Alzheimer's Disease
von: Cheng, Fangqi, et al.
Veröffentlicht: (2025)
von: Cheng, Fangqi, et al.
Veröffentlicht: (2025)
Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
von: Li, Yu, et al.
Veröffentlicht: (2025)
von: Li, Yu, et al.
Veröffentlicht: (2025)
MMDG-Bench: A Benchmark for Multimodal Domain Generalization
von: Zhan, Qianshan, et al.
Veröffentlicht: (2026)
von: Zhan, Qianshan, et al.
Veröffentlicht: (2026)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
von: Ding, Yi, et al.
Veröffentlicht: (2025)
von: Ding, Yi, et al.
Veröffentlicht: (2025)
MMDRFuse: Distilled Mini-Model with Dynamic Refresh for Multi-Modality Image Fusion
von: Deng, Yanglin, et al.
Veröffentlicht: (2024)
von: Deng, Yanglin, et al.
Veröffentlicht: (2024)
An Improved Graph Pooling Network for Skeleton-Based Action Recognition
von: Wu, Cong, et al.
Veröffentlicht: (2024)
von: Wu, Cong, et al.
Veröffentlicht: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
von: Hai, Jia-Wei, et al.
Veröffentlicht: (2026)
von: Hai, Jia-Wei, et al.
Veröffentlicht: (2026)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
von: Zheng, Weiying, et al.
Veröffentlicht: (2025)
von: Zheng, Weiying, et al.
Veröffentlicht: (2025)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
von: Qi, Zhangyang, et al.
Veröffentlicht: (2025)
von: Qi, Zhangyang, et al.
Veröffentlicht: (2025)
Layer-Specific Fine-Tuning for Improved Negation Handling in Medical Vision-Language Models
von: Abbasi, Ali, et al.
Veröffentlicht: (2026)
von: Abbasi, Ali, et al.
Veröffentlicht: (2026)
ConceptHash: Interpretable Fine-Grained Hashing via Concept Discovery
von: Ng, Kam Woh, et al.
Veröffentlicht: (2024)
von: Ng, Kam Woh, et al.
Veröffentlicht: (2024)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
von: Oh, Changdae, et al.
Veröffentlicht: (2023)
von: Oh, Changdae, et al.
Veröffentlicht: (2023)
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
von: Tang, Zhangyong, et al.
Veröffentlicht: (2025)
von: Tang, Zhangyong, et al.
Veröffentlicht: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
von: Tan, Huajie, et al.
Veröffentlicht: (2025)
von: Tan, Huajie, et al.
Veröffentlicht: (2025)
Efficient Test-Time Prompt Tuning for Vision-Language Models
von: Zhu, Yuhan, et al.
Veröffentlicht: (2024)
von: Zhu, Yuhan, et al.
Veröffentlicht: (2024)
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
von: Gu, Zijian, et al.
Veröffentlicht: (2025)
von: Gu, Zijian, et al.
Veröffentlicht: (2025)
Preconditioned Score-based Generative Models
von: Ma, Hengyuan, et al.
Veröffentlicht: (2023)
von: Ma, Hengyuan, et al.
Veröffentlicht: (2023)
GLAD: Generalizable Tuning for Vision-Language Models
von: Peng, Yuqi, et al.
Veröffentlicht: (2025)
von: Peng, Yuqi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Single Image, Any Face: Generalisable 3D Face Generation
von: Wang, Wenqing, et al.
Veröffentlicht: (2024) -
Dynamic Avatar-Scene Rendering from Human-centric Context
von: Wang, Wenqing, et al.
Veröffentlicht: (2025) -
Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction
von: Li, Yuanbo, et al.
Veröffentlicht: (2026) -
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
von: Song, Nan, et al.
Veröffentlicht: (2025) -
KANs for Computer Vision: An Experimental Study
von: Mohan, Karthik, et al.
Veröffentlicht: (2024)