CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Nan, Wang, Huiqun, Zheng, Yaoyan, Huang, Di |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Implicit Modeling for Transferability Estimation of Vision Foundation Models
von: Zheng, Yaoyan, et al.
Veröffentlicht: (2025)
von: Zheng, Yaoyan, et al.
Veröffentlicht: (2025)
Crowd-SAM: SAM as a Smart Annotator for Object Detection in Crowded Scenes
von: Cai, Zhi, et al.
Veröffentlicht: (2024)
von: Cai, Zhi, et al.
Veröffentlicht: (2024)
Deep Common Feature Mining for Efficient Video Semantic Segmentation
von: Zheng, Yaoyan, et al.
Veröffentlicht: (2024)
von: Zheng, Yaoyan, et al.
Veröffentlicht: (2024)
EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
von: Chen, Zhenghao, et al.
Veröffentlicht: (2026)
von: Chen, Zhenghao, et al.
Veröffentlicht: (2026)
Semantic-aware Adversarial Fine-tuning for CLIP
von: Zhang, Jiacheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiacheng, et al.
Veröffentlicht: (2026)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
von: Sinha, Sanchit, et al.
Veröffentlicht: (2026)
von: Sinha, Sanchit, et al.
Veröffentlicht: (2026)
Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
von: Huang, Zhuo, et al.
Veröffentlicht: (2023)
von: Huang, Zhuo, et al.
Veröffentlicht: (2023)
TCP:Textual-based Class-aware Prompt tuning for Visual-Language Model
von: Yao, Hantao, et al.
Veröffentlicht: (2023)
von: Yao, Hantao, et al.
Veröffentlicht: (2023)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
Visual In-Context Learning for Large Vision-Language Models
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
von: Luo, Fuwen, et al.
Veröffentlicht: (2024)
von: Luo, Fuwen, et al.
Veröffentlicht: (2024)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
von: Liu, Juntao, et al.
Veröffentlicht: (2025)
von: Liu, Juntao, et al.
Veröffentlicht: (2025)
Personal Visual Context Learning in Large Multimodal Models
von: Xue, Zihui, et al.
Veröffentlicht: (2026)
von: Xue, Zihui, et al.
Veröffentlicht: (2026)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
von: Chen, Junkai, et al.
Veröffentlicht: (2026)
von: Chen, Junkai, et al.
Veröffentlicht: (2026)
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
von: Weng, Tengjin, et al.
Veröffentlicht: (2026)
von: Weng, Tengjin, et al.
Veröffentlicht: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
von: Li, Yanshu
Veröffentlicht: (2025)
von: Li, Yanshu
Veröffentlicht: (2025)
A Unified Framework with Multimodal Fine-tuning for Remote Sensing Semantic Segmentation
von: Ma, Xianping, et al.
Veröffentlicht: (2024)
von: Ma, Xianping, et al.
Veröffentlicht: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
COCO is "ALL'' You Need for Visual Instruction Fine-tuning
von: Han, Xiaotian, et al.
Veröffentlicht: (2024)
von: Han, Xiaotian, et al.
Veröffentlicht: (2024)
Plug-and-play Class-aware Knowledge Injection for Prompt Learning with Visual-Language Model
von: Yin, Junhui, et al.
Veröffentlicht: (2026)
von: Yin, Junhui, et al.
Veröffentlicht: (2026)
Batch Augmentation with Unimodal Fine-tuning for Multimodal Learning
von: Kabir, H M Dipu, et al.
Veröffentlicht: (2025)
von: Kabir, H M Dipu, et al.
Veröffentlicht: (2025)
Low-Rank Adaptation with Task-Relevant Feature Enhancement for Fine-tuning Language Models
von: Li, Changqun, et al.
Veröffentlicht: (2024)
von: Li, Changqun, et al.
Veröffentlicht: (2024)
TASeg: Text-aware RGB-T Semantic Segmentation based on Fine-tuning Vision Foundation Models
von: Yu, Meng, et al.
Veröffentlicht: (2025)
von: Yu, Meng, et al.
Veröffentlicht: (2025)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
von: Liu, Haogeng, et al.
Veröffentlicht: (2024)
von: Liu, Haogeng, et al.
Veröffentlicht: (2024)
Direction-aware 3D Large Multimodal Models
von: Liu, Quan, et al.
Veröffentlicht: (2026)
von: Liu, Quan, et al.
Veröffentlicht: (2026)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
von: Pan, Xichen, et al.
Veröffentlicht: (2023)
von: Pan, Xichen, et al.
Veröffentlicht: (2023)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
von: Wang, Chunshi, et al.
Veröffentlicht: (2025)
von: Wang, Chunshi, et al.
Veröffentlicht: (2025)
SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning
von: Kim, Minjun, et al.
Veröffentlicht: (2026)
von: Kim, Minjun, et al.
Veröffentlicht: (2026)
Democratizing Fine-grained Visual Recognition with Large Language Models
von: Liu, Mingxuan, et al.
Veröffentlicht: (2024)
von: Liu, Mingxuan, et al.
Veröffentlicht: (2024)
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
von: Xu, Quanxing, et al.
Veröffentlicht: (2026)
von: Xu, Quanxing, et al.
Veröffentlicht: (2026)
Improving Visual Storytelling with Multimodal Large Language Models
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
Visual Representation Alignment for Multimodal Large Language Models
von: Yoon, Heeji, et al.
Veröffentlicht: (2025)
von: Yoon, Heeji, et al.
Veröffentlicht: (2025)
Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
Semantic-guided Fine-tuning of Foundation Model for Long-tailed Visual Recognition
von: Peng, Yufei, et al.
Veröffentlicht: (2025)
von: Peng, Yufei, et al.
Veröffentlicht: (2025)
iVPT: Improving Task-relevant Information Sharing in Visual Prompt Tuning by Cross-layer Dynamic Connection
von: Zhou, Nan, et al.
Veröffentlicht: (2024)
von: Zhou, Nan, et al.
Veröffentlicht: (2024)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
von: Wang, Yunnan, et al.
Veröffentlicht: (2025)
von: Wang, Yunnan, et al.
Veröffentlicht: (2025)
Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models
von: Wang, Ruofan, et al.
Veröffentlicht: (2025)
von: Wang, Ruofan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Implicit Modeling for Transferability Estimation of Vision Foundation Models
von: Zheng, Yaoyan, et al.
Veröffentlicht: (2025) -
Crowd-SAM: SAM as a Smart Annotator for Object Detection in Crowded Scenes
von: Cai, Zhi, et al.
Veröffentlicht: (2024) -
Deep Common Feature Mining for Efficient Video Semantic Segmentation
von: Zheng, Yaoyan, et al.
Veröffentlicht: (2024) -
EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
von: Chen, Zhenghao, et al.
Veröffentlicht: (2026) -
Semantic-aware Adversarial Fine-tuning for CLIP
von: Zhang, Jiacheng, et al.
Veröffentlicht: (2026)