Anchor-based Robust Finetuning of Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Han, Jinwei, Lin, Zhiwen, Sun, Zhongyisun, Gao, Yingguo, Yan, Ke, Ding, Shouhong, Gao, Yuan, Xia, Gui-Song |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Dual Relation Mining Network for Zero-Shot Learning
by: Han, Jinwei, et al.
Published: (2024)
by: Han, Jinwei, et al.
Published: (2024)
Fuse Before Transfer: Knowledge Fusion for Heterogeneous Distillation
by: Li, Guopeng, et al.
Published: (2024)
by: Li, Guopeng, et al.
Published: (2024)
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
by: Wu, Yuanchen, et al.
Published: (2025)
by: Wu, Yuanchen, et al.
Published: (2025)
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
by: Weng, Xingxing, et al.
Published: (2025)
by: Weng, Xingxing, et al.
Published: (2025)
Timestep-Aware Block Masking for Efficient Diffusion Model Inference
by: He, Haodong, et al.
Published: (2026)
by: He, Haodong, et al.
Published: (2026)
On the Robustness of Object Detection Models on Aerial Images
by: He, Haodong, et al.
Published: (2023)
by: He, Haodong, et al.
Published: (2023)
Exploring the Collaborative Advantage of Low-level Information on Generalizable AI-Generated Image Detection
by: Zhou, Ziyin, et al.
Published: (2025)
by: Zhou, Ziyin, et al.
Published: (2025)
Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models
by: Mishra, Shambhavi, et al.
Published: (2024)
by: Mishra, Shambhavi, et al.
Published: (2024)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
by: Zhou, Ziyin, et al.
Published: (2025)
by: Zhou, Ziyin, et al.
Published: (2025)
LaRE$^2$: Latent Reconstruction Error Based Method for Diffusion-Generated Image Detection
by: Luo, Yunpeng, et al.
Published: (2024)
by: Luo, Yunpeng, et al.
Published: (2024)
Evolution-based Region Adversarial Prompt Learning for Robustness Enhancement in Vision-Language Models
by: Jia, Xiaojun, et al.
Published: (2025)
by: Jia, Xiaojun, et al.
Published: (2025)
SAFE: Slow and Fast Parameter-Efficient Tuning for Continual Learning with Pre-Trained Models
by: Zhao, Linglan, et al.
Published: (2024)
by: Zhao, Linglan, et al.
Published: (2024)
The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
by: Chopra, Shivang, et al.
Published: (2026)
by: Chopra, Shivang, et al.
Published: (2026)
Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration
by: Wu, Yuanchen, et al.
Published: (2025)
by: Wu, Yuanchen, et al.
Published: (2025)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
by: Wang, Enguang, et al.
Published: (2026)
by: Wang, Enguang, et al.
Published: (2026)
Finetuning Vision-Language Models as OCR Systems for Low-Resource Languages: A Case Study of Manchu
by: Chung, Yan Hon Michael, et al.
Published: (2025)
by: Chung, Yan Hon Michael, et al.
Published: (2025)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
by: Chng, Yong Xien, et al.
Published: (2024)
by: Chng, Yong Xien, et al.
Published: (2024)
Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise
by: Gao, Yansheng, et al.
Published: (2025)
by: Gao, Yansheng, et al.
Published: (2025)
VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection
by: Han, Hui, et al.
Published: (2026)
by: Han, Hui, et al.
Published: (2026)
AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models
by: Li, Zhiwei, et al.
Published: (2026)
by: Li, Zhiwei, et al.
Published: (2026)
BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning
by: Ke, Jingyang, et al.
Published: (2026)
by: Ke, Jingyang, et al.
Published: (2026)
AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows
by: Zhou, Zhenglin, et al.
Published: (2025)
by: Zhou, Zhenglin, et al.
Published: (2025)
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
by: Li, Jiangyang, et al.
Published: (2026)
by: Li, Jiangyang, et al.
Published: (2026)
Approximate Nullspace Augmented Finetuning for Robust Vision Transformers
by: Liu, Haoyang, et al.
Published: (2024)
by: Liu, Haoyang, et al.
Published: (2024)
GSVA: Generalized Segmentation via Multimodal Large Language Models
by: Xia, Zhuofan, et al.
Published: (2023)
by: Xia, Zhuofan, et al.
Published: (2023)
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
by: Zang, Yuhang, et al.
Published: (2024)
by: Zang, Yuhang, et al.
Published: (2024)
Towards Human-Level 3D Relative Pose Estimation: Generalizable, Training-Free, with Single Reference
by: Gao, Yuan, et al.
Published: (2024)
by: Gao, Yuan, et al.
Published: (2024)
CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models
by: Jha, Saurav, et al.
Published: (2024)
by: Jha, Saurav, et al.
Published: (2024)
OneTo3D: One Image to Re-editable Dynamic 3D Model and Video Generation
by: Lin, Jinwei
Published: (2024)
by: Lin, Jinwei
Published: (2024)
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
by: Xing, Songlong, et al.
Published: (2026)
by: Xing, Songlong, et al.
Published: (2026)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
by: An, Xiao, et al.
Published: (2024)
by: An, Xiao, et al.
Published: (2024)
Towards General Visual-Linguistic Face Forgery Detection
by: Sun, Ke, et al.
Published: (2023)
by: Sun, Ke, et al.
Published: (2023)
DiffusionFake: Enhancing Generalization in Deepfake Detection via Guided Stable Diffusion
by: Sun, Ke, et al.
Published: (2024)
by: Sun, Ke, et al.
Published: (2024)
Exploring the Adversarial Robustness of Face Forgery Detection with Decision-based Black-box Attacks
by: Chen, Zhaoyu, et al.
Published: (2023)
by: Chen, Zhaoyu, et al.
Published: (2023)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
by: Gao, Kuofeng, et al.
Published: (2024)
by: Gao, Kuofeng, et al.
Published: (2024)
Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors
by: Yang, Chengxu, et al.
Published: (2026)
by: Yang, Chengxu, et al.
Published: (2026)
AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment
by: Chen, Ruoxin, et al.
Published: (2025)
by: Chen, Ruoxin, et al.
Published: (2025)
VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
by: Pang, Chao, et al.
Published: (2024)
by: Pang, Chao, et al.
Published: (2024)
QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning
by: Wang, Haoxuan, et al.
Published: (2024)
by: Wang, Haoxuan, et al.
Published: (2024)
Self-supervised Gait-based Emotion Representation Learning from Selective Strongly Augmented Skeleton Sequences
by: Song, Cheng, et al.
Published: (2024)
by: Song, Cheng, et al.
Published: (2024)
Similar Items
-
Dual Relation Mining Network for Zero-Shot Learning
by: Han, Jinwei, et al.
Published: (2024) -
Fuse Before Transfer: Knowledge Fusion for Heterogeneous Distillation
by: Li, Guopeng, et al.
Published: (2024) -
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
by: Wu, Yuanchen, et al.
Published: (2025) -
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
by: Weng, Xingxing, et al.
Published: (2025) -
Timestep-Aware Block Masking for Efficient Diffusion Model Inference
by: He, Haodong, et al.
Published: (2026)