Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Hossain, Md Zarif, Imteaj, Ahmed |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
por: Hossain, Md Zarif, et al.
Publicado: (2024)
por: Hossain, Md Zarif, et al.
Publicado: (2024)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
por: Schlarmann, Christian, et al.
Publicado: (2024)
por: Schlarmann, Christian, et al.
Publicado: (2024)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
por: Cao, Anh-Quan, et al.
Publicado: (2024)
por: Cao, Anh-Quan, et al.
Publicado: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models
por: Liang, Yuhan, et al.
Publicado: (2024)
por: Liang, Yuhan, et al.
Publicado: (2024)
Robust Vision-Language Models via Tensor Decomposition: A Defense Against Adversarial Attacks
por: Patel, Het, et al.
Publicado: (2025)
por: Patel, Het, et al.
Publicado: (2025)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
por: Panos, Aristeidis, et al.
Publicado: (2024)
por: Panos, Aristeidis, et al.
Publicado: (2024)
Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models
por: Siddique, Md. Abu Bakor, et al.
Publicado: (2026)
por: Siddique, Md. Abu Bakor, et al.
Publicado: (2026)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
por: Poppi, Samuele, et al.
Publicado: (2023)
por: Poppi, Samuele, et al.
Publicado: (2023)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
por: Oh, Changdae, et al.
Publicado: (2023)
por: Oh, Changdae, et al.
Publicado: (2023)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
por: Wu, Xiangyang, et al.
Publicado: (2025)
por: Wu, Xiangyang, et al.
Publicado: (2025)
Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions
por: Sert, Egemen, et al.
Publicado: (2025)
por: Sert, Egemen, et al.
Publicado: (2025)
Distributed LLMs and Multimodal Large Language Models: A Survey on Advances, Challenges, and Future Directions
por: Amini, Hadi, et al.
Publicado: (2025)
por: Amini, Hadi, et al.
Publicado: (2025)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2025)
por: Zhang, Jiaming, et al.
Publicado: (2025)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
por: Yan, Qiao, et al.
Publicado: (2025)
por: Yan, Qiao, et al.
Publicado: (2025)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
por: Sun, Haoyuan, et al.
Publicado: (2025)
por: Sun, Haoyuan, et al.
Publicado: (2025)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
por: Rashad, Mohamed
Publicado: (2024)
por: Rashad, Mohamed
Publicado: (2024)
FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs
por: Asokan, Mothilal, et al.
Publicado: (2025)
por: Asokan, Mothilal, et al.
Publicado: (2025)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
por: Zhai, Yuexiang, et al.
Publicado: (2024)
por: Zhai, Yuexiang, et al.
Publicado: (2024)
Adversarial Prompt Tuning for Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2023)
por: Zhang, Jiaming, et al.
Publicado: (2023)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Directional Gradient Projection for Robust Fine-Tuning of Foundation Models
por: Huang, Chengyue, et al.
Publicado: (2025)
por: Huang, Chengyue, et al.
Publicado: (2025)
Vision-Language Models for Edge Networks: A Comprehensive Survey
por: Sharshar, Ahmed, et al.
Publicado: (2025)
por: Sharshar, Ahmed, et al.
Publicado: (2025)
microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification
por: Silva, Sathira, et al.
Publicado: (2025)
por: Silva, Sathira, et al.
Publicado: (2025)
CLIP-Guided Unsupervised Semantic-Aware Exposure Correction
por: Wu, Puzhen, et al.
Publicado: (2026)
por: Wu, Puzhen, et al.
Publicado: (2026)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
From Pampas to Pixels: Fine-Tuning Diffusion Models for Gaúcho Heritage
por: Amadeus, Marcellus, et al.
Publicado: (2024)
por: Amadeus, Marcellus, et al.
Publicado: (2024)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
por: Wang, Zehao, et al.
Publicado: (2024)
por: Wang, Zehao, et al.
Publicado: (2024)
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
por: Huang, Haochen, et al.
Publicado: (2025)
por: Huang, Haochen, et al.
Publicado: (2025)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding
por: Fujitake, Masato
Publicado: (2024)
por: Fujitake, Masato
Publicado: (2024)
Fine-Tuning Adversarially-Robust Transformers for Single-Image Dehazing
por: Vasilescu, Vlad, et al.
Publicado: (2025)
por: Vasilescu, Vlad, et al.
Publicado: (2025)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
por: Kang, Weitai, et al.
Publicado: (2024)
por: Kang, Weitai, et al.
Publicado: (2024)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
por: Lyu, Mengyao, et al.
Publicado: (2025)
por: Lyu, Mengyao, et al.
Publicado: (2025)
Robustness of Vision Language Models Against Split-Image Harmful Input Attacks
por: Rashid, Md Rafi Ur, et al.
Publicado: (2026)
por: Rashid, Md Rafi Ur, et al.
Publicado: (2026)
Historical Test-time Prompt Tuning for Vision Foundation Models
por: Zhang, Jingyi, et al.
Publicado: (2024)
por: Zhang, Jingyi, et al.
Publicado: (2024)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
por: Wang, Xingqi, et al.
Publicado: (2025)
por: Wang, Xingqi, et al.
Publicado: (2025)
MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
por: Zhao, Haozhe, et al.
Publicado: (2025)
por: Zhao, Haozhe, et al.
Publicado: (2025)
Ejemplares similares
-
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
por: Hossain, Md Zarif, et al.
Publicado: (2024) -
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
por: Schlarmann, Christian, et al.
Publicado: (2024) -
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
por: Cao, Anh-Quan, et al.
Publicado: (2024) -
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025) -
A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models
por: Liang, Yuhan, et al.
Publicado: (2024)