Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fang, Xiang, Fang, Wanlong, Ji, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
Rethinking Video-Language Model from the Language Input Perspective
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception
von: Chang, Fuhao, et al.
Veröffentlicht: (2025)
von: Chang, Fuhao, et al.
Veröffentlicht: (2025)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
von: Li, Yuliang, et al.
Veröffentlicht: (2026)
von: Li, Yuliang, et al.
Veröffentlicht: (2026)
WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning
von: Englmeier, Stefan, et al.
Veröffentlicht: (2026)
von: Englmeier, Stefan, et al.
Veröffentlicht: (2026)
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
von: Shi, Liang, et al.
Veröffentlicht: (2026)
von: Shi, Liang, et al.
Veröffentlicht: (2026)
U-VLM: Hierarchical Vision Language Modeling for Report Generation
von: Shi, Pengcheng, et al.
Veröffentlicht: (2026)
von: Shi, Pengcheng, et al.
Veröffentlicht: (2026)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
von: Gu, Renjie, et al.
Veröffentlicht: (2026)
von: Gu, Renjie, et al.
Veröffentlicht: (2026)
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2023)
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2023)
Q-VLM: Post-training Quantization for Large Vision-Language Models
von: Wang, Changyuan, et al.
Veröffentlicht: (2024)
von: Wang, Changyuan, et al.
Veröffentlicht: (2024)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2024)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
von: Ji, Yatai, et al.
Veröffentlicht: (2024)
von: Ji, Yatai, et al.
Veröffentlicht: (2024)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
von: Shen, Haozhan, et al.
Veröffentlicht: (2025)
von: Shen, Haozhan, et al.
Veröffentlicht: (2025)
Towards Open-World Grasping with Large Vision-Language Models
von: Tziafas, Georgios, et al.
Veröffentlicht: (2024)
von: Tziafas, Georgios, et al.
Veröffentlicht: (2024)
Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network
von: Fang, Xiang, et al.
Veröffentlicht: (2024)
von: Fang, Xiang, et al.
Veröffentlicht: (2024)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
von: Yin, Xiangyu, et al.
Veröffentlicht: (2025)
von: Yin, Xiangyu, et al.
Veröffentlicht: (2025)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
von: Huang, Zhipeng, et al.
Veröffentlicht: (2024)
von: Huang, Zhipeng, et al.
Veröffentlicht: (2024)
CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis
von: Boudiaf, Abderrahmene, et al.
Veröffentlicht: (2026)
von: Boudiaf, Abderrahmene, et al.
Veröffentlicht: (2026)
Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patches for Infrared Vision-Language Models
von: Hu, Chengyin, et al.
Veröffentlicht: (2026)
von: Hu, Chengyin, et al.
Veröffentlicht: (2026)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
von: Shao, Rui, et al.
Veröffentlicht: (2025)
von: Shao, Rui, et al.
Veröffentlicht: (2025)
Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection
von: Lee, Chanhui, et al.
Veröffentlicht: (2026)
von: Lee, Chanhui, et al.
Veröffentlicht: (2026)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
von: He, Xingwei, et al.
Veröffentlicht: (2024)
von: He, Xingwei, et al.
Veröffentlicht: (2024)
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
von: Jia, Pengyue, et al.
Veröffentlicht: (2025)
von: Jia, Pengyue, et al.
Veröffentlicht: (2025)
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
von: Kang, Shuhao, et al.
Veröffentlicht: (2026)
von: Kang, Shuhao, et al.
Veröffentlicht: (2026)
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
von: Berman, Nimrod, et al.
Veröffentlicht: (2025)
von: Berman, Nimrod, et al.
Veröffentlicht: (2025)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
von: Yang, Hongji, et al.
Veröffentlicht: (2026)
von: Yang, Hongji, et al.
Veröffentlicht: (2026)
Open World Scene Graph Generation using Vision Language Models
von: Dutta, Amartya, et al.
Veröffentlicht: (2025)
von: Dutta, Amartya, et al.
Veröffentlicht: (2025)
Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection
von: Bao, Wentao, et al.
Veröffentlicht: (2024)
von: Bao, Wentao, et al.
Veröffentlicht: (2024)
World-Consistent Data Generation for Vision-and-Language Navigation
von: Zhong, Yu, et al.
Veröffentlicht: (2024)
von: Zhong, Yu, et al.
Veröffentlicht: (2024)
Immunizing 3D Gaussian Generative Models Against Unauthorized Fine-Tuning via Attribute-Space Traps
von: Zhang, Jianwei, et al.
Veröffentlicht: (2026)
von: Zhang, Jianwei, et al.
Veröffentlicht: (2026)
From Open Vocabulary to Open World: Teaching Vision Language Models to Detect Novel Objects
von: Li, Zizhao, et al.
Veröffentlicht: (2024)
von: Li, Zizhao, et al.
Veröffentlicht: (2024)
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
von: Liu, Jiajin, et al.
Veröffentlicht: (2026)
von: Liu, Jiajin, et al.
Veröffentlicht: (2026)
FloorplanVLM: A Vision-Language Model for Floorplan Vectorization
von: Liu, Yuanqing, et al.
Veröffentlicht: (2026)
von: Liu, Yuanqing, et al.
Veröffentlicht: (2026)
TrojVLM: Backdoor Attack Against Vision Language Models
von: Lyu, Weimin, et al.
Veröffentlicht: (2024)
von: Lyu, Weimin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
von: Fang, Xiang, et al.
Veröffentlicht: (2026) -
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
von: Fang, Xiang, et al.
Veröffentlicht: (2026) -
Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
von: Fang, Xiang, et al.
Veröffentlicht: (2026) -
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
von: Fang, Xiang, et al.
Veröffentlicht: (2026) -
CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
von: Fang, Xiang, et al.
Veröffentlicht: (2026)