VALD: Multi-Stage Vision Attack Detection for Efficient LVLM Defense
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kadvil, Nadav, Fares, Malak, Tal, Ayellet |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SFMNet: Sparse Focal Modulation for 3D Object Detection
par: Shrout, Oren, et autres
Publié: (2025)
par: Shrout, Oren, et autres
Publié: (2025)
MME: Mixture of Mesh Experts with Random Walk Transformer Gating
par: Belder, Amir, et autres
Publié: (2026)
par: Belder, Amir, et autres
Publié: (2026)
CLID: Controlled-Length Image Descriptions with Limited Data
par: Hirsch, Elad, et autres
Publié: (2022)
par: Hirsch, Elad, et autres
Publié: (2022)
GraVoS: Voxel Selection for 3D Point-Cloud Detection
par: Shrout, Oren, et autres
Publié: (2022)
par: Shrout, Oren, et autres
Publié: (2022)
Random Walks in Self-supervised Learning for Triangular Meshes
par: Yefet, Gal, et autres
Publié: (2025)
par: Yefet, Gal, et autres
Publié: (2025)
Concept Retrieval -- What and How?
par: Nizan, Ori, et autres
Publié: (2025)
par: Nizan, Ori, et autres
Publié: (2025)
MedRAT: Unpaired Medical Report Generation via Auxiliary Tasks
par: Hirsch, Elad, et autres
Publié: (2024)
par: Hirsch, Elad, et autres
Publié: (2024)
Image-aware Evaluation of Generated Medical Reports
par: Dawidowicz, Gefen, et autres
Publié: (2024)
par: Dawidowicz, Gefen, et autres
Publié: (2024)
MedCycle: Unpaired Medical Report Generation via Cycle-Consistency
par: Hirsch, Elad, et autres
Publié: (2024)
par: Hirsch, Elad, et autres
Publié: (2024)
PatchContrast: Self-Supervised Pre-training for 3D Object Detection
par: Shrout, Oren, et autres
Publié: (2023)
par: Shrout, Oren, et autres
Publié: (2023)
ArcAid: Analysis of Archaeological Artifacts using Drawings
par: Hayon, Offry, et autres
Publié: (2022)
par: Hayon, Offry, et autres
Publié: (2022)
PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
par: Mei, Hefei, et autres
Publié: (2026)
par: Mei, Hefei, et autres
Publié: (2026)
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
par: Feng, Ze, et autres
Publié: (2025)
par: Feng, Ze, et autres
Publié: (2025)
SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense
par: Huang, Yiyang, et autres
Publié: (2025)
par: Huang, Yiyang, et autres
Publié: (2025)
LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models
par: Stan, Gabriela Ben Melech, et autres
Publié: (2024)
par: Stan, Gabriela Ben Melech, et autres
Publié: (2024)
MirrorCheck: Efficient Adversarial Defense for Vision-Language Models
par: Fares, Samar, et autres
Publié: (2024)
par: Fares, Samar, et autres
Publié: (2024)
Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation
par: Hwang, Yerin, et autres
Publié: (2025)
par: Hwang, Yerin, et autres
Publié: (2025)
LAVID: An Agentic LVLM Framework for Diffusion-Generated Video Detection
par: Liu, Qingyuan, et autres
Publié: (2025)
par: Liu, Qingyuan, et autres
Publié: (2025)
XDR-LVLM: An Explainable Vision-Language Large Model for Diabetic Retinopathy Diagnosis
par: Ito, Masato, et autres
Publié: (2025)
par: Ito, Masato, et autres
Publié: (2025)
Multi-Level LVLM Guidance for Untrimmed Video Action Recognition
par: Peng, Liyang, et autres
Publié: (2025)
par: Peng, Liyang, et autres
Publié: (2025)
LVLM-Aided Alignment of Task-Specific Vision Models
par: Koebler, Alexander, et autres
Publié: (2025)
par: Koebler, Alexander, et autres
Publié: (2025)
AnyAnomaly: Zero-Shot Customizable Video Anomaly Detection with LVLM
par: Ahn, Sunghyun, et autres
Publié: (2025)
par: Ahn, Sunghyun, et autres
Publié: (2025)
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
par: Ma, Ji, et autres
Publié: (2025)
par: Ma, Ji, et autres
Publié: (2025)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
LVLM-empowered Multi-modal Representation Learning for Visual Place Recognition
par: Wang, Teng, et autres
Publié: (2024)
par: Wang, Teng, et autres
Publié: (2024)
OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language Models
par: Miyamoto, Ryoto, et autres
Publié: (2025)
par: Miyamoto, Ryoto, et autres
Publié: (2025)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
par: Zhao, Yunhan, et autres
Publié: (2025)
par: Zhao, Yunhan, et autres
Publié: (2025)
ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference
par: Huang, Zhaohong, et autres
Publié: (2026)
par: Huang, Zhaohong, et autres
Publié: (2026)
When and Where to Attack? Stage-wise Attention-Guided Adversarial Attack on Large Vision Language Models
par: Kwak, Jaehyun, et autres
Publié: (2026)
par: Kwak, Jaehyun, et autres
Publié: (2026)
VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation
par: Park, Seongheon, et autres
Publié: (2026)
par: Park, Seongheon, et autres
Publié: (2026)
Evaluation of Neural Networks Defenses and Attacks using NDCG and Reciprocal Rank Metrics
par: Brama, Haya, et autres
Publié: (2022)
par: Brama, Haya, et autres
Publié: (2022)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
par: Qharabagh, Muhammad Fetrat, et autres
Publié: (2024)
par: Qharabagh, Muhammad Fetrat, et autres
Publié: (2024)
LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation
par: Chen, Hanning, et autres
Publié: (2025)
par: Chen, Hanning, et autres
Publié: (2025)
LVLM-Composer's Explicit Planning for Image Generation
par: Ramsey, Spencer, et autres
Publié: (2025)
par: Ramsey, Spencer, et autres
Publié: (2025)
Provoking Multi-modal Few-Shot LVLM via Exploration-Exploitation In-Context Learning
par: Chen, Cheng, et autres
Publié: (2025)
par: Chen, Cheng, et autres
Publié: (2025)
ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference
par: Pathak, Surendra, et autres
Publié: (2026)
par: Pathak, Surendra, et autres
Publié: (2026)
Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models
par: Xu, Haochuan, et autres
Publié: (2025)
par: Xu, Haochuan, et autres
Publié: (2025)
IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning
par: Zhao, Mengyang, et autres
Publié: (2025)
par: Zhao, Mengyang, et autres
Publié: (2025)
Attention-Based Real-Time Defenses for Physical Adversarial Attacks in Vision Applications
par: Rossolini, Giulio, et autres
Publié: (2023)
par: Rossolini, Giulio, et autres
Publié: (2023)
Documents similaires
-
SFMNet: Sparse Focal Modulation for 3D Object Detection
par: Shrout, Oren, et autres
Publié: (2025) -
MME: Mixture of Mesh Experts with Random Walk Transformer Gating
par: Belder, Amir, et autres
Publié: (2026) -
CLID: Controlled-Length Image Descriptions with Limited Data
par: Hirsch, Elad, et autres
Publié: (2022) -
GraVoS: Voxel Selection for 3D Point-Cloud Detection
par: Shrout, Oren, et autres
Publié: (2022) -
Random Walks in Self-supervised Learning for Triangular Meshes
par: Yefet, Gal, et autres
Publié: (2025)