Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Peng-Fei, Huang, Zi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
Universal Adversarial Perturbations for Vision-Language Pre-trained Models
por: Zhang, Peng-Fei, et al.
Publicado: (2024)
por: Zhang, Peng-Fei, et al.
Publicado: (2024)
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
por: Zhang, Fengyi, et al.
Publicado: (2024)
por: Zhang, Fengyi, et al.
Publicado: (2024)
Mitigating Image Captioning Hallucinations in Vision-Language Models
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
por: Huang, Yuhang, et al.
Publicado: (2024)
por: Huang, Yuhang, et al.
Publicado: (2024)
PG-Attack: A Precision-Guided Adversarial Attack Framework Against Vision Foundation Models for Autonomous Driving
por: Fu, Jiyuan, et al.
Publicado: (2024)
por: Fu, Jiyuan, et al.
Publicado: (2024)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
por: Xu, Jingning, et al.
Publicado: (2026)
por: Xu, Jingning, et al.
Publicado: (2026)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
por: Tang, Hao, et al.
Publicado: (2026)
por: Tang, Hao, et al.
Publicado: (2026)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
por: Song, Shezheng, et al.
Publicado: (2026)
por: Song, Shezheng, et al.
Publicado: (2026)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
por: Zhu, Hongyi, et al.
Publicado: (2024)
por: Zhu, Hongyi, et al.
Publicado: (2024)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
por: Zhang, Rui, et al.
Publicado: (2024)
por: Zhang, Rui, et al.
Publicado: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
por: Jiang, Chaoya, et al.
Publicado: (2024)
por: Jiang, Chaoya, et al.
Publicado: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
por: Liu, Jingping, et al.
Publicado: (2025)
por: Liu, Jingping, et al.
Publicado: (2025)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
por: Sun, Yanpeng, et al.
Publicado: (2024)
por: Sun, Yanpeng, et al.
Publicado: (2024)
CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
por: Luo, Yuxuan, et al.
Publicado: (2025)
por: Luo, Yuxuan, et al.
Publicado: (2025)
Unveiling Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
por: Feng, X., et al.
Publicado: (2024)
por: Feng, X., et al.
Publicado: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
por: Zhu, Xingyu, et al.
Publicado: (2026)
por: Zhu, Xingyu, et al.
Publicado: (2026)
ComAlign: Compositional Alignment in Vision-Language Models
por: Abdollah, Ali, et al.
Publicado: (2024)
por: Abdollah, Ali, et al.
Publicado: (2024)
G-Refine: A General Quality Refiner for Text-to-Image Generation
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
MIPS at SemEval-2024 Task 3: Multimodal Emotion-Cause Pair Extraction in Conversations with Multimodal Language Models
por: Cheng, Zebang, et al.
Publicado: (2024)
por: Cheng, Zebang, et al.
Publicado: (2024)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
por: Liu, Yating, et al.
Publicado: (2025)
por: Liu, Yating, et al.
Publicado: (2025)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
por: Hao, Jing, et al.
Publicado: (2025)
por: Hao, Jing, et al.
Publicado: (2025)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
por: Zhou, Yuchen, et al.
Publicado: (2025)
por: Zhou, Yuchen, et al.
Publicado: (2025)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
por: Wu, Jiaying, et al.
Publicado: (2025)
por: Wu, Jiaying, et al.
Publicado: (2025)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Towards Training-free Multimodal Hate Localisation with Large Language Models
por: Sun, Yueming, et al.
Publicado: (2026)
por: Sun, Yueming, et al.
Publicado: (2026)
HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs
por: Zhang, Zijian, et al.
Publicado: (2025)
por: Zhang, Zijian, et al.
Publicado: (2025)
Improving Adversarial Transferability of Vision-Language Pre-training Models through Collaborative Multimodal Interaction
por: Fu, Jiyuan, et al.
Publicado: (2024)
por: Fu, Jiyuan, et al.
Publicado: (2024)
DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
por: Yang, Wei, et al.
Publicado: (2025)
por: Yang, Wei, et al.
Publicado: (2025)
A Preprocessing Framework for Video Machine Vision under Compression
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
por: Xu, Shuolin, et al.
Publicado: (2025)
por: Xu, Shuolin, et al.
Publicado: (2025)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
por: He, Xin, et al.
Publicado: (2024)
por: He, Xin, et al.
Publicado: (2024)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
por: Zhan, Wengyi, et al.
Publicado: (2025)
por: Zhan, Wengyi, et al.
Publicado: (2025)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
por: Ma, Jingtian, et al.
Publicado: (2025)
por: Ma, Jingtian, et al.
Publicado: (2025)
Ejemplares similares
-
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024) -
Universal Adversarial Perturbations for Vision-Language Pre-trained Models
por: Zhang, Peng-Fei, et al.
Publicado: (2024) -
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
por: Zhang, Fengyi, et al.
Publicado: (2024) -
Mitigating Image Captioning Hallucinations in Vision-Language Models
por: Zhao, Fei, et al.
Publicado: (2025) -
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
por: Huang, Yuhang, et al.
Publicado: (2024)