Red Teaming Visual Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Mukai, Li, Lei, Yin, Yuwei, Ahmed, Masood, Liu, Zhenguang, Liu, Qi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models
par: Li, Mukai, et autres
Publié: (2024)
par: Li, Mukai, et autres
Publié: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
par: Zhang, Wenqiao, et autres
Publié: (2024)
par: Zhang, Wenqiao, et autres
Publié: (2024)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
par: Mazeika, Mantas, et autres
Publié: (2024)
par: Mazeika, Mantas, et autres
Publié: (2024)
VisualRWKV-HD and UHD: Advancing High-Resolution Processing for Visual Language Models
par: Li, Zihang, et autres
Publié: (2024)
par: Li, Zihang, et autres
Publié: (2024)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
par: Li, Shicheng, et autres
Publié: (2023)
par: Li, Shicheng, et autres
Publié: (2023)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
par: Zhao, Yiming, et autres
Publié: (2025)
par: Zhao, Yiming, et autres
Publié: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
par: Wang, Zhenhailong, et autres
Publié: (2024)
par: Wang, Zhenhailong, et autres
Publié: (2024)
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language Models
par: Tu, Shangqing, et autres
Publié: (2025)
par: Tu, Shangqing, et autres
Publié: (2025)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
par: Chen, Kesheng, et autres
Publié: (2026)
par: Chen, Kesheng, et autres
Publié: (2026)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
par: Liu, Daixian, et autres
Publié: (2026)
par: Liu, Daixian, et autres
Publié: (2026)
Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
Retrieval-based Disentangled Representation Learning with Natural Language Supervision
par: Zhou, Jiawei, et autres
Publié: (2022)
par: Zhou, Jiawei, et autres
Publié: (2022)
Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
par: Lai, Xin, et autres
Publié: (2025)
par: Lai, Xin, et autres
Publié: (2025)
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
par: Lin, Bin, et autres
Publié: (2025)
par: Lin, Bin, et autres
Publié: (2025)
MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models
par: Lin, Xiao, et autres
Publié: (2025)
par: Lin, Xiao, et autres
Publié: (2025)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
par: Li, Kailing, et autres
Publié: (2025)
par: Li, Kailing, et autres
Publié: (2025)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models
par: Liang, Yuhan, et autres
Publié: (2024)
par: Liang, Yuhan, et autres
Publié: (2024)
Lightweight and Production-Ready PDF Visual Element Parsing
par: Liu, Meizhu, et autres
Publié: (2026)
par: Liu, Meizhu, et autres
Publié: (2026)
Better Language Models Exhibit Higher Visual Alignment
par: Ruthardt, Jona, et autres
Publié: (2024)
par: Ruthardt, Jona, et autres
Publié: (2024)
Semantically-Prompted Language Models Improve Visual Descriptions
par: Ogezi, Michael, et autres
Publié: (2023)
par: Ogezi, Michael, et autres
Publié: (2023)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
Unbiased Visual Reasoning with Controlled Visual Inputs
par: Li, Zhaonan, et autres
Publié: (2025)
par: Li, Zhaonan, et autres
Publié: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
par: Zhao, Yi, et autres
Publié: (2024)
par: Zhao, Yi, et autres
Publié: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
par: Zhong, Yiwu, et autres
Publié: (2024)
par: Zhong, Yiwu, et autres
Publié: (2024)
Navigation with VLM framework: Towards Going to Any Language
par: Yin, Zecheng, et autres
Publié: (2024)
par: Yin, Zecheng, et autres
Publié: (2024)
The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge
par: Peng, Jinghan, et autres
Publié: (2025)
par: Peng, Jinghan, et autres
Publié: (2025)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
par: Liu, Zhihang, et autres
Publié: (2025)
par: Liu, Zhihang, et autres
Publié: (2025)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
par: Tartaglini, Alexa R., et autres
Publié: (2025)
par: Tartaglini, Alexa R., et autres
Publié: (2025)
Can Vision-Language Models Solve Visual Math Equations?
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
par: Sun, Qiushi, et autres
Publié: (2025)
par: Sun, Qiushi, et autres
Publié: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
par: Feng, Jie, et autres
Publié: (2025)
par: Feng, Jie, et autres
Publié: (2025)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
par: Zhang, Zhifang, et autres
Publié: (2024)
par: Zhang, Zhifang, et autres
Publié: (2024)
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
par: Li, You, et autres
Publié: (2025)
par: Li, You, et autres
Publié: (2025)
General Scene Adaptation for Vision-and-Language Navigation
par: Hong, Haodong, et autres
Publié: (2025)
par: Hong, Haodong, et autres
Publié: (2025)
Documents similaires
-
GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models
par: Li, Mukai, et autres
Publié: (2024) -
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
par: Zhang, Wenqiao, et autres
Publié: (2024) -
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
par: Mazeika, Mantas, et autres
Publié: (2024) -
VisualRWKV-HD and UHD: Advancing High-Resolution Processing for Visual Language Models
par: Li, Zihang, et autres
Publié: (2024) -
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
par: Li, Shicheng, et autres
Publié: (2023)