From Evaluation to Defense: Advancing Safety in Video Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Yiwei, Jiang, Peiqi, Liu, Chuanbin, Lin, Luohao, Lu, Zhiying, Xie, Hongtao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
von: Li, Yinglu, et al.
Veröffentlicht: (2025)
von: Li, Yinglu, et al.
Veröffentlicht: (2025)
Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding
von: Pu, Bowei, et al.
Veröffentlicht: (2025)
von: Pu, Bowei, et al.
Veröffentlicht: (2025)
Hallucination Mitigation Prompts Long-term Video Understanding
von: Sun, Yiwei, et al.
Veröffentlicht: (2024)
von: Sun, Yiwei, et al.
Veröffentlicht: (2024)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
von: Zhang, Zefan, et al.
Veröffentlicht: (2026)
von: Zhang, Zefan, et al.
Veröffentlicht: (2026)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
von: Yuan, Liping, et al.
Veröffentlicht: (2025)
von: Yuan, Liping, et al.
Veröffentlicht: (2025)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
von: Pang, Cong, et al.
Veröffentlicht: (2025)
von: Pang, Cong, et al.
Veröffentlicht: (2025)
Advancing Content Moderation: Evaluating Large Language Models for Detecting Sensitive Content Across Text, Images, and Videos
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2024)
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2024)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
von: Ge, Qihang, et al.
Veröffentlicht: (2024)
von: Ge, Qihang, et al.
Veröffentlicht: (2024)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
von: Wang, Yixu, et al.
Veröffentlicht: (2025)
von: Wang, Yixu, et al.
Veröffentlicht: (2025)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
von: Ma, Yiwei, et al.
Veröffentlicht: (2024)
von: Ma, Yiwei, et al.
Veröffentlicht: (2024)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
von: Zou, Heqing, et al.
Veröffentlicht: (2024)
von: Zou, Heqing, et al.
Veröffentlicht: (2024)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
von: Deng, Ziye, et al.
Veröffentlicht: (2025)
von: Deng, Ziye, et al.
Veröffentlicht: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering
von: Gao, Yifan, et al.
Veröffentlicht: (2025)
von: Gao, Yifan, et al.
Veröffentlicht: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
von: Ye, Mang, et al.
Veröffentlicht: (2025)
von: Ye, Mang, et al.
Veröffentlicht: (2025)
T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
VideoPoet: A Large Language Model for Zero-Shot Video Generation
von: Kondratyuk, Dan, et al.
Veröffentlicht: (2023)
von: Kondratyuk, Dan, et al.
Veröffentlicht: (2023)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
von: Li, Jianjian, et al.
Veröffentlicht: (2025)
von: Li, Jianjian, et al.
Veröffentlicht: (2025)
Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation
von: Xie, Jingjing, et al.
Veröffentlicht: (2024)
von: Xie, Jingjing, et al.
Veröffentlicht: (2024)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
von: Wang, Jiankang, et al.
Veröffentlicht: (2025)
von: Wang, Jiankang, et al.
Veröffentlicht: (2025)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
von: Zhao, Yunhan, et al.
Veröffentlicht: (2025)
von: Zhao, Yunhan, et al.
Veröffentlicht: (2025)
Adversarial Defense in Vision-Language Models: An Overview
von: Fu, Xiaowei, et al.
Veröffentlicht: (2026)
von: Fu, Xiaowei, et al.
Veröffentlicht: (2026)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
COLT: Enhancing Video Large Language Models with Continual Tool Usage
von: Liu, Yuyang, et al.
Veröffentlicht: (2025)
von: Liu, Yuyang, et al.
Veröffentlicht: (2025)
VideoPhy: Evaluating Physical Commonsense for Video Generation
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
von: Zeng, Xingchen, et al.
Veröffentlicht: (2024)
von: Zeng, Xingchen, et al.
Veröffentlicht: (2024)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
von: Li, Shicheng, et al.
Veröffentlicht: (2025)
von: Li, Shicheng, et al.
Veröffentlicht: (2025)
Navigating the Trade-off: A Synthesis of Defensive Strategies for Zero-Shot Adversarial Robustness in Vision-Language Models
von: Xu, Zane, et al.
Veröffentlicht: (2025)
von: Xu, Zane, et al.
Veröffentlicht: (2025)
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
von: Wang, Jiyuan, et al.
Veröffentlicht: (2026)
von: Wang, Jiyuan, et al.
Veröffentlicht: (2026)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
von: Patel, Alkesh, et al.
Veröffentlicht: (2025)
von: Patel, Alkesh, et al.
Veröffentlicht: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
von: Zhang, Enming, et al.
Veröffentlicht: (2025)
von: Zhang, Enming, et al.
Veröffentlicht: (2025)
RAU: Reference-based Anatomical Understanding with Vision Language Models
von: Li, Yiwei, et al.
Veröffentlicht: (2025)
von: Li, Yiwei, et al.
Veröffentlicht: (2025)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
von: Ren, Shuhuai, et al.
Veröffentlicht: (2023)
von: Ren, Shuhuai, et al.
Veröffentlicht: (2023)
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
von: Shen, Yichao, et al.
Veröffentlicht: (2025)
von: Shen, Yichao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
von: Li, Yinglu, et al.
Veröffentlicht: (2025) -
Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding
von: Pu, Bowei, et al.
Veröffentlicht: (2025) -
Hallucination Mitigation Prompts Long-term Video Understanding
von: Sun, Yiwei, et al.
Veröffentlicht: (2024) -
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
von: Liu, Zhihang, et al.
Veröffentlicht: (2025) -
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
von: Zhang, Zefan, et al.
Veröffentlicht: (2026)