VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Shibo, Yang, Peipei, Liu, Yangyang, Chen, Yi, Zhu, Han, Zhang, Xuyao, Huang, Linlin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection
par: Zhu, Jiaqi, et autres
Publié: (2024)
par: Zhu, Jiaqi, et autres
Publié: (2024)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
par: Chao, Jianghan, et autres
Publié: (2025)
par: Chao, Jianghan, et autres
Publié: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
par: Zhang, Long, et autres
Publié: (2025)
par: Zhang, Long, et autres
Publié: (2025)
Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
par: Li, Jie, et autres
Publié: (2025)
par: Li, Jie, et autres
Publié: (2025)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024)
par: Yang, Shuyu, et autres
Publié: (2024)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
par: Miao, Bingchen, et autres
Publié: (2024)
par: Miao, Bingchen, et autres
Publié: (2024)
InstructHumans: Editing Animated 3D Human Textures with Instructions
par: Zhu, Jiayin, et autres
Publié: (2024)
par: Zhu, Jiayin, et autres
Publié: (2024)
The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM
par: Gao, Shibo, et autres
Publié: (2025)
par: Gao, Shibo, et autres
Publié: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
par: Zeng, Xiangyu, et autres
Publié: (2024)
par: Zeng, Xiangyu, et autres
Publié: (2024)
Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models
par: Liu, Yang, et autres
Publié: (2023)
par: Liu, Yang, et autres
Publié: (2023)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
par: Tan, Chaolei, et autres
Publié: (2024)
par: Tan, Chaolei, et autres
Publié: (2024)
Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding
par: Huang, Dawei, et autres
Publié: (2025)
par: Huang, Dawei, et autres
Publié: (2025)
Do Joint Audio-Video Generation Models Understand Physics?
par: Cui, Zijun, et autres
Publié: (2026)
par: Cui, Zijun, et autres
Publié: (2026)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
par: Zhang, Xueqiao, et autres
Publié: (2025)
par: Zhang, Xueqiao, et autres
Publié: (2025)
WaveMamba: Wavelet-Driven Mamba Fusion for RGB-Infrared Object Detection
par: Zhu, Haodong, et autres
Publié: (2025)
par: Zhu, Haodong, et autres
Publié: (2025)
Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
Advancing Grounded Multimodal Named Entity Recognition via LLM-Based Reformulation and Box-Based Segmentation
par: Li, Jinyuan, et autres
Publié: (2024)
par: Li, Jinyuan, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
par: Pramanick, Shraman, et autres
Publié: (2025)
par: Pramanick, Shraman, et autres
Publié: (2025)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
par: Qin, You, et autres
Publié: (2024)
par: Qin, You, et autres
Publié: (2024)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
Joint Flow And Feature Refinement Using Attention For Video Restoration
par: Merugu, Ranjith, et autres
Publié: (2025)
par: Merugu, Ranjith, et autres
Publié: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
par: Qu, Mengxue, et autres
Publié: (2024)
par: Qu, Mengxue, et autres
Publié: (2024)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
par: Zhou, Pengyuan, et autres
Publié: (2024)
par: Zhou, Pengyuan, et autres
Publié: (2024)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
par: Dai, Guangyu, et autres
Publié: (2025)
par: Dai, Guangyu, et autres
Publié: (2025)
Generative Frame Sampler for Long Video Understanding
par: Yao, Linli, et autres
Publié: (2025)
par: Yao, Linli, et autres
Publié: (2025)
Face Consistency Benchmark for GenAI Video
par: Podstawski, Michal, et autres
Publié: (2025)
par: Podstawski, Michal, et autres
Publié: (2025)
TAVGBench: Benchmarking Text to Audible-Video Generation
par: Mao, Yuxin, et autres
Publié: (2024)
par: Mao, Yuxin, et autres
Publié: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
par: Yin, Zhiyu, et autres
Publié: (2026)
par: Yin, Zhiyu, et autres
Publié: (2026)
Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning
par: Han, Zhiyuan, et autres
Publié: (2025)
par: Han, Zhiyuan, et autres
Publié: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
par: Li, Hebeizi, et autres
Publié: (2026)
par: Li, Hebeizi, et autres
Publié: (2026)
A Sleep Monitoring System Based on Audio, Video and Depth Information
par: Chen, Lyn Chao-ling, et autres
Publié: (2025)
par: Chen, Lyn Chao-ling, et autres
Publié: (2025)
Visual Grounding with Multi-modal Conditional Adaptation
par: Yao, Ruilin, et autres
Publié: (2024)
par: Yao, Ruilin, et autres
Publié: (2024)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
Documents similaires
-
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024) -
Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection
par: Zhu, Jiaqi, et autres
Publié: (2024) -
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
par: Chao, Jianghan, et autres
Publié: (2025) -
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025) -
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
par: Zhang, Long, et autres
Publié: (2025)