ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zihao, Wu, Xiaoyu, Li, Wenna, Wu, Jianqin, Yang, Linlin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language-guided Open-world Video Anomaly Detection under Weak Supervision
por: Liu, Zihao, et al.
Publicado: (2025)
por: Liu, Zihao, et al.
Publicado: (2025)
Rethinking Metrics and Benchmarks of Video Anomaly Detection
por: Liu, Zihao, et al.
Publicado: (2025)
por: Liu, Zihao, et al.
Publicado: (2025)
MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding
por: Zhu, Zhiyi, et al.
Publicado: (2025)
por: Zhu, Zhiyi, et al.
Publicado: (2025)
Hawk: Learning to Understand Open-World Video Anomalies
por: Tang, Jiaqi, et al.
Publicado: (2024)
por: Tang, Jiaqi, et al.
Publicado: (2024)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
por: Lin, Junming, et al.
Publicado: (2024)
por: Lin, Junming, et al.
Publicado: (2024)
An Efficient Streaming Video Understanding Framework with Agentic Control
por: Liu, Jinming, et al.
Publicado: (2026)
por: Liu, Jinming, et al.
Publicado: (2026)
Open-Vocabulary Video Anomaly Detection
por: Wu, Peng, et al.
Publicado: (2023)
por: Wu, Peng, et al.
Publicado: (2023)
Learning Prompt-Enhanced Context Features for Weakly-Supervised Video Anomaly Detection
por: Pu, Yujiang, et al.
Publicado: (2023)
por: Pu, Yujiang, et al.
Publicado: (2023)
CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering
por: Jiang, Yuanyuan, et al.
Publicado: (2024)
por: Jiang, Yuanyuan, et al.
Publicado: (2024)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
por: Gao, Shibo, et al.
Publicado: (2025)
por: Gao, Shibo, et al.
Publicado: (2025)
SVL: Spike-based Vision-language Pretraining for Efficient 3D Open-world Understanding
por: Qiu, Xuerui, et al.
Publicado: (2025)
por: Qiu, Xuerui, et al.
Publicado: (2025)
SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning
por: Zhao, Zihao, et al.
Publicado: (2026)
por: Zhao, Zihao, et al.
Publicado: (2026)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
por: Wang, Junxi, et al.
Publicado: (2026)
por: Wang, Junxi, et al.
Publicado: (2026)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
por: Kang, Hyolim, et al.
Publicado: (2025)
por: Kang, Hyolim, et al.
Publicado: (2025)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
por: Zeng, Xiangyu, et al.
Publicado: (2025)
por: Zeng, Xiangyu, et al.
Publicado: (2025)
VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers
por: Li, Ruanjun, et al.
Publicado: (2025)
por: Li, Ruanjun, et al.
Publicado: (2025)
Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
por: Zhang, Yulin, et al.
Publicado: (2025)
por: Zhang, Yulin, et al.
Publicado: (2025)
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
por: Yang, Zhenyu, et al.
Publicado: (2025)
por: Yang, Zhenyu, et al.
Publicado: (2025)
CueBench: Advancing Unified Understanding of Context-Aware Video Anomalies in Real-World
por: Yu, Yating, et al.
Publicado: (2025)
por: Yu, Yating, et al.
Publicado: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
por: Chen, Xueyi, et al.
Publicado: (2025)
por: Chen, Xueyi, et al.
Publicado: (2025)
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
por: Wang, Yifei, et al.
Publicado: (2025)
por: Wang, Yifei, et al.
Publicado: (2025)
EA3D: Online Open-World 3D Object Extraction from Streaming Videos
por: Zhou, Xiaoyu, et al.
Publicado: (2025)
por: Zhou, Xiaoyu, et al.
Publicado: (2025)
X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding
por: Sun, Peiwen, et al.
Publicado: (2026)
por: Sun, Peiwen, et al.
Publicado: (2026)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
por: Yang, Haolin, et al.
Publicado: (2025)
por: Yang, Haolin, et al.
Publicado: (2025)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
por: Liu, Ye, et al.
Publicado: (2024)
por: Liu, Ye, et al.
Publicado: (2024)
LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval
por: Ning, Zhenyu, et al.
Publicado: (2025)
por: Ning, Zhenyu, et al.
Publicado: (2025)
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
por: Wu, Peng, et al.
Publicado: (2026)
por: Wu, Peng, et al.
Publicado: (2026)
Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly Detection
por: Yang, Zhiwei, et al.
Publicado: (2024)
por: Yang, Zhiwei, et al.
Publicado: (2024)
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
por: Lu, Xudong, et al.
Publicado: (2026)
por: Lu, Xudong, et al.
Publicado: (2026)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
por: Xie, Ming, et al.
Publicado: (2026)
por: Xie, Ming, et al.
Publicado: (2026)
Anomize: Better Open Vocabulary Video Anomaly Detection
por: Li, Fei, et al.
Publicado: (2025)
por: Li, Fei, et al.
Publicado: (2025)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
por: Chen, Feng, et al.
Publicado: (2024)
por: Chen, Feng, et al.
Publicado: (2024)
The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos
por: Wu, Zhuoyuan, et al.
Publicado: (2025)
por: Wu, Zhuoyuan, et al.
Publicado: (2025)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
por: Wu, Hang, et al.
Publicado: (2026)
por: Wu, Hang, et al.
Publicado: (2026)
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
por: Wu, Peiran, et al.
Publicado: (2025)
por: Wu, Peiran, et al.
Publicado: (2025)
O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding
por: Wu, Peiran, et al.
Publicado: (2026)
por: Wu, Peiran, et al.
Publicado: (2026)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
por: Patel, Shrenik, et al.
Publicado: (2025)
por: Patel, Shrenik, et al.
Publicado: (2025)
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
por: Luo, Yawen, et al.
Publicado: (2026)
por: Luo, Yawen, et al.
Publicado: (2026)
Ejemplares similares
-
Language-guided Open-world Video Anomaly Detection under Weak Supervision
por: Liu, Zihao, et al.
Publicado: (2025) -
Rethinking Metrics and Benchmarks of Video Anomaly Detection
por: Liu, Zihao, et al.
Publicado: (2025) -
MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding
por: Zhu, Zhiyi, et al.
Publicado: (2025) -
Hawk: Learning to Understand Open-World Video Anomalies
por: Tang, Jiaqi, et al.
Publicado: (2024) -
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
por: Lin, Junming, et al.
Publicado: (2024)