Instance-Aligned Captions for Explainable Video Anomaly Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Inpyo, Joo, Minjun, Kwon, Joonhyung, Jeon, Eunji, Lee, Jangwon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video Question Answering for People with Visual Impairments Using an Egocentric 360-Degree Camera
di: Song, Inpyo, et al.
Pubblicazione: (2024)
di: Song, Inpyo, et al.
Pubblicazione: (2024)
Anomaly Detection for People with Visual Impairments Using an Egocentric 360-Degree Camera
di: Song, Inpyo, et al.
Pubblicazione: (2024)
di: Song, Inpyo, et al.
Pubblicazione: (2024)
Bounding-Box Trajectories Matter for Video Anomaly Detection
di: Song, Inpyo, et al.
Pubblicazione: (2026)
di: Song, Inpyo, et al.
Pubblicazione: (2026)
Real-time Traffic Accident Anticipation with Feature Reuse
di: Song, Inpyo, et al.
Pubblicazione: (2025)
di: Song, Inpyo, et al.
Pubblicazione: (2025)
PawPrint: Whose Footprints Are These? Identifying Animal Individuals by Their Footprints
di: Song, Inpyo, et al.
Pubblicazione: (2025)
di: Song, Inpyo, et al.
Pubblicazione: (2025)
AnyAnomaly: Zero-Shot Customizable Video Anomaly Detection with LVLM
di: Ahn, Sunghyun, et al.
Pubblicazione: (2025)
di: Ahn, Sunghyun, et al.
Pubblicazione: (2025)
PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models
di: Song, Inpyo, et al.
Pubblicazione: (2025)
di: Song, Inpyo, et al.
Pubblicazione: (2025)
SFTrack: A Robust Scale and Motion Adaptive Algorithm for Tracking Small and Fast Moving Objects
di: Song, InPyo, et al.
Pubblicazione: (2024)
di: Song, InPyo, et al.
Pubblicazione: (2024)
Knowledge-Guided Textual Reasoning for Explainable Video Anomaly Detection via LLMs
di: Lee, Hari
Pubblicazione: (2025)
di: Lee, Hari
Pubblicazione: (2025)
DUAL-VAD: Dual Benchmarks and Anomaly-Focused Sampling for Video Anomaly Detection
di: Jung, Seoik, et al.
Pubblicazione: (2025)
di: Jung, Seoik, et al.
Pubblicazione: (2025)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
Habaek: High-performance water segmentation through dataset expansion and inductive bias optimization
di: Joo, Hanseon, et al.
Pubblicazione: (2024)
di: Joo, Hanseon, et al.
Pubblicazione: (2024)
LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection
di: Piehl, Mitchell, et al.
Pubblicazione: (2026)
di: Piehl, Mitchell, et al.
Pubblicazione: (2026)
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
A Lightweight Video Anomaly Detection Model with Weak Supervision and Adaptive Instance Selection
di: Wang, Yang, et al.
Pubblicazione: (2023)
di: Wang, Yang, et al.
Pubblicazione: (2023)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
di: Hu, Shiyu, et al.
Pubblicazione: (2024)
di: Hu, Shiyu, et al.
Pubblicazione: (2024)
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
di: Tang, Jiyang, et al.
Pubblicazione: (2025)
di: Tang, Jiyang, et al.
Pubblicazione: (2025)
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
di: Kim, Joowon, et al.
Pubblicazione: (2026)
di: Kim, Joowon, et al.
Pubblicazione: (2026)
ABM-LoRA: Activation Boundary Matching for Fast Convergence in Low-Rank Adaptation
di: Lee, Dongha, et al.
Pubblicazione: (2025)
di: Lee, Dongha, et al.
Pubblicazione: (2025)
Continuous Memory Representation for Anomaly Detection
di: Lee, Joo Chan, et al.
Pubblicazione: (2024)
di: Lee, Joo Chan, et al.
Pubblicazione: (2024)
OW-Rep: Open World Object Detection with Instance Representation Learning
di: Lee, Sunoh, et al.
Pubblicazione: (2024)
di: Lee, Sunoh, et al.
Pubblicazione: (2024)
OoDIS: Anomaly Instance Segmentation and Detection Benchmark
di: Nekrasov, Alexey, et al.
Pubblicazione: (2024)
di: Nekrasov, Alexey, et al.
Pubblicazione: (2024)
Leveraging Multimodal LLM Descriptions of Activity for Explainable Semi-Supervised Video Anomaly Detection
di: Mumcu, Furkan, et al.
Pubblicazione: (2025)
di: Mumcu, Furkan, et al.
Pubblicazione: (2025)
A Decoding Scheme with Successive Aggregation of Multi-Level Features for Light-Weight Semantic Segmentation
di: Yoo, Jiwon, et al.
Pubblicazione: (2024)
di: Yoo, Jiwon, et al.
Pubblicazione: (2024)
GLaVE-Cap: Global-Local Aligned Video Captioning with Vision Expert Integration
di: Xu, Wan, et al.
Pubblicazione: (2025)
di: Xu, Wan, et al.
Pubblicazione: (2025)
VISAGE: Video Instance Segmentation with Appearance-Guided Enhancement
di: Kim, Hanjung, et al.
Pubblicazione: (2023)
di: Kim, Hanjung, et al.
Pubblicazione: (2023)
Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models
di: Jung, Mingi, et al.
Pubblicazione: (2025)
di: Jung, Mingi, et al.
Pubblicazione: (2025)
VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree
di: Li, Wenlong, et al.
Pubblicazione: (2025)
di: Li, Wenlong, et al.
Pubblicazione: (2025)
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
Aligning Effective Tokens with Video Anomaly in Large Language Models
di: Chen, Yingxian, et al.
Pubblicazione: (2025)
di: Chen, Yingxian, et al.
Pubblicazione: (2025)
OW-VISCapTor: Abstractors for Open-World Video Instance Segmentation and Captioning
di: Choudhuri, Anwesa, et al.
Pubblicazione: (2024)
di: Choudhuri, Anwesa, et al.
Pubblicazione: (2024)
Cross Pseudo Labeling For Weakly Supervised Video Anomaly Detection
di: Lee, Dayeon, et al.
Pubblicazione: (2026)
di: Lee, Dayeon, et al.
Pubblicazione: (2026)
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
Drag4D: Align Your Motion with Text-Driven 3D Scene Generation
di: Kang, Minjun, et al.
Pubblicazione: (2025)
di: Kang, Minjun, et al.
Pubblicazione: (2025)
Explainable Deep Convolutional Multi-Type Anomaly Detection
di: George, Alex, et al.
Pubblicazione: (2025)
di: George, Alex, et al.
Pubblicazione: (2025)
VideoPatchCore: An Effective Method to Memorize Normality for Video Anomaly Detection
di: Ahn, Sunghyun, et al.
Pubblicazione: (2024)
di: Ahn, Sunghyun, et al.
Pubblicazione: (2024)
Live Video Captioning
di: Blanco-Fernández, Eduardo, et al.
Pubblicazione: (2024)
di: Blanco-Fernández, Eduardo, et al.
Pubblicazione: (2024)
Injecting Explainability and Lightweight Design into Weakly Supervised Video Anomaly Detection Systems
di: Jiang, Wen-Dong, et al.
Pubblicazione: (2024)
di: Jiang, Wen-Dong, et al.
Pubblicazione: (2024)
When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
di: Sun, Zhengyang, et al.
Pubblicazione: (2026)
di: Sun, Zhengyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Video Question Answering for People with Visual Impairments Using an Egocentric 360-Degree Camera
di: Song, Inpyo, et al.
Pubblicazione: (2024) -
Anomaly Detection for People with Visual Impairments Using an Egocentric 360-Degree Camera
di: Song, Inpyo, et al.
Pubblicazione: (2024) -
Bounding-Box Trajectories Matter for Video Anomaly Detection
di: Song, Inpyo, et al.
Pubblicazione: (2026) -
Real-time Traffic Accident Anticipation with Feature Reuse
di: Song, Inpyo, et al.
Pubblicazione: (2025) -
PawPrint: Whose Footprints Are These? Identifying Animal Individuals by Their Footprints
di: Song, Inpyo, et al.
Pubblicazione: (2025)