Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Shuyu, Wang, Yilun, Wang, Yaxiong, Zhu, Li, Zheng, Zhedong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024)
par: Yang, Shuyu, et autres
Publié: (2024)
Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval
par: Yang, Shuyu, et autres
Publié: (2025)
par: Yang, Shuyu, et autres
Publié: (2025)
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
par: Liu, Lingyu, et autres
Publié: (2026)
par: Liu, Lingyu, et autres
Publié: (2026)
AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search
par: Ju, Hao, et autres
Publié: (2025)
par: Ju, Hao, et autres
Publié: (2025)
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
par: Liu, Lingyu, et autres
Publié: (2025)
par: Liu, Lingyu, et autres
Publié: (2025)
Scale Up Composed Image Retrieval Learning via Modification Text Generation
par: Zhou, Yinan, et autres
Publié: (2025)
par: Zhou, Yinan, et autres
Publié: (2025)
Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model
par: Wu, Peng, et autres
Publié: (2023)
par: Wu, Peng, et autres
Publié: (2023)
Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search
par: Zhang, Jiahao, et autres
Publié: (2026)
par: Zhang, Jiahao, et autres
Publié: (2026)
Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos
par: Zhao, Zecheng, et autres
Publié: (2025)
par: Zhao, Zecheng, et autres
Publié: (2025)
Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
par: Li, Jie, et autres
Publié: (2025)
par: Li, Jie, et autres
Publié: (2025)
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
par: Liu, Lingyu, et autres
Publié: (2026)
par: Liu, Lingyu, et autres
Publié: (2026)
Video2BEV: Transforming Drone Videos to BEVs for Video-based Geo-localization
par: Ju, Hao, et autres
Publié: (2024)
par: Ju, Hao, et autres
Publié: (2024)
POS: A Prompts Optimization Suite for Augmenting Text-to-Video Generation
par: Ma, Shijie, et autres
Publié: (2023)
par: Ma, Shijie, et autres
Publié: (2023)
The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts
par: Zhang, Yuchen, et autres
Publié: (2025)
par: Zhang, Yuchen, et autres
Publié: (2025)
MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
par: Huang, Jinghao, et autres
Publié: (2025)
par: Huang, Jinghao, et autres
Publié: (2025)
TIGeR: Text-Instructed Generation and Refinement for Template-Free Hand-Object Interaction
par: Huang, Yiyao, et autres
Publié: (2025)
par: Huang, Yiyao, et autres
Publié: (2025)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
par: Wang, Chenting, et autres
Publié: (2025)
par: Wang, Chenting, et autres
Publié: (2025)
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
par: Yang, Xiangpeng, et autres
Publié: (2024)
par: Yang, Xiangpeng, et autres
Publié: (2024)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
par: Chu, Meng, et autres
Publié: (2023)
par: Chu, Meng, et autres
Publié: (2023)
TVPR: Text-to-Video Person Retrieval and a New Benchmark
par: Zhang, Xu, et autres
Publié: (2023)
par: Zhang, Xu, et autres
Publié: (2023)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
par: Zhao, Zijia, et autres
Publié: (2024)
par: Zhao, Zijia, et autres
Publié: (2024)
Consistency-aware Fake Videos Detection on Short Video Platforms
par: Wang, Junxi, et autres
Publié: (2025)
par: Wang, Junxi, et autres
Publié: (2025)
Text-guided Fine-Grained Video Anomaly Understanding
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
par: Zhang, Yuchen, et autres
Publié: (2026)
par: Zhang, Yuchen, et autres
Publié: (2026)
Rethinking Metrics and Benchmarks of Video Anomaly Detection
par: Liu, Zihao, et autres
Publié: (2025)
par: Liu, Zihao, et autres
Publié: (2025)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
par: Liu, Weijia, et autres
Publié: (2025)
par: Liu, Weijia, et autres
Publié: (2025)
Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations
par: Zhang, Xu, et autres
Publié: (2023)
par: Zhang, Xu, et autres
Publié: (2023)
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
par: Wu, Peng, et autres
Publié: (2026)
par: Wu, Peng, et autres
Publié: (2026)
VideoTetris: Towards Compositional Text-to-Video Generation
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
par: Liu, Yunze, et autres
Publié: (2025)
par: Liu, Yunze, et autres
Publié: (2025)
Adversarial Video Promotion Against Text-to-Video Retrieval
par: Tian, Qiwei, et autres
Publié: (2025)
par: Tian, Qiwei, et autres
Publié: (2025)
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
par: Wang, Jiamian, et autres
Publié: (2024)
par: Wang, Jiamian, et autres
Publié: (2024)
Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline
par: Lian, Jingchun, et autres
Publié: (2024)
par: Lian, Jingchun, et autres
Publié: (2024)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
par: Yang, Zhoufaran, et autres
Publié: (2025)
par: Yang, Zhoufaran, et autres
Publié: (2025)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
par: Zhou, Jun, et autres
Publié: (2026)
par: Zhou, Jun, et autres
Publié: (2026)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
par: Jin, Xiaojie, et autres
Publié: (2023)
par: Jin, Xiaojie, et autres
Publié: (2023)
PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
par: Yang, Zhiwei, et autres
Publié: (2025)
par: Yang, Zhiwei, et autres
Publié: (2025)
Video Text Preservation with Synthetic Text-Rich Videos
par: Liu, Ziyang, et autres
Publié: (2025)
par: Liu, Ziyang, et autres
Publié: (2025)
Documents similaires
-
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024) -
Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval
par: Yang, Shuyu, et autres
Publié: (2025) -
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
par: Liu, Lingyu, et autres
Publié: (2026) -
AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search
par: Ju, Hao, et autres
Publié: (2025) -
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
par: Liu, Lingyu, et autres
Publié: (2025)