VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
Fuente:
arXiv
Guardado en:
| Autores principales: | Meng, Jiahao, Yue, Tan, Xu, Qi, Wang, Haochen, Ren, Zhongwei, Liu, Weisong, Wang, Yuhao, Zhang, Renrui, Tong, Yunhai, Duan, Haodong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
por: Xu, Zhaoyang, et al.
Publicado: (2026)
por: Xu, Zhaoyang, et al.
Publicado: (2026)
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
por: Wang, Dali, et al.
Publicado: (2026)
por: Wang, Dali, et al.
Publicado: (2026)
Semantic-Guided Unsupervised Video Summarization
por: Liu, Haizhou, et al.
Publicado: (2026)
por: Liu, Haizhou, et al.
Publicado: (2026)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
por: Tong, Xinyi, et al.
Publicado: (2025)
por: Tong, Xinyi, et al.
Publicado: (2025)
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production
por: Hu, Huanran, et al.
Publicado: (2026)
por: Hu, Huanran, et al.
Publicado: (2026)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
por: Fang, Xinyu, et al.
Publicado: (2024)
por: Fang, Xinyu, et al.
Publicado: (2024)
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
por: Jin, Yili, et al.
Publicado: (2024)
por: Jin, Yili, et al.
Publicado: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
por: Zhang, Juan, et al.
Publicado: (2024)
por: Zhang, Juan, et al.
Publicado: (2024)
Integrated Semantic and Temporal Alignment for Interactive Video Retrieval
por: Luu, Thanh-Danh, et al.
Publicado: (2025)
por: Luu, Thanh-Danh, et al.
Publicado: (2025)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
por: Zhang, Zhongwei, et al.
Publicado: (2024)
por: Zhang, Zhongwei, et al.
Publicado: (2024)
Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
por: Yang, Dingyi, et al.
Publicado: (2024)
por: Yang, Dingyi, et al.
Publicado: (2024)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
por: Xu, Pengju, et al.
Publicado: (2025)
por: Xu, Pengju, et al.
Publicado: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
Exposure Completing for Temporally Consistent Neural High Dynamic Range Video Rendering
por: Cui, Jiahao, et al.
Publicado: (2024)
por: Cui, Jiahao, et al.
Publicado: (2024)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
por: Fang, Pengcheng, et al.
Publicado: (2026)
por: Fang, Pengcheng, et al.
Publicado: (2026)
Retrieval Augmented Verification for Zero-Shot Detection of Multimodal Disinformation
por: Dey, Arka Ujjal, et al.
Publicado: (2024)
por: Dey, Arka Ujjal, et al.
Publicado: (2024)
Music Grounding by Short Video
por: Xin, Zijie, et al.
Publicado: (2024)
por: Xin, Zijie, et al.
Publicado: (2024)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
por: Tong, Haonan, et al.
Publicado: (2024)
por: Tong, Haonan, et al.
Publicado: (2024)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
por: Wang, Feng, et al.
Publicado: (2024)
por: Wang, Feng, et al.
Publicado: (2024)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
por: Li, Xiaolou, et al.
Publicado: (2024)
por: Li, Xiaolou, et al.
Publicado: (2024)
Loss-resilient Coding of Texture and Depth for Free-viewpoint Video Conferencing
por: Macchiavello, Bruno, et al.
Publicado: (2013)
por: Macchiavello, Bruno, et al.
Publicado: (2013)
StreamOptix: A Cross-layer Adaptive Video Delivery Scheme
por: Liu, Mufan, et al.
Publicado: (2024)
por: Liu, Mufan, et al.
Publicado: (2024)
Stepwise Schema-Guided Prompting Framework with Parameter Efficient Instruction Tuning for Multimedia Event Extraction
por: Yuan, Xiang, et al.
Publicado: (2025)
por: Yuan, Xiang, et al.
Publicado: (2025)
Region-Constraint In-Context Generation for Instructional Video Editing
por: Zhang, Zhongwei, et al.
Publicado: (2025)
por: Zhang, Zhongwei, et al.
Publicado: (2025)
Compression Metadata-assisted RoI Extraction and Adaptive Inference for Efficient Video Analytics
por: Wang, Chengzhi, et al.
Publicado: (2025)
por: Wang, Chengzhi, et al.
Publicado: (2025)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
por: Ren, Yong, et al.
Publicado: (2024)
por: Ren, Yong, et al.
Publicado: (2024)
CLIPRerank: An Extremely Simple Method for Improving Ad-hoc Video Search
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
Interactive $360^{\circ}$ Video Streaming Using FoV-Adaptive Coding with Temporal Prediction
por: Mao, Yixiang, et al.
Publicado: (2024)
por: Mao, Yixiang, et al.
Publicado: (2024)
Cap2Sum: Learning to Summarize Videos by Generating Captions
por: Zhao, Cairong, et al.
Publicado: (2024)
por: Zhao, Cairong, et al.
Publicado: (2024)
E-FreeM2: Efficient Training-Free Multi-Scale and Cross-Modal News Verification via MLLMs
por: Phan, Van-Hoang, et al.
Publicado: (2025)
por: Phan, Van-Hoang, et al.
Publicado: (2025)
ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing
por: Wang, Yisu, et al.
Publicado: (2025)
por: Wang, Yisu, et al.
Publicado: (2025)
Multi-modal and Metadata Capture Model for Micro Video Popularity Prediction
por: Lu, Jiacheng, et al.
Publicado: (2025)
por: Lu, Jiacheng, et al.
Publicado: (2025)
Advanced Learning-Based Inter Prediction for Future Video Coding
por: Zhao, Yanchen, et al.
Publicado: (2024)
por: Zhao, Yanchen, et al.
Publicado: (2024)
Hallucination Localization in Video Captioning
por: Nakada, Shota, et al.
Publicado: (2025)
por: Nakada, Shota, et al.
Publicado: (2025)
SVD: Spatial Video Dataset
por: Izadimehr, M. H., et al.
Publicado: (2025)
por: Izadimehr, M. H., et al.
Publicado: (2025)
Consistency-aware Fake Videos Detection on Short Video Platforms
por: Wang, Junxi, et al.
Publicado: (2025)
por: Wang, Junxi, et al.
Publicado: (2025)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
por: Zhang, Zhongwei, et al.
Publicado: (2025)
por: Zhang, Zhongwei, et al.
Publicado: (2025)
Ejemplares similares
-
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025) -
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
por: Xu, Zhaoyang, et al.
Publicado: (2026) -
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
por: Wang, Dali, et al.
Publicado: (2026) -
Semantic-Guided Unsupervised Video Summarization
por: Liu, Haizhou, et al.
Publicado: (2026) -
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
por: Tong, Xinyi, et al.
Publicado: (2025)