ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Hongbo, He, Jingwen, Jin, Yi, Zheng, Dian, Dong, Yuhao, Zhang, Fan, Huang, Ziqi, He, Yinan, Li, Yangguang, Chen, Weichao, Qiao, Yu, Ouyang, Wanli, Zhao, Shengjie, Liu, Ziwei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cut2Next: Generating Next Shot via In-Context Tuning
by: He, Jingwen, et al.
Published: (2025)
by: He, Jingwen, et al.
Published: (2025)
Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
by: Zou, Kai, et al.
Published: (2025)
by: Zou, Kai, et al.
Published: (2025)
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
by: Zheng, Dian, et al.
Published: (2025)
by: Zheng, Dian, et al.
Published: (2025)
CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
by: Qiu, Haonan, et al.
Published: (2025)
by: Qiu, Haonan, et al.
Published: (2025)
VEnhancer: Generative Space-Time Enhancement for Video Generation
by: He, Jingwen, et al.
Published: (2024)
by: He, Jingwen, et al.
Published: (2024)
PredBench: Benchmarking Spatio-Temporal Prediction across Diverse Disciplines
by: Wang, ZiDong, et al.
Published: (2024)
by: Wang, ZiDong, et al.
Published: (2024)
ShapeGen: Towards High-Quality 3D Shape Synthesis
by: Li, Yangguang, et al.
Published: (2025)
by: Li, Yangguang, et al.
Published: (2025)
MeshCraft: Exploring Efficient and Controllable Mesh Generation with Flow-based DiTs
by: He, Xianglong, et al.
Published: (2025)
by: He, Xianglong, et al.
Published: (2025)
TennisExpert: Towards Expert-Level Analytical Sports Video Understanding
by: Liu, Zhaoyu, et al.
Published: (2026)
by: Liu, Zhaoyu, et al.
Published: (2026)
Advances in GRPO for Generation Models: A Survey
by: Liu, Zexiang, et al.
Published: (2026)
by: Liu, Zexiang, et al.
Published: (2026)
DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior
by: Lin, Xinqi, et al.
Published: (2023)
by: Lin, Xinqi, et al.
Published: (2023)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
by: Zhang, Fan, et al.
Published: (2024)
by: Zhang, Fan, et al.
Published: (2024)
GVGEN: Text-to-3D Generation with Volumetric Representation
by: He, Xianglong, et al.
Published: (2024)
by: He, Xianglong, et al.
Published: (2024)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
by: Li, Haitian, et al.
Published: (2026)
by: Li, Haitian, et al.
Published: (2026)
Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution
by: Liu, Zuyan, et al.
Published: (2024)
by: Liu, Zuyan, et al.
Published: (2024)
HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
by: Meng, Yihao, et al.
Published: (2025)
by: Meng, Yihao, et al.
Published: (2025)
MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation
by: Xing, Jinbo, et al.
Published: (2025)
by: Xing, Jinbo, et al.
Published: (2025)
GROVER: Graph-guided Representation of Omics and Vision with Expert Regulation for Adaptive Spatial Multi-omics Fusion
by: Xiao, Yongjun, et al.
Published: (2025)
by: Xiao, Yongjun, et al.
Published: (2025)
EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding
by: Zou, Kai, et al.
Published: (2026)
by: Zou, Kai, et al.
Published: (2026)
Point Transformer V3 Extreme: 1st Place Solution for 2024 Waymo Open Dataset Challenge in Semantic Segmentation
by: Wu, Xiaoyang, et al.
Published: (2024)
by: Wu, Xiaoyang, et al.
Published: (2024)
Flow-GRPO: Training Flow Matching Models via Online RL
by: Liu, Jie, et al.
Published: (2025)
by: Liu, Jie, et al.
Published: (2025)
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
by: Yang, Songlin, et al.
Published: (2026)
by: Yang, Songlin, et al.
Published: (2026)
CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
by: Guo, Jiacheng, et al.
Published: (2025)
by: Guo, Jiacheng, et al.
Published: (2025)
RepVideo: Rethinking Cross-Layer Representation for Video Generation
by: Si, Chenyang, et al.
Published: (2025)
by: Si, Chenyang, et al.
Published: (2025)
VisionNVS: Self-Supervised Inpainting for Novel View Synthesis under the Virtual-Shift Paradigm
by: Lu, Hongbo, et al.
Published: (2026)
by: Lu, Hongbo, et al.
Published: (2026)
FreqMoE: Enhancing Time Series Forecasting through Frequency Decomposition Mixture of Experts
by: Liu, Ziqi
Published: (2025)
by: Liu, Ziqi
Published: (2025)
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
by: Zhang, Yuanhan, et al.
Published: (2025)
by: Zhang, Yuanhan, et al.
Published: (2025)
Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models
by: Fan, Weichen, et al.
Published: (2025)
by: Fan, Weichen, et al.
Published: (2025)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
by: Zhou, Zhanhui, et al.
Published: (2024)
by: Zhou, Zhanhui, et al.
Published: (2024)
The discussions on the universal relation between corrections to entropy and the extremality of Schwarzschild-de Sitter black holes under the GUP and EUP
by: Cheng, Hongbo, et al.
Published: (2025)
by: Cheng, Hongbo, et al.
Published: (2025)
The thermodynamic stability and phase structure of the Einstein-Euler-Heisenberg-AdS black holes
by: Zhao, Yinan, et al.
Published: (2025)
by: Zhao, Yinan, et al.
Published: (2025)
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
by: Yu, Haorui, et al.
Published: (2026)
by: Yu, Haorui, et al.
Published: (2026)
Adapter-X: A Novel General Parameter-Efficient Fine-Tuning Framework for Vision
by: Li, Minglei, et al.
Published: (2024)
by: Li, Minglei, et al.
Published: (2024)
Cinematic Rendering of Pure Arterial Malformations
by: Linggen Dong, et al.
Published: (2024)
by: Linggen Dong, et al.
Published: (2024)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
by: Liu, Qing'an, et al.
Published: (2026)
by: Liu, Qing'an, et al.
Published: (2026)
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
by: Zhang, Haojie, et al.
Published: (2026)
by: Zhang, Haojie, et al.
Published: (2026)
Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing
by: Yang, Minglai, et al.
Published: (2026)
by: Yang, Minglai, et al.
Published: (2026)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
by: Bai, Ge, et al.
Published: (2024)
by: Bai, Ge, et al.
Published: (2024)
TabAttackBench: A Benchmark for Adversarial Attacks on Tabular Data
by: He, Zhipeng, et al.
Published: (2025)
by: He, Zhipeng, et al.
Published: (2025)
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
by: Yang, Songlin, et al.
Published: (2026)
by: Yang, Songlin, et al.
Published: (2026)
Similar Items
-
Cut2Next: Generating Next Shot via In-Context Tuning
by: He, Jingwen, et al.
Published: (2025) -
Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
by: Zou, Kai, et al.
Published: (2025) -
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
by: Zheng, Dian, et al.
Published: (2025) -
CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
by: Qiu, Haonan, et al.
Published: (2025) -
VEnhancer: Generative Space-Time Enhancement for Video Generation
by: He, Jingwen, et al.
Published: (2024)