EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Songlin, Zhong, Haobin, Zhang, Ruilin, Zhao, Xiaotong, Li, Shuai, Zheng, Kai, Yang, Xuyi, Wang, Zhe, Tang, Zhenchen, Li, Yang, Gu, Bohai, Peng, Zhengwei, Huang, Yidan, Luo, Mengzhou, Bo, Yihang, Feng, Dalu, Zhang, Yujia, Ma, Juntao, Wang, Ruiqi, Zhang, Lvmin, Guo, Yuwei, Guan, Frank, Agrawala, Maneesh, Fu, Hongbo, Zhao, Alan, Rao, Anyi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
Transparent Image Layer Diffusion using Latent Transparency
par: Zhang, Lvmin, et autres
Publié: (2024)
par: Zhang, Lvmin, et autres
Publié: (2024)
View-oriented Conversation Compiler for Agent Trace Analysis
par: Zhang, Lvmin, et autres
Publié: (2026)
par: Zhang, Lvmin, et autres
Publié: (2026)
Taming Flow-based I2V Models for Creative Video Editing
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
par: Zhang, Lvmin, et autres
Publié: (2025)
par: Zhang, Lvmin, et autres
Publié: (2025)
Instance Segmentation of Scene Sketches Using Natural Image Priors
par: Tang, Mia, et autres
Publié: (2025)
par: Tang, Mia, et autres
Publié: (2025)
ScriptViz: A Visualization Tool to Aid Scriptwriting based on a Large Movie Database
par: Rao, Anyi, et autres
Publié: (2024)
par: Rao, Anyi, et autres
Publié: (2024)
CineVision: An Interactive Pre-visualization Storyboard System for Director-Cinematographer Collaboration
par: Wei, Zheng, et autres
Publié: (2025)
par: Wei, Zheng, et autres
Publié: (2025)
Pretraining Frame Preservation for Lightweight Autoregressive Video History Embedding
par: Zhang, Lvmin, et autres
Publié: (2025)
par: Zhang, Lvmin, et autres
Publié: (2025)
Captain Cinema: Towards Short Movie Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
HandEval: Taking the First Step Towards Hand Quality Evaluation in Generated Images
par: Wang, Zichuan, et autres
Publié: (2025)
par: Wang, Zichuan, et autres
Publié: (2025)
MoVer: Motion Verification for Motion Graphics Animations
par: Ma, Jiaju, et autres
Publié: (2025)
par: Ma, Jiaju, et autres
Publié: (2025)
Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation
par: Li, Xingyang, et autres
Publié: (2025)
par: Li, Xingyang, et autres
Publié: (2025)
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025)
par: Cai, Shengqu, et autres
Publié: (2025)
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
par: Guo, Yuwei, et autres
Publié: (2023)
par: Guo, Yuwei, et autres
Publié: (2023)
CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition
par: Phung, Quynh, et autres
Publié: (2025)
par: Phung, Quynh, et autres
Publié: (2025)
A timespace of zero‐COVID in Southwest China: Building community, governing time
par: Xuyi Zhao
Publié: (2024)
par: Xuyi Zhao
Publié: (2024)
Hollywood Town: Long-Video Generation via Cross-Modal Multi-Agent Orchestration
par: Wei, Zheng, et autres
Publié: (2025)
par: Wei, Zheng, et autres
Publié: (2025)
Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
par: Tang, Zhenchen, et autres
Publié: (2025)
par: Tang, Zhenchen, et autres
Publié: (2025)
Fast Stochastic Policy Gradient: Negative Momentum for Reinforcement Learning
par: Zhang, Haobin, et autres
Publié: (2024)
par: Zhang, Haobin, et autres
Publié: (2024)
StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation
par: Feng, Tianrui, et autres
Publié: (2025)
par: Feng, Tianrui, et autres
Publié: (2025)
Mode Seeking meets Mean Seeking for Fast Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2026)
par: Cai, Shengqu, et autres
Publié: (2026)
Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
par: Gu, Bohai, et autres
Publié: (2026)
par: Gu, Bohai, et autres
Publié: (2026)
TableNet A Large-Scale Table Dataset with LLM-Powered Autonomous
par: Zhang, Ruilin, et autres
Publié: (2026)
par: Zhang, Ruilin, et autres
Publié: (2026)
Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models
par: Tang, Zhenchen, et autres
Publié: (2026)
par: Tang, Zhenchen, et autres
Publié: (2026)
Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders
par: Bohacek, Matyas, et autres
Publié: (2025)
par: Bohacek, Matyas, et autres
Publié: (2025)
Self-Consistency for LLM-Based Motion Trajectory Generation and Verification
par: Ma, Jiaju, et autres
Publié: (2026)
par: Ma, Jiaju, et autres
Publié: (2026)
M-Eval: A Heterogeneity-Based Framework for Multi-evidence Validation in Medical RAG Systems
par: Sun, Mengzhou, et autres
Publié: (2025)
par: Sun, Mengzhou, et autres
Publié: (2025)
Block and Detail: Scaffolding Sketch-to-Image Generation
par: Sarukkai, Vishnu, et autres
Publié: (2024)
par: Sarukkai, Vishnu, et autres
Publié: (2024)
Functional BART with Shape Priors: A Bayesian Tree Approach to Constrained Functional Regression
par: Cao, Jiahao, et autres
Publié: (2025)
par: Cao, Jiahao, et autres
Publié: (2025)
Bridging the Gulf of Envisioning: Cognitive Design Challenges in LLM Interfaces
par: Subramonyam, Hariharan, et autres
Publié: (2023)
par: Subramonyam, Hariharan, et autres
Publié: (2023)
EmphasisChecker: A Tool for Guiding Chart and Caption Emphasis
par: Kim, Dae Hyun, et autres
Publié: (2023)
par: Kim, Dae Hyun, et autres
Publié: (2023)
WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models
par: Gu, Bohai, et autres
Publié: (2026)
par: Gu, Bohai, et autres
Publié: (2026)
TableCenterNet: A one-stage network for table structure recognition
par: Xiao, Anyi, et autres
Publié: (2025)
par: Xiao, Anyi, et autres
Publié: (2025)
Dense Semantic Matching with VGGT Prior
par: Yang, Songlin, et autres
Publié: (2025)
par: Yang, Songlin, et autres
Publié: (2025)
LouvreSAE: Sparse Autoencoders for Interpretable and Controllable Style Transfer
par: Panda, Raina, et autres
Publié: (2025)
par: Panda, Raina, et autres
Publié: (2025)
What makes an action sequence enjoyable to watch?
par: Chou, Jean-Peïc, et autres
Publié: (2026)
par: Chou, Jean-Peïc, et autres
Publié: (2026)
Facilitators and Barriers to Standardized Community Hypertension Management in Chinese Older Adults From Service Providers and Recipients: A Qualitative Study
par: Zhiyao Xiong, et autres
Publié: (2025)
par: Zhiyao Xiong, et autres
Publié: (2025)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
par: Chen, Houyuan, et autres
Publié: (2026)
par: Chen, Houyuan, et autres
Publié: (2026)
Documents similaires
-
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
par: Yang, Songlin, et autres
Publié: (2026) -
Transparent Image Layer Diffusion using Latent Transparency
par: Zhang, Lvmin, et autres
Publié: (2024) -
View-oriented Conversation Compiler for Agent Trace Analysis
par: Zhang, Lvmin, et autres
Publié: (2026) -
Taming Flow-based I2V Models for Creative Video Editing
par: Kong, Xianghao, et autres
Publié: (2025) -
Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
par: Zhang, Lvmin, et autres
Publié: (2025)