MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haojie, Wu, Di, Liu, Bingyan, Zhong, Linjie, Wei, Yuancheng, Ye, Xingsong, Liu, Nanqing, Liang, Yaling |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
par: Meng, Yihao, et autres
Publié: (2025)
par: Meng, Yihao, et autres
Publié: (2025)
Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation
par: Zhang, Haojie, et autres
Publié: (2024)
par: Zhang, Haojie, et autres
Publié: (2024)
A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation
par: Zhang, Peixuan, et autres
Publié: (2026)
par: Zhang, Peixuan, et autres
Publié: (2026)
STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
par: Zhang, Peixuan, et autres
Publié: (2025)
par: Zhang, Peixuan, et autres
Publié: (2025)
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control
par: Zhang, Zhida, et autres
Publié: (2026)
par: Zhang, Zhida, et autres
Publié: (2026)
MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation
par: Xing, Jinbo, et autres
Publié: (2025)
par: Xing, Jinbo, et autres
Publié: (2025)
Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
par: Han, Mingfei, et autres
Publié: (2023)
par: Han, Mingfei, et autres
Publié: (2023)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
par: Wei, Yuancheng, et autres
Publié: (2026)
par: Wei, Yuancheng, et autres
Publié: (2026)
FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
par: Liu, Jiaxuan, et autres
Publié: (2026)
par: Liu, Jiaxuan, et autres
Publié: (2026)
Biology-Instructions: A Dataset and Benchmark for Multi-Omics Sequence Understanding Capability of Large Language Models
par: He, Haonan, et autres
Publié: (2024)
par: He, Haonan, et autres
Publié: (2024)
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
par: Song, Yiren, et autres
Publié: (2026)
par: Song, Yiren, et autres
Publié: (2026)
TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation
par: Chen, Jiaben, et autres
Publié: (2025)
par: Chen, Jiaben, et autres
Publié: (2025)
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
par: Liu, Hongbo, et autres
Publié: (2025)
par: Liu, Hongbo, et autres
Publié: (2025)
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
par: Liu, Shansong, et autres
Publié: (2024)
par: Liu, Shansong, et autres
Publié: (2024)
Rank-and-Reason: Multi-Agent Collaboration Accelerates Zero-Shot Protein Mutation Prediction
par: Tan, Yang, et autres
Publié: (2026)
par: Tan, Yang, et autres
Publié: (2026)
BenchSeg: A Large-Scale Dataset and Benchmark for Multi-View Food Video Segmentation
par: AlMughrabi, Ahmad, et autres
Publié: (2026)
par: AlMughrabi, Ahmad, et autres
Publié: (2026)
MultiBind: A Benchmark for Attribute Misbinding in Multi-Subject Generation
par: Tian, Wenqing, et autres
Publié: (2026)
par: Tian, Wenqing, et autres
Publié: (2026)
CineBrain: A Large-Scale Multi-Modal Brain Dataset During Naturalistic Audiovisual Narrative Processing
par: Gao, Jianxiong, et autres
Publié: (2025)
par: Gao, Jianxiong, et autres
Publié: (2025)
PointSAM: Pointly-Supervised Segment Anything Model for Remote Sensing Images
par: Liu, Nanqing, et autres
Publié: (2024)
par: Liu, Nanqing, et autres
Publié: (2024)
Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles
par: Wang, Zhilong, et autres
Publié: (2024)
par: Wang, Zhilong, et autres
Publié: (2024)
CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives
par: Meng, Yihao, et autres
Publié: (2026)
par: Meng, Yihao, et autres
Publié: (2026)
OSS-Bench: Benchmark Generator for Coding LLMs
par: Jiang, Yuancheng, et autres
Publié: (2025)
par: Jiang, Yuancheng, et autres
Publié: (2025)
Scalable Multi-Agent Reinforcement Learning for Residential Load Scheduling under Data Governance
par: Qin, Zhaoming, et autres
Publié: (2021)
par: Qin, Zhaoming, et autres
Publié: (2021)
CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
par: Qiu, Haonan, et autres
Publié: (2025)
par: Qiu, Haonan, et autres
Publié: (2025)
StoryTailor:A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives
par: Hu, Jinghao, et autres
Publié: (2026)
par: Hu, Jinghao, et autres
Publié: (2026)
Generative Photographic Control for Scene-Consistent Video Cinematic Editing
par: Sun, Huiqiang, et autres
Publié: (2025)
par: Sun, Huiqiang, et autres
Publié: (2025)
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control
par: Wei, Yujie, et autres
Publié: (2024)
par: Wei, Yujie, et autres
Publié: (2024)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
Enhancing Perception Quality in Remote Sensing Image Compression via Invertible Neural Network
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
Exploiting Inter-Image Similarity Prior for Low-Bitrate Remote Sensing Image Compression
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
MSVCOD:A Large-Scale Multi-Scene Dataset for Video Camouflage Object Detection
par: Gao, Shuyong, et autres
Publié: (2025)
par: Gao, Shuyong, et autres
Publié: (2025)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
par: Kou, Tengchuan, et autres
Publié: (2024)
par: Kou, Tengchuan, et autres
Publié: (2024)
Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA
par: Li, Zhanli, et autres
Publié: (2026)
par: Li, Zhanli, et autres
Publié: (2026)
Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
par: Luo, Zekai, et autres
Publié: (2025)
par: Luo, Zekai, et autres
Publié: (2025)
Large Bayesian Tensor Autoregressions
par: Qi, Yaling
Publié: (2025)
par: Qi, Yaling
Publié: (2025)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
par: Li, Haitian, et autres
Publié: (2026)
par: Li, Haitian, et autres
Publié: (2026)
Accelerating Quantitative MRI using Subspace Multiscale Energy Model (SS-MuSE)
par: Chen, Yan, et autres
Publié: (2025)
par: Chen, Yan, et autres
Publié: (2025)
Documents similaires
-
HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
par: Meng, Yihao, et autres
Publié: (2025) -
Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation
par: Zhang, Haojie, et autres
Publié: (2024) -
A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation
par: Zhang, Peixuan, et autres
Publié: (2026) -
STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
par: Zhang, Peixuan, et autres
Publié: (2025) -
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
par: Yang, Songlin, et autres
Publié: (2026)