A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Peixuan, Zhou, Chang, Zhang, Ziyuan, Liu, Hualuo, Zhang, Chunjie, Liu, Jingqi, Zhou, Xiaohui, Chen, Xi, Weng, Shuchen, Li, Si, Shi, Boxin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
by: Zhang, Peixuan, et al.
Published: (2025)
by: Zhang, Peixuan, et al.
Published: (2025)
Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
by: Zhang, Peixuan, et al.
Published: (2025)
by: Zhang, Peixuan, et al.
Published: (2025)
VIRES: Video Instance Repainting via Sketch and Text Guided Generation
by: Weng, Shuchen, et al.
Published: (2024)
by: Weng, Shuchen, et al.
Published: (2024)
ReContraster: Making Your Posters Stand Out with Regional Contrast
by: Zhang, Peixuan, et al.
Published: (2026)
by: Zhang, Peixuan, et al.
Published: (2026)
AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
by: Zheng, Haojie, et al.
Published: (2025)
by: Zheng, Haojie, et al.
Published: (2025)
Audio-Sync Video Generation with Multi-Stream Temporal Control
by: Weng, Shuchen, et al.
Published: (2025)
by: Weng, Shuchen, et al.
Published: (2025)
Affective Image Editing: Shaping Emotional Factors via Text Descriptions
by: Zhang, Peixuan, et al.
Published: (2025)
by: Zhang, Peixuan, et al.
Published: (2025)
Personalized Image Filter: Mastering Your Photographic Style
by: Zhu, Chengxuan, et al.
Published: (2025)
by: Zhu, Chengxuan, et al.
Published: (2025)
Lighting-grounded Video Generation with Renderer-based Agent Reasoning
by: Cai, Ziqi, et al.
Published: (2026)
by: Cai, Ziqi, et al.
Published: (2026)
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
by: Zheng, Haojie, et al.
Published: (2026)
by: Zheng, Haojie, et al.
Published: (2026)
L-C4: Language-Based Video Colorization for Creative and Consistent Color
by: Chang, Zheng, et al.
Published: (2024)
by: Chang, Zheng, et al.
Published: (2024)
PanoWan: Lifting Diffusion Video Generation Models to 360° with Latitude/Longitude-aware Mechanisms
by: Xia, Yifei, et al.
Published: (2025)
by: Xia, Yifei, et al.
Published: (2025)
Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos
by: Du, Henghui, et al.
Published: (2025)
by: Du, Henghui, et al.
Published: (2025)
Colorizing Monochromatic Radiance Fields
by: Cheng, Yean, et al.
Published: (2024)
by: Cheng, Yean, et al.
Published: (2024)
Language-guided Image Reflection Separation
by: Zhong, Haofeng, et al.
Published: (2024)
by: Zhong, Haofeng, et al.
Published: (2024)
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
by: Zhang, Haojie, et al.
Published: (2026)
by: Zhang, Haojie, et al.
Published: (2026)
Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges
by: Zhou, Ziyuan, et al.
Published: (2023)
by: Zhou, Ziyuan, et al.
Published: (2023)
Distributed Optimal Consensus of Nonlinear Multi-Agent Systems
by: Guo, Ziyuan, et al.
Published: (2026)
by: Guo, Ziyuan, et al.
Published: (2026)
TIME: Temporal-Sensitive Multi-Dimensional Instruction Tuning and Robust Benchmarking for Video-LLMs
by: Wang, Yunxiao, et al.
Published: (2025)
by: Wang, Yunxiao, et al.
Published: (2025)
Partially Observable Mean Field Multi-Agent Reinforcement Learning Based on Graph-Attention
by: Yang, Min, et al.
Published: (2023)
by: Yang, Min, et al.
Published: (2023)
Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling
by: Jia, Yueru, et al.
Published: (2025)
by: Jia, Yueru, et al.
Published: (2025)
PolarVSR: A Unified Framework and Benchmark for Continuous Space-Time Polarization Video Reconstruction
by: Li, Chenggong, et al.
Published: (2026)
by: Li, Chenggong, et al.
Published: (2026)
SAJA: A State-Action Joint Attack Framework on Multi-Agent Deep Reinforcement Learning
by: Guo, Weiqi, et al.
Published: (2025)
by: Guo, Weiqi, et al.
Published: (2025)
Wan-S2V: Audio-Driven Cinematic Video Generation
by: Gao, Xin, et al.
Published: (2025)
by: Gao, Xin, et al.
Published: (2025)
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
by: Yang, Songlin, et al.
Published: (2026)
by: Yang, Songlin, et al.
Published: (2026)
TraceCodec: A Compiler-Backed Neural Codec for Stateful Multi-Flow Network Traffic Traces
by: Ding, Junhui, et al.
Published: (2026)
by: Ding, Junhui, et al.
Published: (2026)
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
by: Liu, Jiashuo, et al.
Published: (2025)
by: Liu, Jiashuo, et al.
Published: (2025)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
by: Li, Haitian, et al.
Published: (2026)
by: Li, Haitian, et al.
Published: (2026)
Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems
by: Ma, Yue, et al.
Published: (2026)
by: Ma, Yue, et al.
Published: (2026)
Whispers in the Noise: Surrogate-Guided Concept Awakening via a Multi-Agent Framework
by: Sun, Mengyu, et al.
Published: (2026)
by: Sun, Mengyu, et al.
Published: (2026)
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
by: Song, Yiren, et al.
Published: (2026)
by: Song, Yiren, et al.
Published: (2026)
Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video Generation
by: Hu, Haobo, et al.
Published: (2026)
by: Hu, Haobo, et al.
Published: (2026)
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
by: Yang, Songlin, et al.
Published: (2026)
by: Yang, Songlin, et al.
Published: (2026)
Hierarchical Multi-Marginal Optimal Transport for Network Alignment
by: Zeng, Zhichen, et al.
Published: (2023)
by: Zeng, Zhichen, et al.
Published: (2023)
Imaging Interiors: An Implicit Solution to Electromagnetic Inverse Scattering Problems
by: Luo, Ziyuan, et al.
Published: (2024)
by: Luo, Ziyuan, et al.
Published: (2024)
Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge
by: Li, Bin, et al.
Published: (2025)
by: Li, Bin, et al.
Published: (2025)
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
by: Eskandar, George, et al.
Published: (2026)
by: Eskandar, George, et al.
Published: (2026)
MLVU: Benchmarking Multi-task Long Video Understanding
by: Zhou, Junjie, et al.
Published: (2024)
by: Zhou, Junjie, et al.
Published: (2024)
PrismAgent: Illuminating Harm in Memes via a Zero-Shot Interpretable Multi-Agent Framework
by: Ding, Zihan, et al.
Published: (2026)
by: Ding, Zihan, et al.
Published: (2026)
SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
by: Zhou, Xingcheng, et al.
Published: (2026)
by: Zhou, Xingcheng, et al.
Published: (2026)
Similar Items
-
STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
by: Zhang, Peixuan, et al.
Published: (2025) -
Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
by: Zhang, Peixuan, et al.
Published: (2025) -
VIRES: Video Instance Repainting via Sketch and Text Guided Generation
by: Weng, Shuchen, et al.
Published: (2024) -
ReContraster: Making Your Posters Stand Out with Regional Contrast
by: Zhang, Peixuan, et al.
Published: (2026) -
AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
by: Zheng, Haojie, et al.
Published: (2025)