ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Songlin, Wang, Zhe, Yang, Xuyi, Zhang, Songchun, Kong, Xianghao, Wu, Taiyi, Zhao, Xiaotong, Zhang, Ran, Zhao, Alan, Rao, Anyi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Composing Concepts from Images and Videos via Concept-prompt Binding
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
par: Zhang, Songchun, et autres
Publié: (2026)
par: Zhang, Songchun, et autres
Publié: (2026)
SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment
par: Zhao, Zhuoran, et autres
Publié: (2026)
par: Zhao, Zhuoran, et autres
Publié: (2026)
ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models
par: Gu, Bohai, et autres
Publié: (2026)
par: Gu, Bohai, et autres
Publié: (2026)
Taming Flow-based I2V Models for Creative Video Editing
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
Pragmatist: Multiview Conditional Diffusion Models for High-Fidelity 3D Reconstruction from Unposed Sparse Views
par: Zhang, Songchun, et autres
Publié: (2024)
par: Zhang, Songchun, et autres
Publié: (2024)
Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
par: Gu, Bohai, et autres
Publié: (2026)
par: Gu, Bohai, et autres
Publié: (2026)
Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control
par: Song, Chenxi, et autres
Publié: (2025)
par: Song, Chenxi, et autres
Publié: (2025)
MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation
par: Xing, Jinbo, et autres
Publié: (2025)
par: Xing, Jinbo, et autres
Publié: (2025)
Liberating Seen Classes: Boosting Few-Shot and Zero-Shot Text Classification via Anchor Generation and Classification Reframing
par: Liu, Han, et autres
Publié: (2024)
par: Liu, Han, et autres
Publié: (2024)
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
par: Liu, Hongbo, et autres
Publié: (2025)
par: Liu, Hongbo, et autres
Publié: (2025)
HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
par: Meng, Yihao, et autres
Publié: (2025)
par: Meng, Yihao, et autres
Publié: (2025)
FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
par: Liu, Jiaxuan, et autres
Publié: (2026)
par: Liu, Jiaxuan, et autres
Publié: (2026)
MONA: Moving Object Detection from Videos Shot by Dynamic Camera
par: Hu, Boxun, et autres
Publié: (2025)
par: Hu, Boxun, et autres
Publié: (2025)
MultiVerse: Efficient and Expressive Zero-Shot Multi-Task Text-to-Speech
par: Bak, Taejun, et autres
Publié: (2024)
par: Bak, Taejun, et autres
Publié: (2024)
PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
par: Gao, Heyuan, et autres
Publié: (2026)
par: Gao, Heyuan, et autres
Publié: (2026)
SKALD: Learning-Based Shot Assembly for Coherent Multi-Shot Video Creation
par: Lu, Chen Yi, et autres
Publié: (2025)
par: Lu, Chen Yi, et autres
Publié: (2025)
ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search
par: Yu, Tao, et autres
Publié: (2026)
par: Yu, Tao, et autres
Publié: (2026)
Wan-S2V: Audio-Driven Cinematic Video Generation
par: Gao, Xin, et autres
Publié: (2025)
par: Gao, Xin, et autres
Publié: (2025)
CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition
par: Phung, Quynh, et autres
Publié: (2025)
par: Phung, Quynh, et autres
Publié: (2025)
A timespace of zero‐COVID in Southwest China: Building community, governing time
par: Xuyi Zhao
Publié: (2024)
par: Xuyi Zhao
Publié: (2024)
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
par: Zhang, Haojie, et autres
Publié: (2026)
par: Zhang, Haojie, et autres
Publié: (2026)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
par: Chen, Houyuan, et autres
Publié: (2026)
par: Chen, Houyuan, et autres
Publié: (2026)
SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner
par: Zhou, Yufan, et autres
Publié: (2024)
par: Zhou, Yufan, et autres
Publié: (2024)
Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition
par: Yang, Hongji, et autres
Publié: (2026)
par: Yang, Hongji, et autres
Publié: (2026)
Generative AI for Film Creation: A Survey of Recent Advances
par: Zhang, Ruihan, et autres
Publié: (2025)
par: Zhang, Ruihan, et autres
Publié: (2025)
ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models
par: Kara, Ozgur, et autres
Publié: (2025)
par: Kara, Ozgur, et autres
Publié: (2025)
Pre-Training and Prompting for Few-Shot Node Classification on Text-Attributed Graphs
par: Zhao, Huanjing, et autres
Publié: (2024)
par: Zhao, Huanjing, et autres
Publié: (2024)
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control
par: Wei, Yujie, et autres
Publié: (2024)
par: Wei, Yujie, et autres
Publié: (2024)
Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion Models
par: Ren, Yixuan, et autres
Publié: (2024)
par: Ren, Yixuan, et autres
Publié: (2024)
Are Image-to-Video Models Good Zero-Shot Image Editors?
par: Zhang, Zechuan, et autres
Publié: (2025)
par: Zhang, Zechuan, et autres
Publié: (2025)
Dense Semantic Matching with VGGT Prior
par: Yang, Songlin, et autres
Publié: (2025)
par: Yang, Songlin, et autres
Publié: (2025)
VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing
par: Couairon, Paul, et autres
Publié: (2023)
par: Couairon, Paul, et autres
Publié: (2023)
Shot-Aware Frame Sampling for Video Understanding
par: Zhao, Mengyu, et autres
Publié: (2026)
par: Zhao, Mengyu, et autres
Publié: (2026)
Multi-Text Guided Few-Shot Semantic Segmentation
par: Jiao, Qiang, et autres
Publié: (2025)
par: Jiao, Qiang, et autres
Publié: (2025)
Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature
par: Bao, Guangsheng, et autres
Publié: (2023)
par: Bao, Guangsheng, et autres
Publié: (2023)
Documents similaires
-
Composing Concepts from Images and Videos via Concept-prompt Binding
par: Kong, Xianghao, et autres
Publié: (2025) -
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
par: Yang, Songlin, et autres
Publié: (2026) -
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
par: Yang, Songlin, et autres
Publié: (2026) -
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
par: Zhang, Songchun, et autres
Publié: (2026) -
SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment
par: Zhao, Zhuoran, et autres
Publié: (2026)