Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Zhenghong, Zhan, Xiaohang, Chen, Zhiqin, Kim, Soo Ye, Zhao, Nanxuan, Zheng, Haitian, Liu, Qing, Zhang, He, Lin, Zhe, Zhou, Yuqian, Luo, Jiebo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training
par: Zhou, Zhenghong, et autres
Publié: (2024)
par: Zhou, Zhenghong, et autres
Publié: (2024)
PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
par: Zheng, Haitian, et autres
Publié: (2025)
par: Zheng, Haitian, et autres
Publié: (2025)
Aurora: Unified Video Editing with a Tool-Using Agent
par: Yu, Yongsheng, et autres
Publié: (2026)
par: Yu, Yongsheng, et autres
Publié: (2026)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
par: Ju, Xuan, et autres
Publié: (2025)
par: Ju, Xuan, et autres
Publié: (2025)
ZipIR: Latent Pyramid Diffusion Transformer for High-Resolution Image Restoration
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions
par: Cai, Yuanhao, et autres
Publié: (2025)
par: Cai, Yuanhao, et autres
Publié: (2025)
Structure-Guided Image Completion with Image-level and Object-level Semantic Discriminators
par: Zheng, Haitian, et autres
Publié: (2022)
par: Zheng, Haitian, et autres
Publié: (2022)
MotionBridge: Dynamic Video Inbetweening with Flexible Controls
par: Tanveer, Maham, et autres
Publié: (2024)
par: Tanveer, Maham, et autres
Publié: (2024)
SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner
par: Zhou, Yufan, et autres
Publié: (2024)
par: Zhou, Yufan, et autres
Publié: (2024)
OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Programmable Motion Generation for Open-Set Motion Control Tasks
par: Liu, Hanchao, et autres
Publié: (2024)
par: Liu, Hanchao, et autres
Publié: (2024)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
par: Yu, Yongsheng, et autres
Publié: (2024)
par: Yu, Yongsheng, et autres
Publié: (2024)
Real-Time Motion-Controllable Autoregressive Video Diffusion
par: Zhao, Kesen, et autres
Publié: (2025)
par: Zhao, Kesen, et autres
Publié: (2025)
Video-As-Prompt: Unified Semantic Control for Video Generation
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
par: Jang, Sangwon, et autres
Publié: (2025)
par: Jang, Sangwon, et autres
Publié: (2025)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer
par: Liu, Penghui, et autres
Publié: (2025)
par: Liu, Penghui, et autres
Publié: (2025)
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
par: Wang, Zhouxia, et autres
Publié: (2023)
par: Wang, Zhouxia, et autres
Publié: (2023)
Video Diffusion Models are Training-free Motion Interpreter and Controller
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation
par: Lee, JoungBin, et autres
Publié: (2025)
par: Lee, JoungBin, et autres
Publié: (2025)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
par: Chen, Zhikai, et autres
Publié: (2024)
par: Chen, Zhikai, et autres
Publié: (2024)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering
par: Zhan, Xiaohang, et autres
Publié: (2025)
par: Zhan, Xiaohang, et autres
Publié: (2025)
UniSER: A Foundation Model for Unified Soft Effects Removal
par: Zhang, Jingdong, et autres
Publié: (2025)
par: Zhang, Jingdong, et autres
Publié: (2025)
MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer
par: Teodoro, Samuel, et autres
Publié: (2026)
par: Teodoro, Samuel, et autres
Publié: (2026)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
Motion Prompting: Controlling Video Generation with Motion Trajectories
par: Geng, Daniel, et autres
Publié: (2024)
par: Geng, Daniel, et autres
Publié: (2024)
SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
par: Cho, Jungbin, et autres
Publié: (2025)
par: Cho, Jungbin, et autres
Publié: (2025)
Video Motion Graphs
par: Liu, Haiyang, et autres
Publié: (2025)
par: Liu, Haiyang, et autres
Publié: (2025)
Spatial As Deep: Spatial CNN for Traffic Scene Understanding
par: Pan, Xingang, et autres
Publié: (2017)
par: Pan, Xingang, et autres
Publié: (2017)
JARViS: Detecting Actions in Video Using Unified Actor-Scene Context Relation Modeling
par: Lee, Seok Hwan, et autres
Publié: (2024)
par: Lee, Seok Hwan, et autres
Publié: (2024)
LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion
par: Liu, Fangfu, et autres
Publié: (2025)
par: Liu, Fangfu, et autres
Publié: (2025)
A Unified Diffusion Framework for Scene-aware Human Motion Estimation from Sparse Signals
par: Tang, Jiangnan, et autres
Publié: (2024)
par: Tang, Jiangnan, et autres
Publié: (2024)
Motion Control for Enhanced Complex Action Video Generation
par: Zhou, Qiang, et autres
Publié: (2024)
par: Zhou, Qiang, et autres
Publié: (2024)
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
par: Huang, Chi-Pin, et autres
Publié: (2025)
par: Huang, Chi-Pin, et autres
Publié: (2025)
HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
par: Wang, Xiang, et autres
Publié: (2025)
par: Wang, Xiang, et autres
Publié: (2025)
EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
par: Yang, Yuxiao, et autres
Publié: (2025)
par: Yang, Yuxiao, et autres
Publié: (2025)
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control
par: Wei, Yujie, et autres
Publié: (2024)
par: Wei, Yujie, et autres
Publié: (2024)
Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes
par: Wang, Yin, et autres
Publié: (2026)
par: Wang, Yin, et autres
Publié: (2026)
Documents similaires
-
Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training
par: Zhou, Zhenghong, et autres
Publié: (2024) -
PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
par: Zheng, Haitian, et autres
Publié: (2025) -
Aurora: Unified Video Editing with a Tool-Using Agent
par: Yu, Yongsheng, et autres
Publié: (2026) -
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
par: Ju, Xuan, et autres
Publié: (2025) -
ZipIR: Latent Pyramid Diffusion Transformer for High-Resolution Image Restoration
par: Yu, Yongsheng, et autres
Publié: (2025)