Enregistré dans:
| Auteurs principaux: | Zhou, Zhenghong, An, Jie, Luo, Jiebo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2412.06029 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion
par: Zhou, Zhenghong, et autres
Publié: (2026)
par: Zhou, Zhenghong, et autres
Publié: (2026)
On Inductive Biases That Enable Generalization of Diffusion Transformers
par: An, Jie, et autres
Publié: (2024)
par: An, Jie, et autres
Publié: (2024)
Aurora: Unified Video Editing with a Tool-Using Agent
par: Yu, Yongsheng, et autres
Publié: (2026)
par: Yu, Yongsheng, et autres
Publié: (2026)
Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion
par: Chen, Jingyuan, et autres
Publié: (2025)
par: Chen, Jingyuan, et autres
Publié: (2025)
PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
par: Zheng, Haitian, et autres
Publié: (2025)
par: Zheng, Haitian, et autres
Publié: (2025)
CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping
par: Zhao, Haoyu, et autres
Publié: (2026)
par: Zhao, Haoyu, et autres
Publié: (2026)
CameraCtrl: Enabling Camera Control for Text-to-Video Generation
par: He, Hao, et autres
Publié: (2024)
par: He, Hao, et autres
Publié: (2024)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
LiDAR-Camera Fusion for Video Panoptic Segmentation without Video Training
par: Ayar, Fardin, et autres
Publié: (2024)
par: Ayar, Fardin, et autres
Publié: (2024)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
par: Chen, Zhikai, et autres
Publié: (2024)
par: Chen, Zhikai, et autres
Publié: (2024)
Latent Diffusion Model without Variational Autoencoder
par: Shi, Minglei, et autres
Publié: (2025)
par: Shi, Minglei, et autres
Publié: (2025)
Bring Metric Functions into Diffusion Models
par: An, Jie, et autres
Publié: (2024)
par: An, Jie, et autres
Publié: (2024)
FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video Synthesis
par: Jin, Wonjoon, et autres
Publié: (2025)
par: Jin, Wonjoon, et autres
Publié: (2025)
Training-free Camera Control for Video Generation
par: Hou, Chen, et autres
Publié: (2024)
par: Hou, Chen, et autres
Publié: (2024)
CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback
par: Ge, Wenhang, et autres
Publié: (2026)
par: Ge, Wenhang, et autres
Publié: (2026)
ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation
par: Yang, Liudi, et autres
Publié: (2026)
par: Yang, Liudi, et autres
Publié: (2026)
CamCloneMaster: Enabling Reference-based Camera Control for Video Generation
par: Luo, Yawen, et autres
Publié: (2025)
par: Luo, Yawen, et autres
Publié: (2025)
ZipIR: Latent Pyramid Diffusion Transformer for High-Resolution Image Restoration
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
Video Diffusion Models are Training-free Motion Interpreter and Controller
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
DanceCamera3D: 3D Camera Movement Synthesis with Music and Dance
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
Drive Any Mesh: 4D Latent Diffusion for Mesh Deformation from Video
par: Shi, Yahao, et autres
Publié: (2025)
par: Shi, Yahao, et autres
Publié: (2025)
Enabling Versatile Controls for Video Diffusion Models
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
par: Zheng, Guangcong, et autres
Publié: (2024)
par: Zheng, Guangcong, et autres
Publié: (2024)
Probing into Camera Control of Video Models
par: Hou, Chen, et autres
Publié: (2026)
par: Hou, Chen, et autres
Publié: (2026)
GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
par: Fortier-Chouinard, Frédéric, et autres
Publié: (2025)
par: Fortier-Chouinard, Frédéric, et autres
Publié: (2025)
DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
par: Zhang, Hongfei, et autres
Publié: (2025)
par: Zhang, Hongfei, et autres
Publié: (2025)
Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
par: Yu, Yongsheng, et autres
Publié: (2024)
par: Yu, Yongsheng, et autres
Publié: (2024)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
Holistic Visual-Textual Sentiment Analysis with Prior Models
par: Chen, Junyu, et autres
Publié: (2022)
par: Chen, Junyu, et autres
Publié: (2022)
RGB Pre-Training Enhanced Unobservable Feature Latent Diffusion Model for Spectral Reconstruction
par: Deng, Keli, et autres
Publié: (2025)
par: Deng, Keli, et autres
Publié: (2025)
CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control
par: Kuang, Zhiyi, et autres
Publié: (2026)
par: Kuang, Zhiyi, et autres
Publié: (2026)
Reframe Anything: LLM Agent for Open World Video Reframing
par: Cao, Jiawang, et autres
Publié: (2024)
par: Cao, Jiawang, et autres
Publié: (2024)
Boosting Camera Motion Control for Video Diffusion Transformers
par: Cheong, Soon Yau, et autres
Publié: (2024)
par: Cheong, Soon Yau, et autres
Publié: (2024)
DreamColour: Controllable Video Colour Editing without Training
par: Utintu, Chaitat, et autres
Publié: (2024)
par: Utintu, Chaitat, et autres
Publié: (2024)
Motion-aware Latent Diffusion Models for Video Frame Interpolation
par: Huang, Zhilin, et autres
Publié: (2024)
par: Huang, Zhilin, et autres
Publié: (2024)
Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation
par: Maduabuchi, Chika, et autres
Publié: (2025)
par: Maduabuchi, Chika, et autres
Publié: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
par: Lin, Jingyang, et autres
Publié: (2025)
par: Lin, Jingyang, et autres
Publié: (2025)
CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
par: He, Hao, et autres
Publié: (2025)
par: He, Hao, et autres
Publié: (2025)
CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion
par: Ji, Chenhao, et autres
Publié: (2025)
par: Ji, Chenhao, et autres
Publié: (2025)
Documents similaires
-
Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion
par: Zhou, Zhenghong, et autres
Publié: (2026) -
On Inductive Biases That Enable Generalization of Diffusion Transformers
par: An, Jie, et autres
Publié: (2024) -
Aurora: Unified Video Editing with a Tool-Using Agent
par: Yu, Yongsheng, et autres
Publié: (2026) -
Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion
par: Chen, Jingyuan, et autres
Publié: (2025) -
PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
par: Zheng, Haitian, et autres
Publié: (2025)