UCM: Unifying Camera Control and Memory with Time-aware Positional Encoding Warping for World Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Tianxing, Wang, Zixuan, Wang, Guangyuan, Hu, Li, Zhang, Zhongyi, Zhang, Peng, Zhang, Bang, Zhang, Song-Hai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unified Camera Positional Encoding for Controlled Video Generation
di: Zhang, Cheng, et al.
Pubblicazione: (2025)
di: Zhang, Cheng, et al.
Pubblicazione: (2025)
WATCH: World-aware Allied Trajectory and pose reconstruction for Camera and Human
di: Ying, Qijun, et al.
Pubblicazione: (2025)
di: Ying, Qijun, et al.
Pubblicazione: (2025)
Unit Region Encoding: A Unified and Compact Geometry-aware Representation for Floorplan Applications
di: Zhang, Huichao, et al.
Pubblicazione: (2025)
di: Zhang, Huichao, et al.
Pubblicazione: (2025)
CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking
di: Wang, Zhongjian, et al.
Pubblicazione: (2025)
di: Wang, Zhongjian, et al.
Pubblicazione: (2025)
MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation
di: Meng, Dechao, et al.
Pubblicazione: (2025)
di: Meng, Dechao, et al.
Pubblicazione: (2025)
Cameras as Relative Positional Encoding
di: Li, Ruilong, et al.
Pubblicazione: (2025)
di: Li, Ruilong, et al.
Pubblicazione: (2025)
Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
CPA: Camera-pose-awareness Diffusion Transformer for Video Generation
di: Wang, Yuelei, et al.
Pubblicazione: (2024)
di: Wang, Yuelei, et al.
Pubblicazione: (2024)
Co-speech Gesture Video Generation via Motion-Based Graph Retrieval
di: Song, Yafei, et al.
Pubblicazione: (2025)
di: Song, Yafei, et al.
Pubblicazione: (2025)
CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation
di: Jin, Seonghyun, et al.
Pubblicazione: (2026)
di: Jin, Seonghyun, et al.
Pubblicazione: (2026)
Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance
di: Hu, Li, et al.
Pubblicazione: (2025)
di: Hu, Li, et al.
Pubblicazione: (2025)
CameraMaster: Unified Camera Semantic-Parameter Control for Photography Retouching
di: Yang, Qirui, et al.
Pubblicazione: (2025)
di: Yang, Qirui, et al.
Pubblicazione: (2025)
Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
di: Cheng, Gang, et al.
Pubblicazione: (2025)
di: Cheng, Gang, et al.
Pubblicazione: (2025)
DMAD: Dual Memory Bank for Real-World Anomaly Detection
di: Hu, Jianlong, et al.
Pubblicazione: (2024)
di: Hu, Jianlong, et al.
Pubblicazione: (2024)
PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment
di: Ji, Chaonan, et al.
Pubblicazione: (2026)
di: Ji, Chaonan, et al.
Pubblicazione: (2026)
Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation
di: Hu, Li, et al.
Pubblicazione: (2023)
di: Hu, Li, et al.
Pubblicazione: (2023)
FW-VTON: Flattening-and-Warping for Person-to-Person Virtual Try-on
di: Wang, Zheng, et al.
Pubblicazione: (2025)
di: Wang, Zheng, et al.
Pubblicazione: (2025)
WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories
di: Zhang, Yisu, et al.
Pubblicazione: (2026)
di: Zhang, Yisu, et al.
Pubblicazione: (2026)
PositionIC: Unified Position and Identity Consistency for Image Customization
di: Hu, Junjie, et al.
Pubblicazione: (2025)
di: Hu, Junjie, et al.
Pubblicazione: (2025)
DreamWorld: Unified World Modeling in Video Generation
di: Tan, Boming, et al.
Pubblicazione: (2026)
di: Tan, Boming, et al.
Pubblicazione: (2026)
BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
PuzzleBoard: A New Camera Calibration Pattern with Position Encoding
di: Stelldinger, Peer, et al.
Pubblicazione: (2024)
di: Stelldinger, Peer, et al.
Pubblicazione: (2024)
Controllable and Expressive One-Shot Video Head Swapping
di: Ji, Chaonan, et al.
Pubblicazione: (2025)
di: Ji, Chaonan, et al.
Pubblicazione: (2025)
MaTe3D: Mask-guided Text-based 3D-aware Portrait Editing
di: Zhou, Kangneng, et al.
Pubblicazione: (2023)
di: Zhou, Kangneng, et al.
Pubblicazione: (2023)
EAGLE: Episodic Appearance- and Geometry-aware Memory for Unified 2D-3D Visual Query Localization in Egocentric Vision
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation
di: Lu, Jiachen, et al.
Pubblicazione: (2023)
di: Lu, Jiachen, et al.
Pubblicazione: (2023)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
di: Chen, Shuang, et al.
Pubblicazione: (2026)
di: Chen, Shuang, et al.
Pubblicazione: (2026)
Towards Highly Realistic Artistic Style Transfer via Stable Diffusion with Step-aware and Layer-aware Prompt
di: Zhang, Zhanjie, et al.
Pubblicazione: (2024)
di: Zhang, Zhanjie, et al.
Pubblicazione: (2024)
Test-Time Discovery via Hashing Memory
di: Lyu, Fan, et al.
Pubblicazione: (2025)
di: Lyu, Fan, et al.
Pubblicazione: (2025)
Deep Clustering with Diffused Sampling and Hardness-aware Self-distillation
di: Zhang, Hai-Xin, et al.
Pubblicazione: (2024)
di: Zhang, Hai-Xin, et al.
Pubblicazione: (2024)
Weierstrass Positional Encoding for Vision Transformers
di: Xin, Zhihang, et al.
Pubblicazione: (2026)
di: Xin, Zhihang, et al.
Pubblicazione: (2026)
OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
di: Huang, Ruoxiang, et al.
Pubblicazione: (2025)
di: Huang, Ruoxiang, et al.
Pubblicazione: (2025)
MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time
di: Jeon, Sooyoung, et al.
Pubblicazione: (2026)
di: Jeon, Sooyoung, et al.
Pubblicazione: (2026)
OmniCam: Unified Multimodal Video Generation via Camera Control
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
di: Zheng, Chaoda, et al.
Pubblicazione: (2026)
di: Zheng, Chaoda, et al.
Pubblicazione: (2026)
SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild
di: Zhang, Xindi, et al.
Pubblicazione: (2025)
di: Zhang, Xindi, et al.
Pubblicazione: (2025)
Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation
di: Xiao, Steven, et al.
Pubblicazione: (2025)
di: Xiao, Steven, et al.
Pubblicazione: (2025)
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
di: Wang, Yukun, et al.
Pubblicazione: (2026)
di: Wang, Yukun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Unified Camera Positional Encoding for Controlled Video Generation
di: Zhang, Cheng, et al.
Pubblicazione: (2025) -
WATCH: World-aware Allied Trajectory and pose reconstruction for Camera and Human
di: Ying, Qijun, et al.
Pubblicazione: (2025) -
Unit Region Encoding: A Unified and Compact Geometry-aware Representation for Floorplan Applications
di: Zhang, Huichao, et al.
Pubblicazione: (2025) -
CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping
di: Zhao, Haoyu, et al.
Pubblicazione: (2026) -
OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking
di: Wang, Zhongjian, et al.
Pubblicazione: (2025)