Interspatial Attention for Efficient 4D Human Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Shao, Ruizhi, Xu, Yinghao, Shen, Yujun, Yang, Ceyuan, Zheng, Yang, Chen, Changan, Liu, Yebin, Wetzstein, Gordon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation
di: Xu, Yinghao, et al.
Pubblicazione: (2024)
di: Xu, Yinghao, et al.
Pubblicazione: (2024)
CameraCtrl: Enabling Camera Control for Text-to-Video Generation
di: He, Hao, et al.
Pubblicazione: (2024)
di: He, Hao, et al.
Pubblicazione: (2024)
Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer
di: Shao, Ruizhi, et al.
Pubblicazione: (2024)
di: Shao, Ruizhi, et al.
Pubblicazione: (2024)
Real-time 3D-aware Portrait Editing from a Single Image
di: Bai, Qingyan, et al.
Pubblicazione: (2024)
di: Bai, Qingyan, et al.
Pubblicazione: (2024)
The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
3DitScene: Editing Any Scene via Language-guided Disentangled Gaussian Splatting
di: Zhang, Qihang, et al.
Pubblicazione: (2024)
di: Zhang, Qihang, et al.
Pubblicazione: (2024)
BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models
di: Po, Ryan, et al.
Pubblicazione: (2025)
di: Po, Ryan, et al.
Pubblicazione: (2025)
CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
di: He, Hao, et al.
Pubblicazione: (2025)
di: He, Hao, et al.
Pubblicazione: (2025)
Mixture of Contexts for Long Video Generation
di: Cai, Shengqu, et al.
Pubblicazione: (2025)
di: Cai, Shengqu, et al.
Pubblicazione: (2025)
Spatial Steerability of GANs via Self-Supervision from Discriminator
di: Wang, Jianyuan, et al.
Pubblicazione: (2023)
di: Wang, Jianyuan, et al.
Pubblicazione: (2023)
UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework
di: Pang, Youxin, et al.
Pubblicazione: (2025)
di: Pang, Youxin, et al.
Pubblicazione: (2025)
Video World Models with Long-term Spatial Memory
di: Wu, Tong, et al.
Pubblicazione: (2025)
di: Wu, Tong, et al.
Pubblicazione: (2025)
Spectral Progressive Diffusion for Efficient Image and Video Generation
di: Xiao, Howard, et al.
Pubblicazione: (2026)
di: Xiao, Howard, et al.
Pubblicazione: (2026)
Edicho: Consistent Image Editing in the Wild
di: Bai, Qingyan, et al.
Pubblicazione: (2024)
di: Bai, Qingyan, et al.
Pubblicazione: (2024)
Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation
di: Chao, Brian, et al.
Pubblicazione: (2026)
di: Chao, Brian, et al.
Pubblicazione: (2026)
FLARE: Feed-forward Geometry, Appearance and Camera Estimation from Uncalibrated Sparse Views
di: Zhang, Shangzhan, et al.
Pubblicazione: (2025)
di: Zhang, Shangzhan, et al.
Pubblicazione: (2025)
Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control
di: Kuang, Zhengfei, et al.
Pubblicazione: (2024)
di: Kuang, Zhengfei, et al.
Pubblicazione: (2024)
Layered 3D Human Generation via Semantic-Aware Diffusion Model
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
GroomLight: Hybrid Inverse Rendering for Relightable Human Hair Appearance Modeling
di: Zheng, Yang, et al.
Pubblicazione: (2025)
di: Zheng, Yang, et al.
Pubblicazione: (2025)
SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios
di: Dang, Lingwei, et al.
Pubblicazione: (2025)
di: Dang, Lingwei, et al.
Pubblicazione: (2025)
GPS-Gaussian: Generalizable Pixel-wise 3D Gaussian Splatting for Real-time Human Novel View Synthesis
di: Zheng, Shunyuan, et al.
Pubblicazione: (2023)
di: Zheng, Shunyuan, et al.
Pubblicazione: (2023)
Captain Cinema: Towards Short Movie Generation
di: Xiao, Junfei, et al.
Pubblicazione: (2025)
di: Xiao, Junfei, et al.
Pubblicazione: (2025)
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
di: Pang, Youxin, et al.
Pubblicazione: (2024)
di: Pang, Youxin, et al.
Pubblicazione: (2024)
DreamCraft3D++: Efficient Hierarchical 3D Generation with Multi-Plane Reconstruction Model
di: Sun, Jingxiang, et al.
Pubblicazione: (2024)
di: Sun, Jingxiang, et al.
Pubblicazione: (2024)
GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D Generation
di: Wu, Tong, et al.
Pubblicazione: (2024)
di: Wu, Tong, et al.
Pubblicazione: (2024)
GPS-Gaussian+: Generalizable Pixel-wise 3D Gaussian Splatting for Real-Time Human-Scene Rendering from Sparse Views
di: Zhou, Boyao, et al.
Pubblicazione: (2024)
di: Zhou, Boyao, et al.
Pubblicazione: (2024)
Learning Naturally Aggregated Appearance for Efficient 3D Editing
di: Cheng, Ka Leong, et al.
Pubblicazione: (2023)
di: Cheng, Ka Leong, et al.
Pubblicazione: (2023)
DevilSight: Augmenting Monocular Human Avatar Reconstruction through a Virtual Perspective
di: Chen, Yushuo, et al.
Pubblicazione: (2025)
di: Chen, Yushuo, et al.
Pubblicazione: (2025)
Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control
di: Xie, Linxi, et al.
Pubblicazione: (2026)
di: Xie, Linxi, et al.
Pubblicazione: (2026)
GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator
di: Zhu, Liyuan, et al.
Pubblicazione: (2026)
di: Zhu, Liyuan, et al.
Pubblicazione: (2026)
Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models
di: Jin, Yudong, et al.
Pubblicazione: (2025)
di: Jin, Yudong, et al.
Pubblicazione: (2025)
Long Context Tuning for Video Generation
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
MeshAvatar: Learning High-quality Triangular Human Avatars from Multi-view Videos
di: Chen, Yushuo, et al.
Pubblicazione: (2024)
di: Chen, Yushuo, et al.
Pubblicazione: (2024)
CloSET: Modeling Clothed Humans on Continuous Surface with Explicit Template Decomposition
di: Zhang, Hongwen, et al.
Pubblicazione: (2023)
di: Zhang, Hongwen, et al.
Pubblicazione: (2023)
Ins-HOI: Instance Aware Human-Object Interactions Recovery
di: Zhang, Jiajun, et al.
Pubblicazione: (2023)
di: Zhang, Jiajun, et al.
Pubblicazione: (2023)
SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls
di: Xu, Qianxun, et al.
Pubblicazione: (2026)
di: Xu, Qianxun, et al.
Pubblicazione: (2026)
GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation
di: Ackermann, Jan, et al.
Pubblicazione: (2026)
di: Ackermann, Jan, et al.
Pubblicazione: (2026)
Towards Vision-Language-Garment Models for Web Knowledge Garment Understanding and Generation
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation
di: Yang, Yuanbo, et al.
Pubblicazione: (2024)
di: Yang, Yuanbo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation
di: Xu, Yinghao, et al.
Pubblicazione: (2024) -
CameraCtrl: Enabling Camera Control for Text-to-Video Generation
di: He, Hao, et al.
Pubblicazione: (2024) -
Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer
di: Shao, Ruizhi, et al.
Pubblicazione: (2024) -
Real-time 3D-aware Portrait Editing from a Single Image
di: Bai, Qingyan, et al.
Pubblicazione: (2024) -
The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion
di: Chen, Changan, et al.
Pubblicazione: (2024)