Spatial-Temporal State Propagation Autoregressive Model for 4D Object Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Liying, Liu, Jialun, Hu, Jiakui, Guan, Chenhao, Huang, Haibin, Yi, Fangqiu, Zhang, Chi, Liang, Yanyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context
por: Hu, JiaKui, et al.
Publicado: (2026)
por: Hu, JiaKui, et al.
Publicado: (2026)
VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation
por: Zhang, Chi, et al.
Publicado: (2024)
por: Zhang, Chi, et al.
Publicado: (2024)
Conditional Video Generation for High-Efficiency Video Compression
por: Yi, Fangqiu, et al.
Publicado: (2025)
por: Yi, Fangqiu, et al.
Publicado: (2025)
Distilling Future Temporal Knowledge with Masked Feature Reconstruction for 3D Object Detection
por: Zheng, Haowen, et al.
Publicado: (2025)
por: Zheng, Haowen, et al.
Publicado: (2025)
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
por: Hu, Panwen, et al.
Publicado: (2025)
por: Hu, Panwen, et al.
Publicado: (2025)
Not All Frame Features Are Equal: Video-to-4D Generation via Decoupling Dynamic-Static Features
por: Yang, Liying, et al.
Publicado: (2025)
por: Yang, Liying, et al.
Publicado: (2025)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
por: Liu, Jialun, et al.
Publicado: (2026)
por: Liu, Jialun, et al.
Publicado: (2026)
TexGaussian: Generating High-quality PBR Material via Octree-based 3D Gaussian Splatting
por: Xiong, Bojun, et al.
Publicado: (2024)
por: Xiong, Bojun, et al.
Publicado: (2024)
Distilling Temporal Knowledge with Masked Feature Reconstruction for 3D Object Detection
por: Zheng, Haowen, et al.
Publicado: (2024)
por: Zheng, Haowen, et al.
Publicado: (2024)
MORPHOS: Autoregressive 4D Generation with Temporal Structured Latents
por: Kwon, Minkyung, et al.
Publicado: (2026)
por: Kwon, Minkyung, et al.
Publicado: (2026)
StarPose: 3D Human Pose Estimation via Spatial-Temporal Autoregressive Diffusion
por: Yang, Haoxin, et al.
Publicado: (2025)
por: Yang, Haoxin, et al.
Publicado: (2025)
PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learning
por: Yu, Xinxing, et al.
Publicado: (2026)
por: Yu, Xinxing, et al.
Publicado: (2026)
Free4D: Tuning-free 4D Scene Generation with Spatial-Temporal Consistency
por: Liu, Tianqi, et al.
Publicado: (2025)
por: Liu, Tianqi, et al.
Publicado: (2025)
STAG4D: Spatial-Temporal Anchored Generative 4D Gaussians
por: Zeng, Yifei, et al.
Publicado: (2024)
por: Zeng, Yifei, et al.
Publicado: (2024)
InterFusion: Text-Driven Generation of 3D Human-Object Interaction
por: Dai, Sisi, et al.
Publicado: (2024)
por: Dai, Sisi, et al.
Publicado: (2024)
FB-4D: Spatial-Temporal Coherent Dynamic 3D Content Generation with Feature Banks
por: Li, Jinwei, et al.
Publicado: (2025)
por: Li, Jinwei, et al.
Publicado: (2025)
Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context
por: Shen, Cuifeng, et al.
Publicado: (2025)
por: Shen, Cuifeng, et al.
Publicado: (2025)
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
por: Yin, Xingyilang, et al.
Publicado: (2026)
por: Yin, Xingyilang, et al.
Publicado: (2026)
GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splatting
por: Yang, Xianben, et al.
Publicado: (2026)
por: Yang, Xianben, et al.
Publicado: (2026)
4DSTR: Advancing Generative 4D Gaussians with Spatial-Temporal Rectification for High-Quality and Consistent 4D Generation
por: Liu, Mengmeng, et al.
Publicado: (2025)
por: Liu, Mengmeng, et al.
Publicado: (2025)
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
por: Ni, Ziqi, et al.
Publicado: (2025)
por: Ni, Ziqi, et al.
Publicado: (2025)
Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation
por: Xiang, Xunzhi, et al.
Publicado: (2025)
por: Xiang, Xunzhi, et al.
Publicado: (2025)
On the Feasibility and Opportunity of Autoregressive 3D Object Detection
por: Huang, Zanming, et al.
Publicado: (2026)
por: Huang, Zanming, et al.
Publicado: (2026)
From Sequential to Spatial: Reordering Autoregression for Efficient Visual Generation
por: Wang, Siyang, et al.
Publicado: (2025)
por: Wang, Siyang, et al.
Publicado: (2025)
PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object Detection
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion
por: Xi, Dianbing, et al.
Publicado: (2025)
por: Xi, Dianbing, et al.
Publicado: (2025)
Repurposing 3D Generative Model for Autoregressive Layout Generation
por: Feng, Haoran, et al.
Publicado: (2026)
por: Feng, Haoran, et al.
Publicado: (2026)
Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion
por: Yang, Shiyuan, et al.
Publicado: (2024)
por: Yang, Shiyuan, et al.
Publicado: (2024)
Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation
por: Liu, Ruiying, et al.
Publicado: (2025)
por: Liu, Ruiying, et al.
Publicado: (2025)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
por: Huang, Bowen, et al.
Publicado: (2024)
por: Huang, Bowen, et al.
Publicado: (2024)
Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
por: Wang, Zan, et al.
Publicado: (2025)
por: Wang, Zan, et al.
Publicado: (2025)
AR4D: Autoregressive 4D Generation from Monocular Videos
por: Zhu, Hanxin, et al.
Publicado: (2025)
por: Zhu, Hanxin, et al.
Publicado: (2025)
Reward-Aware Trajectory Shaping for Few-step Visual Generation
por: Li, Rui, et al.
Publicado: (2026)
por: Li, Rui, et al.
Publicado: (2026)
ColorMNet: A Memory-based Deep Spatial-Temporal Feature Propagation Network for Video Colorization
por: Yang, Yixin, et al.
Publicado: (2024)
por: Yang, Yixin, et al.
Publicado: (2024)
Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation
por: Chen, Shifeng, et al.
Publicado: (2026)
por: Chen, Shifeng, et al.
Publicado: (2026)
Object-Centric Temporal Consistency via Conditional Autoregressive Inductive Biases
por: Meo, Cristian, et al.
Publicado: (2024)
por: Meo, Cristian, et al.
Publicado: (2024)
Video Spatial Reasoning with Object-Centric 3D Rollout
por: Tang, Haoran, et al.
Publicado: (2025)
por: Tang, Haoran, et al.
Publicado: (2025)
End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction
por: Zhang, Haoyu, et al.
Publicado: (2026)
por: Zhang, Haoyu, et al.
Publicado: (2026)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space
por: Xie, Yichen, et al.
Publicado: (2026)
por: Xie, Yichen, et al.
Publicado: (2026)
Ejemplares similares
-
Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context
por: Hu, JiaKui, et al.
Publicado: (2026) -
VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation
por: Zhang, Chi, et al.
Publicado: (2024) -
Conditional Video Generation for High-Efficiency Video Compression
por: Yi, Fangqiu, et al.
Publicado: (2025) -
Distilling Future Temporal Knowledge with Masked Feature Reconstruction for 3D Object Detection
por: Zheng, Haowen, et al.
Publicado: (2025) -
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
por: Hu, Panwen, et al.
Publicado: (2025)