UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Mengfei, Li, Peng, Zhang, Zheng, Lu, Jiahao, Zhao, Chengfeng, Xue, Wei, Liu, Qifeng, Peng, Sida, Zhang, Wenxiao, Luo, Wenhan, Liu, Yuan, Guo, Yike |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-speech Gesture Generation
by: Qi, Xingqun, et al.
Published: (2023)
by: Qi, Xingqun, et al.
Published: (2023)
Multi-View Large Reconstruction Model via Geometry-Aware Positional Encoding and Attention
by: Li, Mengfei, et al.
Published: (2024)
by: Li, Mengfei, et al.
Published: (2024)
CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild
by: Qi, Xingqun, et al.
Published: (2024)
by: Qi, Xingqun, et al.
Published: (2024)
UniForward: Unified 3D Scene and Semantic Field Reconstruction via Feed-Forward Gaussian Splatting from Only Sparse-View Images
by: Tian, Qijian, et al.
Published: (2025)
by: Tian, Qijian, et al.
Published: (2025)
HuPrior3R: Incorporating Human Priors for Better 3D Dynamic Reconstruction from Monocular Videos
by: Xiong, Weitao, et al.
Published: (2025)
by: Xiong, Weitao, et al.
Published: (2025)
SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
by: Chen, Wenyue, et al.
Published: (2025)
by: Chen, Wenyue, et al.
Published: (2025)
UniRecGen: Unifying Multi-View 3D Reconstruction and Generation
by: Huang, Zhisheng, et al.
Published: (2026)
by: Huang, Zhisheng, et al.
Published: (2026)
Era3D: High-Resolution Multiview Diffusion using Efficient Row-wise Attention
by: Li, Peng, et al.
Published: (2024)
by: Li, Peng, et al.
Published: (2024)
Uni-HOI:A Unified framework for Learning the Joint distribution of Text and Human-Object Interaction
by: Zhang, Mengfei, et al.
Published: (2026)
by: Zhang, Mengfei, et al.
Published: (2026)
UniVerse: Unleashing the Scene Prior of Video Diffusion Models for Robust Radiance Field Reconstruction
by: Cao, Jin, et al.
Published: (2025)
by: Cao, Jin, et al.
Published: (2025)
DenoiseSplat: Feed-Forward Gaussian Splatting for Noisy 3D Scene Reconstruction
by: Jiang, Fuzhen, et al.
Published: (2026)
by: Jiang, Fuzhen, et al.
Published: (2026)
Co$^{3}$Gesture: Towards Coherent Concurrent Co-speech 3D Gesture Generation with Interactive Diffusion
by: Qi, Xingqun, et al.
Published: (2025)
by: Qi, Xingqun, et al.
Published: (2025)
FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
by: Chen, Shijie, et al.
Published: (2025)
by: Chen, Shijie, et al.
Published: (2025)
FFAvatar: Few-Shot, Feed-Forward, and Generalizable Avatar Reconstruction
by: Nguyen, Thuan Hoang, et al.
Published: (2026)
by: Nguyen, Thuan Hoang, et al.
Published: (2026)
TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction
by: Wang, Weijie, et al.
Published: (2026)
by: Wang, Weijie, et al.
Published: (2026)
Splat-SAP: Feed-Forward Gaussian Splatting for Human-Centered Scene with Scale-Aware Point Map Reconstruction
by: Zhou, Boyao, et al.
Published: (2025)
by: Zhou, Boyao, et al.
Published: (2025)
VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer
by: Liu, Xinyu, et al.
Published: (2025)
by: Liu, Xinyu, et al.
Published: (2025)
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
by: Ren, Yuan, et al.
Published: (2024)
by: Ren, Yuan, et al.
Published: (2024)
PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing
by: Li, Peng, et al.
Published: (2024)
by: Li, Peng, et al.
Published: (2024)
SHARE: Scene-Human Aligned Reconstruction
by: Li, Joshua, et al.
Published: (2025)
by: Li, Joshua, et al.
Published: (2025)
UniScene: Unified Occupancy-centric Driving Scene Generation
by: Li, Bohan, et al.
Published: (2024)
by: Li, Bohan, et al.
Published: (2024)
HiPrompt: Tuning-free Higher-Resolution Generation with Hierarchical MLLM Prompts
by: Liu, Xinyu, et al.
Published: (2024)
by: Liu, Xinyu, et al.
Published: (2024)
DelowlightSplat: Feed-Forward Gaussian Splatting for Lowlight 3D Scene Reconstruction
by: Jiang, Fuzhen, et al.
Published: (2026)
by: Jiang, Fuzhen, et al.
Published: (2026)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
by: Chi, Xiaowei, et al.
Published: (2024)
by: Chi, Xiaowei, et al.
Published: (2024)
Long-LRM++: Preserving Fine Details in Feed-Forward Wide-Coverage Reconstruction
by: Ziwen, Chen, et al.
Published: (2025)
by: Ziwen, Chen, et al.
Published: (2025)
Feed-Forward Bullet-Time Reconstruction of Dynamic Scenes from Monocular Videos
by: Liang, Hanxue, et al.
Published: (2024)
by: Liang, Hanxue, et al.
Published: (2024)
Any4D: Unified Feed-Forward Metric 4D Reconstruction
by: Karhade, Jay, et al.
Published: (2025)
by: Karhade, Jay, et al.
Published: (2025)
Enhancing Human-Centered Dynamic Scene Understanding via Multiple LLMs Collaborated Reasoning
by: Zhang, Hang, et al.
Published: (2024)
by: Zhang, Hang, et al.
Published: (2024)
SemanticSplat: Feed-Forward 3D Scene Understanding with Language-Aware Gaussian Fields
by: Li, Qijing, et al.
Published: (2025)
by: Li, Qijing, et al.
Published: (2025)
UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction
by: Shi, Chen, et al.
Published: (2025)
by: Shi, Chen, et al.
Published: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
by: Tian, Zeyue, et al.
Published: (2024)
by: Tian, Zeyue, et al.
Published: (2024)
UniDream: Unifying Diffusion Priors for Relightable Text-to-3D Generation
by: Liu, Zexiang, et al.
Published: (2023)
by: Liu, Zexiang, et al.
Published: (2023)
Dynamic Gaussian Scene Reconstruction from Unsynchronized Videos
by: Xu, Zhixin, et al.
Published: (2025)
by: Xu, Zhixin, et al.
Published: (2025)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
by: Li, Yunxin, et al.
Published: (2024)
by: Li, Yunxin, et al.
Published: (2024)
UniSRCodec: Unified and Low-Bitrate Single Codebook Codec with Sub-Band Reconstruction
by: Zhang, Zhisheng, et al.
Published: (2026)
by: Zhang, Zhisheng, et al.
Published: (2026)
Keyframe-Based Feed-Forward Visual Odometry
by: Dai, Weichen, et al.
Published: (2026)
by: Dai, Weichen, et al.
Published: (2026)
CMD: Controllable Multiview Diffusion for 3D Editing and Progressive Generation
by: Li, Peng, et al.
Published: (2025)
by: Li, Peng, et al.
Published: (2025)
Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation
by: Yang, Yuanbo, et al.
Published: (2024)
by: Yang, Yuanbo, et al.
Published: (2024)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
by: Li, Kunchang, et al.
Published: (2022)
by: Li, Kunchang, et al.
Published: (2022)
UniMove: A Unified Model for Multi-city Human Mobility Prediction
by: Han, Chonghua, et al.
Published: (2025)
by: Han, Chonghua, et al.
Published: (2025)
Similar Items
-
Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-speech Gesture Generation
by: Qi, Xingqun, et al.
Published: (2023) -
Multi-View Large Reconstruction Model via Geometry-Aware Positional Encoding and Attention
by: Li, Mengfei, et al.
Published: (2024) -
CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild
by: Qi, Xingqun, et al.
Published: (2024) -
UniForward: Unified 3D Scene and Semantic Field Reconstruction via Feed-Forward Gaussian Splatting from Only Sparse-View Images
by: Tian, Qijian, et al.
Published: (2025) -
HuPrior3R: Incorporating Human Priors for Better 3D Dynamic Reconstruction from Monocular Videos
by: Xiong, Weitao, et al.
Published: (2025)