Compositional 3D-aware Video Generation with LLM Director
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Hanxin, He, Tianyu, Tang, Anni, Guo, Junliang, Chen, Zhibo, Bian, Jiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AR4D: Autoregressive 4D Generation from Monocular Videos
di: Zhu, Hanxin, et al.
Pubblicazione: (2025)
di: Zhu, Hanxin, et al.
Pubblicazione: (2025)
GaussianSR: 3D Gaussian Super-Resolution with 2D Diffusion Priors
di: Yu, Xiqian, et al.
Pubblicazione: (2024)
di: Yu, Xiqian, et al.
Pubblicazione: (2024)
CMC: Few-shot Novel View Synthesis via Cross-view Multiplane Consistency
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion
di: Zhu, Hanxin, et al.
Pubblicazione: (2026)
di: Zhu, Hanxin, et al.
Pubblicazione: (2026)
End-to-End Rate-Distortion Optimized 3D Gaussian Representation
di: Wang, Henan, et al.
Pubblicazione: (2024)
di: Wang, Henan, et al.
Pubblicazione: (2024)
VidTok: A Versatile and Open-Source Video Tokenizer
di: Tang, Anni, et al.
Pubblicazione: (2024)
di: Tang, Anni, et al.
Pubblicazione: (2024)
Is Vanilla MLP in Neural Radiance Field Enough for Few-shot View Synthesis?
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
P-4DGS: Predictive 4D Gaussian Splatting with 90$\times$ Compression
di: Wang, Henan, et al.
Pubblicazione: (2025)
di: Wang, Henan, et al.
Pubblicazione: (2025)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
di: Zhang, Wentao, et al.
Pubblicazione: (2024)
di: Zhang, Wentao, et al.
Pubblicazione: (2024)
OrthoPhys: Physically Plausible Video Generation with Orthogonal-View Geometry Guidance
di: Wang, Cong, et al.
Pubblicazione: (2026)
di: Wang, Cong, et al.
Pubblicazione: (2026)
Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling
di: Wu, Haoyu, et al.
Pubblicazione: (2025)
di: Wu, Haoyu, et al.
Pubblicazione: (2025)
GSemSplat: Generalizable Semantic 3D Gaussian Splatting from Uncalibrated Image Pairs
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation
di: Luo, Jiayi, et al.
Pubblicazione: (2026)
di: Luo, Jiayi, et al.
Pubblicazione: (2026)
UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
Fast Autoregressive Video Generation with Diagonal Decoding
di: Ye, Yang, et al.
Pubblicazione: (2025)
di: Ye, Yang, et al.
Pubblicazione: (2025)
Light Field Compression Based on Implicit Neural Representation
di: Wang, Henan, et al.
Pubblicazione: (2024)
di: Wang, Henan, et al.
Pubblicazione: (2024)
VidTwin: Video VAE with Decoupled Structure and Dynamics
di: Wang, Yuchi, et al.
Pubblicazione: (2024)
di: Wang, Yuchi, et al.
Pubblicazione: (2024)
Playing with Transformer at 30+ FPS via Next-Frame Diffusion
di: Cheng, Xinle, et al.
Pubblicazione: (2025)
di: Cheng, Xinle, et al.
Pubblicazione: (2025)
Rate-aware Compression for NeRF-based Volumetric Video
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
di: Luo, Jiayi, et al.
Pubblicazione: (2026)
di: Luo, Jiayi, et al.
Pubblicazione: (2026)
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
di: Ye, Junliang, et al.
Pubblicazione: (2025)
di: Ye, Junliang, et al.
Pubblicazione: (2025)
4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
Memories are One-to-Many Mapping Alleviators in Talking Face Generation
di: Tang, Anni, et al.
Pubblicazione: (2022)
di: Tang, Anni, et al.
Pubblicazione: (2022)
Llama Learns to Direct: DirectorLLM for Human-Centric Video Generation
di: Song, Kunpeng, et al.
Pubblicazione: (2024)
di: Song, Kunpeng, et al.
Pubblicazione: (2024)
Embody4D: A Generalist 4D World Model for Embodied AI
di: Tu, Peiyan, et al.
Pubblicazione: (2026)
di: Tu, Peiyan, et al.
Pubblicazione: (2026)
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
di: Guo, Junliang, et al.
Pubblicazione: (2025)
di: Guo, Junliang, et al.
Pubblicazione: (2025)
InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation
di: Wang, Yuchi, et al.
Pubblicazione: (2024)
di: Wang, Yuchi, et al.
Pubblicazione: (2024)
Diffusion Models in 3D Vision: A Survey
di: Wang, Zhen, et al.
Pubblicazione: (2024)
di: Wang, Zhen, et al.
Pubblicazione: (2024)
Training-free Camera Control for Video Generation
di: Hou, Chen, et al.
Pubblicazione: (2024)
di: Hou, Chen, et al.
Pubblicazione: (2024)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
di: Wang, Chunshi, et al.
Pubblicazione: (2025)
di: Wang, Chunshi, et al.
Pubblicazione: (2025)
Make Your Actor Talk: Generalizable and High-Fidelity Lip Sync with Motion and Appearance Disentanglement
di: Yu, Runyi, et al.
Pubblicazione: (2024)
di: Yu, Runyi, et al.
Pubblicazione: (2024)
Frequency-aware Neural Representation for Videos
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
UCIP: A Universal Framework for Compressed Image Super-Resolution using Dynamic Prompt
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
SeD: Semantic-Aware Discriminator for Image Super-Resolution
di: Li, Bingchen, et al.
Pubblicazione: (2024)
di: Li, Bingchen, et al.
Pubblicazione: (2024)
Generalized Low-Rank Matrix Completion Model with Overlapping Group Error Representation
di: Lu, Wenjing, et al.
Pubblicazione: (2024)
di: Lu, Wenjing, et al.
Pubblicazione: (2024)
GAIA: Zero-shot Talking Avatar Generation
di: He, Tianyu, et al.
Pubblicazione: (2023)
di: He, Tianyu, et al.
Pubblicazione: (2023)
LIVE: Long-horizon Interactive Video World Modeling
di: Huang, Junchao, et al.
Pubblicazione: (2026)
di: Huang, Junchao, et al.
Pubblicazione: (2026)
Reinforcement Learning with Inverse Rewards for World Model Post-training
di: Ye, Yang, et al.
Pubblicazione: (2025)
di: Ye, Yang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AR4D: Autoregressive 4D Generation from Monocular Videos
di: Zhu, Hanxin, et al.
Pubblicazione: (2025) -
GaussianSR: 3D Gaussian Super-Resolution with 2D Diffusion Priors
di: Yu, Xiqian, et al.
Pubblicazione: (2024) -
CMC: Few-shot Novel View Synthesis via Cross-view Multiplane Consistency
di: Zhu, Hanxin, et al.
Pubblicazione: (2024) -
GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion
di: Zhu, Hanxin, et al.
Pubblicazione: (2026) -
End-to-End Rate-Distortion Optimized 3D Gaussian Representation
di: Wang, Henan, et al.
Pubblicazione: (2024)