GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking
Fuente:
arXiv
Guardado en:
| Autores principales: | Bian, Weikang, Huang, Zhaoyang, Shi, Xiaoyu, Li, Yijin, Wang, Fu-Yun, Li, Hongsheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AnimateLCM: Computation-Efficient Personalized Style Video Generation without Personalized Video Data
por: Wang, Fu-Yun, et al.
Publicado: (2024)
por: Wang, Fu-Yun, et al.
Publicado: (2024)
BlinkVision: A Benchmark for Optical Flow, Scene Flow and Point Tracking Estimation using RGB Frames and Events
por: Li, Yijin, et al.
Publicado: (2024)
por: Li, Yijin, et al.
Publicado: (2024)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
por: Liu, Dongyang, et al.
Publicado: (2025)
por: Liu, Dongyang, et al.
Publicado: (2025)
DirectTriGS: Triplane-based Gaussian Splatting Field Representation for 3D Generation
por: Ju, Xiaoliang, et al.
Publicado: (2025)
por: Ju, Xiaoliang, et al.
Publicado: (2025)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
por: Ma, Teli, et al.
Publicado: (2026)
por: Ma, Teli, et al.
Publicado: (2026)
RelightMaster: Precise Video Relighting with Multi-plane Light Images
por: Bian, Weikang, et al.
Publicado: (2025)
por: Bian, Weikang, et al.
Publicado: (2025)
Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer
por: Shao, Ruizhi, et al.
Publicado: (2024)
por: Shao, Ruizhi, et al.
Publicado: (2024)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
por: Zhang, Jinxiao, et al.
Publicado: (2026)
por: Zhang, Jinxiao, et al.
Publicado: (2026)
Be-Your-Outpainter: Mastering Video Outpainting through Input-Specific Adaptation
por: Wang, Fu-Yun, et al.
Publicado: (2024)
por: Wang, Fu-Yun, et al.
Publicado: (2024)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
por: Shi, Junqi, et al.
Publicado: (2026)
por: Shi, Junqi, et al.
Publicado: (2026)
Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling
por: Shi, Xiaoyu, et al.
Publicado: (2024)
por: Shi, Xiaoyu, et al.
Publicado: (2024)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
por: Wang, Kai, et al.
Publicado: (2024)
por: Wang, Kai, et al.
Publicado: (2024)
A Global Depth-Range-Free Multi-View Stereo Transformer Network with Pose Embedding
por: Dong, Yitong, et al.
Publicado: (2024)
por: Dong, Yitong, et al.
Publicado: (2024)
DiVE: DiT-based Video Generation with Enhanced Control
por: Jiang, Junpeng, et al.
Publicado: (2024)
por: Jiang, Junpeng, et al.
Publicado: (2024)
ProtoGS: Efficient and High-Quality Rendering with 3D Gaussian Prototypes
por: Gao, Zhengqing, et al.
Publicado: (2025)
por: Gao, Zhengqing, et al.
Publicado: (2025)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
por: Lyu, Hengye, et al.
Publicado: (2026)
por: Lyu, Hengye, et al.
Publicado: (2026)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
por: Deng, Juncan, et al.
Publicado: (2024)
por: Deng, Juncan, et al.
Publicado: (2024)
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
por: Wu, Chenyang, et al.
Publicado: (2026)
por: Wu, Chenyang, et al.
Publicado: (2026)
FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers
por: Chen, Ruichen, et al.
Publicado: (2025)
por: Chen, Ruichen, et al.
Publicado: (2025)
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
por: Yan, Chi, et al.
Publicado: (2023)
por: Yan, Chi, et al.
Publicado: (2023)
Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
por: Zhuo, Le, et al.
Publicado: (2024)
por: Zhuo, Le, et al.
Publicado: (2024)
TetriServe: Efficient DiT Serving for Heterogeneous Image Generation
por: Lu, Runyu, et al.
Publicado: (2025)
por: Lu, Runyu, et al.
Publicado: (2025)
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
por: Liu, Wenxuan, et al.
Publicado: (2024)
por: Liu, Wenxuan, et al.
Publicado: (2024)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
por: Lin, Hangyu, et al.
Publicado: (2026)
por: Lin, Hangyu, et al.
Publicado: (2026)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
por: Zhao, Lin, et al.
Publicado: (2026)
por: Zhao, Lin, et al.
Publicado: (2026)
BlinkFlow: A Dataset to Push the Limits of Event-based Optical Flow Estimation
por: Li, Yijin, et al.
Publicado: (2023)
por: Li, Yijin, et al.
Publicado: (2023)
SplAttN: Bridging 2D and 3D with Gaussian Soft Splatting and Attention for Point Cloud Completion
por: Li, Zhaoyang, et al.
Publicado: (2026)
por: Li, Zhaoyang, et al.
Publicado: (2026)
DiT4Edit: Diffusion Transformer for Image Editing
por: Feng, Kunyu, et al.
Publicado: (2024)
por: Feng, Kunyu, et al.
Publicado: (2024)
TQ-DiT: Efficient Time-Aware Quantization for Diffusion Transformers
por: Hwang, Younghye, et al.
Publicado: (2025)
por: Hwang, Younghye, et al.
Publicado: (2025)
PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting
por: Song, Yixiao, et al.
Publicado: (2026)
por: Song, Yixiao, et al.
Publicado: (2026)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
por: Fang, Jiarui, et al.
Publicado: (2024)
por: Fang, Jiarui, et al.
Publicado: (2024)
AirGS: Real-Time 4D Gaussian Streaming for Free-Viewpoint Video Experiences
por: Wang, Zhe, et al.
Publicado: (2025)
por: Wang, Zhe, et al.
Publicado: (2025)
TrackGS: Optimizing COLMAP-Free 3D Gaussian Splatting with Global Track Constraints
por: Shi, Dongbo, et al.
Publicado: (2025)
por: Shi, Dongbo, et al.
Publicado: (2025)
4DVD: Cascaded Dense-view Video Diffusion Model for High-quality 4D Content Generation
por: Yang, Shuzhou, et al.
Publicado: (2025)
por: Yang, Shuzhou, et al.
Publicado: (2025)
GaussianPainter: Painting Point Cloud into 3D Gaussians with Normal Guidance
por: Zhou, Jingqiu, et al.
Publicado: (2024)
por: Zhou, Jingqiu, et al.
Publicado: (2024)
TaQ-DiT: Time-aware Quantization for Diffusion Transformers
por: Liu, Xinyan, et al.
Publicado: (2024)
por: Liu, Xinyan, et al.
Publicado: (2024)
XFreq-GS: Cross-Frequency Wireless Radiation Field Reconstruction with 3D Gaussian Splatting
por: Wang, Sheng, et al.
Publicado: (2026)
por: Wang, Sheng, et al.
Publicado: (2026)
RetinaGS: Scalable Training for Dense Scene Rendering with Billion-Scale 3D Gaussians
por: Li, Bingling, et al.
Publicado: (2024)
por: Li, Bingling, et al.
Publicado: (2024)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
por: Wu, Junyi, et al.
Publicado: (2024)
por: Wu, Junyi, et al.
Publicado: (2024)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
por: Sun, Jiahui, et al.
Publicado: (2025)
por: Sun, Jiahui, et al.
Publicado: (2025)
Ejemplares similares
-
AnimateLCM: Computation-Efficient Personalized Style Video Generation without Personalized Video Data
por: Wang, Fu-Yun, et al.
Publicado: (2024) -
BlinkVision: A Benchmark for Optical Flow, Scene Flow and Point Tracking Estimation using RGB Frames and Events
por: Li, Yijin, et al.
Publicado: (2024) -
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
por: Liu, Dongyang, et al.
Publicado: (2025) -
DirectTriGS: Triplane-based Gaussian Splatting Field Representation for 3D Generation
por: Ju, Xiaoliang, et al.
Publicado: (2025) -
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
por: Ma, Teli, et al.
Publicado: (2026)