DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhuo, Dong, Zheng, Wenzhao, Zuo, Sicheng, Yan, Siming, Hou, Lu, Zhou, Jie, Lu, Jiwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vega: Learning to Drive with Natural Language Instructions
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
di: Wu, Yuqi, et al.
Pubblicazione: (2024)
di: Wu, Yuqi, et al.
Pubblicazione: (2024)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
di: Zuo, Sicheng, et al.
Pubblicazione: (2024)
di: Zuo, Sicheng, et al.
Pubblicazione: (2024)
GPD-1: Generative Pre-training for Driving
di: Xie, Zixun, et al.
Pubblicazione: (2024)
di: Xie, Zixun, et al.
Pubblicazione: (2024)
QuadricFormer: Scene as Superquadrics for 3D Semantic Occupancy Prediction
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
di: Wu, Yuqi, et al.
Pubblicazione: (2025)
di: Wu, Yuqi, et al.
Pubblicazione: (2025)
Driv3R: Learning Dense 4D Reconstruction for Autonomous Driving
di: Fei, Xin, et al.
Pubblicazione: (2024)
di: Fei, Xin, et al.
Pubblicazione: (2024)
Hardness-Aware Scene Synthesis for Semi-Supervised 3D Object Detection
di: Zeng, Shuai, et al.
Pubblicazione: (2024)
di: Zeng, Shuai, et al.
Pubblicazione: (2024)
OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
DVGT: Driving Visual Geometry Transformer
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
Streaming 4D Visual Geometry Transformer
di: Zhuo, Dong, et al.
Pubblicazione: (2025)
di: Zhuo, Dong, et al.
Pubblicazione: (2025)
Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
di: Liu, Zhe, et al.
Pubblicazione: (2025)
di: Liu, Zhe, et al.
Pubblicazione: (2025)
SFTok: Bridging the Performance Gap in Discrete Tokenizers
di: Rao, Qihang, et al.
Pubblicazione: (2025)
di: Rao, Qihang, et al.
Pubblicazione: (2025)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
di: Dong, Jiajun, et al.
Pubblicazione: (2025)
di: Dong, Jiajun, et al.
Pubblicazione: (2025)
Fast Shapley Value Estimation: A Unified Approach
di: Zhang, Borui, et al.
Pubblicazione: (2023)
di: Zhang, Borui, et al.
Pubblicazione: (2023)
PixelGaussian: Generalizable 3D Gaussian Reconstruction from Arbitrary Views
di: Fei, Xin, et al.
Pubblicazione: (2024)
di: Fei, Xin, et al.
Pubblicazione: (2024)
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
di: Wang, Lening, et al.
Pubblicazione: (2024)
di: Wang, Lening, et al.
Pubblicazione: (2024)
DrivingRecon: Large 4D Gaussian Reconstruction Model For Autonomous Driving
di: Lu, Hao, et al.
Pubblicazione: (2024)
di: Lu, Hao, et al.
Pubblicazione: (2024)
Path Choice Matters for Clear Attribution in Path Methods
di: Zhang, Borui, et al.
Pubblicazione: (2024)
di: Zhang, Borui, et al.
Pubblicazione: (2024)
Preventing Local Pitfalls in Vector Quantization via Optimal Transport
di: Zhang, Borui, et al.
Pubblicazione: (2024)
di: Zhang, Borui, et al.
Pubblicazione: (2024)
GlobalMamba: Global Image Serialization for Vision Mamba
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention
di: Lu, Hannan, et al.
Pubblicazione: (2024)
di: Lu, Hannan, et al.
Pubblicazione: (2024)
4D Driving Scene Generation With Stereo Forcing
di: Lu, Hao, et al.
Pubblicazione: (2025)
di: Lu, Hao, et al.
Pubblicazione: (2025)
Measuring 3D Spatial Geometric Consistency in Dynamic Generated Videos
di: Dou, Weijia, et al.
Pubblicazione: (2026)
di: Dou, Weijia, et al.
Pubblicazione: (2026)
4DRadar-GS: Self-Supervised Dynamic Driving Scene Reconstruction with 4D Radar
di: Tang, Xiao, et al.
Pubblicazione: (2025)
di: Tang, Xiao, et al.
Pubblicazione: (2025)
Stag-1: Towards Realistic 4D Driving Simulation with Video Generation Model
di: Wang, Lening, et al.
Pubblicazione: (2024)
di: Wang, Lening, et al.
Pubblicazione: (2024)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
di: Min, Chen, et al.
Pubblicazione: (2023)
di: Min, Chen, et al.
Pubblicazione: (2023)
DriveEditor: A Unified 3D Information-Guided Framework for Controllable Object Editing in Driving Scenes
di: Liang, Yiyuan, et al.
Pubblicazione: (2024)
di: Liang, Yiyuan, et al.
Pubblicazione: (2024)
DriveSplat: Unified Neural Gaussian Reconstruction for Dynamic Driving Scenes
di: Wang, Cong, et al.
Pubblicazione: (2025)
di: Wang, Cong, et al.
Pubblicazione: (2025)
DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
di: Wang, Weijie, et al.
Pubblicazione: (2025)
di: Wang, Weijie, et al.
Pubblicazione: (2025)
Quantize-then-Rectify: Efficient VQ-VAE Training
di: Zhang, Borui, et al.
Pubblicazione: (2025)
di: Zhang, Borui, et al.
Pubblicazione: (2025)
V2M: Visual 2-Dimensional Mamba for Image Representation Learning
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
Terra: Explorable Native 3D World Model with Point Latents
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
UniPre3D: Unified Pre-training of 3D Point Cloud Models with Cross-Modal Gaussian Splatting
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026)
di: Zhou, Xin, et al.
Pubblicazione: (2026)
HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving
di: Wu, Zehuan, et al.
Pubblicazione: (2024)
di: Wu, Zehuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vega: Learning to Drive with Natural Language Instructions
di: Zuo, Sicheng, et al.
Pubblicazione: (2026) -
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
di: Wu, Yuqi, et al.
Pubblicazione: (2024) -
Doe-1: Closed-Loop Autonomous Driving with Large World Model
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024) -
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
di: Zuo, Sicheng, et al.
Pubblicazione: (2024) -
GPD-1: Generative Pre-training for Driving
di: Xie, Zixun, et al.
Pubblicazione: (2024)