GPD-1: Generative Pre-training for Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Zixun, Zuo, Sicheng, Zheng, Wenzhao, Zhang, Yunpeng, Du, Dalong, Zhou, Jie, Lu, Jiwen, Zhang, Shanghang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vega: Learning to Drive with Natural Language Instructions
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
DVGT: Driving Visual Geometry Transformer
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
GaussianAD: Gaussian-Centric End-to-End Autonomous Driving
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
Stag-1: Towards Realistic 4D Driving Simulation with Video Generation Model
di: Wang, Lening, et al.
Pubblicazione: (2024)
di: Wang, Lening, et al.
Pubblicazione: (2024)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
di: Chen, Anthony, et al.
Pubblicazione: (2025)
di: Chen, Anthony, et al.
Pubblicazione: (2025)
DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
di: Zhuo, Dong, et al.
Pubblicazione: (2026)
di: Zhuo, Dong, et al.
Pubblicazione: (2026)
GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
OmniIndoor3D: Comprehensive Indoor 3D Reconstruction
di: Wei, Xiaobao, et al.
Pubblicazione: (2025)
di: Wei, Xiaobao, et al.
Pubblicazione: (2025)
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
di: Zuo, Sicheng, et al.
Pubblicazione: (2024)
di: Zuo, Sicheng, et al.
Pubblicazione: (2024)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
DrivingRecon: Large 4D Gaussian Reconstruction Model For Autonomous Driving
di: Lu, Hao, et al.
Pubblicazione: (2024)
di: Lu, Hao, et al.
Pubblicazione: (2024)
R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation
di: Xu, Xiuwei, et al.
Pubblicazione: (2025)
di: Xu, Xiuwei, et al.
Pubblicazione: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
di: Wu, Yuqi, et al.
Pubblicazione: (2024)
di: Wu, Yuqi, et al.
Pubblicazione: (2024)
QuadricFormer: Scene as Superquadrics for 3D Semantic Occupancy Prediction
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
di: Zuo, Sicheng, et al.
Pubblicazione: (2025)
Path Choice Matters for Clear Attribution in Path Methods
di: Zhang, Borui, et al.
Pubblicazione: (2024)
di: Zhang, Borui, et al.
Pubblicazione: (2024)
Preventing Local Pitfalls in Vector Quantization via Optimal Transport
di: Zhang, Borui, et al.
Pubblicazione: (2024)
di: Zhang, Borui, et al.
Pubblicazione: (2024)
GlobalMamba: Global Image Serialization for Vision Mamba
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation
di: Yin, Hang, et al.
Pubblicazione: (2024)
di: Yin, Hang, et al.
Pubblicazione: (2024)
VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving
di: Zhang, Haiming, et al.
Pubblicazione: (2024)
di: Zhang, Haiming, et al.
Pubblicazione: (2024)
GASP: Unifying Geometric and Semantic Self-Supervised Pre-training for Autonomous Driving
di: Ljungbergh, William, et al.
Pubblicazione: (2025)
di: Ljungbergh, William, et al.
Pubblicazione: (2025)
UniGoal: Towards Universal Zero-shot Goal-oriented Navigation
di: Yin, Hang, et al.
Pubblicazione: (2025)
di: Yin, Hang, et al.
Pubblicazione: (2025)
EmbodiedSAM: Online Segment Any 3D Thing in Real Time
di: Xu, Xiuwei, et al.
Pubblicazione: (2024)
di: Xu, Xiuwei, et al.
Pubblicazione: (2024)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
di: Yin, Hang, et al.
Pubblicazione: (2025)
di: Yin, Hang, et al.
Pubblicazione: (2025)
UniPre3D: Unified Pre-training of 3D Point Cloud Models with Cross-Modal Gaussian Splatting
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Measuring 3D Spatial Geometric Consistency in Dynamic Generated Videos
di: Dou, Weijia, et al.
Pubblicazione: (2026)
di: Dou, Weijia, et al.
Pubblicazione: (2026)
SFTok: Bridging the Performance Gap in Discrete Tokenizers
di: Rao, Qihang, et al.
Pubblicazione: (2025)
di: Rao, Qihang, et al.
Pubblicazione: (2025)
Quantize-then-Rectify: Efficient VQ-VAE Training
di: Zhang, Borui, et al.
Pubblicazione: (2025)
di: Zhang, Borui, et al.
Pubblicazione: (2025)
Fast Shapley Value Estimation: A Unified Approach
di: Zhang, Borui, et al.
Pubblicazione: (2023)
di: Zhang, Borui, et al.
Pubblicazione: (2023)
DINO Pre-training for Vision-based End-to-end Autonomous Driving
di: Juneja, Shubham, et al.
Pubblicazione: (2024)
di: Juneja, Shubham, et al.
Pubblicazione: (2024)
IGL-Nav: Incremental 3D Gaussian Localization for Image-goal Navigation
di: Guo, Wenxuan, et al.
Pubblicazione: (2025)
di: Guo, Wenxuan, et al.
Pubblicazione: (2025)
ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation
di: Lu, Guanxing, et al.
Pubblicazione: (2024)
di: Lu, Guanxing, et al.
Pubblicazione: (2024)
UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection
di: Zhang, Yanran, et al.
Pubblicazione: (2026)
di: Zhang, Yanran, et al.
Pubblicazione: (2026)
OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
V2M: Visual 2-Dimensional Mamba for Image Representation Learning
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond
di: Zhang, Haiming, et al.
Pubblicazione: (2026)
di: Zhang, Haiming, et al.
Pubblicazione: (2026)
Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
di: Wu, Yuqi, et al.
Pubblicazione: (2025)
di: Wu, Yuqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Vega: Learning to Drive with Natural Language Instructions
di: Zuo, Sicheng, et al.
Pubblicazione: (2026) -
DVGT: Driving Visual Geometry Transformer
di: Zuo, Sicheng, et al.
Pubblicazione: (2025) -
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
di: Zuo, Sicheng, et al.
Pubblicazione: (2026) -
GaussianAD: Gaussian-Centric End-to-End Autonomous Driving
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024) -
Stag-1: Towards Realistic 4D Driving Simulation with Video Generation Model
di: Wang, Lening, et al.
Pubblicazione: (2024)