Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gui, Xingtai, Zhang, Meijie, Yan, Tianyi, Han, Wencheng, Gong, Jiahao, Tan, Feiyang, Xu, Cheng-zhong, Shen, Jianbing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TrajDiff: End-to-end Autonomous Driving without Perception Annotation
par: Gui, Xingtai, et autres
Publié: (2025)
par: Gui, Xingtai, et autres
Publié: (2025)
RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
par: Yan, Tianyi, et autres
Publié: (2025)
par: Yan, Tianyi, et autres
Publié: (2025)
Breaking Down Monocular Ambiguity: Exploiting Temporal Evolution for 3D Lane Detection
par: Zheng, Huan, et autres
Publié: (2025)
par: Zheng, Huan, et autres
Publié: (2025)
DrivingSphere: Building a High-fidelity 4D World for Closed-loop Simulation
par: Yan, Tianyi, et autres
Publié: (2024)
par: Yan, Tianyi, et autres
Publié: (2024)
AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
par: Yan, Tianyi, et autres
Publié: (2025)
par: Yan, Tianyi, et autres
Publié: (2025)
DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving
par: Han, Wencheng, et autres
Publié: (2024)
par: Han, Wencheng, et autres
Publié: (2024)
Language Prompt for Autonomous Driving
par: Wu, Dongming, et autres
Publié: (2023)
par: Wu, Dongming, et autres
Publié: (2023)
From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving
par: Zheng, Huan, et autres
Publié: (2025)
par: Zheng, Huan, et autres
Publié: (2025)
High-Precision Self-Supervised Monocular Depth Estimation with Rich-Resource Prior
par: Han, Wencheng, et autres
Publié: (2024)
par: Han, Wencheng, et autres
Publié: (2024)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
par: Yang, Hongji, et autres
Publié: (2025)
par: Yang, Hongji, et autres
Publié: (2025)
RepVF: A Unified Vector Fields Representation for Multi-task 3D Perception
par: Li, Chunliang, et autres
Publié: (2024)
par: Li, Chunliang, et autres
Publié: (2024)
Towards Geometry-Aware and Motion-Guided Video Human Mesh Recovery
par: Chen, Hongjun, et autres
Publié: (2026)
par: Chen, Hongjun, et autres
Publié: (2026)
ChainFlow-VLA: Causal Flow Planning with Vision-Language Models
par: Wang, Xiyang, et autres
Publié: (2026)
par: Wang, Xiyang, et autres
Publié: (2026)
RAWMamba: Unified sRGB-to-RAW De-rendering With State Space Model
par: Chen, Hongjun, et autres
Publié: (2024)
par: Chen, Hongjun, et autres
Publié: (2024)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
par: Zhou, Xin, et autres
Publié: (2026)
par: Zhou, Xin, et autres
Publié: (2026)
Decoupling Fine Detail and Global Geometry for Compressed Depth Map Super-Resolution
par: Zheng, Huan, et autres
Publié: (2024)
par: Zheng, Huan, et autres
Publié: (2024)
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
par: Zhou, Xin, et autres
Publié: (2025)
par: Zhou, Xin, et autres
Publié: (2025)
DC-ControlNet: Decoupling Inter- and Intra-Element Conditions in Image Generation with Diffusion Models
par: Yang, Hongji, et autres
Publié: (2025)
par: Yang, Hongji, et autres
Publié: (2025)
Towards High-Fidelity 3D Portrait Generation with Rich Details by Cross-View Prior-Aware Diffusion
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
UniScene: Unified Occupancy-centric Driving Scene Generation
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
ScenePilot: Controllable Boundary-Driven Critical Scenario Generation for Autonomous Driving
par: Ruan, Qiyu, et autres
Publié: (2026)
par: Ruan, Qiyu, et autres
Publié: (2026)
Towards Better Cephalometric Landmark Detection with Diffusion Data Generation
par: Guo, Dongqian, et autres
Publié: (2025)
par: Guo, Dongqian, et autres
Publié: (2025)
AdaOcc: Adaptive Forward View Transformation and Flow Modeling for 3D Occupancy and Flow Prediction
par: Chen, Dubing, et autres
Publié: (2024)
par: Chen, Dubing, et autres
Publié: (2024)
RiskMap: A Unified Driving Context Representation for Autonomous Motion Planning in Urban Driving Environment
par: Xin, Ren, et autres
Publié: (2024)
par: Xin, Ren, et autres
Publié: (2024)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
par: Yang, Hongji, et autres
Publié: (2026)
par: Yang, Hongji, et autres
Publié: (2026)
OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space
par: Liang, Zhuding, et autres
Publié: (2026)
par: Liang, Zhuding, et autres
Publié: (2026)
OLiDM: Object-aware LiDAR Diffusion Models for Autonomous Driving
par: Yan, Tianyi, et autres
Publié: (2024)
par: Yan, Tianyi, et autres
Publié: (2024)
OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder
par: Gao, Sensen, et autres
Publié: (2026)
par: Gao, Sensen, et autres
Publié: (2026)
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
par: Xiong, Zhexiao, et autres
Publié: (2026)
par: Xiong, Zhexiao, et autres
Publié: (2026)
BridgeNet: A Unified Multimodal Framework for Bridging 2D and 3D Industrial Anomaly Detection
par: Xiang, An, et autres
Publié: (2025)
par: Xiang, An, et autres
Publié: (2025)
TransBridge: Boost 3D Object Detection by Scene-Level Completion with Transformer Decoder
par: Meng, Qinghao, et autres
Publié: (2025)
par: Meng, Qinghao, et autres
Publié: (2025)
Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity
par: Zhou, Yucheng, et autres
Publié: (2026)
par: Zhou, Yucheng, et autres
Publié: (2026)
CLAIM: Camera-LiDAR Alignment with Intensity and Monodepth
par: Zhang, Zhuo, et autres
Publié: (2025)
par: Zhang, Zhuo, et autres
Publié: (2025)
Human Motion Synthesis in 3D Scenes via Unified Scene Semantic Occupancy
par: Jingyu, Gong, et autres
Publié: (2025)
par: Jingyu, Gong, et autres
Publié: (2025)
FipTR: A Simple yet Effective Transformer Framework for Future Instance Prediction in Autonomous Driving
par: Gui, Xingtai, et autres
Publié: (2024)
par: Gui, Xingtai, et autres
Publié: (2024)
DriveLaW:Unifying Planning and Video Generation in a Latent Driving World
par: Xia, Tianze, et autres
Publié: (2025)
par: Xia, Tianze, et autres
Publié: (2025)
Open-World Task and Motion Planning via Vision-Language Model Generated Constraints
par: Kumar, Nishanth, et autres
Publié: (2024)
par: Kumar, Nishanth, et autres
Publié: (2024)
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
par: Yang, Hongji, et autres
Publié: (2025)
par: Yang, Hongji, et autres
Publié: (2025)
Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving
par: Chen, Xuyang, et autres
Publié: (2026)
par: Chen, Xuyang, et autres
Publié: (2026)
Documents similaires
-
TrajDiff: End-to-end Autonomous Driving without Perception Annotation
par: Gui, Xingtai, et autres
Publié: (2025) -
RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
par: Yan, Tianyi, et autres
Publié: (2025) -
Breaking Down Monocular Ambiguity: Exploiting Temporal Evolution for 3D Lane Detection
par: Zheng, Huan, et autres
Publié: (2025) -
DrivingSphere: Building a High-fidelity 4D World for Closed-loop Simulation
par: Yan, Tianyi, et autres
Publié: (2024) -
AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
par: Yan, Tianyi, et autres
Publié: (2025)