Generating Multimodal Driving Scenes via Next-Scene Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yanhao, Zhang, Haoyang, Lin, Tianwei, Huang, Lichao, Luo, Shujie, Wu, Rui, Qiu, Congpei, Ke, Wei, Zhang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving
par: Wu, Yanhao, et autres
Publié: (2026)
par: Wu, Yanhao, et autres
Publié: (2026)
Refining CLIP's Spatial Awareness: A Visual-Centric Perspective
par: Qiu, Congpei, et autres
Publié: (2025)
par: Qiu, Congpei, et autres
Publié: (2025)
UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register
par: Qiu, Congpei, et autres
Publié: (2026)
par: Qiu, Congpei, et autres
Publié: (2026)
Mitigating Object Dependencies: Improving Point Cloud Self-Supervised Learning through Object Exchange
par: Wu, Yanhao, et autres
Publié: (2024)
par: Wu, Yanhao, et autres
Publié: (2024)
Pair2Scene: Learning Local Object Relations for Procedural Scene Generation
par: Ran, Xingjian, et autres
Publié: (2026)
par: Ran, Xingjian, et autres
Publié: (2026)
OmniHD-Scenes: A Next-Generation Multimodal Dataset for Autonomous Driving
par: Zheng, Lianqing, et autres
Publié: (2024)
par: Zheng, Lianqing, et autres
Publié: (2024)
SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
par: Sun, Wenchao, et autres
Publié: (2024)
par: Sun, Wenchao, et autres
Publié: (2024)
Physics-Aware 3D Gaussian Editing for Driving Scene Generation
par: Zhou, Feng, et autres
Publié: (2026)
par: Zhou, Feng, et autres
Publié: (2026)
UniScene: Unified Occupancy-centric Driving Scene Generation
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent
par: Yang, Yandan, et autres
Publié: (2025)
par: Yang, Yandan, et autres
Publié: (2025)
What Happens Next? Next Scene Prediction with a Unified Video Model
par: Li, Xinjie, et autres
Publié: (2025)
par: Li, Xinjie, et autres
Publié: (2025)
GA-Drive: Geometry-Appearance Decoupled Modeling for Free-viewpoint Driving Scene Generation
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
DHGS: Decoupled Hybrid Gaussian Splatting for Driving Scene
par: Shi, Xi, et autres
Publié: (2024)
par: Shi, Xi, et autres
Publié: (2024)
BEVWorld: A Multimodal World Simulator for Autonomous Driving via Scene-Level BEV Latents
par: Zhang, Yumeng, et autres
Publié: (2024)
par: Zhang, Yumeng, et autres
Publié: (2024)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
par: Guo, Xiangyu, et autres
Publié: (2025)
par: Guo, Xiangyu, et autres
Publié: (2025)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
par: Wang, Chuhan, et autres
Publié: (2026)
par: Wang, Chuhan, et autres
Publié: (2026)
3D Scene Change Modeling With Consistent Multi-View Aggregation
par: Zhou, Zirui, et autres
Publié: (2025)
par: Zhou, Zirui, et autres
Publié: (2025)
Predicting 3D representations for Dynamic Scenes
par: Qi, Di, et autres
Publié: (2025)
par: Qi, Di, et autres
Publié: (2025)
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
par: Song, Ruiqi, et autres
Publié: (2025)
par: Song, Ruiqi, et autres
Publié: (2025)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
par: Chen, Zhuohao, et autres
Publié: (2026)
par: Chen, Zhuohao, et autres
Publié: (2026)
OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
par: Liu, Pei, et autres
Publié: (2025)
par: Liu, Pei, et autres
Publié: (2025)
AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond
par: Zhang, Haiming, et autres
Publié: (2026)
par: Zhang, Haiming, et autres
Publié: (2026)
SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation
par: Feng, Jiaye, et autres
Publié: (2026)
par: Feng, Jiaye, et autres
Publié: (2026)
SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving
par: Li, Jingyu, et autres
Publié: (2026)
par: Li, Jingyu, et autres
Publié: (2026)
DreamScene: 3D Gaussian-based Text-to-3D Scene Generation via Formation Pattern Sampling
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving
par: Wu, Zehuan, et autres
Publié: (2024)
par: Wu, Zehuan, et autres
Publié: (2024)
Expanding Scene Graph Boundaries: Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and Retention
par: Chen, Zuyao, et autres
Publié: (2023)
par: Chen, Zuyao, et autres
Publié: (2023)
SceneStreamer: Continuous Scenario Generation as Next Token Group Prediction
par: Peng, Zhenghao, et autres
Publié: (2025)
par: Peng, Zhenghao, et autres
Publié: (2025)
GS-RoadPatching: Inpainting Gaussians via 3D Searching and Placing for Driving Scenes
par: Chen, Guo, et autres
Publié: (2025)
par: Chen, Guo, et autres
Publié: (2025)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
par: Xiao, Zhendong, et autres
Publié: (2025)
par: Xiao, Zhendong, et autres
Publié: (2025)
Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing
par: Fan, Jiahe, et autres
Publié: (2026)
par: Fan, Jiahe, et autres
Publié: (2026)
SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments
par: Cao, Yue, et autres
Publié: (2024)
par: Cao, Yue, et autres
Publié: (2024)
4D Driving Scene Generation With Stereo Forcing
par: Lu, Hao, et autres
Publié: (2025)
par: Lu, Hao, et autres
Publié: (2025)
DriveSplat: Unified Neural Gaussian Reconstruction for Dynamic Driving Scenes
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
SceneCrafter: Controllable Multi-View Driving Scene Editing
par: Zhu, Zehao, et autres
Publié: (2025)
par: Zhu, Zehao, et autres
Publié: (2025)
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
par: Zhang, Yunzhi, et autres
Publié: (2024)
par: Zhang, Yunzhi, et autres
Publié: (2024)
FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow
par: Yang, Zhifei, et autres
Publié: (2026)
par: Yang, Zhifei, et autres
Publié: (2026)
Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention
par: Lu, Hannan, et autres
Publié: (2024)
par: Lu, Hannan, et autres
Publié: (2024)
Active Learning from Scene Embeddings for End-to-End Autonomous Driving
par: Jiang, Wenhao, et autres
Publié: (2025)
par: Jiang, Wenhao, et autres
Publié: (2025)
Documents similaires
-
AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving
par: Wu, Yanhao, et autres
Publié: (2026) -
Refining CLIP's Spatial Awareness: A Visual-Centric Perspective
par: Qiu, Congpei, et autres
Publié: (2025) -
UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register
par: Qiu, Congpei, et autres
Publié: (2026) -
Mitigating Object Dependencies: Improving Point Cloud Self-Supervised Learning through Object Exchange
par: Wu, Yanhao, et autres
Publié: (2024) -
Pair2Scene: Learning Local Object Relations for Procedural Scene Generation
par: Ran, Xingjian, et autres
Publié: (2026)