VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception
Fuente:
arXiv
Guardado en:
| Autores principales: | Chang, Fuhao, Li, Shuxin, Li, Yabei, He, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HQ-OV3D: A High Box Quality Open-World 3D Detection Framework based on Diffision Model
por: Liu, Qi, et al.
Publicado: (2025)
por: Liu, Qi, et al.
Publicado: (2025)
Rethinking the Spatio-Temporal Alignment of End-to-End 3D Perception
por: Li, Xiaoyu, et al.
Publicado: (2025)
por: Li, Xiaoyu, et al.
Publicado: (2025)
Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving
por: Li, Tengpeng, et al.
Publicado: (2025)
por: Li, Tengpeng, et al.
Publicado: (2025)
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
por: Xu, Yi, et al.
Publicado: (2024)
por: Xu, Yi, et al.
Publicado: (2024)
VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving
por: Seong, Hyunki, et al.
Publicado: (2025)
por: Seong, Hyunki, et al.
Publicado: (2025)
End-to-End 3D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration
por: Yang, Zhenwei, et al.
Publicado: (2025)
por: Yang, Zhenwei, et al.
Publicado: (2025)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
por: Xiong, Haomiao, et al.
Publicado: (2025)
por: Xiong, Haomiao, et al.
Publicado: (2025)
RAP: 3D Rasterization Augmented End-to-End Planning
por: Feng, Lan, et al.
Publicado: (2025)
por: Feng, Lan, et al.
Publicado: (2025)
Open 3D World in Autonomous Driving
por: Cheng, Xinlong, et al.
Publicado: (2024)
por: Cheng, Xinlong, et al.
Publicado: (2024)
E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models
por: Cong, Wenyan, et al.
Publicado: (2025)
por: Cong, Wenyan, et al.
Publicado: (2025)
Hunyuan3D Studio: End-to-End AI Pipeline for Game-Ready 3D Asset Generation
por: Lei, Biwen, et al.
Publicado: (2025)
por: Lei, Biwen, et al.
Publicado: (2025)
Enhancing End-to-End Autonomous Driving with Latent World Model
por: Li, Yingyan, et al.
Publicado: (2024)
por: Li, Yingyan, et al.
Publicado: (2024)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
por: Zhong, Yufeng, et al.
Publicado: (2026)
por: Zhong, Yufeng, et al.
Publicado: (2026)
Perception in Plan: Coupled Perception and Planning for End-to-End Autonomous Driving
por: Zhang, Bozhou, et al.
Publicado: (2025)
por: Zhang, Bozhou, et al.
Publicado: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
por: Wang, Yuxin, et al.
Publicado: (2025)
por: Wang, Yuxin, et al.
Publicado: (2025)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
por: Song, Nan, et al.
Publicado: (2025)
por: Song, Nan, et al.
Publicado: (2025)
Puzzles: Unbounded Video-Depth Augmentation for Scalable End-to-End 3D Reconstruction
por: Ma, Jiahao, et al.
Publicado: (2025)
por: Ma, Jiahao, et al.
Publicado: (2025)
End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation
por: Guo, Mingzhe, et al.
Publicado: (2024)
por: Guo, Mingzhe, et al.
Publicado: (2024)
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
por: Han, Jianhua, et al.
Publicado: (2025)
por: Han, Jianhua, et al.
Publicado: (2025)
End-to-End Rate-Distortion Optimized 3D Gaussian Representation
por: Wang, Henan, et al.
Publicado: (2024)
por: Wang, Henan, et al.
Publicado: (2024)
End-to-End Driving with Online Trajectory Evaluation via BEV World Model
por: Li, Yingyan, et al.
Publicado: (2025)
por: Li, Yingyan, et al.
Publicado: (2025)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
por: Fan, Zhiwen, et al.
Publicado: (2025)
por: Fan, Zhiwen, et al.
Publicado: (2025)
SS3D: End2End Self-Supervised 3D from Web Videos
por: Hariat, Marwane, et al.
Publicado: (2026)
por: Hariat, Marwane, et al.
Publicado: (2026)
Rethinking End-to-End 2D to 3D Scene Segmentation in Gaussian Splatting
por: Zhu, Runsong, et al.
Publicado: (2025)
por: Zhu, Runsong, et al.
Publicado: (2025)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
por: Chen, Xuesong, et al.
Publicado: (2025)
por: Chen, Xuesong, et al.
Publicado: (2025)
MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving
por: Sun, Bin, et al.
Publicado: (2025)
por: Sun, Bin, et al.
Publicado: (2025)
ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
por: Cui, Can, et al.
Publicado: (2025)
por: Cui, Can, et al.
Publicado: (2025)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
por: Jiang, Bo, et al.
Publicado: (2024)
por: Jiang, Bo, et al.
Publicado: (2024)
BEEP3D: Box-Supervised End-to-End Pseudo-Mask Generation for 3D Instance Segmentation
por: Yoo, Youngju, et al.
Publicado: (2025)
por: Yoo, Youngju, et al.
Publicado: (2025)
E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
por: Tang, Yihong, et al.
Publicado: (2025)
por: Tang, Yihong, et al.
Publicado: (2025)
Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors
por: Hashimoto, Hiroki, et al.
Publicado: (2026)
por: Hashimoto, Hiroki, et al.
Publicado: (2026)
ObjectVLA: End-to-End Open-World Object Manipulation Without Demonstration
por: Zhu, Minjie, et al.
Publicado: (2025)
por: Zhu, Minjie, et al.
Publicado: (2025)
From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving
por: Ang, Sining, et al.
Publicado: (2026)
por: Ang, Sining, et al.
Publicado: (2026)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
por: Sun, Fan-Yun, et al.
Publicado: (2024)
por: Sun, Fan-Yun, et al.
Publicado: (2024)
VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
por: Zhou, Shijie, et al.
Publicado: (2025)
por: Zhou, Shijie, et al.
Publicado: (2025)
End-to-End Fine-Tuning of 3D Texture Generation using Differentiable Rewards
por: Zamani, AmirHossein, et al.
Publicado: (2025)
por: Zamani, AmirHossein, et al.
Publicado: (2025)
SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation
por: Wang, Ruoyu, et al.
Publicado: (2026)
por: Wang, Ruoyu, et al.
Publicado: (2026)
NuiWorld: Exploring a Scalable Framework for End-to-End Controllable World Generation
por: Lee, Han-Hung, et al.
Publicado: (2026)
por: Lee, Han-Hung, et al.
Publicado: (2026)
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
por: Zhang, Songyan, et al.
Publicado: (2024)
por: Zhang, Songyan, et al.
Publicado: (2024)
Ejemplares similares
-
HQ-OV3D: A High Box Quality Open-World 3D Detection Framework based on Diffision Model
por: Liu, Qi, et al.
Publicado: (2025) -
Rethinking the Spatio-Temporal Alignment of End-to-End 3D Perception
por: Li, Xiaoyu, et al.
Publicado: (2025) -
Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving
por: Li, Tengpeng, et al.
Publicado: (2025) -
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
por: Xu, Yi, et al.
Publicado: (2024) -
VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving
por: Seong, Hyunki, et al.
Publicado: (2025)