Language-Image Models with 3D Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Cho, Jang Hyun, Ivanovic, Boris, Cao, Yulong, Schmerling, Edward, Wang, Yue, Weng, Xinshuo, Li, Boyi, You, Yurong, Krähenbühl, Philipp, Wang, Yan, Pavone, Marco |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Promptable Closed-loop Traffic Simulation
por: Tan, Shuhan, et al.
Publicado: (2024)
por: Tan, Shuhan, et al.
Publicado: (2024)
Tokenize the World into Object-level Knowledge to Address Long-tail Events in Autonomous Driving
por: Tian, Ran, et al.
Publicado: (2024)
por: Tian, Ran, et al.
Publicado: (2024)
Latent Chain-of-Thought World Modeling for End-to-End Driving
por: Tan, Shuhan, et al.
Publicado: (2025)
por: Tan, Shuhan, et al.
Publicado: (2025)
DreamDrive: Generative 4D Scene Modeling from Street View Images
por: Mao, Jiageng, et al.
Publicado: (2024)
por: Mao, Jiageng, et al.
Publicado: (2024)
Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
por: Ivanovic, Boris, et al.
Publicado: (2025)
por: Ivanovic, Boris, et al.
Publicado: (2025)
Towards Efficient and Effective Multi-Camera Encoding for End-to-End Driving
por: Yang, Jiawei, et al.
Publicado: (2025)
por: Yang, Jiawei, et al.
Publicado: (2025)
Driving Everywhere with Large Language Model Policy Adaptation
por: Li, Boyi, et al.
Publicado: (2024)
por: Li, Boyi, et al.
Publicado: (2024)
Extrapolated Urban View Synthesis Benchmark
por: Han, Xiangyu, et al.
Publicado: (2024)
por: Han, Xiangyu, et al.
Publicado: (2024)
LoRA3D: Low-Rank Self-Calibration of 3D Geometric Foundation Models
por: Lu, Ziqi, et al.
Publicado: (2024)
por: Lu, Ziqi, et al.
Publicado: (2024)
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
por: Ma, Yingzi, et al.
Publicado: (2025)
por: Ma, Yingzi, et al.
Publicado: (2025)
STORM: Spatio-Temporal Reconstruction Model for Large-Scale Outdoor Scenes
por: Yang, Jiawei, et al.
Publicado: (2024)
por: Yang, Jiawei, et al.
Publicado: (2024)
Gen-Drive: Enhancing Diffusion Generative Driving Policies with Reward Modeling and Reinforcement Learning Fine-tuning
por: Huang, Zhiyu, et al.
Publicado: (2024)
por: Huang, Zhiyu, et al.
Publicado: (2024)
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
por: Hirota, Yusuke, et al.
Publicado: (2025)
por: Hirota, Yusuke, et al.
Publicado: (2025)
Parallelized Spatiotemporal Binding
por: Singh, Gautam, et al.
Publicado: (2024)
por: Singh, Gautam, et al.
Publicado: (2024)
Sample-Efficient Safety Assurances using Conformal Prediction
por: Luo, Rachel, et al.
Publicado: (2021)
por: Luo, Rachel, et al.
Publicado: (2021)
Image and Video Tokenization with Binary Spherical Quantization
por: Zhao, Yue, et al.
Publicado: (2024)
por: Zhao, Yue, et al.
Publicado: (2024)
Producing and Leveraging Online Map Uncertainty in Trajectory Prediction
por: Gu, Xunjiang, et al.
Publicado: (2024)
por: Gu, Xunjiang, et al.
Publicado: (2024)
Accelerating Online Mapping and Behavior Prediction via Direct BEV Feature Attention
por: Gu, Xunjiang, et al.
Publicado: (2024)
por: Gu, Xunjiang, et al.
Publicado: (2024)
Learning Traffic Crashes as Language: Datasets, Benchmarks, and What-if Causal Analyses
por: Fan, Zhiwen, et al.
Publicado: (2024)
por: Fan, Zhiwen, et al.
Publicado: (2024)
NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking
por: Dauner, Daniel, et al.
Publicado: (2024)
por: Dauner, Daniel, et al.
Publicado: (2024)
Accelerating Structured Chain-of-Thought in Autonomous Vehicles
por: Gu, Yi, et al.
Publicado: (2026)
por: Gu, Yi, et al.
Publicado: (2026)
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
por: Peng, Zhenghao "Mark", et al.
Publicado: (2025)
por: Peng, Zhenghao "Mark", et al.
Publicado: (2025)
Compressed Map Priors for 3D Perception
por: Zhou, Brady, et al.
Publicado: (2025)
por: Zhou, Brady, et al.
Publicado: (2025)
Interactive Post-Training for Vision-Language-Action Models
por: Tan, Shuhan, et al.
Publicado: (2025)
por: Tan, Shuhan, et al.
Publicado: (2025)
Large Spatial Model: End-to-end Unposed Images to Semantic 3D
por: Fan, Zhiwen, et al.
Publicado: (2024)
por: Fan, Zhiwen, et al.
Publicado: (2024)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
por: Gan, Yulu, et al.
Publicado: (2025)
por: Gan, Yulu, et al.
Publicado: (2025)
DistillNeRF: Perceiving 3D Scenes from Single-Glance Images by Distilling Neural Fields and Foundation Model Features
por: Wang, Letian, et al.
Publicado: (2024)
por: Wang, Letian, et al.
Publicado: (2024)
E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models
por: Cong, Wenyan, et al.
Publicado: (2025)
por: Cong, Wenyan, et al.
Publicado: (2025)
A Language Agent for Autonomous Driving
por: Mao, Jiageng, et al.
Publicado: (2023)
por: Mao, Jiageng, et al.
Publicado: (2023)
Wolf: Dense Video Captioning with a World Summarization Framework
por: Li, Boyi, et al.
Publicado: (2024)
por: Li, Boyi, et al.
Publicado: (2024)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
InstantSplat: Sparse-view Gaussian Splatting in Seconds
por: Fan, Zhiwen, et al.
Publicado: (2024)
por: Fan, Zhiwen, et al.
Publicado: (2024)
VILA$^2$: VILA Augmented VILA
por: Fang, Yunhao, et al.
Publicado: (2024)
por: Fang, Yunhao, et al.
Publicado: (2024)
StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement
por: Seo, Junwon, et al.
Publicado: (2026)
por: Seo, Junwon, et al.
Publicado: (2026)
DiffuBox: Refining 3D Object Detection with Point Diffusion
por: Chen, Xiangyu, et al.
Publicado: (2024)
por: Chen, Xiangyu, et al.
Publicado: (2024)
Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
por: Hirota, Yusuke, et al.
Publicado: (2025)
por: Hirota, Yusuke, et al.
Publicado: (2025)
Cut Your Losses in Large-Vocabulary Language Models
por: Wijmans, Erik, et al.
Publicado: (2024)
por: Wijmans, Erik, et al.
Publicado: (2024)
Domain Adaptation Through Task Distillation
por: Zhou, Brady, et al.
Publicado: (2020)
por: Zhou, Brady, et al.
Publicado: (2020)
Long-term Traffic Simulation with Interleaved Autoregressive Motion and Scenario Generation
por: Yang, Xiuyu, et al.
Publicado: (2025)
por: Yang, Xiuyu, et al.
Publicado: (2025)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
Ejemplares similares
-
Promptable Closed-loop Traffic Simulation
por: Tan, Shuhan, et al.
Publicado: (2024) -
Tokenize the World into Object-level Knowledge to Address Long-tail Events in Autonomous Driving
por: Tian, Ran, et al.
Publicado: (2024) -
Latent Chain-of-Thought World Modeling for End-to-End Driving
por: Tan, Shuhan, et al.
Publicado: (2025) -
DreamDrive: Generative 4D Scene Modeling from Street View Images
por: Mao, Jiageng, et al.
Publicado: (2024) -
Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
por: Ivanovic, Boris, et al.
Publicado: (2025)