Navigation Instruction Generation with BEV Perception and Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Fan, Sheng, Liu, Rui, Wang, Wenguan, Yang, Yi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Volumetric Environment Representation for Vision-Language Navigation
by: Liu, Rui, et al.
Published: (2024)
by: Liu, Rui, et al.
Published: (2024)
Vision-Language Navigation with Energy-Based Policy
by: Liu, Rui, et al.
Published: (2024)
by: Liu, Rui, et al.
Published: (2024)
LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels
by: Feng, Tuo, et al.
Published: (2024)
by: Feng, Tuo, et al.
Published: (2024)
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
by: Gao, Jianzhe, et al.
Published: (2026)
by: Gao, Jianzhe, et al.
Published: (2026)
Controllable Navigation Instruction Generation with Chain of Thought Prompting
by: Kong, Xianghao, et al.
Published: (2024)
by: Kong, Xianghao, et al.
Published: (2024)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
by: Li, Liulei, et al.
Published: (2024)
by: Li, Liulei, et al.
Published: (2024)
Scene Graph Generation with Role-Playing Large Language Models
by: Chen, Guikun, et al.
Published: (2024)
by: Chen, Guikun, et al.
Published: (2024)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
by: Liu, Xu, et al.
Published: (2026)
by: Liu, Xu, et al.
Published: (2026)
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
by: Gao, Jianzhe, et al.
Published: (2026)
by: Gao, Jianzhe, et al.
Published: (2026)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
by: Yang, Zongxin, et al.
Published: (2024)
by: Yang, Zongxin, et al.
Published: (2024)
RESBev: Making BEV Perception More Robust
by: Zhuo, Lifeng, et al.
Published: (2026)
by: Zhuo, Lifeng, et al.
Published: (2026)
A Survey of World Models for Autonomous Driving
by: Feng, Tuo, et al.
Published: (2025)
by: Feng, Tuo, et al.
Published: (2025)
Psychometry: An Omnifit Model for Image Reconstruction from Human Brain Activity
by: Quan, Ruijie, et al.
Published: (2024)
by: Quan, Ruijie, et al.
Published: (2024)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
by: Chen, Mu, et al.
Published: (2025)
by: Chen, Mu, et al.
Published: (2025)
Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph Generation
by: Chen, Minghan, et al.
Published: (2024)
by: Chen, Minghan, et al.
Published: (2024)
LSSInst: Improving Geometric Modeling in LSS-Based BEV Perception with Instance Representation
by: Ma, Weijie, et al.
Published: (2024)
by: Ma, Weijie, et al.
Published: (2024)
Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception
by: Li, Yang, et al.
Published: (2025)
by: Li, Yang, et al.
Published: (2025)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
by: Ding, Xichen, et al.
Published: (2025)
by: Ding, Xichen, et al.
Published: (2025)
Fast-BEV: A Fast and Strong Bird's-Eye View Perception Baseline
by: Li, Yangguang, et al.
Published: (2023)
by: Li, Yangguang, et al.
Published: (2023)
Toward Real-world BEV Perception: Depth Uncertainty Estimation via Gaussian Splatting
by: Lu, Shu-Wei, et al.
Published: (2025)
by: Lu, Shu-Wei, et al.
Published: (2025)
Can BEV Perception Gracefully Degrade under Sensor Failures?
by: Zhang, Haifa, et al.
Published: (2026)
by: Zhang, Haifa, et al.
Published: (2026)
End-to-End Driving with Online Trajectory Evaluation via BEV World Model
by: Li, Yingyan, et al.
Published: (2025)
by: Li, Yingyan, et al.
Published: (2025)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
by: Yang, Jiahao, et al.
Published: (2026)
by: Yang, Jiahao, et al.
Published: (2026)
ChatBEV: A Visual Language Model that Understands BEV Maps
by: Xu, Qingyao, et al.
Published: (2025)
by: Xu, Qingyao, et al.
Published: (2025)
RopeBEV: A Multi-Camera Roadside Perception Network in Bird's-Eye-View
by: Jia, Jinrang, et al.
Published: (2024)
by: Jia, Jinrang, et al.
Published: (2024)
Hierarchical and Decoupled BEV Perception Learning Framework for Autonomous Driving
by: Dai, Yuqi, et al.
Published: (2024)
by: Dai, Yuqi, et al.
Published: (2024)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
by: Li, Haoyuan, et al.
Published: (2026)
by: Li, Haoyuan, et al.
Published: (2026)
Neural Clustering based Visual Representation Learning
by: Chen, Guikun, et al.
Published: (2024)
by: Chen, Guikun, et al.
Published: (2024)
Clustering Propagation for Universal Medical Image Segmentation
by: Ding, Yuhang, et al.
Published: (2024)
by: Ding, Yuhang, et al.
Published: (2024)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
by: An, Dong, et al.
Published: (2023)
by: An, Dong, et al.
Published: (2023)
Visual Knowledge in the Big Model Era: Retrospect and Prospect
by: Wang, Wenguan, et al.
Published: (2024)
by: Wang, Wenguan, et al.
Published: (2024)
Privacy-Concealing Cooperative Perception for BEV Scene Segmentation
by: Wang, Song, et al.
Published: (2026)
by: Wang, Song, et al.
Published: (2026)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
by: Liang, Chen, et al.
Published: (2022)
by: Liang, Chen, et al.
Published: (2022)
ROA-BEV: 2D Region-Oriented Attention for BEV-based 3D Object Detection
by: Chen, Jiwei, et al.
Published: (2024)
by: Chen, Jiwei, et al.
Published: (2024)
MaskBEV: Towards A Unified Framework for BEV Detection and Map Segmentation
by: Zhao, Xiao, et al.
Published: (2024)
by: Zhao, Xiao, et al.
Published: (2024)
BLOS-BEV: Navigation Map Enhanced Lane Segmentation Network, Beyond Line of Sight
by: Wu, Hang, et al.
Published: (2024)
by: Wu, Hang, et al.
Published: (2024)
GraphBEV: Towards Robust BEV Feature Alignment for Multi-Modal 3D Object Detection
by: Song, Ziying, et al.
Published: (2024)
by: Song, Ziying, et al.
Published: (2024)
Fast-BEV++: Fast by Algorithm, Deployable by Design
by: Chen, Yuanpeng, et al.
Published: (2025)
by: Chen, Yuanpeng, et al.
Published: (2025)
General and Task-Oriented Video Segmentation
by: Chen, Mu, et al.
Published: (2024)
by: Chen, Mu, et al.
Published: (2024)
Improved Single Camera BEV Perception Using Multi-Camera Training
by: Busch, Daniel, et al.
Published: (2024)
by: Busch, Daniel, et al.
Published: (2024)
Similar Items
-
Volumetric Environment Representation for Vision-Language Navigation
by: Liu, Rui, et al.
Published: (2024) -
Vision-Language Navigation with Energy-Based Policy
by: Liu, Rui, et al.
Published: (2024) -
LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels
by: Feng, Tuo, et al.
Published: (2024) -
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
by: Gao, Jianzhe, et al.
Published: (2026) -
Controllable Navigation Instruction Generation with Chain of Thought Prompting
by: Kong, Xianghao, et al.
Published: (2024)