Volumetric Environment Representation for Vision-Language Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Rui, Wang, Wenguan, Yang, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-Language Navigation with Energy-Based Policy
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
par: Gao, Jianzhe, et autres
Publié: (2026)
par: Gao, Jianzhe, et autres
Publié: (2026)
Navigation Instruction Generation with BEV Perception and Large Language Models
par: Fan, Sheng, et autres
Publié: (2024)
par: Fan, Sheng, et autres
Publié: (2024)
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
par: Gao, Jianzhe, et autres
Publié: (2026)
par: Gao, Jianzhe, et autres
Publié: (2026)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
par: An, Dong, et autres
Publié: (2023)
par: An, Dong, et autres
Publié: (2023)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
par: Ding, Xichen, et autres
Publié: (2025)
par: Ding, Xichen, et autres
Publié: (2025)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
par: Li, Haoyuan, et autres
Publié: (2026)
par: Li, Haoyuan, et autres
Publié: (2026)
Neural Clustering based Visual Representation Learning
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
par: Li, Liulei, et autres
Publié: (2024)
par: Li, Liulei, et autres
Publié: (2024)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
par: Hong, Haodong, et autres
Publié: (2024)
par: Hong, Haodong, et autres
Publié: (2024)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
par: Liu, Xu, et autres
Publié: (2026)
par: Liu, Xu, et autres
Publié: (2026)
Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data
par: Feng, Tuo, et autres
Publié: (2024)
par: Feng, Tuo, et autres
Publié: (2024)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
par: Jiang, Wen, et autres
Publié: (2026)
par: Jiang, Wen, et autres
Publié: (2026)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
A Survey of World Models for Autonomous Driving
par: Feng, Tuo, et autres
Publié: (2025)
par: Feng, Tuo, et autres
Publié: (2025)
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
Controllable Navigation Instruction Generation with Chain of Thought Prompting
par: Kong, Xianghao, et autres
Publié: (2024)
par: Kong, Xianghao, et autres
Publié: (2024)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
par: Yang, Zongxin, et autres
Publié: (2024)
par: Yang, Zongxin, et autres
Publié: (2024)
LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels
par: Feng, Tuo, et autres
Publié: (2024)
par: Feng, Tuo, et autres
Publié: (2024)
Clustering Propagation for Universal Medical Image Segmentation
par: Ding, Yuhang, et autres
Publié: (2024)
par: Ding, Yuhang, et autres
Publié: (2024)
Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph Generation
par: Chen, Minghan, et autres
Publié: (2024)
par: Chen, Minghan, et autres
Publié: (2024)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
par: Chen, Mu, et autres
Publié: (2025)
par: Chen, Mu, et autres
Publié: (2025)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
par: Liang, Chen, et autres
Publié: (2022)
par: Liang, Chen, et autres
Publié: (2022)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
par: Zhang, Ziyang, et autres
Publié: (2025)
par: Zhang, Ziyang, et autres
Publié: (2025)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
par: Chen, Kehan, et autres
Publié: (2024)
par: Chen, Kehan, et autres
Publié: (2024)
Scene Graph Generation with Role-Playing Large Language Models
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
MePT: Multi-Representation Guided Prompt Tuning for Vision-Language Model
par: Wang, Xinyang, et autres
Publié: (2024)
par: Wang, Xinyang, et autres
Publié: (2024)
Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning
par: Li, Yang, et autres
Publié: (2026)
par: Li, Yang, et autres
Publié: (2026)
Psychometry: An Omnifit Model for Image Reconstruction from Human Brain Activity
par: Quan, Ruijie, et autres
Publié: (2024)
par: Quan, Ruijie, et autres
Publié: (2024)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
par: Zheng, Qi, et autres
Publié: (2023)
par: Zheng, Qi, et autres
Publié: (2023)
The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation
par: Liu, Zhen, et autres
Publié: (2026)
par: Liu, Zhen, et autres
Publié: (2026)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
par: Yang, Jiahao, et autres
Publié: (2026)
par: Yang, Jiahao, et autres
Publié: (2026)
World-Consistent Data Generation for Vision-and-Language Navigation
par: Zhong, Yu, et autres
Publié: (2024)
par: Zhong, Yu, et autres
Publié: (2024)
Scalable Video Object Segmentation with Identification Mechanism
par: Yang, Zongxin, et autres
Publié: (2022)
par: Yang, Zongxin, et autres
Publié: (2022)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
par: Ning, Yuwei, et autres
Publié: (2026)
par: Ning, Yuwei, et autres
Publié: (2026)
Visual Knowledge in the Big Model Era: Retrospect and Prospect
par: Wang, Wenguan, et autres
Publié: (2024)
par: Wang, Wenguan, et autres
Publié: (2024)
Towards Data-and Knowledge-Driven Artificial Intelligence: A Survey on Neuro-Symbolic Computing
par: Wang, Wenguan, et autres
Publié: (2022)
par: Wang, Wenguan, et autres
Publié: (2022)
Nonverbal Interaction Detection
par: Wei, Jianan, et autres
Publié: (2024)
par: Wei, Jianan, et autres
Publié: (2024)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos
par: Han, Mingfei, et autres
Publié: (2026)
par: Han, Mingfei, et autres
Publié: (2026)
Documents similaires
-
Vision-Language Navigation with Energy-Based Policy
par: Liu, Rui, et autres
Publié: (2024) -
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
par: Gao, Jianzhe, et autres
Publié: (2026) -
Navigation Instruction Generation with BEV Perception and Large Language Models
par: Fan, Sheng, et autres
Publié: (2024) -
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
par: Gao, Jianzhe, et autres
Publié: (2026) -
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
par: An, Dong, et autres
Publié: (2023)