FLAME: Learning to Navigate with Multimodal LLM in Urban Environments
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Yunzhe, Pan, Yiyuan, Liu, Zhe, Wang, Hesheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
par: Xu, Yunzhe, et autres
Publié: (2025)
par: Xu, Yunzhe, et autres
Publié: (2025)
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
par: Pan, Yiyuan, et autres
Publié: (2024)
par: Pan, Yiyuan, et autres
Publié: (2024)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
par: Long, Yuxing, et autres
Publié: (2024)
par: Long, Yuxing, et autres
Publié: (2024)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
What Limits Vision-and-Language Navigation ?
par: Wang, Yunheng, et autres
Publié: (2026)
par: Wang, Yunheng, et autres
Publié: (2026)
LangNav: Language as a Perceptual Representation for Navigation
par: Pan, Bowen, et autres
Publié: (2023)
par: Pan, Bowen, et autres
Publié: (2023)
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
par: Wang, Yunheng, et autres
Publié: (2025)
par: Wang, Yunheng, et autres
Publié: (2025)
NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
par: Wang, Liuyi, et autres
Publié: (2025)
par: Wang, Liuyi, et autres
Publié: (2025)
Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning
par: Zhao, Yubo, et autres
Publié: (2025)
par: Zhao, Yubo, et autres
Publié: (2025)
HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles
par: Wang, Yunheng, et autres
Publié: (2025)
par: Wang, Yunheng, et autres
Publié: (2025)
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
par: Feng, Di, et autres
Publié: (2025)
par: Feng, Di, et autres
Publié: (2025)
Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation
par: Nie, Chang, et autres
Publié: (2026)
par: Nie, Chang, et autres
Publié: (2026)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
par: Zhou, Gengze, et autres
Publié: (2024)
par: Zhou, Gengze, et autres
Publié: (2024)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
par: Zhang, Pingrui, et autres
Publié: (2025)
par: Zhang, Pingrui, et autres
Publié: (2025)
Vision-and-Language Navigation Generative Pretrained Transformer
par: Hanlin, Wen
Publié: (2024)
par: Hanlin, Wen
Publié: (2024)
Explore and Explain: Self-supervised Navigation and Recounting
par: Bigazzi, Roberto, et autres
Publié: (2020)
par: Bigazzi, Roberto, et autres
Publié: (2020)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025)
par: Wei, Ziming, et autres
Publié: (2025)
ZeST: an LLM-based Zero-Shot Traversability Navigation for Unknown Environments
par: Gummadi, Shreya, et autres
Publié: (2025)
par: Gummadi, Shreya, et autres
Publié: (2025)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
par: Perincherry, Akhil, et autres
Publié: (2025)
par: Perincherry, Akhil, et autres
Publié: (2025)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
par: Li, Kailing, et autres
Publié: (2026)
par: Li, Kailing, et autres
Publié: (2026)
Holodeck: Language Guided Generation of 3D Embodied AI Environments
par: Yang, Yue, et autres
Publié: (2023)
par: Yang, Yue, et autres
Publié: (2023)
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
par: Yu, Zhuoyuan, et autres
Publié: (2025)
par: Yu, Zhuoyuan, et autres
Publié: (2025)
InfraGPT Smart Infrastructure: An End-to-End VLM-Based Framework for Detecting and Managing Urban Defects
par: Mohamed, Ibrahim Sheikh, et autres
Publié: (2025)
par: Mohamed, Ibrahim Sheikh, et autres
Publié: (2025)
VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
par: Zhang, Shiduo, et autres
Publié: (2024)
par: Zhang, Shiduo, et autres
Publié: (2024)
Advancing Autonomous Vehicle Intelligence: Deep Learning and Multimodal LLM for Traffic Sign Recognition and Robust Lane Detection
par: Sah, Chandan Kumar, et autres
Publié: (2025)
par: Sah, Chandan Kumar, et autres
Publié: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
par: Hong, Haodong, et autres
Publié: (2024)
par: Hong, Haodong, et autres
Publié: (2024)
PhyGrasp: Generalizing Robotic Grasping with Physics-informed Large Multimodal Models
par: Guo, Dingkun, et autres
Publié: (2024)
par: Guo, Dingkun, et autres
Publié: (2024)
SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts
par: Zhou, Gengze, et autres
Publié: (2024)
par: Zhou, Gengze, et autres
Publié: (2024)
Object Navigation with Structure-Semantic Reasoning-Based Multi-level Map and Multimodal Decision-Making LLM
par: Yan, Chongshang, et autres
Publié: (2025)
par: Yan, Chongshang, et autres
Publié: (2025)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
par: Li, Jianxiong, et autres
Publié: (2024)
par: Li, Jianxiong, et autres
Publié: (2024)
Learning Compositional Behaviors from Demonstration and Language
par: Liu, Weiyu, et autres
Publié: (2025)
par: Liu, Weiyu, et autres
Publié: (2025)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
par: Chia, Yew Ken, et autres
Publié: (2024)
par: Chia, Yew Ken, et autres
Publié: (2024)
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
par: Sun, Qi, et autres
Publié: (2024)
par: Sun, Qi, et autres
Publié: (2024)
Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation
par: Hu, Chih Yao, et autres
Publié: (2025)
par: Hu, Chih Yao, et autres
Publié: (2025)
When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills
par: Wang, Yunfei, et autres
Publié: (2026)
par: Wang, Yunfei, et autres
Publié: (2026)
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
par: Wei, Yifei, et autres
Publié: (2026)
par: Wei, Yifei, et autres
Publié: (2026)
From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation
par: Liu, Yibin, et autres
Publié: (2026)
par: Liu, Yibin, et autres
Publié: (2026)
Documents similaires
-
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
par: Xu, Yunzhe, et autres
Publié: (2025) -
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
par: Pan, Yiyuan, et autres
Publié: (2024) -
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
par: Lin, Bingqian, et autres
Publié: (2024) -
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
par: Long, Yuxing, et autres
Publié: (2024) -
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)