World-aware Planning Narratives Enhance Large Vision-Language Model Planner

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Shi, Junhao, Fei, Zhaoye, Wang, Siyin, Guo, Qipeng, Gong, Jingjing, Qiu, Xipeng
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911034820788224
author Shi, Junhao
Fei, Zhaoye
Wang, Siyin
Guo, Qipeng
Gong, Jingjing
Qiu, Xipeng
author_facet Shi, Junhao
Fei, Zhaoye
Wang, Siyin
Guo, Qipeng
Gong, Jingjing
Qiu, Xipeng
contents Large Vision-Language Models (LVLMs) show promise for embodied planning tasks but struggle with complex scenarios involving unfamiliar environments and multi-step goals. Current approaches rely on environment-agnostic imitation learning that disconnects instructions from environmental contexts, causing models to struggle with context-sensitive instructions and rely on supplementary cues rather than visual reasoning during long-horizon interactions. In this work, we propose World-Aware Planning Narrative Enhancement (WAP), a framework that infuses LVLMs with comprehensive environmental understanding through four cognitive capabilities (visual appearance modeling, spatial reasoning, functional abstraction, and syntactic grounding) while developing and evaluating models using only raw visual observations through curriculum learning. Evaluations on the EB-ALFRED benchmark demonstrate substantial improvements, with Qwen2.5-VL achieving a 60.7 absolute improvement in task success rates, particularly in commonsense reasoning (+60.0) and long-horizon planning (+70.0). Notably, our enhanced open-source models outperform proprietary systems like GPT-4o and Claude-3.5-Sonnet by a large margin.
format Preprint
id arxiv_https___arxiv_org_abs_2506_21230
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle World-aware Planning Narratives Enhance Large Vision-Language Model Planner
Shi, Junhao
Fei, Zhaoye
Wang, Siyin
Guo, Qipeng
Gong, Jingjing
Qiu, Xipeng
Artificial Intelligence
Robotics
Large Vision-Language Models (LVLMs) show promise for embodied planning tasks but struggle with complex scenarios involving unfamiliar environments and multi-step goals. Current approaches rely on environment-agnostic imitation learning that disconnects instructions from environmental contexts, causing models to struggle with context-sensitive instructions and rely on supplementary cues rather than visual reasoning during long-horizon interactions. In this work, we propose World-Aware Planning Narrative Enhancement (WAP), a framework that infuses LVLMs with comprehensive environmental understanding through four cognitive capabilities (visual appearance modeling, spatial reasoning, functional abstraction, and syntactic grounding) while developing and evaluating models using only raw visual observations through curriculum learning. Evaluations on the EB-ALFRED benchmark demonstrate substantial improvements, with Qwen2.5-VL achieving a 60.7 absolute improvement in task success rates, particularly in commonsense reasoning (+60.0) and long-horizon planning (+70.0). Notably, our enhanced open-source models outperform proprietary systems like GPT-4o and Claude-3.5-Sonnet by a large margin.
title World-aware Planning Narratives Enhance Large Vision-Language Model Planner
topic Artificial Intelligence
Robotics
url https://arxiv.org/abs/2506.21230