World-aware Planning Narratives Enhance Large Vision-Language Model Planner
Fuente:
arXiv
Saved in:
| Main Authors: | Shi, Junhao, Fei, Zhaoye, Wang, Siyin, Guo, Qipeng, Gong, Jingjing, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning
by: Fei, Zhaoye, et al.
Published: (2025)
by: Fei, Zhaoye, et al.
Published: (2025)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
by: Wang, Siyin, et al.
Published: (2025)
by: Wang, Siyin, et al.
Published: (2025)
How to Mitigate Overfitting in Weak-to-strong Generalization?
by: Shi, Junhao, et al.
Published: (2025)
by: Shi, Junhao, et al.
Published: (2025)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
by: Fei, Senyu, et al.
Published: (2025)
by: Fei, Senyu, et al.
Published: (2025)
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
by: Hu, Mengkang, et al.
Published: (2023)
by: Hu, Mengkang, et al.
Published: (2023)
How to Set the Learning Rate for Large-Scale Pre-training?
by: Zhou, Yunhua, et al.
Published: (2026)
by: Zhou, Yunhua, et al.
Published: (2026)
DKPROMPT: Domain Knowledge Prompting Vision-Language Models for Open-World Planning
by: Zhang, Xiaohan, et al.
Published: (2024)
by: Zhang, Xiaohan, et al.
Published: (2024)
Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
by: Pei, Xiaohuan, et al.
Published: (2025)
by: Pei, Xiaohuan, et al.
Published: (2025)
World Action Models: The Next Frontier in Embodied AI
by: Wang, Siyin, et al.
Published: (2026)
by: Wang, Siyin, et al.
Published: (2026)
Scalable Task Planning via Large Language Models and Structured World Representations
by: Pérez-Dattari, Rodrigo, et al.
Published: (2024)
by: Pérez-Dattari, Rodrigo, et al.
Published: (2024)
VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing
by: Tang, Guoqin, et al.
Published: (2026)
by: Tang, Guoqin, et al.
Published: (2026)
ActionCodec: What Makes for Good Action Tokenizers
by: Dong, Zibin, et al.
Published: (2026)
by: Dong, Zibin, et al.
Published: (2026)
FM-Planner: Foundation Model Guided Path Planning for Autonomous Drone Navigation
by: Xiao, Jiaping, et al.
Published: (2025)
by: Xiao, Jiaping, et al.
Published: (2025)
CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving
by: Guo, Yihong, et al.
Published: (2026)
by: Guo, Yihong, et al.
Published: (2026)
VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
by: Zhang, Shiduo, et al.
Published: (2024)
by: Zhang, Shiduo, et al.
Published: (2024)
LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
by: Liu, Yudong, et al.
Published: (2025)
by: Liu, Yudong, et al.
Published: (2025)
WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
by: Zhu, Fangqi, et al.
Published: (2025)
by: Zhu, Fangqi, et al.
Published: (2025)
TwoStep: Multi-agent Task Planning using Classical Planners and Large Language Models
by: Bai, David, et al.
Published: (2024)
by: Bai, David, et al.
Published: (2024)
AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models
by: Han, Yuxuan, et al.
Published: (2026)
by: Han, Yuxuan, et al.
Published: (2026)
Vision-Language-Policy Model for Dynamic Robot Task Planning
by: Wang, Jin, et al.
Published: (2025)
by: Wang, Jin, et al.
Published: (2025)
Vision Language Models Can Parse Floor Plan Maps
by: DeFazio, David, et al.
Published: (2024)
by: DeFazio, David, et al.
Published: (2024)
A Unified Framework for Real-Time Failure Handling in Robotics Using Vision-Language Models, Reactive Planner and Behavior Trees
by: Ahmad, Faseeh, et al.
Published: (2025)
by: Ahmad, Faseeh, et al.
Published: (2025)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
by: Dai, Yuntao, et al.
Published: (2025)
by: Dai, Yuntao, et al.
Published: (2025)
LLM-State: Open World State Representation for Long-horizon Task Planning with Large Language Model
by: Chen, Siwei, et al.
Published: (2023)
by: Chen, Siwei, et al.
Published: (2023)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
by: Fei, Senyu, et al.
Published: (2025)
by: Fei, Senyu, et al.
Published: (2025)
Large Trajectory Models are Scalable Motion Predictors and Planners
by: Sun, Qiao, et al.
Published: (2023)
by: Sun, Qiao, et al.
Published: (2023)
Conformal Temporal Logic Planning using Large Language Models
by: Wang, Jun, et al.
Published: (2023)
by: Wang, Jun, et al.
Published: (2023)
Ego-Vision World Model for Humanoid Contact Planning
by: Liu, Hang, et al.
Published: (2025)
by: Liu, Hang, et al.
Published: (2025)
DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation
by: Gu, Tianjun, et al.
Published: (2025)
by: Gu, Tianjun, et al.
Published: (2025)
Hindsight Planner: A Closed-Loop Few-Shot Planner for Embodied Instruction Following
by: Yang, Yuxiao, et al.
Published: (2024)
by: Yang, Yuxiao, et al.
Published: (2024)
SemNav: A Model-Based Planner for Zero-Shot Object Goal Navigation Using Vision-Foundation Models
by: Debnath, Arnab, et al.
Published: (2025)
by: Debnath, Arnab, et al.
Published: (2025)
Dynamically Local-Enhancement Planner for Large-Scale Autonomous Driving
by: Deng, Nanshan, et al.
Published: (2025)
by: Deng, Nanshan, et al.
Published: (2025)
Tool-Planner: Task Planning with Clusters across Multiple Tools
by: Liu, Yanming, et al.
Published: (2024)
by: Liu, Yanming, et al.
Published: (2024)
Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks
by: Wang, Hao, et al.
Published: (2025)
by: Wang, Hao, et al.
Published: (2025)
V-VLAPS: Value-Guided Planning for Vision-Language-Action Models
by: Ren, Ke, et al.
Published: (2026)
by: Ren, Ke, et al.
Published: (2026)
OpenNav: Open-World Navigation with Multimodal Large Language Models
by: Yuan, Mingfeng, et al.
Published: (2025)
by: Yuan, Mingfeng, et al.
Published: (2025)
Leveraging Pre-trained Large Language Models with Refined Prompting for Online Task and Motion Planning
by: Guo, Huihui, et al.
Published: (2025)
by: Guo, Huihui, et al.
Published: (2025)
Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving
by: Li, Yun, et al.
Published: (2026)
by: Li, Yun, et al.
Published: (2026)
HBTP: Heuristic Behavior Tree Planning with Large Language Model Reasoning
by: Cai, Yishuai, et al.
Published: (2024)
by: Cai, Yishuai, et al.
Published: (2024)
Grounded World Model for Semantically Generalizable Planning
by: Li, Quanyi, et al.
Published: (2026)
by: Li, Quanyi, et al.
Published: (2026)
Similar Items
-
Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning
by: Fei, Zhaoye, et al.
Published: (2025) -
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
by: Wang, Siyin, et al.
Published: (2025) -
How to Mitigate Overfitting in Weak-to-strong Generalization?
by: Shi, Junhao, et al.
Published: (2025) -
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
by: Fei, Senyu, et al.
Published: (2025) -
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
by: Hu, Mengkang, et al.
Published: (2023)