Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
Fuente:
arXiv
Saved in:
| Main Authors: | Malik, Ashish, Lowe, Caleb, Shrestha, Aayam, Lee, Stefan, Li, Fuxin, Fern, Alan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Humanoid Hanoi: Investigating Shared Whole-Body Control for Skill-Based Box Rearrangement
by: Kim, Minku, et al.
Published: (2026)
by: Kim, Minku, et al.
Published: (2026)
Generating Physically Realistic and Directable Human Motions from Multi-Modal Inputs
by: Shrestha, Aayam, et al.
Published: (2025)
by: Shrestha, Aayam, et al.
Published: (2025)
Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots
by: Dugar, Pranay, et al.
Published: (2024)
by: Dugar, Pranay, et al.
Published: (2024)
No More Blind Spots: Learning Vision-Based Omnidirectional Bipedal Locomotion for Challenging Terrain
by: Gadde, Mohitvishnu S., et al.
Published: (2025)
by: Gadde, Mohitvishnu S., et al.
Published: (2025)
No More Marching: Learning Humanoid Locomotion for Short-Range SE(2) Targets
by: Dugar, Pranay, et al.
Published: (2025)
by: Dugar, Pranay, et al.
Published: (2025)
DeepAveragers: Offline Reinforcement Learning by Solving Derived Non-Parametric MDPs
by: Shrestha, Aayam, et al.
Published: (2020)
by: Shrestha, Aayam, et al.
Published: (2020)
Learning Decentralized Multi-Biped Control for Payload Transport
by: Pandit, Bikram, et al.
Published: (2024)
by: Pandit, Bikram, et al.
Published: (2024)
Multi-Quadruped Cooperative Object Transport: Learning Decentralized Pinch-Lift-Move
by: Pandit, Bikram, et al.
Published: (2025)
by: Pandit, Bikram, et al.
Published: (2025)
Hierarchical Object-Oriented POMDP Planning for Object Rearrangement
by: Mangannavar, Rajesh, et al.
Published: (2024)
by: Mangannavar, Rajesh, et al.
Published: (2024)
Spatially Grounded Long-Horizon Task Planning in the Wild
by: Jung, Sehun, et al.
Published: (2026)
by: Jung, Sehun, et al.
Published: (2026)
MORE: Mobile Manipulation Rearrangement Through Grounded Language Reasoning
by: Mohammadi, Mohammad, et al.
Published: (2025)
by: Mohammadi, Mohammad, et al.
Published: (2025)
LHManip: A Dataset for Long-Horizon Language-Grounded Manipulation Tasks in Cluttered Tabletop Environments
by: Ceola, Federico, et al.
Published: (2023)
by: Ceola, Federico, et al.
Published: (2023)
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
by: Liu, Jinkun, et al.
Published: (2026)
by: Liu, Jinkun, et al.
Published: (2026)
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
by: Yang, Yi, et al.
Published: (2025)
by: Yang, Yi, et al.
Published: (2025)
Instruction-Augmented Long-Horizon Planning: Embedding Grounding Mechanisms in Embodied Mobile Manipulation
by: Wang, Fangyuan, et al.
Published: (2025)
by: Wang, Fangyuan, et al.
Published: (2025)
Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation
by: Zhang, Lingfeng, et al.
Published: (2025)
by: Zhang, Lingfeng, et al.
Published: (2025)
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
by: Feng, Yunhai, et al.
Published: (2025)
by: Feng, Yunhai, et al.
Published: (2025)
3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning
by: Tang, Guoqin, et al.
Published: (2025)
by: Tang, Guoqin, et al.
Published: (2025)
SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical Planning
by: Han, Zebin, et al.
Published: (2026)
by: Han, Zebin, et al.
Published: (2026)
Revisiting Reward Design and Evaluation for Robust Humanoid Standing and Walking
by: van Marum, Bart, et al.
Published: (2024)
by: van Marum, Bart, et al.
Published: (2024)
Grounded Vision-Language Interpreter for Integrated Task and Motion Planning
by: Siburian, Jeremy, et al.
Published: (2025)
by: Siburian, Jeremy, et al.
Published: (2025)
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
by: Jin, Xinchen, et al.
Published: (2026)
by: Jin, Xinchen, et al.
Published: (2026)
Learning Long-Horizon Predictions for Quadrotor Dynamics
by: Rao, Pratyaksh Prabhav, et al.
Published: (2024)
by: Rao, Pratyaksh Prabhav, et al.
Published: (2024)
Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining
by: Chen, Yipeng, et al.
Published: (2026)
by: Chen, Yipeng, et al.
Published: (2026)
FCRF: Flexible Constructivism Reflection for Long-Horizon Robotic Task Planning with Large Language Models
by: Song, Yufan, et al.
Published: (2025)
by: Song, Yufan, et al.
Published: (2025)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
by: Wang, Shihao, et al.
Published: (2026)
by: Wang, Shihao, et al.
Published: (2026)
Refining Compositional Diffusion for Reliable Long-Horizon Planning
by: Lee, Kyowoon, et al.
Published: (2026)
by: Lee, Kyowoon, et al.
Published: (2026)
CubeRobot: Grounding Language in Rubik's Cube Manipulation via Vision-Language Model
by: Wang, Feiyang, et al.
Published: (2025)
by: Wang, Feiyang, et al.
Published: (2025)
Grounded Vision-Language Navigation for UAVs with Open-Vocabulary Goal Understanding
by: Zhang, Yuhang, et al.
Published: (2025)
by: Zhang, Yuhang, et al.
Published: (2025)
SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction
by: Gan, Linyong, et al.
Published: (2026)
by: Gan, Linyong, et al.
Published: (2026)
CHD: Coupled Hierarchical Diffusion for Long-Horizon Tasks
by: Hao, Ce, et al.
Published: (2025)
by: Hao, Ce, et al.
Published: (2025)
SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks
by: Li, Jialiang, et al.
Published: (2025)
by: Li, Jialiang, et al.
Published: (2025)
OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision
by: Liu, Ruixun, et al.
Published: (2025)
by: Liu, Ruixun, et al.
Published: (2025)
Trust the PRoC3S: Solving Long-Horizon Robotics Problems with LLMs and Constraint Satisfaction
by: Curtis, Aidan, et al.
Published: (2024)
by: Curtis, Aidan, et al.
Published: (2024)
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
by: Li, Ruiying, et al.
Published: (2026)
by: Li, Ruiying, et al.
Published: (2026)
Language-Grounded Hierarchical Planning and Execution with Multi-Robot 3D Scene Graphs
by: Strader, Jared, et al.
Published: (2025)
by: Strader, Jared, et al.
Published: (2025)
System Design for Maintaining Internal State Consistency in Long-Horizon Robotic Tabletop Games
by: Zhao, Guangyu, et al.
Published: (2026)
by: Zhao, Guangyu, et al.
Published: (2026)
STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory
by: Yuan, Mingfeng, et al.
Published: (2026)
by: Yuan, Mingfeng, et al.
Published: (2026)
Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments
by: Pang, Yiwen, et al.
Published: (2026)
by: Pang, Yiwen, et al.
Published: (2026)
ELHPlan: Efficient Long-Horizon Task Planning for Multi-Agent Collaboration
by: Ling, Shaobin, et al.
Published: (2025)
by: Ling, Shaobin, et al.
Published: (2025)
Similar Items
-
Humanoid Hanoi: Investigating Shared Whole-Body Control for Skill-Based Box Rearrangement
by: Kim, Minku, et al.
Published: (2026) -
Generating Physically Realistic and Directable Human Motions from Multi-Modal Inputs
by: Shrestha, Aayam, et al.
Published: (2025) -
Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots
by: Dugar, Pranay, et al.
Published: (2024) -
No More Blind Spots: Learning Vision-Based Omnidirectional Bipedal Locomotion for Challenging Terrain
by: Gadde, Mohitvishnu S., et al.
Published: (2025) -
No More Marching: Learning Humanoid Locomotion for Short-Range SE(2) Targets
by: Dugar, Pranay, et al.
Published: (2025)