RoboMP$^2$: A Robotic Multimodal Perception-Planning Framework with Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lv, Qi, Li, Hao, Deng, Xiang, Shao, Rui, Wang, Michael Yu, Nie, Liqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STAR: Learning Diverse Robot Skill Abstractions through Rotation-Augmented Vector Quantization
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
par: Lv, Qi, et autres
Publié: (2025)
par: Lv, Qi, et autres
Publié: (2025)
EPD: Long-term Memory Extraction, Context-awared Planning and Multi-iteration Decision @ EgoPlan Challenge ICML 2024
par: Shi, Letian, et autres
Publié: (2024)
par: Shi, Letian, et autres
Publié: (2024)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
par: Chu, Hengshuo, et autres
Publié: (2025)
par: Chu, Hengshuo, et autres
Publié: (2025)
RoboLLM: Robotic Vision Tasks Grounded on Multimodal Large Language Models
par: Long, Zijun, et autres
Publié: (2023)
par: Long, Zijun, et autres
Publié: (2023)
Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation
par: Zhang, Xuening, et autres
Publié: (2026)
par: Zhang, Xuening, et autres
Publié: (2026)
RoboTron-Mani: All-in-One Multimodal Large Model for Robotic Manipulation
par: Yan, Feng, et autres
Publié: (2024)
par: Yan, Feng, et autres
Publié: (2024)
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
par: Li, Wei, et autres
Publié: (2026)
par: Li, Wei, et autres
Publié: (2026)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
par: Shao, Rui, et autres
Publié: (2025)
par: Shao, Rui, et autres
Publié: (2025)
RoboBERT: An End-to-end Multimodal Robotic Manipulation Model
par: Wang, Sicheng, et autres
Publié: (2025)
par: Wang, Sicheng, et autres
Publié: (2025)
Robo-MUTUAL: Robotic Multimodal Task Specification via Unimodal Learning
par: Li, Jianxiong, et autres
Publié: (2024)
par: Li, Jianxiong, et autres
Publié: (2024)
RoboGPT-R1: Enhancing Robot Planning with Reinforcement Learning
par: Liu, Jinrui, et autres
Publié: (2025)
par: Liu, Jinrui, et autres
Publié: (2025)
RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
par: Mu, Yao, et autres
Publié: (2024)
par: Mu, Yao, et autres
Publié: (2024)
RoboAfford++: A Generative AI-Enhanced Dataset for Multimodal Affordance Learning in Robotic Manipulation and Navigation
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
OpenRoboCare: A Multimodal Multi-Task Expert Demonstration Dataset for Robot Caregiving
par: Liang, Xiaoyu, et autres
Publié: (2025)
par: Liang, Xiaoyu, et autres
Publié: (2025)
RoboCup@Home 2024 OPL Winner NimbRo: Anthropomorphic Service Robots using Foundation Models for Perception and Planning
par: Memmesheimer, Raphael, et autres
Publié: (2024)
par: Memmesheimer, Raphael, et autres
Publié: (2024)
Preference-Based Long-Horizon Robotic Stacking with Multimodal Large Language Models
par: Yu, Wanming, et autres
Publié: (2025)
par: Yu, Wanming, et autres
Publié: (2025)
Assessing the Value of Visual Input: A Benchmark of Multimodal Large Language Models for Robotic Path Planning
par: Colan, Jacinto, et autres
Publié: (2025)
par: Colan, Jacinto, et autres
Publié: (2025)
RoboRetriever: Single-Camera Robot Object Retrieval via Active and Interactive Perception with Dynamic Scene Graph
par: Wang, Hecheng, et autres
Publié: (2025)
par: Wang, Hecheng, et autres
Publié: (2025)
RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model
par: Li, Shunlei, et autres
Publié: (2024)
par: Li, Shunlei, et autres
Publié: (2024)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
AssemLM: Spatial Reasoning Multimodal Large Language Models for Robotic Assembly
par: Jing, Zhi, et autres
Publié: (2026)
par: Jing, Zhi, et autres
Publié: (2026)
RoboMorph: Evolving Robot Morphology using Large Language Models
par: Qiu, Kevin, et autres
Publié: (2024)
par: Qiu, Kevin, et autres
Publié: (2024)
RoboDexVLM: Visual Language Model-Enabled Task Planning and Motion Control for Dexterous Robot Manipulation
par: Liu, Haichao, et autres
Publié: (2025)
par: Liu, Haichao, et autres
Publié: (2025)
RoboTron-Nav: A Unified Framework for Embodied Navigation Integrating Perception, Planning, and Prediction
par: Zhong, Yufeng, et autres
Publié: (2025)
par: Zhong, Yufeng, et autres
Publié: (2025)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
par: Li, Zaijing, et autres
Publié: (2026)
par: Li, Zaijing, et autres
Publié: (2026)
RoboSolver: A Multi-Agent Large Language Model Framework for Solving Robotic Arm Problems
par: Khabazi, Hamid, et autres
Publié: (2026)
par: Khabazi, Hamid, et autres
Publié: (2026)
DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models
par: Huang, Shucheng, et autres
Publié: (2025)
par: Huang, Shucheng, et autres
Publié: (2025)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
par: Chen, Yi, et autres
Publié: (2023)
par: Chen, Yi, et autres
Publié: (2023)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
par: Huang, Zhijian, et autres
Publié: (2024)
par: Huang, Zhijian, et autres
Publié: (2024)
MLLM-Fabric: Multimodal Large Language Model-Driven Robotic Framework for Fabric Sorting and Selection
par: Wang, Liman, et autres
Publié: (2025)
par: Wang, Liman, et autres
Publié: (2025)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
par: Hou, Chengkai, et autres
Publié: (2025)
par: Hou, Chengkai, et autres
Publié: (2025)
SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models
par: Torres-Fonseca, Josue, et autres
Publié: (2026)
par: Torres-Fonseca, Josue, et autres
Publié: (2026)
RoboCoder: Robotic Learning from Basic Skills to General Tasks with Large Language Models
par: Li, Jingyao, et autres
Publié: (2024)
par: Li, Jingyao, et autres
Publié: (2024)
Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning
par: Battistini, Cristiano, et autres
Publié: (2026)
par: Battistini, Cristiano, et autres
Publié: (2026)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
par: Li, Xiaoqi, et autres
Publié: (2025)
par: Li, Xiaoqi, et autres
Publié: (2025)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
par: Shen, Leyang, et autres
Publié: (2024)
par: Shen, Leyang, et autres
Publié: (2024)
Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models
par: Liu, Jinyi, et autres
Publié: (2024)
par: Liu, Jinyi, et autres
Publié: (2024)
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
par: Lee, Tony, et autres
Publié: (2026)
par: Lee, Tony, et autres
Publié: (2026)
Documents similaires
-
STAR: Learning Diverse Robot Skill Abstractions through Rotation-Augmented Vector Quantization
par: Li, Hao, et autres
Publié: (2025) -
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
par: Lv, Qi, et autres
Publié: (2025) -
EPD: Long-term Memory Extraction, Context-awared Planning and Multi-iteration Decision @ EgoPlan Challenge ICML 2024
par: Shi, Letian, et autres
Publié: (2024) -
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
par: Chu, Hengshuo, et autres
Publié: (2025) -
RoboLLM: Robotic Vision Tasks Grounded on Multimodal Large Language Models
par: Long, Zijun, et autres
Publié: (2023)