Prompter: Utilizing Large Language Model Prompting for a Data Efficient Embodied Instruction Following
Fuente:
arXiv
Salvato in:
| Autori principali: | Inoue, Yuki, Ohashi, Hiroki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiffPrompter: Differentiable Implicit Visual Prompts for Semantic-Segmentation in Adverse Conditions
di: Kalwar, Sanket, et al.
Pubblicazione: (2023)
di: Kalwar, Sanket, et al.
Pubblicazione: (2023)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
di: Luo, Yulin, et al.
Pubblicazione: (2025)
di: Luo, Yulin, et al.
Pubblicazione: (2025)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
di: Luo, Gen, et al.
Pubblicazione: (2025)
di: Luo, Gen, et al.
Pubblicazione: (2025)
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
di: Choi, Wonje, et al.
Pubblicazione: (2024)
di: Choi, Wonje, et al.
Pubblicazione: (2024)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models
di: He, Ziheng, et al.
Pubblicazione: (2026)
di: He, Ziheng, et al.
Pubblicazione: (2026)
Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
di: Sohn, Tin Stribor, et al.
Pubblicazione: (2025)
di: Sohn, Tin Stribor, et al.
Pubblicazione: (2025)
Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2024)
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2024)
Embodied Scene Understanding for Vision Language Models via MetaVQA
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
di: GigaWorld Team, et al.
Pubblicazione: (2025)
di: GigaWorld Team, et al.
Pubblicazione: (2025)
Bridging the Indoor-Outdoor Gap: Vision-Centric Instruction-Guided Embodied Navigation for the Last Meters
di: Zhao, Yuxiang, et al.
Pubblicazione: (2026)
di: Zhao, Yuxiang, et al.
Pubblicazione: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis
di: Qi, Yu, et al.
Pubblicazione: (2025)
di: Qi, Yu, et al.
Pubblicazione: (2025)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
Building Cooperative Embodied Agents Modularly with Large Language Models
di: Zhang, Hongxin, et al.
Pubblicazione: (2023)
di: Zhang, Hongxin, et al.
Pubblicazione: (2023)
Multimodal Data Storage and Retrieval for Embodied AI: A Survey
di: Lu, Yihao, et al.
Pubblicazione: (2025)
di: Lu, Yihao, et al.
Pubblicazione: (2025)
MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning
di: Ju, Yuanchen, et al.
Pubblicazione: (2025)
di: Ju, Yuanchen, et al.
Pubblicazione: (2025)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
di: Wang, Xinjie, et al.
Pubblicazione: (2025)
di: Wang, Xinjie, et al.
Pubblicazione: (2025)
Egocentric Instruction-oriented Affordance Prediction via Large Multimodal Model
di: Ji, Bokai, et al.
Pubblicazione: (2025)
di: Ji, Bokai, et al.
Pubblicazione: (2025)
DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning
di: Lee, Junha, et al.
Pubblicazione: (2026)
di: Lee, Junha, et al.
Pubblicazione: (2026)
Following Route Instructions using Large Vision-Language Models: A Comparison between Low-level and Panoramic Action Spaces
di: Kåsene, Vebjørn Haug, et al.
Pubblicazione: (2025)
di: Kåsene, Vebjørn Haug, et al.
Pubblicazione: (2025)
RoboScape: Physics-informed Embodied World Model
di: Shang, Yu, et al.
Pubblicazione: (2025)
di: Shang, Yu, et al.
Pubblicazione: (2025)
Learning 3D Persistent Embodied World Models
di: Zhou, Siyuan, et al.
Pubblicazione: (2025)
di: Zhou, Siyuan, et al.
Pubblicazione: (2025)
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
di: Zou, Ding, et al.
Pubblicazione: (2025)
di: Zou, Ding, et al.
Pubblicazione: (2025)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
di: Hao, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Hao, Xiaoshuai, et al.
Pubblicazione: (2025)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
Configurable Embodied Data Generation for Class-Agnostic RGB-D Video Segmentation
di: Opipari, Anthony, et al.
Pubblicazione: (2024)
di: Opipari, Anthony, et al.
Pubblicazione: (2024)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
di: Peng, Baorui, et al.
Pubblicazione: (2026)
di: Peng, Baorui, et al.
Pubblicazione: (2026)
SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning
di: Yang, Yuyuan, et al.
Pubblicazione: (2026)
di: Yang, Yuyuan, et al.
Pubblicazione: (2026)
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
di: Dissanayake, Dinura, et al.
Pubblicazione: (2025)
di: Dissanayake, Dinura, et al.
Pubblicazione: (2025)
TesserAct: Learning 4D Embodied World Models
di: Zhen, Haoyu, et al.
Pubblicazione: (2025)
di: Zhen, Haoyu, et al.
Pubblicazione: (2025)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
di: Lin, Sihao, et al.
Pubblicazione: (2025)
di: Lin, Sihao, et al.
Pubblicazione: (2025)
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
di: Qian, Kangan, et al.
Pubblicazione: (2026)
di: Qian, Kangan, et al.
Pubblicazione: (2026)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
di: Wen, Junjie, et al.
Pubblicazione: (2024)
di: Wen, Junjie, et al.
Pubblicazione: (2024)
CLIPSwarm: Generating Drone Shows from Text Prompts with Vision-Language Models
di: Pueyo, Pablo, et al.
Pubblicazione: (2024)
di: Pueyo, Pablo, et al.
Pubblicazione: (2024)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DiffPrompter: Differentiable Implicit Visual Prompts for Semantic-Segmentation in Adverse Conditions
di: Kalwar, Sanket, et al.
Pubblicazione: (2023) -
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
di: Luo, Yulin, et al.
Pubblicazione: (2025) -
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
di: Luo, Gen, et al.
Pubblicazione: (2025) -
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
di: Choi, Wonje, et al.
Pubblicazione: (2024) -
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)