Saved in:
| Main Authors: | Inoue, Yuki, Ohashi, Hiroki |
|---|---|
| Format: | Preprint |
| Published: |
2022
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2211.03267 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DiffPrompter: Differentiable Implicit Visual Prompts for Semantic-Segmentation in Adverse Conditions
by: Kalwar, Sanket, et al.
Published: (2023)
by: Kalwar, Sanket, et al.
Published: (2023)
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
by: Choi, Wonje, et al.
Published: (2024)
by: Choi, Wonje, et al.
Published: (2024)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
by: Luo, Yulin, et al.
Published: (2025)
by: Luo, Yulin, et al.
Published: (2025)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
by: Zhang, Jiyao, et al.
Published: (2026)
by: Zhang, Jiyao, et al.
Published: (2026)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
by: Luo, Gen, et al.
Published: (2025)
by: Luo, Gen, et al.
Published: (2025)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
by: Song, Zirui, et al.
Published: (2025)
by: Song, Zirui, et al.
Published: (2025)
SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models
by: He, Ziheng, et al.
Published: (2026)
by: He, Ziheng, et al.
Published: (2026)
Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
by: Sohn, Tin Stribor, et al.
Published: (2025)
by: Sohn, Tin Stribor, et al.
Published: (2025)
Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation
by: Raychaudhuri, Sonia, et al.
Published: (2024)
by: Raychaudhuri, Sonia, et al.
Published: (2024)
Embodied Scene Understanding for Vision Language Models via MetaVQA
by: Wang, Weizhen, et al.
Published: (2025)
by: Wang, Weizhen, et al.
Published: (2025)
Building Cooperative Embodied Agents Modularly with Large Language Models
by: Zhang, Hongxin, et al.
Published: (2023)
by: Zhang, Hongxin, et al.
Published: (2023)
Bridging the Indoor-Outdoor Gap: Vision-Centric Instruction-Guided Embodied Navigation for the Last Meters
by: Zhao, Yuxiang, et al.
Published: (2026)
by: Zhao, Yuxiang, et al.
Published: (2026)
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
by: GigaWorld Team, et al.
Published: (2025)
by: GigaWorld Team, et al.
Published: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
by: Ling, Yiran, et al.
Published: (2026)
by: Ling, Yiran, et al.
Published: (2026)
Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis
by: Qi, Yu, et al.
Published: (2025)
by: Qi, Yu, et al.
Published: (2025)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
by: Zhang, Qiyao, et al.
Published: (2026)
by: Zhang, Qiyao, et al.
Published: (2026)
Following Route Instructions using Large Vision-Language Models: A Comparison between Low-level and Panoramic Action Spaces
by: Kåsene, Vebjørn Haug, et al.
Published: (2025)
by: Kåsene, Vebjørn Haug, et al.
Published: (2025)
Multimodal Data Storage and Retrieval for Embodied AI: A Survey
by: Lu, Yihao, et al.
Published: (2025)
by: Lu, Yihao, et al.
Published: (2025)
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
by: Wang, Xinjie, et al.
Published: (2025)
by: Wang, Xinjie, et al.
Published: (2025)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
by: Hao, Xiaoshuai, et al.
Published: (2025)
by: Hao, Xiaoshuai, et al.
Published: (2025)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
by: Lang, Xiaolei, et al.
Published: (2026)
by: Lang, Xiaolei, et al.
Published: (2026)
MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning
by: Ju, Yuanchen, et al.
Published: (2025)
by: Ju, Yuanchen, et al.
Published: (2025)
DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning
by: Lee, Junha, et al.
Published: (2026)
by: Lee, Junha, et al.
Published: (2026)
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
by: Zou, Ding, et al.
Published: (2025)
by: Zou, Ding, et al.
Published: (2025)
Egocentric Instruction-oriented Affordance Prediction via Large Multimodal Model
by: Ji, Bokai, et al.
Published: (2025)
by: Ji, Bokai, et al.
Published: (2025)
RoboScape: Physics-informed Embodied World Model
by: Shang, Yu, et al.
Published: (2025)
by: Shang, Yu, et al.
Published: (2025)
Learning 3D Persistent Embodied World Models
by: Zhou, Siyuan, et al.
Published: (2025)
by: Zhou, Siyuan, et al.
Published: (2025)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
by: Halacheva, Anna-Maria, et al.
Published: (2025)
by: Halacheva, Anna-Maria, et al.
Published: (2025)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
by: Zhang, Jiazhao, et al.
Published: (2024)
by: Zhang, Jiazhao, et al.
Published: (2024)
Configurable Embodied Data Generation for Class-Agnostic RGB-D Video Segmentation
by: Opipari, Anthony, et al.
Published: (2024)
by: Opipari, Anthony, et al.
Published: (2024)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
by: Peng, Baorui, et al.
Published: (2026)
by: Peng, Baorui, et al.
Published: (2026)
SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning
by: Yang, Yuyuan, et al.
Published: (2026)
by: Yang, Yuyuan, et al.
Published: (2026)
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
by: Dissanayake, Dinura, et al.
Published: (2025)
by: Dissanayake, Dinura, et al.
Published: (2025)
TesserAct: Learning 4D Embodied World Models
by: Zhen, Haoyu, et al.
Published: (2025)
by: Zhen, Haoyu, et al.
Published: (2025)
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
by: Qian, Kangan, et al.
Published: (2026)
by: Qian, Kangan, et al.
Published: (2026)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
by: Han, Mingfei, et al.
Published: (2024)
by: Han, Mingfei, et al.
Published: (2024)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
by: Lin, Sihao, et al.
Published: (2025)
by: Lin, Sihao, et al.
Published: (2025)
Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model
by: Xu, Wenjiang, et al.
Published: (2025)
by: Xu, Wenjiang, et al.
Published: (2025)
EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering
by: Cheng, Kai, et al.
Published: (2024)
by: Cheng, Kai, et al.
Published: (2024)
Similar Items
-
DiffPrompter: Differentiable Implicit Visual Prompts for Semantic-Segmentation in Adverse Conditions
by: Kalwar, Sanket, et al.
Published: (2023) -
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
by: Choi, Wonje, et al.
Published: (2024) -
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
by: Luo, Yulin, et al.
Published: (2025) -
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
by: Zhang, Jiyao, et al.
Published: (2026) -
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
by: Luo, Gen, et al.
Published: (2025)