Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chia, Yew Ken, Sun, Qi, Bing, Lidong, Poria, Soujanya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles
por: Toh, Vernon Y. H., et al.
Publicado: (2025)
por: Toh, Vernon Y. H., et al.
Publicado: (2025)
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
por: Zheng, Kaizhi, et al.
Publicado: (2022)
por: Zheng, Kaizhi, et al.
Publicado: (2022)
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
por: Li, Xingxuan, et al.
Publicado: (2023)
por: Li, Xingxuan, et al.
Publicado: (2023)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
por: Ghosal, Deepanway, et al.
Publicado: (2024)
por: Ghosal, Deepanway, et al.
Publicado: (2024)
Neuro-Symbolic Concepts
por: Mao, Jiayuan, et al.
Publicado: (2025)
por: Mao, Jiayuan, et al.
Publicado: (2025)
Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus
por: Guillen-Perez, Antonio
Publicado: (2025)
por: Guillen-Perez, Antonio
Publicado: (2025)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
por: Chen, Yi, et al.
Publicado: (2023)
por: Chen, Yi, et al.
Publicado: (2023)
M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
Toward Robust Multimodal Learning using Multimodal Foundational Models
por: Zhao, Xianbing, et al.
Publicado: (2024)
por: Zhao, Xianbing, et al.
Publicado: (2024)
Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation
por: Korekata, Ryosuke, et al.
Publicado: (2025)
por: Korekata, Ryosuke, et al.
Publicado: (2025)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
Domain-Expanded ASTE: Rethinking Generalization in Aspect Sentiment Triplet Extraction
por: Chia, Yew Ken, et al.
Publicado: (2023)
por: Chia, Yew Ken, et al.
Publicado: (2023)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
World Action Models: The Next Frontier in Embodied AI
por: Wang, Siyin, et al.
Publicado: (2026)
por: Wang, Siyin, et al.
Publicado: (2026)
GPT-4V(ision) for Robotics: Multimodal Task Planning from Human Demonstration
por: Wake, Naoki, et al.
Publicado: (2023)
por: Wake, Naoki, et al.
Publicado: (2023)
Building Cooperative Embodied Agents Modularly with Large Language Models
por: Zhang, Hongxin, et al.
Publicado: (2023)
por: Zhang, Hongxin, et al.
Publicado: (2023)
OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning
por: Liu, Yuecheng, et al.
Publicado: (2025)
por: Liu, Yuecheng, et al.
Publicado: (2025)
Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding
por: Song, Yaoxian, et al.
Publicado: (2023)
por: Song, Yaoxian, et al.
Publicado: (2023)
SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning
por: Yang, Yuyuan, et al.
Publicado: (2026)
por: Yang, Yuyuan, et al.
Publicado: (2026)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
por: Wang, Tianyu, et al.
Publicado: (2024)
por: Wang, Tianyu, et al.
Publicado: (2024)
ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark
por: Dang, Ronghao, et al.
Publicado: (2025)
por: Dang, Ronghao, et al.
Publicado: (2025)
NEUSIS: A Compositional Neuro-Symbolic Framework for Autonomous Perception, Reasoning, and Planning in Complex UAV Search Missions
por: Cai, Zhixi, et al.
Publicado: (2024)
por: Cai, Zhixi, et al.
Publicado: (2024)
A Superalignment Framework in Autonomous Driving with Large Language Models
por: Kong, Xiangrui, et al.
Publicado: (2024)
por: Kong, Xiangrui, et al.
Publicado: (2024)
Neuro-Symbolic Manipulation Understanding with Enriched Semantic Event Chains
por: Ziaeetabar, Fatemeh
Publicado: (2026)
por: Ziaeetabar, Fatemeh
Publicado: (2026)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
por: Li, Jianxiong, et al.
Publicado: (2024)
por: Li, Jianxiong, et al.
Publicado: (2024)
From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning
por: Gado, Ahmed Y., et al.
Publicado: (2026)
por: Gado, Ahmed Y., et al.
Publicado: (2026)
Can Language Beat Numerical Regression? Language-Based Multimodal Trajectory Prediction
por: Bae, Inhwan, et al.
Publicado: (2024)
por: Bae, Inhwan, et al.
Publicado: (2024)
Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs
por: Hong, Yining, et al.
Publicado: (2026)
por: Hong, Yining, et al.
Publicado: (2026)
A Multi-Modal Neuro-Symbolic Approach for Spatial Reasoning-Based Visual Grounding in Robotics
por: Jahangard, Simindokht, et al.
Publicado: (2025)
por: Jahangard, Simindokht, et al.
Publicado: (2025)
Holodeck: Language Guided Generation of 3D Embodied AI Environments
por: Yang, Yue, et al.
Publicado: (2023)
por: Yang, Yue, et al.
Publicado: (2023)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
por: Lu, Jinghui, et al.
Publicado: (2026)
por: Lu, Jinghui, et al.
Publicado: (2026)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
por: Han, Wei, et al.
Publicado: (2023)
por: Han, Wei, et al.
Publicado: (2023)
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
por: Zou, Ding, et al.
Publicado: (2025)
por: Zou, Ding, et al.
Publicado: (2025)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Embodied Agents for Efficient Exploration and Smart Scene Description
por: Bigazzi, Roberto, et al.
Publicado: (2023)
por: Bigazzi, Roberto, et al.
Publicado: (2023)
TartanGround: A Large-Scale Dataset for Ground Robot Perception and Navigation
por: Patel, Manthan, et al.
Publicado: (2025)
por: Patel, Manthan, et al.
Publicado: (2025)
Ejemplares similares
-
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
por: Sun, Qi, et al.
Publicado: (2024) -
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
por: Chia, Yew Ken, et al.
Publicado: (2024) -
The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles
por: Toh, Vernon Y. H., et al.
Publicado: (2025) -
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
por: Zheng, Kaizhi, et al.
Publicado: (2022) -
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
por: Li, Xingxuan, et al.
Publicado: (2023)