MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Min, Fu, Xian, Hao, Jianye, Han, Peilong, Zhang, Hao, Shi, Lei, Tang, Hongyao, Zheng, Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MUVLA: Learning to Explore Object Navigation via Map Understanding
par: Han, Peilong, et autres
Publié: (2025)
par: Han, Peilong, et autres
Publié: (2025)
ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models
par: Zhang, Lingfeng, et autres
Publié: (2024)
par: Zhang, Lingfeng, et autres
Publié: (2024)
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
par: Yuan, Yifu, et autres
Publié: (2025)
par: Yuan, Yifu, et autres
Publié: (2025)
Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI
par: Ni, Fei, et autres
Publié: (2025)
par: Ni, Fei, et autres
Publié: (2025)
The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning
par: Wu, Zihao, et autres
Publié: (2026)
par: Wu, Zihao, et autres
Publié: (2026)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents
par: Zhu, Zihao, et autres
Publié: (2024)
par: Zhu, Zihao, et autres
Publié: (2024)
AhaRobot: A Low-Cost Open-Source Bimanual Mobile Manipulator for Embodied AI
par: Cui, Haiqin, et autres
Publié: (2025)
par: Cui, Haiqin, et autres
Publié: (2025)
Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
par: Liang, Jing, et autres
Publié: (2025)
par: Liang, Jing, et autres
Publié: (2025)
COMET: Benchmark for Comprehensive Biological Multi-omics Evaluation Tasks and Language Models
par: Ren, Yuchen, et autres
Publié: (2024)
par: Ren, Yuchen, et autres
Publié: (2024)
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
par: Zou, Ding, et autres
Publié: (2025)
par: Zou, Ding, et autres
Publié: (2025)
ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark
par: Dang, Ronghao, et autres
Publié: (2025)
par: Dang, Ronghao, et autres
Publié: (2025)
ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making
par: Dai, Liu, et autres
Publié: (2025)
par: Dai, Liu, et autres
Publié: (2025)
A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents
par: Huang, Yuting, et autres
Publié: (2025)
par: Huang, Yuting, et autres
Publié: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
PARTNR: A Benchmark for Planning and Reasoning in Embodied Multi-agent Tasks
par: Chang, Matthew, et autres
Publié: (2024)
par: Chang, Matthew, et autres
Publié: (2024)
SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning
par: Liu, Yuecheng, et autres
Publié: (2025)
par: Liu, Yuecheng, et autres
Publié: (2025)
EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation
par: Dong, Zibin, et autres
Publié: (2025)
par: Dong, Zibin, et autres
Publié: (2025)
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
LLM-Driven Self-Refinement for Embodied Drone Task Planning
par: Zhang, Deyu, et autres
Publié: (2025)
par: Zhang, Deyu, et autres
Publié: (2025)
ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching
par: Zhang, Shuoheng, et autres
Publié: (2026)
par: Zhang, Shuoheng, et autres
Publié: (2026)
Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies
par: Ma, Yi, et autres
Publié: (2025)
par: Ma, Yi, et autres
Publié: (2025)
3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow
par: Ma, Yueen, et autres
Publié: (2025)
par: Ma, Yueen, et autres
Publié: (2025)
A Survey on Vision-Language-Action Models for Embodied AI
par: Ma, Yueen, et autres
Publié: (2024)
par: Ma, Yueen, et autres
Publié: (2024)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
par: Li, Zhong-Zhi, et autres
Publié: (2024)
par: Li, Zhong-Zhi, et autres
Publié: (2024)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
par: Luo, Yulin, et autres
Publié: (2025)
par: Luo, Yulin, et autres
Publié: (2025)
Can We Optimize Deep RL Policy Weights as Trajectory Modeling?
par: Tang, Hongyao
Publié: (2025)
par: Tang, Hongyao
Publié: (2025)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
par: Wang, Lu, et autres
Publié: (2025)
par: Wang, Lu, et autres
Publié: (2025)
GUI Agents with Foundation Models: A Comprehensive Survey
par: Wang, Shuai, et autres
Publié: (2024)
par: Wang, Shuai, et autres
Publié: (2024)
CD133 in T ‐lymphoblastic leukemia is preferentially expressed in early T ‐phenotype ( ETP ) and near ETP subtypes
par: Shuyu E, et autres
Publié: (2024)
par: Shuyu E, et autres
Publié: (2024)
Human-centered In-building Embodied Delivery Benchmark
par: Xu, Zhuoqun, et autres
Publié: (2024)
par: Xu, Zhuoqun, et autres
Publié: (2024)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
par: Zhang, Min, et autres
Publié: (2025)
par: Zhang, Min, et autres
Publié: (2025)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
MCTS-EP: Empowering Embodied Planning with Online Preference Optimization
par: Xu, Hang, et autres
Publié: (2025)
par: Xu, Hang, et autres
Publié: (2025)
BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs
par: Guo, Mingning, et autres
Publié: (2025)
par: Guo, Mingning, et autres
Publié: (2025)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
C-ReD: A Comprehensive Chinese Benchmark for AI-Generated Text Detection Derived from Real-World Prompts
par: Qing, Chenxi, et autres
Publié: (2026)
par: Qing, Chenxi, et autres
Publié: (2026)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
par: Yuan, Yifu, et autres
Publié: (2024)
par: Yuan, Yifu, et autres
Publié: (2024)
Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives
par: Bai, Shuanghao, et autres
Publié: (2025)
par: Bai, Shuanghao, et autres
Publié: (2025)
Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines
par: Ma, Zi-Ao, et autres
Publié: (2024)
par: Ma, Zi-Ao, et autres
Publié: (2024)
Documents similaires
-
MUVLA: Learning to Explore Object Navigation via Map Understanding
par: Han, Peilong, et autres
Publié: (2025) -
ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models
par: Zhang, Lingfeng, et autres
Publié: (2024) -
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
par: Yuan, Yifu, et autres
Publié: (2025) -
Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI
par: Ni, Fei, et autres
Publié: (2025) -
The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning
par: Wu, Zihao, et autres
Publié: (2026)