A2Eval: Agentic and Automated Evaluation for Embodied Brain
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Shuai, Hu, Jiayu, Chen, Zijie, Ding, Zeyuan, Zhang, Yi, Zhang, Yingji, Zhou, Ziyi, Liao, Junwei, Zhou, Shengjie, Dai, Yong, Lan, Zhenzhong, Ju, Xiaozhu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
by: Shan, Haozhe, et al.
Published: (2026)
by: Shan, Haozhe, et al.
Published: (2026)
Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization
by: Zhang, Yi, et al.
Published: (2025)
by: Zhang, Yi, et al.
Published: (2025)
Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence
by: Zhang, Yi, et al.
Published: (2025)
by: Zhang, Yi, et al.
Published: (2025)
Robo-Cortex: A Self-Evolving Embodied Agent via Dual-Grain Cognitive Memory and Autonomous Knowledge Induction
by: Chan, Nga Teng, et al.
Published: (2026)
by: Chan, Nga Teng, et al.
Published: (2026)
VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing
by: Shi, Haoyuan, et al.
Published: (2026)
by: Shi, Haoyuan, et al.
Published: (2026)
Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action
by: Zhang, Yi, et al.
Published: (2026)
by: Zhang, Yi, et al.
Published: (2026)
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
by: Shen, Chengyu, et al.
Published: (2026)
by: Shen, Chengyu, et al.
Published: (2026)
GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving
by: Zhang, Yingji, et al.
Published: (2026)
by: Zhang, Yingji, et al.
Published: (2026)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
by: Cheng, Zhili, et al.
Published: (2025)
by: Cheng, Zhili, et al.
Published: (2025)
Position: Agentic AI System Is a Foreseeable Pathway to AGI
by: Liao, Junwei, et al.
Published: (2026)
by: Liao, Junwei, et al.
Published: (2026)
Embodied Science: Closing the Discovery Loop with Agentic Embodied AI
by: Zhuang, Xiang, et al.
Published: (2026)
by: Zhuang, Xiang, et al.
Published: (2026)
Agentic Self-Evolutionary Replanning for Embodied Navigation
by: Li, Guoliang, et al.
Published: (2026)
by: Li, Guoliang, et al.
Published: (2026)
Ella: Embodied Social Agents with Lifelong Memory
by: Zhang, Hongxin, et al.
Published: (2025)
by: Zhang, Hongxin, et al.
Published: (2025)
Formal Semantic Control over Language Models
by: Zhang, Yingji
Published: (2026)
by: Zhang, Yingji
Published: (2026)
Tailored Visions: Enhancing Text-to-Image Generation with Personalized Prompt Rewriting
by: Chen, Zijie, et al.
Published: (2023)
by: Chen, Zijie, et al.
Published: (2023)
Agentic Robot: A Brain-Inspired Framework for Vision-Language-Action Models in Embodied Agents
by: Yang, Zhejian, et al.
Published: (2025)
by: Yang, Zhejian, et al.
Published: (2025)
Body Discovery of Embodied AI
by: Sun, Zhe, et al.
Published: (2025)
by: Sun, Zhe, et al.
Published: (2025)
RepEval: Effective Text Evaluation with LLM Representation
by: Sheng, Shuqian, et al.
Published: (2024)
by: Sheng, Shuqian, et al.
Published: (2024)
ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue
by: Zhang, Daoxuan, et al.
Published: (2026)
by: Zhang, Daoxuan, et al.
Published: (2026)
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
by: Zhang, Junlei, et al.
Published: (2025)
by: Zhang, Junlei, et al.
Published: (2025)
Agentic Information Retrieval
by: Zhang, Weinan, et al.
Published: (2024)
by: Zhang, Weinan, et al.
Published: (2024)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
by: Luo, Yulin, et al.
Published: (2025)
by: Luo, Yulin, et al.
Published: (2025)
QUBE: Enhancing Automatic Heuristic Design via Quality-Uncertainty Balanced Evolution
by: Chen, Zijie, et al.
Published: (2024)
by: Chen, Zijie, et al.
Published: (2024)
Agentic AI-Empowered Conversational Embodied Intelligence Networks in 6G
by: Chen, Mingkai, et al.
Published: (2025)
by: Chen, Mingkai, et al.
Published: (2025)
Automating API Documentation from Crowdsourced Knowledge
by: Kou, Bonan, et al.
Published: (2026)
by: Kou, Bonan, et al.
Published: (2026)
CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration
by: Qian, Yiyue, et al.
Published: (2026)
by: Qian, Yiyue, et al.
Published: (2026)
Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test
by: Fan, Chun-Kai, et al.
Published: (2026)
by: Fan, Chun-Kai, et al.
Published: (2026)
ConceptPsy:A Benchmark Suite with Conceptual Comprehensiveness in Psychology
by: Zhang, Junlei, et al.
Published: (2023)
by: Zhang, Junlei, et al.
Published: (2023)
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
by: Wang, Yibo, et al.
Published: (2026)
by: Wang, Yibo, et al.
Published: (2026)
SedarEval: Automated Evaluation using Self-Adaptive Rubrics
by: Fan, Zhiyuan, et al.
Published: (2025)
by: Fan, Zhiyuan, et al.
Published: (2025)
Fluctuation Response Patterns of Network Dynamics -- an Introduction
by: Zhang, Xiaozhu, et al.
Published: (2024)
by: Zhang, Xiaozhu, et al.
Published: (2024)
DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing
by: Zhang, Hongzhi, et al.
Published: (2026)
by: Zhang, Hongzhi, et al.
Published: (2026)
Facilitating Pornographic Text Detection for Open-Domain Dialogue Systems via Knowledge Distillation of Large Language Models
by: Qiu, Huachuan, et al.
Published: (2024)
by: Qiu, Huachuan, et al.
Published: (2024)
SMILE: Single-turn to Multi-turn Inclusive Language Expansion via ChatGPT for Mental Health Support
by: Qiu, Huachuan, et al.
Published: (2023)
by: Qiu, Huachuan, et al.
Published: (2023)
Facilitating NSFW Text Detection in Open-Domain Dialogue Systems via Knowledge Distillation
by: Qiu, Huachuan, et al.
Published: (2023)
by: Qiu, Huachuan, et al.
Published: (2023)
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
by: Zou, Ding, et al.
Published: (2025)
by: Zou, Ding, et al.
Published: (2025)
PsyGUARD: An Automated System for Suicide Detection and Risk Assessment in Psychological Counseling
by: Qiu, Huachuan, et al.
Published: (2024)
by: Qiu, Huachuan, et al.
Published: (2024)
SocialEval: Evaluating Social Intelligence of Large Language Models
by: Zhou, Jinfeng, et al.
Published: (2025)
by: Zhou, Jinfeng, et al.
Published: (2025)
SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents
by: Tian, Wanxin, et al.
Published: (2025)
by: Tian, Wanxin, et al.
Published: (2025)
LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation
by: Hwangbo, Gyeom, et al.
Published: (2025)
by: Hwangbo, Gyeom, et al.
Published: (2025)
Similar Items
-
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
by: Shan, Haozhe, et al.
Published: (2026) -
Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization
by: Zhang, Yi, et al.
Published: (2025) -
Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence
by: Zhang, Yi, et al.
Published: (2025) -
Robo-Cortex: A Self-Evolving Embodied Agent via Dual-Grain Cognitive Memory and Autonomous Knowledge Induction
by: Chan, Nga Teng, et al.
Published: (2026) -
VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing
by: Shi, Haoyuan, et al.
Published: (2026)