A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Yuting, Ding, Leilei, Tang, Zhipeng, Wang, Tianfu, Lin, Xinrui, Zhang, Wuyang, Ma, Mingxiao, Zhang, Yanyong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VLMPlanner: Integrating Visual Language Models with Motion Planning
by: Tang, Zhipeng, et al.
Published: (2025)
by: Tang, Zhipeng, et al.
Published: (2025)
Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models
by: Huang, Yuting, et al.
Published: (2026)
by: Huang, Yuting, et al.
Published: (2026)
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
by: Yin, Sheng, et al.
Published: (2024)
by: Yin, Sheng, et al.
Published: (2024)
CLMASP: Coupling Large Language Models with Answer Set Programming for Robotic Task Planning
by: Lin, Xinrui, et al.
Published: (2024)
by: Lin, Xinrui, et al.
Published: (2024)
Plan Verification for LLM-Based Embodied Task Completion Agents
by: Hariharan, Ananth, et al.
Published: (2025)
by: Hariharan, Ananth, et al.
Published: (2025)
SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents
by: Chen, Ruolin, et al.
Published: (2025)
by: Chen, Ruolin, et al.
Published: (2025)
LLM-Driven Self-Refinement for Embodied Drone Task Planning
by: Zhang, Deyu, et al.
Published: (2025)
by: Zhang, Deyu, et al.
Published: (2025)
DGR: A General Graph Desmoothing Framework for Recommendation via Global and Local Perspectives
by: Ding, Leilei, et al.
Published: (2024)
by: Ding, Leilei, et al.
Published: (2024)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
by: Lei, Zixing, et al.
Published: (2026)
by: Lei, Zixing, et al.
Published: (2026)
MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning
by: Zhang, Min, et al.
Published: (2024)
by: Zhang, Min, et al.
Published: (2024)
Your LLM Agent Can Leak Your Data: Data Exfiltration via Backdoored Tool Use
by: Zhang, Wuyang, et al.
Published: (2026)
by: Zhang, Wuyang, et al.
Published: (2026)
Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation
by: Wang, Ning, et al.
Published: (2025)
by: Wang, Ning, et al.
Published: (2025)
LLM-Empowered Embodied Agent for Memory-Augmented Task Planning in Household Robotics
by: Glocker, Marc, et al.
Published: (2025)
by: Glocker, Marc, et al.
Published: (2025)
BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning
by: Ma, Xiaoyu, et al.
Published: (2026)
by: Ma, Xiaoyu, et al.
Published: (2026)
DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference
by: Xia, Xiang, et al.
Published: (2026)
by: Xia, Xiang, et al.
Published: (2026)
ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models
by: Zhang, Lingfeng, et al.
Published: (2024)
by: Zhang, Lingfeng, et al.
Published: (2024)
Breaking Model Lock-in: Cost-Efficient Zero-Shot LLM Routing via a Universal Latent Space
by: Yan, Cheng, et al.
Published: (2026)
by: Yan, Cheng, et al.
Published: (2026)
PARTNR: A Benchmark for Planning and Reasoning in Embodied Multi-agent Tasks
by: Chang, Matthew, et al.
Published: (2024)
by: Chang, Matthew, et al.
Published: (2024)
EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents
by: Ju, Ruofei, et al.
Published: (2026)
by: Ju, Ruofei, et al.
Published: (2026)
EMAC+: Embodied Multimodal Agent for Collaborative Planning with VLM+LLM
by: Ao, Shuang, et al.
Published: (2025)
by: Ao, Shuang, et al.
Published: (2025)
TransLLM: A Unified Multi-Task Foundation Framework for Urban Transportation via Learnable Prompting
by: Leng, Jiaming, et al.
Published: (2025)
by: Leng, Jiaming, et al.
Published: (2025)
SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems
by: Shindo, Hikaru, et al.
Published: (2026)
by: Shindo, Hikaru, et al.
Published: (2026)
LoTa-Bench: Benchmarking Language-oriented Task Planners for Embodied Agents
by: Choi, Jae-Woo, et al.
Published: (2024)
by: Choi, Jae-Woo, et al.
Published: (2024)
3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning
by: Tang, Guoqin, et al.
Published: (2025)
by: Tang, Guoqin, et al.
Published: (2025)
Graphormer-Guided Task Planning: Beyond Static Rules with LLM Safety Perception
by: Huang, Wanjing, et al.
Published: (2025)
by: Huang, Wanjing, et al.
Published: (2025)
EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents
by: Zhu, Zihao, et al.
Published: (2024)
by: Zhu, Zihao, et al.
Published: (2024)
MADRA: Multi-Agent Debate for Risk-Aware Embodied Planning
by: Wang, Junjian, et al.
Published: (2025)
by: Wang, Junjian, et al.
Published: (2025)
TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents
by: Chen, Weiyi, et al.
Published: (2026)
by: Chen, Weiyi, et al.
Published: (2026)
EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems
by: Qin, Xue, et al.
Published: (2026)
by: Qin, Xue, et al.
Published: (2026)
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
by: Gao, Chen, et al.
Published: (2024)
by: Gao, Chen, et al.
Published: (2024)
STMA: A Spatio-Temporal Memory Agent for Long-Horizon Embodied Task Planning
by: Lei, Mingcong, et al.
Published: (2025)
by: Lei, Mingcong, et al.
Published: (2025)
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
by: Lu, Xiaoya, et al.
Published: (2025)
by: Lu, Xiaoya, et al.
Published: (2025)
Hierarchical LLM-Based Multi-Agent Framework with Prompt Optimization for Multi-Robot Task Planning
by: Kawabe, Tomoya, et al.
Published: (2026)
by: Kawabe, Tomoya, et al.
Published: (2026)
VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora
by: Xu, Yuting, et al.
Published: (2026)
by: Xu, Yuting, et al.
Published: (2026)
CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space
by: Zhao, Yong, et al.
Published: (2025)
by: Zhao, Yong, et al.
Published: (2025)
FlagVNE: A Flexible and Generalizable Reinforcement Learning Framework for Network Resource Allocation
by: Wang, Tianfu, et al.
Published: (2024)
by: Wang, Tianfu, et al.
Published: (2024)
Automatic Cognitive Task Generation for In-Situ Evaluation of Embodied Agents
by: He, Xinyi, et al.
Published: (2026)
by: He, Xinyi, et al.
Published: (2026)
Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making
by: Li, Manling, et al.
Published: (2024)
by: Li, Manling, et al.
Published: (2024)
AI Planning Framework for LLM-Based Web Agents
by: Shahnovsky, Orit, et al.
Published: (2026)
by: Shahnovsky, Orit, et al.
Published: (2026)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
by: Yuan, Tongxin, et al.
Published: (2024)
by: Yuan, Tongxin, et al.
Published: (2024)
Similar Items
-
VLMPlanner: Integrating Visual Language Models with Motion Planning
by: Tang, Zhipeng, et al.
Published: (2025) -
Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models
by: Huang, Yuting, et al.
Published: (2026) -
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
by: Yin, Sheng, et al.
Published: (2024) -
CLMASP: Coupling Large Language Models with Answer Set Programming for Robotic Task Planning
by: Lin, Xinrui, et al.
Published: (2024) -
Plan Verification for LLM-Based Embodied Task Completion Agents
by: Hariharan, Ananth, et al.
Published: (2025)