SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Yin, Sheng, Pang, Xianghe, Ding, Yuanzhuo, Chen, Menglan, Bi, Yutong, Xiong, Yichen, Huang, Wenhao, Xiang, Zhen, Shao, Jing, Chen, Siheng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Malicious Agent Detection for Robust Multi-Agent Collaborative Perception
by: Zhao, Yangheng, et al.
Published: (2023)
by: Zhao, Yangheng, et al.
Published: (2023)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
by: Lei, Zixing, et al.
Published: (2026)
by: Lei, Zixing, et al.
Published: (2026)
InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
by: Du, Yaxin, et al.
Published: (2025)
by: Du, Yaxin, et al.
Published: (2025)
EmboMatrix: A Scalable Training-Ground for Embodied Decision-Making
by: Lei, Zixing, et al.
Published: (2025)
by: Lei, Zixing, et al.
Published: (2025)
EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots
by: Lei, Zixing, et al.
Published: (2026)
by: Lei, Zixing, et al.
Published: (2026)
VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization
by: Chen, Menglan, et al.
Published: (2025)
by: Chen, Menglan, et al.
Published: (2025)
SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents
by: Chen, Ruolin, et al.
Published: (2025)
by: Chen, Ruolin, et al.
Published: (2025)
X-MAS: Towards Building Multi-Agent Systems with Heterogeneous LLMs
by: Ye, Rui, et al.
Published: (2025)
by: Ye, Rui, et al.
Published: (2025)
EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
by: Choi, Dongwook, et al.
Published: (2026)
by: Choi, Dongwook, et al.
Published: (2026)
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
by: Lu, Xiaoya, et al.
Published: (2025)
by: Lu, Xiaoya, et al.
Published: (2025)
BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent Pair
by: Pang, Xianghe, et al.
Published: (2025)
by: Pang, Xianghe, et al.
Published: (2025)
HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents
by: Tomilin, Tristan, et al.
Published: (2025)
by: Tomilin, Tristan, et al.
Published: (2025)
Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review
by: Ye, Rui, et al.
Published: (2024)
by: Ye, Rui, et al.
Published: (2024)
Pragmatic Communication in Multi-Agent Collaborative Perception
by: Hu, Yue, et al.
Published: (2024)
by: Hu, Yue, et al.
Published: (2024)
SELP: Generating Safe and Efficient Task Plans for Robot Agents with Large Language Models
by: Wu, Yi, et al.
Published: (2024)
by: Wu, Yi, et al.
Published: (2024)
MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
by: Wang, Wenhao, et al.
Published: (2026)
by: Wang, Wenhao, et al.
Published: (2026)
RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic
by: Wang, Le, et al.
Published: (2025)
by: Wang, Le, et al.
Published: (2025)
LoTa-Bench: Benchmarking Language-oriented Task Planners for Embodied Agents
by: Choi, Jae-Woo, et al.
Published: (2024)
by: Choi, Jae-Woo, et al.
Published: (2024)
A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents
by: Huang, Yuting, et al.
Published: (2025)
by: Huang, Yuting, et al.
Published: (2025)
HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios
by: Pu, Jiayue, et al.
Published: (2026)
by: Pu, Jiayue, et al.
Published: (2026)
MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
by: Wang, Wenhao, et al.
Published: (2025)
by: Wang, Wenhao, et al.
Published: (2025)
REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?
by: Jiang, Chenxi, et al.
Published: (2025)
by: Jiang, Chenxi, et al.
Published: (2025)
LACUNA: Safe Agents as Recursive Program Holes
by: Zhao, Yaoyu, et al.
Published: (2026)
by: Zhao, Yaoyu, et al.
Published: (2026)
Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation
by: Shi, Haojun, et al.
Published: (2026)
by: Shi, Haojun, et al.
Published: (2026)
FedMABench: Benchmarking Mobile Agents on Decentralized Heterogeneous User Data
by: Wang, Wenhao, et al.
Published: (2025)
by: Wang, Wenhao, et al.
Published: (2025)
ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models
by: Zhang, Lingfeng, et al.
Published: (2024)
by: Zhang, Lingfeng, et al.
Published: (2024)
Synthesizing Post-Training Data for LLMs through Multi-Agent Simulation
by: Tang, Shuo, et al.
Published: (2024)
by: Tang, Shuo, et al.
Published: (2024)
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
by: Zhao, Songwen, et al.
Published: (2025)
by: Zhao, Songwen, et al.
Published: (2025)
Too Helpful to Be Safe: User-Mediated Attacks on Planning and Web-Use Agents
by: Chen, Fengchao, et al.
Published: (2026)
by: Chen, Fengchao, et al.
Published: (2026)
Safe POMDP Online Planning among Dynamic Agents via Adaptive Conformal Prediction
by: Sheng, Shili, et al.
Published: (2024)
by: Sheng, Shili, et al.
Published: (2024)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
by: Yang, Rui, et al.
Published: (2025)
by: Yang, Rui, et al.
Published: (2025)
SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code
by: Li, Xinghang, et al.
Published: (2025)
by: Li, Xinghang, et al.
Published: (2025)
HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection
by: Gao, Siyuan, et al.
Published: (2025)
by: Gao, Siyuan, et al.
Published: (2025)
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
by: Pang, Xianghe, et al.
Published: (2024)
by: Pang, Xianghe, et al.
Published: (2024)
EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems
by: Qin, Xue, et al.
Published: (2026)
by: Qin, Xue, et al.
Published: (2026)
SPARC: Prediction-Based Safe Control for Coupled Controllable and Uncontrollable Agents with Conformal Predictions
by: Wang, Shuqi, et al.
Published: (2024)
by: Wang, Shuqi, et al.
Published: (2024)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
by: Long, Xiang, et al.
Published: (2026)
by: Long, Xiang, et al.
Published: (2026)
SafeCheck: Detecting smart contract vulnerabilities based on static program analysis methods
by: Haiyue Chen, et al.
Published: (2024)
by: Haiyue Chen, et al.
Published: (2024)
Retrieval-Augmented Embodied Agents
by: Zhu, Yichen, et al.
Published: (2024)
by: Zhu, Yichen, et al.
Published: (2024)
SafePred: A Predictive Guardrail for Computer-Using Agents via World Models
by: Chen, Yurun, et al.
Published: (2026)
by: Chen, Yurun, et al.
Published: (2026)
Similar Items
-
Malicious Agent Detection for Robust Multi-Agent Collaborative Perception
by: Zhao, Yangheng, et al.
Published: (2023) -
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
by: Lei, Zixing, et al.
Published: (2026) -
InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
by: Du, Yaxin, et al.
Published: (2025) -
EmboMatrix: A Scalable Training-Ground for Embodied Decision-Making
by: Lei, Zixing, et al.
Published: (2025) -
EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots
by: Lei, Zixing, et al.
Published: (2026)