Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Ning, Yan, Zihan, Li, Weiyang, Ma, Chuan, Chen, He, Xiang, Tao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents
by: Chen, Ruolin, et al.
Published: (2025)
by: Chen, Ruolin, et al.
Published: (2025)
BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs
by: Guo, Mingning, et al.
Published: (2025)
by: Guo, Mingning, et al.
Published: (2025)
A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents
by: Huang, Yuting, et al.
Published: (2025)
by: Huang, Yuting, et al.
Published: (2025)
EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots
by: Lei, Zixing, et al.
Published: (2026)
by: Lei, Zixing, et al.
Published: (2026)
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
by: Gao, Chen, et al.
Published: (2024)
by: Gao, Chen, et al.
Published: (2024)
EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems
by: Qin, Xue, et al.
Published: (2026)
by: Qin, Xue, et al.
Published: (2026)
Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making
by: Li, Manling, et al.
Published: (2024)
by: Li, Manling, et al.
Published: (2024)
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
by: Yin, Sheng, et al.
Published: (2024)
by: Yin, Sheng, et al.
Published: (2024)
ERA: Transforming VLMs into Embodied Agents via Embodied Prior Learning and Online Reinforcement Learning
by: Chen, Hanyang, et al.
Published: (2025)
by: Chen, Hanyang, et al.
Published: (2025)
PULSE: Privileged Knowledge Transfer from Rich to Deployable Sensors for Embodied Multi-Sensory Learning
by: Zhao, Zihan, et al.
Published: (2025)
by: Zhao, Zihan, et al.
Published: (2025)
AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents
by: Luo, Hanjun, et al.
Published: (2025)
by: Luo, Hanjun, et al.
Published: (2025)
WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks
by: Evtimov, Ivan, et al.
Published: (2025)
by: Evtimov, Ivan, et al.
Published: (2025)
SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents
by: Zhan, Simon Sinong, et al.
Published: (2025)
by: Zhan, Simon Sinong, et al.
Published: (2025)
CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space
by: Zhao, Yong, et al.
Published: (2025)
by: Zhao, Yong, et al.
Published: (2025)
EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents
by: Ju, Ruofei, et al.
Published: (2026)
by: Ju, Ruofei, et al.
Published: (2026)
Safety of Embodied Navigation: A Survey
by: Wang, Zixia, et al.
Published: (2025)
by: Wang, Zixia, et al.
Published: (2025)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
by: Yuan, Tongxin, et al.
Published: (2024)
by: Yuan, Tongxin, et al.
Published: (2024)
Safety Control of Service Robots with LLMs and Embodied Knowledge Graphs
by: Qi, Yong, et al.
Published: (2024)
by: Qi, Yong, et al.
Published: (2024)
EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents
by: Juneja, Gurusha, et al.
Published: (2026)
by: Juneja, Gurusha, et al.
Published: (2026)
TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety
by: Hong, Zhepei, et al.
Published: (2026)
by: Hong, Zhepei, et al.
Published: (2026)
See and Think: Embodied Agent in Virtual Environment
by: Zhao, Zhonghan, et al.
Published: (2023)
by: Zhao, Zhonghan, et al.
Published: (2023)
LoTa-Bench: Benchmarking Language-oriented Task Planners for Embodied Agents
by: Choi, Jae-Woo, et al.
Published: (2024)
by: Choi, Jae-Woo, et al.
Published: (2024)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
by: Yang, Rui, et al.
Published: (2025)
by: Yang, Rui, et al.
Published: (2025)
RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic
by: Wang, Le, et al.
Published: (2025)
by: Wang, Le, et al.
Published: (2025)
Multi-agent Embodied AI: Advances and Future Directions
by: Feng, Zhaohan, et al.
Published: (2025)
by: Feng, Zhaohan, et al.
Published: (2025)
Security of AI Agents
by: He, Yifeng, et al.
Published: (2024)
by: He, Yifeng, et al.
Published: (2024)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
by: Guo, Weiyang, et al.
Published: (2025)
by: Guo, Weiyang, et al.
Published: (2025)
FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction
by: Zeng, Zhiyuan, et al.
Published: (2025)
by: Zeng, Zhiyuan, et al.
Published: (2025)
SmartAgent: Chain-of-User-Thought for Embodied Personalized Agent in Cyber World
by: Zhang, Jiaqi, et al.
Published: (2024)
by: Zhang, Jiaqi, et al.
Published: (2024)
SkillTester: Benchmarking Utility and Security of Agent Skills
by: Wang, Leye, et al.
Published: (2026)
by: Wang, Leye, et al.
Published: (2026)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
by: Wang, Siyin, et al.
Published: (2024)
by: Wang, Siyin, et al.
Published: (2024)
Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
by: Li, Xiao, et al.
Published: (2026)
by: Li, Xiao, et al.
Published: (2026)
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents
by: Li, Miles Q., et al.
Published: (2026)
by: Li, Miles Q., et al.
Published: (2026)
Embodied CoT Distillation From LLM To Off-the-shelf Agents
by: Choi, Wonje, et al.
Published: (2024)
by: Choi, Wonje, et al.
Published: (2024)
SAGE: A Service Agent Graph-guided Evaluation Benchmark
by: Shi, Ling, et al.
Published: (2026)
by: Shi, Ling, et al.
Published: (2026)
Safety2Drive: Safety-Critical Scenario Benchmark for the Evaluation of Autonomous Driving
by: Li, Jingzheng, et al.
Published: (2025)
by: Li, Jingzheng, et al.
Published: (2025)
FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments
by: Yang, Zhi, et al.
Published: (2026)
by: Yang, Zhi, et al.
Published: (2026)
The Safety Challenge of World Models for Embodied AI Agents: A Review
by: Baraldi, Lorenzo, et al.
Published: (2025)
by: Baraldi, Lorenzo, et al.
Published: (2025)
Embodied AI Agents: Modeling the World
by: Fung, Pascale, et al.
Published: (2025)
by: Fung, Pascale, et al.
Published: (2025)
Human-centered In-building Embodied Delivery Benchmark
by: Xu, Zhuoqun, et al.
Published: (2024)
by: Xu, Zhuoqun, et al.
Published: (2024)
Similar Items
-
SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents
by: Chen, Ruolin, et al.
Published: (2025) -
BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs
by: Guo, Mingning, et al.
Published: (2025) -
A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents
by: Huang, Yuting, et al.
Published: (2025) -
EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots
by: Lei, Zixing, et al.
Published: (2026) -
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
by: Gao, Chen, et al.
Published: (2024)