Agent-SafetyBench: Evaluating the Safety of LLM Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhexin, Cui, Shiyao, Lu, Yida, Zhou, Jingzhuo, Yang, Junxiao, Wang, Hongning, Huang, Minlie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
di: Liu, Xuannan, et al.
Pubblicazione: (2025)
di: Liu, Xuannan, et al.
Pubblicazione: (2025)
How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Seeker: Towards Exception Safety Code Generation with Intermediate Language Agents Framework
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
di: Pan, Leyi, et al.
Pubblicazione: (2025)
di: Pan, Leyi, et al.
Pubblicazione: (2025)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
di: Choi, Dasol, et al.
Pubblicazione: (2026)
di: Choi, Dasol, et al.
Pubblicazione: (2026)
The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
LegalAgentBench: Evaluating LLM Agents in Legal Domain
di: Li, Haitao, et al.
Pubblicazione: (2024)
di: Li, Haitao, et al.
Pubblicazione: (2024)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
di: Shi, Enyi, et al.
Pubblicazione: (2026)
di: Shi, Enyi, et al.
Pubblicazione: (2026)
Towards Exception Safety Code Generation with Intermediate Representation Agents Framework
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
di: Hou, Yutao, et al.
Pubblicazione: (2026)
di: Hou, Yutao, et al.
Pubblicazione: (2026)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
di: Wen, Bosi, et al.
Pubblicazione: (2026)
di: Wen, Bosi, et al.
Pubblicazione: (2026)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2023)
di: Liu, Xin, et al.
Pubblicazione: (2023)
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control
di: Lee, Juyong, et al.
Pubblicazione: (2024)
di: Lee, Juyong, et al.
Pubblicazione: (2024)
AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback
di: Guan, Jian, et al.
Pubblicazione: (2024)
di: Guan, Jian, et al.
Pubblicazione: (2024)
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
di: Jin, Chang, et al.
Pubblicazione: (2026)
di: Jin, Chang, et al.
Pubblicazione: (2026)
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
di: Lu, Xiaoya, et al.
Pubblicazione: (2025)
di: Lu, Xiaoya, et al.
Pubblicazione: (2025)
AgentBench: Evaluating LLMs as Agents
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
HPSS: Heuristic Prompting Strategy Search for LLM Evaluators
di: Wen, Bosi, et al.
Pubblicazione: (2025)
di: Wen, Bosi, et al.
Pubblicazione: (2025)
Evil Geniuses: Delving into the Safety of LLM-based Agents
di: Tian, Yu, et al.
Pubblicazione: (2023)
di: Tian, Yu, et al.
Pubblicazione: (2023)
SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
di: Zhu, Xiangyang, et al.
Pubblicazione: (2025)
di: Zhu, Xiangyang, et al.
Pubblicazione: (2025)
Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure
di: Lu, Yida, et al.
Pubblicazione: (2026)
di: Lu, Yida, et al.
Pubblicazione: (2026)
Language Model Decoding as Direct Metrics Optimization
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents
di: Jia, Haoxuan, et al.
Pubblicazione: (2026)
di: Jia, Haoxuan, et al.
Pubblicazione: (2026)
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
di: Wen, Bosi, et al.
Pubblicazione: (2025)
di: Wen, Bosi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023) -
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025) -
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
di: Zhang, Zhexin, et al.
Pubblicazione: (2026) -
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024) -
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)