SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Xiangyang, Tian, Yuan, Li, Chunyi, Zhang, Kaiwei, Sun, Wei, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs
von: Zhu, Xiangyang, et al.
Veröffentlicht: (2026)
von: Zhu, Xiangyang, et al.
Veröffentlicht: (2026)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
von: Jia, Qi, et al.
Veröffentlicht: (2025)
von: Jia, Qi, et al.
Veröffentlicht: (2025)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
von: Yuan, Tongxin, et al.
Veröffentlicht: (2024)
von: Yuan, Tongxin, et al.
Veröffentlicht: (2024)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
von: Ji, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Ji, Kaiyuan, et al.
Veröffentlicht: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
Information Density Principle for MLLM Benchmarks
von: Li, Chunyi, et al.
Veröffentlicht: (2025)
von: Li, Chunyi, et al.
Veröffentlicht: (2025)
Evil Geniuses: Delving into the Safety of LLM-based Agents
von: Tian, Yu, et al.
Veröffentlicht: (2023)
von: Tian, Yu, et al.
Veröffentlicht: (2023)
Affordance Benchmark for MLLMs
von: Wang, Junying, et al.
Veröffentlicht: (2025)
von: Wang, Junying, et al.
Veröffentlicht: (2025)
Redundancy Principles for MLLMs Benchmarks
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
von: Xiao, Ruixuan, et al.
Veröffentlicht: (2024)
von: Xiao, Ruixuan, et al.
Veröffentlicht: (2024)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
von: Sun, Chenkai, et al.
Veröffentlicht: (2025)
von: Sun, Chenkai, et al.
Veröffentlicht: (2025)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
von: Zhao, Haochen, et al.
Veröffentlicht: (2024)
von: Zhao, Haochen, et al.
Veröffentlicht: (2024)
Human-Centric Evaluation for Foundation Models
von: Guo, Yijin, et al.
Veröffentlicht: (2025)
von: Guo, Yijin, et al.
Veröffentlicht: (2025)
AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
von: Liu, Xuannan, et al.
Veröffentlicht: (2026)
von: Liu, Xuannan, et al.
Veröffentlicht: (2026)
User-centric Subjective Leaderboard by Customizable Reward Modeling
von: Jia, Qi, et al.
Veröffentlicht: (2025)
von: Jia, Qi, et al.
Veröffentlicht: (2025)
Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages
von: Hu, Yujia, et al.
Veröffentlicht: (2025)
von: Hu, Yujia, et al.
Veröffentlicht: (2025)
ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations
von: Gomaa, Amr, et al.
Veröffentlicht: (2025)
von: Gomaa, Amr, et al.
Veröffentlicht: (2025)
StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction Following
von: Li, Jinnan, et al.
Veröffentlicht: (2025)
von: Li, Jinnan, et al.
Veröffentlicht: (2025)
FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents
von: Jia, Haoxuan, et al.
Veröffentlicht: (2026)
von: Jia, Haoxuan, et al.
Veröffentlicht: (2026)
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
von: Hui, Zheng, et al.
Veröffentlicht: (2025)
von: Hui, Zheng, et al.
Veröffentlicht: (2025)
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
von: Song, Jialin, et al.
Veröffentlicht: (2026)
von: Song, Jialin, et al.
Veröffentlicht: (2026)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
von: Liu, Xuannan, et al.
Veröffentlicht: (2025)
von: Liu, Xuannan, et al.
Veröffentlicht: (2025)
The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions
von: Pan, Wenbo, et al.
Veröffentlicht: (2025)
von: Pan, Wenbo, et al.
Veröffentlicht: (2025)
FlowCompile: An Optimizing Compiler for Structured LLM Workflows
von: Li, Junyan, et al.
Veröffentlicht: (2026)
von: Li, Junyan, et al.
Veröffentlicht: (2026)
AutoFlow: Automated Workflow Generation for Large Language Model Agents
von: Li, Zelong, et al.
Veröffentlicht: (2024)
von: Li, Zelong, et al.
Veröffentlicht: (2024)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
von: Choi, Dasol, et al.
Veröffentlicht: (2026)
von: Choi, Dasol, et al.
Veröffentlicht: (2026)
Auditing Agent Harness Safety
von: Liu, Chengzhi, et al.
Veröffentlicht: (2026)
von: Liu, Chengzhi, et al.
Veröffentlicht: (2026)
Locking Down the Finetuned LLMs Safety
von: Zhu, Minjun, et al.
Veröffentlicht: (2024)
von: Zhu, Minjun, et al.
Veröffentlicht: (2024)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
von: Hou, Yutao, et al.
Veröffentlicht: (2026)
von: Hou, Yutao, et al.
Veröffentlicht: (2026)
SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems
von: Hazra, Rima, et al.
Veröffentlicht: (2026)
von: Hazra, Rima, et al.
Veröffentlicht: (2026)
Automated Adversarial Discovery for Safety Classifiers
von: Lal, Yash Kumar, et al.
Veröffentlicht: (2024)
von: Lal, Yash Kumar, et al.
Veröffentlicht: (2024)
Towards Exception Safety Code Generation with Intermediate Representation Agents Framework
von: Zhang, Xuanming, et al.
Veröffentlicht: (2024)
von: Zhang, Xuanming, et al.
Veröffentlicht: (2024)
SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents
von: Zhan, Qiusi, et al.
Veröffentlicht: (2025)
von: Zhan, Qiusi, et al.
Veröffentlicht: (2025)
How Sensitive Are Safety Benchmarks to Judge Configuration Choices?
von: Zhang, Xinran
Veröffentlicht: (2026)
von: Zhang, Xinran
Veröffentlicht: (2026)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
von: Mou, Yutao, et al.
Veröffentlicht: (2025)
von: Mou, Yutao, et al.
Veröffentlicht: (2025)
Root Defence Strategies: Ensuring Safety of LLM at the Decoding Level
von: Zeng, Xinyi, et al.
Veröffentlicht: (2024)
von: Zeng, Xinyi, et al.
Veröffentlicht: (2024)
Using GUI Agent for Electronic Design Automation
von: Li, Chunyi, et al.
Veröffentlicht: (2025)
von: Li, Chunyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs
von: Zhu, Xiangyang, et al.
Veröffentlicht: (2026) -
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025) -
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
von: Jia, Qi, et al.
Veröffentlicht: (2025) -
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
von: Yuan, Tongxin, et al.
Veröffentlicht: (2024) -
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
von: Ji, Kaiyuan, et al.
Veröffentlicht: (2025)