SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Xiangyang, Tian, Yuan, Li, Chunyi, Zhang, Kaiwei, Sun, Wei, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs
par: Zhu, Xiangyang, et autres
Publié: (2026)
par: Zhu, Xiangyang, et autres
Publié: (2026)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
par: Zhang, Kaiwei, et autres
Publié: (2025)
par: Zhang, Kaiwei, et autres
Publié: (2025)
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
par: Jia, Qi, et autres
Publié: (2025)
par: Jia, Qi, et autres
Publié: (2025)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
par: Yuan, Tongxin, et autres
Publié: (2024)
par: Yuan, Tongxin, et autres
Publié: (2024)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
par: Ji, Kaiyuan, et autres
Publié: (2025)
par: Ji, Kaiyuan, et autres
Publié: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
Information Density Principle for MLLM Benchmarks
par: Li, Chunyi, et autres
Publié: (2025)
par: Li, Chunyi, et autres
Publié: (2025)
Evil Geniuses: Delving into the Safety of LLM-based Agents
par: Tian, Yu, et autres
Publié: (2023)
par: Tian, Yu, et autres
Publié: (2023)
Affordance Benchmark for MLLMs
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
Redundancy Principles for MLLMs Benchmarks
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
par: Xiao, Ruixuan, et autres
Publié: (2024)
par: Xiao, Ruixuan, et autres
Publié: (2024)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
par: Sun, Chenkai, et autres
Publié: (2025)
par: Sun, Chenkai, et autres
Publié: (2025)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
par: Zhao, Haochen, et autres
Publié: (2024)
par: Zhao, Haochen, et autres
Publié: (2024)
Human-Centric Evaluation for Foundation Models
par: Guo, Yijin, et autres
Publié: (2025)
par: Guo, Yijin, et autres
Publié: (2025)
AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
par: Liu, Xuannan, et autres
Publié: (2026)
par: Liu, Xuannan, et autres
Publié: (2026)
User-centric Subjective Leaderboard by Customizable Reward Modeling
par: Jia, Qi, et autres
Publié: (2025)
par: Jia, Qi, et autres
Publié: (2025)
Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages
par: Hu, Yujia, et autres
Publié: (2025)
par: Hu, Yujia, et autres
Publié: (2025)
ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations
par: Gomaa, Amr, et autres
Publié: (2025)
par: Gomaa, Amr, et autres
Publié: (2025)
StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction Following
par: Li, Jinnan, et autres
Publié: (2025)
par: Li, Jinnan, et autres
Publié: (2025)
FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents
par: Jia, Haoxuan, et autres
Publié: (2026)
par: Jia, Haoxuan, et autres
Publié: (2026)
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
par: Hui, Zheng, et autres
Publié: (2025)
par: Hui, Zheng, et autres
Publié: (2025)
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
par: Zhou, Yujun, et autres
Publié: (2024)
par: Zhou, Yujun, et autres
Publié: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
par: Tan, Yingshui, et autres
Publié: (2024)
par: Tan, Yingshui, et autres
Publié: (2024)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
par: Song, Jialin, et autres
Publié: (2026)
par: Song, Jialin, et autres
Publié: (2026)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
par: Liu, Xuannan, et autres
Publié: (2025)
par: Liu, Xuannan, et autres
Publié: (2025)
The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions
par: Pan, Wenbo, et autres
Publié: (2025)
par: Pan, Wenbo, et autres
Publié: (2025)
FlowCompile: An Optimizing Compiler for Structured LLM Workflows
par: Li, Junyan, et autres
Publié: (2026)
par: Li, Junyan, et autres
Publié: (2026)
AutoFlow: Automated Workflow Generation for Large Language Model Agents
par: Li, Zelong, et autres
Publié: (2024)
par: Li, Zelong, et autres
Publié: (2024)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
par: Choi, Dasol, et autres
Publié: (2026)
par: Choi, Dasol, et autres
Publié: (2026)
Auditing Agent Harness Safety
par: Liu, Chengzhi, et autres
Publié: (2026)
par: Liu, Chengzhi, et autres
Publié: (2026)
Locking Down the Finetuned LLMs Safety
par: Zhu, Minjun, et autres
Publié: (2024)
par: Zhu, Minjun, et autres
Publié: (2024)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
par: Hou, Yutao, et autres
Publié: (2026)
par: Hou, Yutao, et autres
Publié: (2026)
SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems
par: Hazra, Rima, et autres
Publié: (2026)
par: Hazra, Rima, et autres
Publié: (2026)
Automated Adversarial Discovery for Safety Classifiers
par: Lal, Yash Kumar, et autres
Publié: (2024)
par: Lal, Yash Kumar, et autres
Publié: (2024)
Towards Exception Safety Code Generation with Intermediate Representation Agents Framework
par: Zhang, Xuanming, et autres
Publié: (2024)
par: Zhang, Xuanming, et autres
Publié: (2024)
SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents
par: Zhan, Qiusi, et autres
Publié: (2025)
par: Zhan, Qiusi, et autres
Publié: (2025)
How Sensitive Are Safety Benchmarks to Judge Configuration Choices?
par: Zhang, Xinran
Publié: (2026)
par: Zhang, Xinran
Publié: (2026)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
par: Mou, Yutao, et autres
Publié: (2025)
par: Mou, Yutao, et autres
Publié: (2025)
Root Defence Strategies: Ensuring Safety of LLM at the Decoding Level
par: Zeng, Xinyi, et autres
Publié: (2024)
par: Zeng, Xinyi, et autres
Publié: (2024)
Using GUI Agent for Electronic Design Automation
par: Li, Chunyi, et autres
Publié: (2025)
par: Li, Chunyi, et autres
Publié: (2025)
Documents similaires
-
Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs
par: Zhu, Xiangyang, et autres
Publié: (2026) -
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
par: Zhang, Kaiwei, et autres
Publié: (2025) -
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
par: Jia, Qi, et autres
Publié: (2025) -
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
par: Yuan, Tongxin, et autres
Publié: (2024) -
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
par: Ji, Kaiyuan, et autres
Publié: (2025)