JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Fan, Feng, Yue, Xu, Zhao, Su, Lixin, Ma, Xinyu, Yin, Dawei, Liu, Hao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning
von: Ni, Hang, et al.
Veröffentlicht: (2025)
von: Ni, Hang, et al.
Veröffentlicht: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
von: Xu, Zhao, et al.
Veröffentlicht: (2024)
von: Xu, Zhao, et al.
Veröffentlicht: (2024)
CoRanking: Collaborative Ranking with Small and Large Ranking Agents
von: Liu, Wenhan, et al.
Veröffentlicht: (2025)
von: Liu, Wenhan, et al.
Veröffentlicht: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
von: Liu, Fan, et al.
Veröffentlicht: (2024)
von: Liu, Fan, et al.
Veröffentlicht: (2024)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
von: Song, Jialin, et al.
Veröffentlicht: (2026)
von: Song, Jialin, et al.
Veröffentlicht: (2026)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
von: Wang, Fengxiang, et al.
Veröffentlicht: (2024)
von: Wang, Fengxiang, et al.
Veröffentlicht: (2024)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
von: Wei, Zhipeng, et al.
Veröffentlicht: (2024)
von: Wei, Zhipeng, et al.
Veröffentlicht: (2024)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
von: Tang, Hua, et al.
Veröffentlicht: (2025)
von: Tang, Hua, et al.
Veröffentlicht: (2025)
Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards
von: Wei, Xiaolong, et al.
Veröffentlicht: (2025)
von: Wei, Xiaolong, et al.
Veröffentlicht: (2025)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
von: Shi, Zhichao, et al.
Veröffentlicht: (2025)
von: Shi, Zhichao, et al.
Veröffentlicht: (2025)
Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation
von: Chen, Junjie, et al.
Veröffentlicht: (2026)
von: Chen, Junjie, et al.
Veröffentlicht: (2026)
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
von: Zhang, Chiyu, et al.
Veröffentlicht: (2026)
von: Zhang, Chiyu, et al.
Veröffentlicht: (2026)
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
GenCRF: Generative Clustering and Reformulation Framework for Enhanced Intent-Driven Information Retrieval
von: Seo, Wonduk, et al.
Veröffentlicht: (2024)
von: Seo, Wonduk, et al.
Veröffentlicht: (2024)
LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods
von: Li, Haitao, et al.
Veröffentlicht: (2024)
von: Li, Haitao, et al.
Veröffentlicht: (2024)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
von: Yuan, Tongxin, et al.
Veröffentlicht: (2024)
von: Yuan, Tongxin, et al.
Veröffentlicht: (2024)
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
von: Zhou, Yilun, et al.
Veröffentlicht: (2025)
von: Zhou, Yilun, et al.
Veröffentlicht: (2025)
Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
von: Chen, Jiaju, et al.
Veröffentlicht: (2025)
von: Chen, Jiaju, et al.
Veröffentlicht: (2025)
RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator
von: Tang, Zhenwei, et al.
Veröffentlicht: (2026)
von: Tang, Zhenwei, et al.
Veröffentlicht: (2026)
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation
von: Zhang, Enze, et al.
Veröffentlicht: (2025)
von: Zhang, Enze, et al.
Veröffentlicht: (2025)
The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
von: Liu, Yilun, et al.
Veröffentlicht: (2026)
von: Liu, Yilun, et al.
Veröffentlicht: (2026)
IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages
von: Pattnayak, Priyaranjan, et al.
Veröffentlicht: (2026)
von: Pattnayak, Priyaranjan, et al.
Veröffentlicht: (2026)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
RAG-Enhanced Large Language Models for Dynamic Content Expiration Prediction in Web Search
von: Chen, Tingyu, et al.
Veröffentlicht: (2026)
von: Chen, Tingyu, et al.
Veröffentlicht: (2026)
VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents
von: Wu, Weihao, et al.
Veröffentlicht: (2025)
von: Wu, Weihao, et al.
Veröffentlicht: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
von: Chen, Zhitong, et al.
Veröffentlicht: (2026)
von: Chen, Zhitong, et al.
Veröffentlicht: (2026)
Agent-as-a-Judge
von: You, Runyang, et al.
Veröffentlicht: (2026)
von: You, Runyang, et al.
Veröffentlicht: (2026)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
von: Bi, Zhenyu, et al.
Veröffentlicht: (2025)
von: Bi, Zhenyu, et al.
Veröffentlicht: (2025)
Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
von: Chen, Yiqun, et al.
Veröffentlicht: (2025)
von: Chen, Yiqun, et al.
Veröffentlicht: (2025)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
FinResearchBench: A Logic Tree based Agent-as-a-Judge Evaluation Framework for Financial Research Agents
von: Sun, Rui, et al.
Veröffentlicht: (2025)
von: Sun, Rui, et al.
Veröffentlicht: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
von: Chu, Junjie, et al.
Veröffentlicht: (2024)
von: Chu, Junjie, et al.
Veröffentlicht: (2024)
Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2025)
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
von: Liu, Runzhou, et al.
Veröffentlicht: (2026)
von: Liu, Runzhou, et al.
Veröffentlicht: (2026)
Judge Like Human Examiners: A Weighted Importance Multi-Point Evaluation Framework for Generative Tasks with Long-form Answers
von: Yu, Guoxin, et al.
Veröffentlicht: (2026)
von: Yu, Guoxin, et al.
Veröffentlicht: (2026)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
von: Wang, Xuehui, et al.
Veröffentlicht: (2025)
von: Wang, Xuehui, et al.
Veröffentlicht: (2025)
The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability
von: Gong, Linlu, et al.
Veröffentlicht: (2025)
von: Gong, Linlu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning
von: Ni, Hang, et al.
Veröffentlicht: (2025) -
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
von: Xu, Zhao, et al.
Veröffentlicht: (2024) -
CoRanking: Collaborative Ranking with Small and Large Ranking Agents
von: Liu, Wenhan, et al.
Veröffentlicht: (2025) -
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
von: Liu, Fan, et al.
Veröffentlicht: (2024) -
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
von: Song, Jialin, et al.
Veröffentlicht: (2026)