SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cao, Hongye, Jing, Sijia, Wang, Yanming, Peng, Ziyue, Bai, Zhixin, Cao, Zhe, Fang, Meng, Feng, Fan, Wang, Boyan, Liu, Jiaheng, Yang, Tianpei, Huo, Jing, Gao, Yang, Meng, Fanyu, Yang, Xi, Deng, Chao, Feng, Junlan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
von: Gan, Siyuan, et al.
Veröffentlicht: (2026)
von: Gan, Siyuan, et al.
Veröffentlicht: (2026)
Causal Information Prioritization for Efficient Reinforcement Learning
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Towards Empowerment Gain through Causal Structure Learning in Model-Based RL
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning
von: Hong, Jialiang, et al.
Veröffentlicht: (2025)
von: Hong, Jialiang, et al.
Veröffentlicht: (2025)
The 2nd FutureDial Challenge: Dialog Systems with Retrieval Augmented Generation (FutureDial-RAG)
von: Cai, Yucheng, et al.
Veröffentlicht: (2024)
von: Cai, Yucheng, et al.
Veröffentlicht: (2024)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
von: Luo, Sichun, et al.
Veröffentlicht: (2025)
von: Luo, Sichun, et al.
Veröffentlicht: (2025)
ProKG-Dial: Progressive Multi-Turn Dialogue Construction with Domain Knowledge Graphs
von: Liang, Yuanyuan, et al.
Veröffentlicht: (2025)
von: Liang, Yuanyuan, et al.
Veröffentlicht: (2025)
Many-Turn Jailbreaking
von: Yang, Xianjun, et al.
Veröffentlicht: (2025)
von: Yang, Xianjun, et al.
Veröffentlicht: (2025)
EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues
von: Soni, Sagar, et al.
Veröffentlicht: (2024)
von: Soni, Sagar, et al.
Veröffentlicht: (2024)
Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
von: Wang, Jiaming, et al.
Veröffentlicht: (2026)
von: Wang, Jiaming, et al.
Veröffentlicht: (2026)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
von: Yang, Yiqi, et al.
Veröffentlicht: (2024)
von: Yang, Yiqi, et al.
Veröffentlicht: (2024)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
von: Yu, Erxin, et al.
Veröffentlicht: (2024)
von: Yu, Erxin, et al.
Veröffentlicht: (2024)
JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs
von: Feng, Junlan, et al.
Veröffentlicht: (2025)
von: Feng, Junlan, et al.
Veröffentlicht: (2025)
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
von: Cheng, Hao, et al.
Veröffentlicht: (2025)
von: Cheng, Hao, et al.
Veröffentlicht: (2025)
Multi-Agent Reinforcement Learning with Communication-Constrained Priors
von: Yang, Guang, et al.
Veröffentlicht: (2025)
von: Yang, Guang, et al.
Veröffentlicht: (2025)
MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
von: Zhang, Xinkai, et al.
Veröffentlicht: (2026)
von: Zhang, Xinkai, et al.
Veröffentlicht: (2026)
Modeling of Moving Sound Sources Based on Array Measurements
von: Meng, Fanyu
Veröffentlicht: (2022)
von: Meng, Fanyu
Veröffentlicht: (2022)
Resource Consumption Red-Teaming for Large Vision-Language Models
von: Gao, Haoran, et al.
Veröffentlicht: (2025)
von: Gao, Haoran, et al.
Veröffentlicht: (2025)
DialBGM: A Benchmark for Background Music Recommendation from Everyday Multi-Turn Dialogues
von: Shin, Joonhyeok, et al.
Veröffentlicht: (2026)
von: Shin, Joonhyeok, et al.
Veröffentlicht: (2026)
HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
von: Luo, Wen, et al.
Veröffentlicht: (2024)
von: Luo, Wen, et al.
Veröffentlicht: (2024)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
von: Jia, Xiaojun, et al.
Veröffentlicht: (2025)
von: Jia, Xiaojun, et al.
Veröffentlicht: (2025)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
von: Wan, Yanming, et al.
Veröffentlicht: (2025)
von: Wan, Yanming, et al.
Veröffentlicht: (2025)
EVA: Editing for Versatile Alignment against Jailbreaks
von: Wang, Yi, et al.
Veröffentlicht: (2026)
von: Wang, Yi, et al.
Veröffentlicht: (2026)
Strategy-Aware Optimization Modeling with Reasoning LLMs
von: Zhao, Ruiqing, et al.
Veröffentlicht: (2026)
von: Zhao, Ruiqing, et al.
Veröffentlicht: (2026)
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
von: Jiang, Yue, et al.
Veröffentlicht: (2026)
von: Jiang, Yue, et al.
Veröffentlicht: (2026)
CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases
von: Xue, Xiaona, et al.
Veröffentlicht: (2026)
von: Xue, Xiaona, et al.
Veröffentlicht: (2026)
Faster Game Solving via Asymmetry of Step Sizes
von: Meng, Linjian, et al.
Veröffentlicht: (2025)
von: Meng, Linjian, et al.
Veröffentlicht: (2025)
Active Honeypot Guardrail System: Probing and Confirming Multi-Turn LLM Jailbreaks
von: Wu, ChenYu, et al.
Veröffentlicht: (2025)
von: Wu, ChenYu, et al.
Veröffentlicht: (2025)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models
von: Li, Fengzhi, et al.
Veröffentlicht: (2026)
von: Li, Fengzhi, et al.
Veröffentlicht: (2026)
Reconstructing Helmholtz Plane Enables Robust F‐Rich Interface for Long‐Life and High‐Safe Sodium‐Ion Batteries
von: Long Chen, et al.
Veröffentlicht: (2024)
von: Long Chen, et al.
Veröffentlicht: (2024)
Reconstructing Helmholtz Plane Enables Robust F‐Rich Interface for Long‐Life and High‐Safe Sodium‐Ion Batteries
von: Long Chen, et al.
Veröffentlicht: (2024)
von: Long Chen, et al.
Veröffentlicht: (2024)
Efficacy and Safety of Low‐Dose Isotretinoin, Spironolactone, and Diammonium Glycyrrhizinate for Acne in Women With Hyperandrogenism: A Randomized Controlled Trial
von: Xinyi Jing, et al.
Veröffentlicht: (2026)
von: Xinyi Jing, et al.
Veröffentlicht: (2026)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
von: Bai, Ge, et al.
Veröffentlicht: (2024)
von: Bai, Ge, et al.
Veröffentlicht: (2024)
Perceived Control and Future Orientation: How Construal Level and Cultural Tightness Shape the Relationship
von: Xueting Yang, et al.
Veröffentlicht: (2025)
von: Xueting Yang, et al.
Veröffentlicht: (2025)
Mitigating Conversational Inertia in Multi-Turn Agents
von: Wan, Yang, et al.
Veröffentlicht: (2026)
von: Wan, Yang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
von: Cao, Hongye, et al.
Veröffentlicht: (2025) -
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
von: Gan, Siyuan, et al.
Veröffentlicht: (2026) -
Causal Information Prioritization for Efficient Reinforcement Learning
von: Cao, Hongye, et al.
Veröffentlicht: (2025) -
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
von: Cao, Hongye, et al.
Veröffentlicht: (2025) -
Towards Empowerment Gain through Causal Structure Learning in Model-Based RL
von: Cao, Hongye, et al.
Veröffentlicht: (2025)