CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Erxin, Li, Jing, Liao, Ming, Wang, Siqi, Gao, Zuchen, Mi, Fei, Hong, Lanqing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
par: Yu, Erxin, et autres
Publié: (2025)
par: Yu, Erxin, et autres
Publié: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
par: Liu, Zheyuan, et autres
Publié: (2026)
par: Liu, Zheyuan, et autres
Publié: (2026)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
par: Zhou, Zhenhong, et autres
Publié: (2024)
par: Zhou, Zhenhong, et autres
Publié: (2024)
CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration
par: Gao, Jiahui, et autres
Publié: (2024)
par: Gao, Jiahui, et autres
Publié: (2024)
PopALM: Popularity-Aligned Language Models for Social Media Trendy Response Prediction
par: Yu, Erxin, et autres
Publié: (2024)
par: Yu, Erxin, et autres
Publié: (2024)
SafeTy Reasoning Elicitation Alignment for Multi-Turn Dialogues
par: Kuo, Martin, et autres
Publié: (2025)
par: Kuo, Martin, et autres
Publié: (2025)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
OASIS: Order-Augmented Strategy for Improved Code Search
par: Gao, Zuchen, et autres
Publié: (2025)
par: Gao, Zuchen, et autres
Publié: (2025)
UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models
par: Xue, Boyang, et autres
Publié: (2024)
par: Xue, Boyang, et autres
Publié: (2024)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
par: Yan, Siyu, et autres
Publié: (2025)
par: Yan, Siyu, et autres
Publié: (2025)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
par: Bai, Ge, et autres
Publié: (2024)
par: Bai, Ge, et autres
Publié: (2024)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
par: Tang, Yuqi, et autres
Publié: (2025)
par: Tang, Yuqi, et autres
Publié: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
par: Zhang, Yiran, et autres
Publié: (2025)
par: Zhang, Yiran, et autres
Publié: (2025)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
par: Gao, Fan, et autres
Publié: (2025)
par: Gao, Fan, et autres
Publié: (2025)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
par: Chen, Jiawei, et autres
Publié: (2025)
par: Chen, Jiawei, et autres
Publié: (2025)
Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions
par: Tan, Cheng, et autres
Publié: (2024)
par: Tan, Cheng, et autres
Publié: (2024)
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
par: Badola, Kartikeya, et autres
Publié: (2025)
par: Badola, Kartikeya, et autres
Publié: (2025)
The Validity of Coreference-based Evaluations of Natural Language Understanding
par: Porada, Ian
Publié: (2026)
par: Porada, Ian
Publié: (2026)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
par: Liu, Junyu, et autres
Publié: (2026)
par: Liu, Junyu, et autres
Publié: (2026)
SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue
par: Dai, Yuqin, et autres
Publié: (2026)
par: Dai, Yuqin, et autres
Publié: (2026)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
Efficient Tuning of Large Language Models for Knowledge-Grounded Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2025)
par: Zhang, Bo, et autres
Publié: (2025)
Evaluating Large Language Models in Analysing Classroom Dialogue
par: Long, Yun, et autres
Publié: (2024)
par: Long, Yun, et autres
Publié: (2024)
Multimodal Coreference Resolution for Chinese Social Media Dialogues: Dataset and Benchmark Approach
par: Li, Xingyu, et autres
Publié: (2025)
par: Li, Xingyu, et autres
Publié: (2025)
Evaluating Temporal Consistency in Multi-Turn Language Models
par: Atri, Yash Kumar, et autres
Publié: (2026)
par: Atri, Yash Kumar, et autres
Publié: (2026)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2024)
par: Kwan, Wai-Chung, et autres
Publié: (2024)
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
par: Lang, Hao, et autres
Publié: (2023)
par: Lang, Hao, et autres
Publié: (2023)
ECoh: Turn-level Coherence Evaluation for Multilingual Dialogues
par: Mendonça, John, et autres
Publié: (2024)
par: Mendonça, John, et autres
Publié: (2024)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
par: Ning, Zhiyuan, et autres
Publié: (2025)
par: Ning, Zhiyuan, et autres
Publié: (2025)
AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models
par: Kang, Hankun, et autres
Publié: (2026)
par: Kang, Hankun, et autres
Publié: (2026)
Discourse Diversity in Multi-Turn Empathic Dialogue
par: Zhan, Hongli, et autres
Publié: (2026)
par: Zhan, Hongli, et autres
Publié: (2026)
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
par: Gao, Jiahui, et autres
Publié: (2023)
par: Gao, Jiahui, et autres
Publié: (2023)
Investigating Co-Constructive Behavior of Large Language Models in Explanation Dialogues
par: Fichtel, Leandra, et autres
Publié: (2025)
par: Fichtel, Leandra, et autres
Publié: (2025)
Reasoning over Object Descriptions Improves Coreference Resolution in Task-Based Dialogue Systems
par: Ijurco, Oier, et autres
Publié: (2026)
par: Ijurco, Oier, et autres
Publié: (2026)
SafeMT: Multi-turn Safety for Multimodal Language Models
par: Zhu, Han, et autres
Publié: (2025)
par: Zhu, Han, et autres
Publié: (2025)
SafetyBench: Evaluating the Safety of Large Language Models
par: Zhang, Zhexin, et autres
Publié: (2023)
par: Zhang, Zhexin, et autres
Publié: (2023)
Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
par: Juneja, Prerna, et autres
Publié: (2026)
par: Juneja, Prerna, et autres
Publié: (2026)
Modeling and Predicting Multi-Turn Answer Instability in Large Language Models
par: He, Jiahang, et autres
Publié: (2025)
par: He, Jiahang, et autres
Publié: (2025)
Documents similaires
-
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
par: Cao, Hongye, et autres
Publié: (2025) -
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
par: Yu, Erxin, et autres
Publié: (2025) -
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
par: Liu, Zheyuan, et autres
Publié: (2026) -
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
par: Zhou, Zhenhong, et autres
Publié: (2024) -
CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration
par: Gao, Jiahui, et autres
Publié: (2024)