CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Erxin, Li, Jing, Liao, Ming, Wang, Siqi, Gao, Zuchen, Mi, Fei, Hong, Lanqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
di: Cao, Hongye, et al.
Pubblicazione: (2025)
di: Cao, Hongye, et al.
Pubblicazione: (2025)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
di: Yu, Erxin, et al.
Pubblicazione: (2025)
di: Yu, Erxin, et al.
Pubblicazione: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration
di: Gao, Jiahui, et al.
Pubblicazione: (2024)
di: Gao, Jiahui, et al.
Pubblicazione: (2024)
PopALM: Popularity-Aligned Language Models for Social Media Trendy Response Prediction
di: Yu, Erxin, et al.
Pubblicazione: (2024)
di: Yu, Erxin, et al.
Pubblicazione: (2024)
SafeTy Reasoning Elicitation Alignment for Multi-Turn Dialogues
di: Kuo, Martin, et al.
Pubblicazione: (2025)
di: Kuo, Martin, et al.
Pubblicazione: (2025)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
OASIS: Order-Augmented Strategy for Improved Code Search
di: Gao, Zuchen, et al.
Pubblicazione: (2025)
di: Gao, Zuchen, et al.
Pubblicazione: (2025)
UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models
di: Xue, Boyang, et al.
Pubblicazione: (2024)
di: Xue, Boyang, et al.
Pubblicazione: (2024)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
di: Yan, Siyu, et al.
Pubblicazione: (2025)
di: Yan, Siyu, et al.
Pubblicazione: (2025)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
di: Bai, Ge, et al.
Pubblicazione: (2024)
di: Bai, Ge, et al.
Pubblicazione: (2024)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
di: Tang, Yuqi, et al.
Pubblicazione: (2025)
di: Tang, Yuqi, et al.
Pubblicazione: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
di: Gao, Fan, et al.
Pubblicazione: (2025)
di: Gao, Fan, et al.
Pubblicazione: (2025)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions
di: Tan, Cheng, et al.
Pubblicazione: (2024)
di: Tan, Cheng, et al.
Pubblicazione: (2024)
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
The Validity of Coreference-based Evaluations of Natural Language Understanding
di: Porada, Ian
Pubblicazione: (2026)
di: Porada, Ian
Pubblicazione: (2026)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
di: Liu, Junyu, et al.
Pubblicazione: (2026)
di: Liu, Junyu, et al.
Pubblicazione: (2026)
SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue
di: Dai, Yuqin, et al.
Pubblicazione: (2026)
di: Dai, Yuqin, et al.
Pubblicazione: (2026)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
di: Li, Kenneth, et al.
Pubblicazione: (2024)
di: Li, Kenneth, et al.
Pubblicazione: (2024)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
di: Kuo, Tzu-Lin, et al.
Pubblicazione: (2024)
di: Kuo, Tzu-Lin, et al.
Pubblicazione: (2024)
Efficient Tuning of Large Language Models for Knowledge-Grounded Dialogue Generation
di: Zhang, Bo, et al.
Pubblicazione: (2025)
di: Zhang, Bo, et al.
Pubblicazione: (2025)
Evaluating Large Language Models in Analysing Classroom Dialogue
di: Long, Yun, et al.
Pubblicazione: (2024)
di: Long, Yun, et al.
Pubblicazione: (2024)
Multimodal Coreference Resolution for Chinese Social Media Dialogues: Dataset and Benchmark Approach
di: Li, Xingyu, et al.
Pubblicazione: (2025)
di: Li, Xingyu, et al.
Pubblicazione: (2025)
Evaluating Temporal Consistency in Multi-Turn Language Models
di: Atri, Yash Kumar, et al.
Pubblicazione: (2026)
di: Atri, Yash Kumar, et al.
Pubblicazione: (2026)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
di: Lang, Hao, et al.
Pubblicazione: (2023)
di: Lang, Hao, et al.
Pubblicazione: (2023)
ECoh: Turn-level Coherence Evaluation for Multilingual Dialogues
di: Mendonça, John, et al.
Pubblicazione: (2024)
di: Mendonça, John, et al.
Pubblicazione: (2024)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models
di: Kang, Hankun, et al.
Pubblicazione: (2026)
di: Kang, Hankun, et al.
Pubblicazione: (2026)
Discourse Diversity in Multi-Turn Empathic Dialogue
di: Zhan, Hongli, et al.
Pubblicazione: (2026)
di: Zhan, Hongli, et al.
Pubblicazione: (2026)
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
di: Gao, Jiahui, et al.
Pubblicazione: (2023)
di: Gao, Jiahui, et al.
Pubblicazione: (2023)
Investigating Co-Constructive Behavior of Large Language Models in Explanation Dialogues
di: Fichtel, Leandra, et al.
Pubblicazione: (2025)
di: Fichtel, Leandra, et al.
Pubblicazione: (2025)
Reasoning over Object Descriptions Improves Coreference Resolution in Task-Based Dialogue Systems
di: Ijurco, Oier, et al.
Pubblicazione: (2026)
di: Ijurco, Oier, et al.
Pubblicazione: (2026)
SafeMT: Multi-turn Safety for Multimodal Language Models
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
di: Juneja, Prerna, et al.
Pubblicazione: (2026)
di: Juneja, Prerna, et al.
Pubblicazione: (2026)
Modeling and Predicting Multi-Turn Answer Instability in Large Language Models
di: He, Jiahang, et al.
Pubblicazione: (2025)
di: He, Jiahang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
di: Cao, Hongye, et al.
Pubblicazione: (2025) -
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
di: Yu, Erxin, et al.
Pubblicazione: (2025) -
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026) -
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024) -
CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration
di: Gao, Jiahui, et al.
Pubblicazione: (2024)