TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yiran, Wang, Mo, Li, Xiaoyang, Ren, Kaixuan, Zhu, Chencheng, Naseem, Usman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CogMem: A Cognitive Memory Architecture for Sustained Multi-Turn Reasoning in Large Language Models
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
Beyond the Black Box: Demystifying Multi-Turn LLM Reasoning with VISTA
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities
di: Maskey, Utsav, et al.
Pubblicazione: (2025)
di: Maskey, Utsav, et al.
Pubblicazione: (2025)
DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models
di: Ren, Kaixuan, et al.
Pubblicazione: (2025)
di: Ren, Kaixuan, et al.
Pubblicazione: (2025)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
di: Liu, Junyu, et al.
Pubblicazione: (2026)
di: Liu, Junyu, et al.
Pubblicazione: (2026)
PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
di: Luo, Sichun, et al.
Pubblicazione: (2025)
di: Luo, Sichun, et al.
Pubblicazione: (2025)
PersoBench: Benchmarking Personalized Response Generation in Large Language Models
di: Afzoon, Saleh, et al.
Pubblicazione: (2024)
di: Afzoon, Saleh, et al.
Pubblicazione: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
di: Bai, Ge, et al.
Pubblicazione: (2024)
di: Bai, Ge, et al.
Pubblicazione: (2024)
Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions
di: Naseem, Usman
Pubblicazione: (2026)
di: Naseem, Usman
Pubblicazione: (2026)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
di: Li, Yubo, et al.
Pubblicazione: (2026)
di: Li, Yubo, et al.
Pubblicazione: (2026)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
di: Li, Yubo, et al.
Pubblicazione: (2025)
di: Li, Yubo, et al.
Pubblicazione: (2025)
MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models
di: Li, Wenzhe, et al.
Pubblicazione: (2025)
di: Li, Wenzhe, et al.
Pubblicazione: (2025)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
di: He, Yun, et al.
Pubblicazione: (2024)
di: He, Yun, et al.
Pubblicazione: (2024)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
di: Wan, Luanbo, et al.
Pubblicazione: (2025)
di: Wan, Luanbo, et al.
Pubblicazione: (2025)
What Makes Large Language Models Reason in (Multi-Turn) Code Generation?
di: Zheng, Kunhao, et al.
Pubblicazione: (2024)
di: Zheng, Kunhao, et al.
Pubblicazione: (2024)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
di: Cao, Hongye, et al.
Pubblicazione: (2025)
di: Cao, Hongye, et al.
Pubblicazione: (2025)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Evaluating Temporal Consistency in Multi-Turn Language Models
di: Atri, Yash Kumar, et al.
Pubblicazione: (2026)
di: Atri, Yash Kumar, et al.
Pubblicazione: (2026)
Modeling and Predicting Multi-Turn Answer Instability in Large Language Models
di: He, Jiahang, et al.
Pubblicazione: (2025)
di: He, Jiahang, et al.
Pubblicazione: (2025)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
di: Du, Yuhao, et al.
Pubblicazione: (2025)
di: Du, Yuhao, et al.
Pubblicazione: (2025)
ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models
di: Kapadnis, Manav Nitin, et al.
Pubblicazione: (2026)
di: Kapadnis, Manav Nitin, et al.
Pubblicazione: (2026)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
di: Chen, Junhao, et al.
Pubblicazione: (2025)
di: Chen, Junhao, et al.
Pubblicazione: (2025)
A Survey on Multi-Turn Interaction Capabilities of Large Language Models
di: Zhang, Chen, et al.
Pubblicazione: (2025)
di: Zhang, Chen, et al.
Pubblicazione: (2025)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
di: Yu, Erxin, et al.
Pubblicazione: (2024)
di: Yu, Erxin, et al.
Pubblicazione: (2024)
SafeTy Reasoning Elicitation Alignment for Multi-Turn Dialogues
di: Kuo, Martin, et al.
Pubblicazione: (2025)
di: Kuo, Martin, et al.
Pubblicazione: (2025)
Proactive Guidance of Multi-Turn Conversation in Industrial Search
di: Li, Xiaoyu, et al.
Pubblicazione: (2025)
di: Li, Xiaoyu, et al.
Pubblicazione: (2025)
XGUARD: A Graded Benchmark for Evaluating Safety Failures of Large Language Models on Extremist Content
di: Abishethvarman, Vadivel, et al.
Pubblicazione: (2025)
di: Abishethvarman, Vadivel, et al.
Pubblicazione: (2025)
Parrot: Enhancing Multi-Turn Instruction Following for Large Language Models
di: Sun, Yuchong, et al.
Pubblicazione: (2023)
di: Sun, Yuchong, et al.
Pubblicazione: (2023)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
di: Wang, Kangrui, et al.
Pubblicazione: (2025)
di: Wang, Kangrui, et al.
Pubblicazione: (2025)
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
di: Kong, Yaxuan, et al.
Pubblicazione: (2026)
di: Kong, Yaxuan, et al.
Pubblicazione: (2026)
From Generation to Detection: A Multimodal Multi-Task Dataset for Benchmarking Health Misinformation
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
TRUTH DECAY: Quantifying Multi-Turn Sycophancy in Language Models
di: Liu, Joshua, et al.
Pubblicazione: (2025)
di: Liu, Joshua, et al.
Pubblicazione: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
Multi-Turn Interactions for Text-to-SQL with Large Language Models
di: Xiong, Guanming, et al.
Pubblicazione: (2024)
di: Xiong, Guanming, et al.
Pubblicazione: (2024)
ContextCache: Context-Aware Semantic Cache for Multi-Turn Queries in Large Language Models
di: Yan, Jianxin, et al.
Pubblicazione: (2025)
di: Yan, Jianxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CogMem: A Cognitive Memory Architecture for Sustained Multi-Turn Reasoning in Large Language Models
di: Zhang, Yiran, et al.
Pubblicazione: (2025) -
Beyond the Black Box: Demystifying Multi-Turn LLM Reasoning with VISTA
di: Zhang, Yiran, et al.
Pubblicazione: (2025) -
Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities
di: Maskey, Utsav, et al.
Pubblicazione: (2025) -
DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models
di: Ren, Kaixuan, et al.
Pubblicazione: (2025) -
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)