MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bai, Ge, Liu, Jie, Bu, Xingyuan, He, Yancheng, Liu, Jiaheng, Zhou, Zhanhui, Lin, Zhuoran, Su, Wenbo, Ge, Tiezheng, Zheng, Bo, Ouyang, Wanli |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
von: Liu, Jie, et al.
Veröffentlicht: (2024)
von: Liu, Jie, et al.
Veröffentlicht: (2024)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
von: He, Yancheng, et al.
Veröffentlicht: (2025)
von: He, Yancheng, et al.
Veröffentlicht: (2025)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
von: Chen, Junhao, et al.
Veröffentlicht: (2025)
von: Chen, Junhao, et al.
Veröffentlicht: (2025)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
E^2-LLM: Efficient and Extreme Length Extension of Large Language Models
von: Liu, Jiaheng, et al.
Veröffentlicht: (2024)
von: Liu, Jiaheng, et al.
Veröffentlicht: (2024)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
von: Luo, Sichun, et al.
Veröffentlicht: (2025)
von: Luo, Sichun, et al.
Veröffentlicht: (2025)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
von: He, Yancheng, et al.
Veröffentlicht: (2024)
von: He, Yancheng, et al.
Veröffentlicht: (2024)
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2025)
von: Tan, Yingshui, et al.
Veröffentlicht: (2025)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
PredBench: Benchmarking Spatio-Temporal Prediction across Diverse Disciplines
von: Wang, ZiDong, et al.
Veröffentlicht: (2024)
von: Wang, ZiDong, et al.
Veröffentlicht: (2024)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
von: Zhang, Xinkai, et al.
Veröffentlicht: (2026)
von: Zhang, Xinkai, et al.
Veröffentlicht: (2026)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
von: Wang, Pei, et al.
Veröffentlicht: (2024)
von: Wang, Pei, et al.
Veröffentlicht: (2024)
AIR: Complex Instruction Generation via Automatic Iterative Refinement
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
von: Liu, Zhiqiang, et al.
Veröffentlicht: (2025)
von: Liu, Zhiqiang, et al.
Veröffentlicht: (2025)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers
von: Wang, Yuxia, et al.
Veröffentlicht: (2023)
von: Wang, Yuxia, et al.
Veröffentlicht: (2023)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
von: Xue, Xiangyuan, et al.
Veröffentlicht: (2024)
von: Xue, Xiangyuan, et al.
Veröffentlicht: (2024)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
von: Deng, Ken, et al.
Veröffentlicht: (2024)
von: Deng, Ken, et al.
Veröffentlicht: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
von: Huang, Hui, et al.
Veröffentlicht: (2026)
von: Huang, Hui, et al.
Veröffentlicht: (2026)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
MoodBench 1.0: An Evaluation Benchmark for Emotional Companionship Dialogue Systems
von: Jing, Haifeng, et al.
Veröffentlicht: (2025)
von: Jing, Haifeng, et al.
Veröffentlicht: (2025)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
von: Yang, Lin, et al.
Veröffentlicht: (2026)
von: Yang, Lin, et al.
Veröffentlicht: (2026)
AdaBrain-Bench: Benchmarking Brain Foundation Models for Brain-Computer Interface Applications
von: Wu, Jiamin, et al.
Veröffentlicht: (2025)
von: Wu, Jiamin, et al.
Veröffentlicht: (2025)
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
von: Ma, Kaijing, et al.
Veröffentlicht: (2024)
von: Ma, Kaijing, et al.
Veröffentlicht: (2024)
CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2026)
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2026)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
von: Zhang, Alexander, et al.
Veröffentlicht: (2025)
von: Zhang, Alexander, et al.
Veröffentlicht: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
von: Du, Yang, et al.
Veröffentlicht: (2025)
von: Du, Yang, et al.
Veröffentlicht: (2025)
Think-J: Learning to Think for Generative LLM-as-a-Judge
von: Huang, Hui, et al.
Veröffentlicht: (2025)
von: Huang, Hui, et al.
Veröffentlicht: (2025)
S-RRG-Bench: Structured Radiology Report Generation with Fine-Grained Evaluation Framework
von: Li, Yingshu, et al.
Veröffentlicht: (2025)
von: Li, Yingshu, et al.
Veröffentlicht: (2025)
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
von: Sun, Lang, et al.
Veröffentlicht: (2026)
von: Sun, Lang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
von: Wu, Yanan, et al.
Veröffentlicht: (2024) -
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
von: Li, Shilong, et al.
Veröffentlicht: (2024) -
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
von: Liu, Jie, et al.
Veröffentlicht: (2024) -
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
von: Pan, Yaning, et al.
Veröffentlicht: (2025) -
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025)