UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities
Fuente:
arXiv
Saved in:
| Main Authors: | Jia, Qi, Zhao, Haodong, Pei, Dun, Song, Xiujie, Shen, Ye, Wang, Shibo, Chen, Zijian, Zhang, Zicheng, Zhu, Xiangyang, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
by: Jia, Qi, et al.
Published: (2025)
by: Jia, Qi, et al.
Published: (2025)
AITutor-EvalKit: Exploring the Capabilities of AI Tutors
by: Naeem, Numaan, et al.
Published: (2025)
by: Naeem, Numaan, et al.
Published: (2025)
User-centric Subjective Leaderboard by Customizable Reward Modeling
by: Jia, Qi, et al.
Published: (2025)
by: Jia, Qi, et al.
Published: (2025)
EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory
by: Shen, Ye, et al.
Published: (2026)
by: Shen, Ye, et al.
Published: (2026)
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
by: Wang, Yiheng, et al.
Published: (2025)
by: Wang, Yiheng, et al.
Published: (2025)
UniProcessor: A Text-induced Unified Low-level Image Processor
by: Duan, Huiyu, et al.
Published: (2024)
by: Duan, Huiyu, et al.
Published: (2024)
QoNext: Towards Next-generation QoE for Foundation Models
by: Guo, Yijin, et al.
Published: (2025)
by: Guo, Yijin, et al.
Published: (2025)
A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
by: Shen, Ye, et al.
Published: (2025)
by: Shen, Ye, et al.
Published: (2025)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
by: Fu, Kang, et al.
Published: (2026)
by: Fu, Kang, et al.
Published: (2026)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
by: Zhang, Kaiwei, et al.
Published: (2025)
by: Zhang, Kaiwei, et al.
Published: (2025)
BDI-Kit Demo: A Toolkit for Programmable and Conversational Data Harmonization
by: Lopez, Roque, et al.
Published: (2026)
by: Lopez, Roque, et al.
Published: (2026)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
by: Li, Yi, et al.
Published: (2025)
by: Li, Yi, et al.
Published: (2025)
Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
Teaching LMMs for Image Quality Scoring and Interpreting
by: Zhang, Zicheng, et al.
Published: (2025)
by: Zhang, Zicheng, et al.
Published: (2025)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
by: Zhu, Xiaorong, et al.
Published: (2025)
by: Zhu, Xiaorong, et al.
Published: (2025)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
by: Ji, Kaiyuan, et al.
Published: (2025)
by: Ji, Kaiyuan, et al.
Published: (2025)
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
by: Dou, Zheng, et al.
Published: (2026)
by: Dou, Zheng, et al.
Published: (2026)
The Ever-Evolving Science Exam
by: Wang, Junying, et al.
Published: (2025)
by: Wang, Junying, et al.
Published: (2025)
VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
by: Duan, Haodong, et al.
Published: (2024)
by: Duan, Haodong, et al.
Published: (2024)
PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction
by: Liang, Bohan, et al.
Published: (2025)
by: Liang, Bohan, et al.
Published: (2025)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
by: Wang, Xianfeng, et al.
Published: (2026)
by: Wang, Xianfeng, et al.
Published: (2026)
A$^3$: Towards Advertising Aesthetic Assessment
by: Ji, Kaiyuan, et al.
Published: (2026)
by: Ji, Kaiyuan, et al.
Published: (2026)
UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
by: Yang, Panqi, et al.
Published: (2025)
by: Yang, Panqi, et al.
Published: (2025)
Benchmarking Cross-Scale Perception Ability of Large Multimodal Models in Material Science
by: Zheng, Yuting, et al.
Published: (2026)
by: Zheng, Yuting, et al.
Published: (2026)
Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model
by: Zhang, Zhichao, et al.
Published: (2024)
by: Zhang, Zhichao, et al.
Published: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
by: Zhou, Hantao, et al.
Published: (2024)
by: Zhou, Hantao, et al.
Published: (2024)
UniBrain: A Unified Model for Cross-Subject Brain Decoding
by: Wang, Zicheng, et al.
Published: (2024)
by: Wang, Zicheng, et al.
Published: (2024)
UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos
by: Yang, Zhi, et al.
Published: (2026)
by: Yang, Zhi, et al.
Published: (2026)
MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror
by: Guo, Shengyu, et al.
Published: (2026)
by: Guo, Shengyu, et al.
Published: (2026)
LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks
by: Gao, Hengjian, et al.
Published: (2026)
by: Gao, Hengjian, et al.
Published: (2026)
Towards Explainable Partial-AIGC Image Quality Assessment
by: Qian, Jiaying, et al.
Published: (2025)
by: Qian, Jiaying, et al.
Published: (2025)
UniMark: Artificial Intelligence Generated Content Identification Toolkit
by: Li, Meilin, et al.
Published: (2025)
by: Li, Meilin, et al.
Published: (2025)
Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
by: Sun, Wei, et al.
Published: (2024)
by: Sun, Wei, et al.
Published: (2024)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
by: Jia, Ziheng, et al.
Published: (2025)
by: Jia, Ziheng, et al.
Published: (2025)
UniConv: Unifying Retrieval and Response Generation for Large Language Models in Conversations
by: Mo, Fengran, et al.
Published: (2025)
by: Mo, Fengran, et al.
Published: (2025)
OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
by: Chen, Zijian, et al.
Published: (2024)
by: Chen, Zijian, et al.
Published: (2024)
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
by: Gupta, Prannaya, et al.
Published: (2024)
by: Gupta, Prannaya, et al.
Published: (2024)
LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science
by: Rong, Dingyi, et al.
Published: (2025)
by: Rong, Dingyi, et al.
Published: (2025)
Information Density Principle for MLLM Benchmarks
by: Li, Chunyi, et al.
Published: (2025)
by: Li, Chunyi, et al.
Published: (2025)
Just Noticeable Difference for Large Multimodal Models
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
Similar Items
-
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
by: Jia, Qi, et al.
Published: (2025) -
AITutor-EvalKit: Exploring the Capabilities of AI Tutors
by: Naeem, Numaan, et al.
Published: (2025) -
User-centric Subjective Leaderboard by Customizable Reward Modeling
by: Jia, Qi, et al.
Published: (2025) -
EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory
by: Shen, Ye, et al.
Published: (2026) -
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
by: Wang, Yiheng, et al.
Published: (2025)