MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Chenghao, Luo, Yinbo, Wen, Zhoufutu, Chu, Qi, Gong, Tao, Liu, Longxiang, Zhang, Kaiyuan, Jiao, Jianpeng, Zhang, Ge, Huang, Wenhao, Yu, Nenghai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
por: Yang, Chenghao, et al.
Publicado: (2026)
por: Yang, Chenghao, et al.
Publicado: (2026)
MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
por: Huang, Yao, et al.
Publicado: (2025)
por: Huang, Yao, et al.
Publicado: (2025)
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
por: Ma, Kaijing, et al.
Publicado: (2024)
por: Ma, Kaijing, et al.
Publicado: (2024)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
por: Fan, Zhiting, et al.
Publicado: (2024)
por: Fan, Zhiting, et al.
Publicado: (2024)
MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation
por: He, Junqing, et al.
Publicado: (2024)
por: He, Junqing, et al.
Publicado: (2024)
MFFI: Multi-Dimensional Face Forgery Image Dataset for Real-World Scenarios
por: Miao, Changtao, et al.
Publicado: (2025)
por: Miao, Changtao, et al.
Publicado: (2025)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
por: Song, Zhiheng, et al.
Publicado: (2026)
por: Song, Zhiheng, et al.
Publicado: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
por: Gao, Zeyu, et al.
Publicado: (2025)
por: Gao, Zeyu, et al.
Publicado: (2025)
Context-Aware Weakly Supervised Image Manipulation Localization with SAM Refinement
por: Wang, Xinghao, et al.
Publicado: (2025)
por: Wang, Xinghao, et al.
Publicado: (2025)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)
por: Shen, Yuanzhe, et al.
Publicado: (2026)
ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents
por: Shen, Haiyang, et al.
Publicado: (2024)
por: Shen, Haiyang, et al.
Publicado: (2024)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
por: Qiu, Lu, et al.
Publicado: (2024)
por: Qiu, Lu, et al.
Publicado: (2024)
Benchmarking Audio Deepfake Detection Robustness in Real-world Communication Scenarios
por: Shi, Haohan, et al.
Publicado: (2025)
por: Shi, Haohan, et al.
Publicado: (2025)
AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment
por: Xiao, Jianfei, et al.
Publicado: (2026)
por: Xiao, Jianfei, et al.
Publicado: (2026)
DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains
por: Zhao, Xiying, et al.
Publicado: (2025)
por: Zhao, Xiying, et al.
Publicado: (2025)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)
por: Zhang, Yibo, et al.
Publicado: (2026)
Kernel Adversarial Learning for Real-world Image Super-resolution
por: Wang, Hu, et al.
Publicado: (2021)
por: Wang, Hu, et al.
Publicado: (2021)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
por: Ma, David, et al.
Publicado: (2025)
por: Ma, David, et al.
Publicado: (2025)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
por: He, Wei, et al.
Publicado: (2025)
por: He, Wei, et al.
Publicado: (2025)
FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning
por: Hu, Liang, et al.
Publicado: (2025)
por: Hu, Liang, et al.
Publicado: (2025)
Towards Anytime Retrieval: A Benchmark for Anytime Person Re-Identification
por: Li, Xulin, et al.
Publicado: (2025)
por: Li, Xulin, et al.
Publicado: (2025)
CryptoX : Compositional Reasoning Evaluation of Large Language Models
por: Shi, Jiajun, et al.
Publicado: (2025)
por: Shi, Jiajun, et al.
Publicado: (2025)
DialogBench: Evaluating LLMs as Human-like Dialogue Systems
por: Ou, Jiao, et al.
Publicado: (2023)
por: Ou, Jiao, et al.
Publicado: (2023)
Data Selection for Multi-turn Dialogue Instruction Tuning
por: Li, Bo, et al.
Publicado: (2026)
por: Li, Bo, et al.
Publicado: (2026)
OpenClawBench: Benchmarking Process-side Anomalies in Real-world Agent Execution Trajectories
por: Liu, Yibing, et al.
Publicado: (2026)
por: Liu, Yibing, et al.
Publicado: (2026)
StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios
por: Wang, Sizhe, et al.
Publicado: (2026)
por: Wang, Sizhe, et al.
Publicado: (2026)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
por: Wang, Sizhe, et al.
Publicado: (2025)
por: Wang, Sizhe, et al.
Publicado: (2025)
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
por: Wang, Jun, et al.
Publicado: (2024)
por: Wang, Jun, et al.
Publicado: (2024)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
por: Wu, Yao, et al.
Publicado: (2026)
por: Wu, Yao, et al.
Publicado: (2026)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
por: Dong, Xuan, et al.
Publicado: (2026)
por: Dong, Xuan, et al.
Publicado: (2026)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
por: Ye, Junjie, et al.
Publicado: (2024)
por: Ye, Junjie, et al.
Publicado: (2024)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
por: Wang, Jiangyuan, et al.
Publicado: (2025)
por: Wang, Jiangyuan, et al.
Publicado: (2025)
SAPL: Semantic-Agnostic Prompt Learning in CLIP for Weakly Supervised Image Manipulation Localization
por: Wang, Xinghao, et al.
Publicado: (2026)
por: Wang, Xinghao, et al.
Publicado: (2026)
MMedFD: A Real-world Healthcare Benchmark for Multi-turn Full-Duplex Automatic Speech Recognition
por: Chen, Hongzhao, et al.
Publicado: (2025)
por: Chen, Hongzhao, et al.
Publicado: (2025)
CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation
por: Yuan, Ruifeng, et al.
Publicado: (2026)
por: Yuan, Ruifeng, et al.
Publicado: (2026)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
Bridging the Sim-to-Real Gap for Athletic Loco-Manipulation
por: Fey, Nolan, et al.
Publicado: (2025)
por: Fey, Nolan, et al.
Publicado: (2025)
Real-world Image Dehazing with Coherence-based Pseudo Labeling and Cooperative Unfolding Network
por: Fang, Chengyu, et al.
Publicado: (2024)
por: Fang, Chengyu, et al.
Publicado: (2024)
Ejemplares similares
-
When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
por: Yang, Chenghao, et al.
Publicado: (2026) -
MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
por: Zhang, Kaiyuan, et al.
Publicado: (2025) -
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
por: Huang, Yao, et al.
Publicado: (2025) -
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
por: Ma, Kaijing, et al.
Publicado: (2024) -
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)