CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases
Fuente:
arXiv
Salvato in:
| Autori principali: | Xue, Xiaona, Huang, Yiqiao, Li, Jiacheng, Zheng, Yuanhang, Miao, Huiqi, Ma, Yunfei, Liu, Rui, Sun, Xinbao, Liu, Minglu, Meng, Fanyu, Deng, Chao, Feng, Junlan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Strategy-Aware Optimization Modeling with Reasoning LLMs
di: Zhao, Ruiqing, et al.
Pubblicazione: (2026)
di: Zhao, Ruiqing, et al.
Pubblicazione: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
di: Gao, Zeyu, et al.
Pubblicazione: (2025)
di: Gao, Zeyu, et al.
Pubblicazione: (2025)
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
di: Huang, Shijue, et al.
Pubblicazione: (2024)
di: Huang, Shijue, et al.
Pubblicazione: (2024)
FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion
di: Ruan, Jiacheng, et al.
Pubblicazione: (2024)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2024)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
di: Lu, Guilong, et al.
Pubblicazione: (2025)
di: Lu, Guilong, et al.
Pubblicazione: (2025)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
di: Li, Yifei, et al.
Pubblicazione: (2025)
di: Li, Yifei, et al.
Pubblicazione: (2025)
SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis
di: Zhang, Chenghanyu, et al.
Pubblicazione: (2025)
di: Zhang, Chenghanyu, et al.
Pubblicazione: (2025)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
di: Song, Zhiheng, et al.
Pubblicazione: (2026)
di: Song, Zhiheng, et al.
Pubblicazione: (2026)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
Traversing Quantum Control Robustness Landscapes: A New Paradigm for Quantum Gate Engineering
di: Xue, Huiqi, et al.
Pubblicazione: (2024)
di: Xue, Huiqi, et al.
Pubblicazione: (2024)
Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents
di: Luo, Yaxin, et al.
Pubblicazione: (2025)
di: Luo, Yaxin, et al.
Pubblicazione: (2025)
MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion
di: Feng, Yunfei, et al.
Pubblicazione: (2026)
di: Feng, Yunfei, et al.
Pubblicazione: (2026)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models
di: Li, Fengzhi, et al.
Pubblicazione: (2026)
di: Li, Fengzhi, et al.
Pubblicazione: (2026)
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
di: Wu, Xianjie, et al.
Pubblicazione: (2024)
di: Wu, Xianjie, et al.
Pubblicazione: (2024)
JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs
di: Feng, Junlan, et al.
Pubblicazione: (2025)
di: Feng, Junlan, et al.
Pubblicazione: (2025)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
di: Miao, Tingjia, et al.
Pubblicazione: (2026)
di: Miao, Tingjia, et al.
Pubblicazione: (2026)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
di: Cao, Hongye, et al.
Pubblicazione: (2025)
di: Cao, Hongye, et al.
Pubblicazione: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
LayeredFlow: A Real-World Benchmark for Non-Lambertian Multi-Layer Optical Flow
di: Wen, Hongyu, et al.
Pubblicazione: (2024)
di: Wen, Hongyu, et al.
Pubblicazione: (2024)
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2024)
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2024)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
di: Yang, Jie, et al.
Pubblicazione: (2026)
di: Yang, Jie, et al.
Pubblicazione: (2026)
CFBench: A Comprehensive Constraints-Following Benchmark for LLMs
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
di: Luo, Sichun, et al.
Pubblicazione: (2025)
di: Luo, Sichun, et al.
Pubblicazione: (2025)
RealPDEBench: A Benchmark for Complex Physical Systems with Real-World Data
di: Hu, Peiyan, et al.
Pubblicazione: (2026)
di: Hu, Peiyan, et al.
Pubblicazione: (2026)
SupChain-Bench: Benchmarking Large Language Models for Real-World Supply Chain Management
di: Guan, Shengyue, et al.
Pubblicazione: (2026)
di: Guan, Shengyue, et al.
Pubblicazione: (2026)
BackdoorBench: A Comprehensive Benchmark and Analysis of Backdoor Learning
di: Wu, Baoyuan, et al.
Pubblicazione: (2024)
di: Wu, Baoyuan, et al.
Pubblicazione: (2024)
BackdoorBench: A Comprehensive Benchmark and Analysis of Backdoor Learning
di: Wu, Baoyuan, et al.
Pubblicazione: (2024)
di: Wu, Baoyuan, et al.
Pubblicazione: (2024)
Study on the Service Characteristics of Planetary Roller Screw Mechanisms with Complex Conditions
di: Miao, Jiacheng
Pubblicazione: (2025)
di: Miao, Jiacheng
Pubblicazione: (2025)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
CausalBench: A Comprehensive Benchmark for Causal Learning Capability of LLMs
di: Zhou, Yu, et al.
Pubblicazione: (2024)
di: Zhou, Yu, et al.
Pubblicazione: (2024)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
di: Jin, Pengwei, et al.
Pubblicazione: (2025)
di: Jin, Pengwei, et al.
Pubblicazione: (2025)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
di: Shen, Yuanzhe, et al.
Pubblicazione: (2026)
di: Shen, Yuanzhe, et al.
Pubblicazione: (2026)
BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software
di: Zhang, Zehua, et al.
Pubblicazione: (2025)
di: Zhang, Zehua, et al.
Pubblicazione: (2025)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
di: Liu, Zhou, et al.
Pubblicazione: (2025)
di: Liu, Zhou, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Strategy-Aware Optimization Modeling with Reasoning LLMs
di: Zhao, Ruiqing, et al.
Pubblicazione: (2026) -
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
di: Gao, Zeyu, et al.
Pubblicazione: (2025) -
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
di: Huang, Shijue, et al.
Pubblicazione: (2024) -
FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion
di: Ruan, Jiacheng, et al.
Pubblicazione: (2024) -
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
di: Lu, Guilong, et al.
Pubblicazione: (2025)