CFBench: A Comprehensive Constraints-Following Benchmark for LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Tao, Zhu, Chenglin, Shen, Yanjun, Luo, Wenjing, Zhang, Yan, Liang, Hao, Yang, Fan, Lin, Mingan, Qiao, Yujing, Chen, Weipeng, Cui, Bin, Zhang, Wentao, Zhou, Zenan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SysBench: Can Large Language Models Follow System Messages?
by: Qin, Yanzhao, et al.
Published: (2024)
by: Qin, Yanzhao, et al.
Published: (2024)
PAS: Data-Efficient Plug-and-Play Prompt Augmentation System
by: Zheng, Miao, et al.
Published: (2024)
by: Zheng, Miao, et al.
Published: (2024)
K12Vista: Exploring the Boundaries of MLLMs in K-12 Education
by: Li, Chong, et al.
Published: (2025)
by: Li, Chong, et al.
Published: (2025)
EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique
by: Zhu, Chenglin, et al.
Published: (2025)
by: Zhu, Chenglin, et al.
Published: (2025)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
by: Li, Youquan, et al.
Published: (2024)
by: Li, Youquan, et al.
Published: (2024)
Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction Tuning
by: Chen, Mingyang, et al.
Published: (2024)
by: Chen, Mingyang, et al.
Published: (2024)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
by: Liang, Hao, et al.
Published: (2024)
by: Liang, Hao, et al.
Published: (2024)
DataSculpt: Crafting Data Landscapes for Long-Context LLMs through Multi-Objective Partitioning
by: Lu, Keer, et al.
Published: (2024)
by: Lu, Keer, et al.
Published: (2024)
Baichuan Alignment Technical Report
by: Lin, Mingan, et al.
Published: (2024)
by: Lin, Mingan, et al.
Published: (2024)
Data Proportion Detection for Optimized Data Management for Large Language Models
by: Liang, Hao, et al.
Published: (2024)
by: Liang, Hao, et al.
Published: (2024)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
by: Chen, Song, et al.
Published: (2025)
by: Chen, Song, et al.
Published: (2025)
Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL
by: Cai, Qifeng, et al.
Published: (2025)
by: Cai, Qifeng, et al.
Published: (2025)
Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge
by: Zhao, Yaqi, et al.
Published: (2024)
by: Zhao, Yaqi, et al.
Published: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
by: Fang, Yuanbo, et al.
Published: (2025)
by: Fang, Yuanbo, et al.
Published: (2025)
BaichuanSEED: Sharing the Potential of ExtensivE Data Collection and Deduplication by Introducing a Competitive Large Language Model Baseline
by: Dong, Guosheng, et al.
Published: (2024)
by: Dong, Guosheng, et al.
Published: (2024)
Fundamental Limits of Pulse Based UWB ISAC Systems: A Parameter Estimation Perspective
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs
by: Feng, Xiang, et al.
Published: (2025)
by: Feng, Xiang, et al.
Published: (2025)
Towards Robust Sensor-Fusion Ground SLAM: A Comprehensive Benchmark and A Resilient Framework
by: Zhang, Deteng, et al.
Published: (2025)
by: Zhang, Deteng, et al.
Published: (2025)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
by: Li, Tianpeng, et al.
Published: (2025)
by: Li, Tianpeng, et al.
Published: (2025)
DARO: Difficulty-Aware Reweighting Policy Optimization
by: Zhou, Jingyu, et al.
Published: (2025)
by: Zhou, Jingyu, et al.
Published: (2025)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
by: Li, Chenglin, et al.
Published: (2024)
by: Li, Chenglin, et al.
Published: (2024)
Baichuan-Omni Technical Report
by: Li, Yadong, et al.
Published: (2024)
by: Li, Yadong, et al.
Published: (2024)
GRADE: Probing Knowledge Gaps in LLMs through Gradient Subspace Dynamics
by: Wang, Yujing, et al.
Published: (2026)
by: Wang, Yujing, et al.
Published: (2026)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
by: Zhang, Jiaxin, et al.
Published: (2024)
by: Zhang, Jiaxin, et al.
Published: (2024)
CCTU: A Benchmark for Tool Use under Complex Constraints
by: Ye, Junjie, et al.
Published: (2026)
by: Ye, Junjie, et al.
Published: (2026)
MathClean: A Benchmark for Synthetic Mathematical Data Cleaning
by: Liang, Hao, et al.
Published: (2025)
by: Liang, Hao, et al.
Published: (2025)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
by: Guo, Tianyu, et al.
Published: (2025)
by: Guo, Tianyu, et al.
Published: (2025)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
by: Tang, Anke, et al.
Published: (2024)
by: Tang, Anke, et al.
Published: (2024)
Dissipated Correction Map Method with Trapezoidal Rule for the Simulations of Gravitational Waves from Spinning Compact Binary
by: Luo, Junjie, et al.
Published: (2024)
by: Luo, Junjie, et al.
Published: (2024)
LogicPuzzleRL: Cultivating Robust Mathematical Reasoning in LLMs via Reinforcement Learning
by: Wong, Zhen Hao, et al.
Published: (2025)
by: Wong, Zhen Hao, et al.
Published: (2025)
Optimization of Private Semantic Communication Performance: An Uncooperative Covert Communication Method
by: Zhang, Wenjing, et al.
Published: (2025)
by: Zhang, Wenjing, et al.
Published: (2025)
VABench: A Comprehensive Benchmark for Audio-Video Generation
by: Hua, Daili, et al.
Published: (2025)
by: Hua, Daili, et al.
Published: (2025)
Intention Analysis Makes LLMs A Good Jailbreak Defender
by: Zhang, Yuqi, et al.
Published: (2024)
by: Zhang, Yuqi, et al.
Published: (2024)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
by: Sun, Linzhuang, et al.
Published: (2025)
by: Sun, Linzhuang, et al.
Published: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
by: Han, ZhaoYang, et al.
Published: (2025)
by: Han, ZhaoYang, et al.
Published: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
by: Cai, Qifeng, et al.
Published: (2025)
by: Cai, Qifeng, et al.
Published: (2025)
EDU-MATRIX: A Society-Centric Generative Cognitive Digital Twin Architecture for Secondary Education
by: Zhai, Wenjing, et al.
Published: (2026)
by: Zhai, Wenjing, et al.
Published: (2026)
Comprehensive Analysis of Network Robustness Evaluation Based on Convolutional Neural Networks with Spatial Pyramid Pooling
by: Jiang, Wenjun, et al.
Published: (2023)
by: Jiang, Wenjun, et al.
Published: (2023)
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
by: Sun, Linzhuang, et al.
Published: (2024)
by: Sun, Linzhuang, et al.
Published: (2024)
Similar Items
-
SysBench: Can Large Language Models Follow System Messages?
by: Qin, Yanzhao, et al.
Published: (2024) -
PAS: Data-Efficient Plug-and-Play Prompt Augmentation System
by: Zheng, Miao, et al.
Published: (2024) -
K12Vista: Exploring the Boundaries of MLLMs in K-12 Education
by: Li, Chong, et al.
Published: (2025) -
EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique
by: Zhu, Chenglin, et al.
Published: (2025) -
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
by: Li, Youquan, et al.
Published: (2024)