MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Shengkun, Peng, Hao, Hou, Lei, Li, Juanzi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
by: Chen, Yelin, et al.
Published: (2026)
by: Chen, Yelin, et al.
Published: (2026)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
by: Qi, Yunjia, et al.
Published: (2025)
by: Qi, Yunjia, et al.
Published: (2025)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026)
by: Guo, Pei-Fu, et al.
Published: (2026)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
by: Peng, Hao, et al.
Published: (2025)
by: Peng, Hao, et al.
Published: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
by: Peng, Hao, et al.
Published: (2026)
by: Peng, Hao, et al.
Published: (2026)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
by: Qi, Yunjia, et al.
Published: (2024)
by: Qi, Yunjia, et al.
Published: (2024)
HeQ: a Large and Diverse Hebrew Reading Comprehension Benchmark
by: Cohen, Amir DN, et al.
Published: (2025)
by: Cohen, Amir DN, et al.
Published: (2025)
Multilingual Multi-Aspect Explainability Analyses on Machine Reading Comprehension Models
by: Cui, Yiming, et al.
Published: (2021)
by: Cui, Yiming, et al.
Published: (2021)
StoryWriter: A Multi-Agent Framework for Long Story Generation
by: Xia, Haotian, et al.
Published: (2025)
by: Xia, Haotian, et al.
Published: (2025)
Pre-training Distillation for Large Language Models: A Design Space Exploration
by: Peng, Hao, et al.
Published: (2024)
by: Peng, Hao, et al.
Published: (2024)
Can LLMs Augment Low-Resource Reading Comprehension Datasets? Opportunities and Challenges
by: Samuel, Vinay, et al.
Published: (2023)
by: Samuel, Vinay, et al.
Published: (2023)
Automatic Generation of Inference Making Questions for Reading Comprehension Assessments
by: Ma, Wanjing Anya, et al.
Published: (2025)
by: Ma, Wanjing Anya, et al.
Published: (2025)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
by: Peng, Hao, et al.
Published: (2025)
by: Peng, Hao, et al.
Published: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
by: Xia, Haotian, et al.
Published: (2026)
by: Xia, Haotian, et al.
Published: (2026)
Applications of the Transformer Architecture in AI-Assisted English Reading Comprehension
by: Li, Ping
Published: (2026)
by: Li, Ping
Published: (2026)
Pay Attention to Real World Perturbations! Natural Robustness Evaluation in Machine Reading Comprehension
by: Wu, Yulong, et al.
Published: (2025)
by: Wu, Yulong, et al.
Published: (2025)
CMB: A Comprehensive Medical Benchmark in Chinese
by: Wang, Xidong, et al.
Published: (2023)
by: Wang, Xidong, et al.
Published: (2023)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
by: Tu, Shangqing, et al.
Published: (2025)
by: Tu, Shangqing, et al.
Published: (2025)
Event-level Knowledge Editing
by: Peng, Hao, et al.
Published: (2024)
by: Peng, Hao, et al.
Published: (2024)
Large Language Models in the Clinic: A Comprehensive Benchmark
by: Liu, Fenglin, et al.
Published: (2024)
by: Liu, Fenglin, et al.
Published: (2024)
ConceptPsy:A Benchmark Suite with Conceptual Comprehensiveness in Psychology
by: Zhang, Junlei, et al.
Published: (2023)
by: Zhang, Junlei, et al.
Published: (2023)
A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future
by: Zhong, Jialun, et al.
Published: (2025)
by: Zhong, Jialun, et al.
Published: (2025)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
Question Generation for Assessing Early Literacy Reading Comprehension
by: Yang, Xiaocheng, et al.
Published: (2025)
by: Yang, Xiaocheng, et al.
Published: (2025)
Reading Comprehension using Entity-based Memory Network
by: Wang, Xun, et al.
Published: (2016)
by: Wang, Xun, et al.
Published: (2016)
Question Difficulty Ranking for Multiple-Choice Reading Comprehension
by: Raina, Vatsal, et al.
Published: (2024)
by: Raina, Vatsal, et al.
Published: (2024)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
by: Lin, Nianyi, et al.
Published: (2025)
by: Lin, Nianyi, et al.
Published: (2025)
Must Read: A Comprehensive Survey of Computational Persuasion
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
WritingBench: A Comprehensive Benchmark for Generative Writing
by: Wu, Yuning, et al.
Published: (2025)
by: Wu, Yuning, et al.
Published: (2025)
OCRTurk: A Comprehensive OCR Benchmark for Turkish
by: Yılmaz, Deniz, et al.
Published: (2026)
by: Yılmaz, Deniz, et al.
Published: (2026)
CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models
by: He, Zicong, et al.
Published: (2025)
by: He, Zicong, et al.
Published: (2025)
Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step Reading
by: Han, Feijiang, et al.
Published: (2025)
by: Han, Feijiang, et al.
Published: (2025)
A Vietnamese Dataset for Text Segmentation and Multiple Choices Reading Comprehension
by: Hai, Toan Nguyen, et al.
Published: (2025)
by: Hai, Toan Nguyen, et al.
Published: (2025)
Read Quietly, Think Aloud: Decoupling Comprehension and Reasoning in LLMs
by: Wang, Yuanxin, et al.
Published: (2025)
by: Wang, Yuanxin, et al.
Published: (2025)
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
by: Jahan, Israt, et al.
Published: (2023)
by: Jahan, Israt, et al.
Published: (2023)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
by: Tu, Shangqing, et al.
Published: (2023)
by: Tu, Shangqing, et al.
Published: (2023)
TEG-DB: A Comprehensive Dataset and Benchmark of Textual-Edge Graphs
by: Li, Zhuofeng, et al.
Published: (2024)
by: Li, Zhuofeng, et al.
Published: (2024)
NarraBench: A Comprehensive Framework for Narrative Benchmarking
by: Hamilton, Sil, et al.
Published: (2025)
by: Hamilton, Sil, et al.
Published: (2025)
HeTGB: A Comprehensive Benchmark for Heterophilic Text-Attributed Graphs
by: Li, Shujie, et al.
Published: (2025)
by: Li, Shujie, et al.
Published: (2025)
Similar Items
-
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
by: Chen, Yelin, et al.
Published: (2026) -
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
by: Qi, Yunjia, et al.
Published: (2025) -
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026) -
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
by: Peng, Hao, et al.
Published: (2025) -
WildReward: Learning Reward Models from In-the-Wild Human Interactions
by: Peng, Hao, et al.
Published: (2026)