ChiMDQA: Towards Comprehensive Chinese Document QA with Fine-grained Evaluation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gao, Jing, Luo, Shutiao, Liu, Yumeng, Li, Yuanming, Zeng, Hongji |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation
von: Huang, Tiancheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiancheng, et al.
Veröffentlicht: (2025)
ChiEngMixBench: Evaluating Large Language Models on Spontaneous and Natural Chinese-English Code-Mixed Generation
von: Yang, Qingyan, et al.
Veröffentlicht: (2026)
von: Yang, Qingyan, et al.
Veröffentlicht: (2026)
Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA
von: Li, Zhanli, et al.
Veröffentlicht: (2026)
von: Li, Zhanli, et al.
Veröffentlicht: (2026)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
von: Li, Chuhan, et al.
Veröffentlicht: (2024)
von: Li, Chuhan, et al.
Veröffentlicht: (2024)
LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
von: Bonomo, Tommaso, et al.
Veröffentlicht: (2025)
von: Bonomo, Tommaso, et al.
Veröffentlicht: (2025)
Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs
von: Liang, Zhuowen, et al.
Veröffentlicht: (2026)
von: Liang, Zhuowen, et al.
Veröffentlicht: (2026)
CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
von: Wu, Chengwei, et al.
Veröffentlicht: (2025)
von: Wu, Chengwei, et al.
Veröffentlicht: (2025)
FunQA: Towards Surprising Video Comprehension
von: Xie, Binzhu, et al.
Veröffentlicht: (2023)
von: Xie, Binzhu, et al.
Veröffentlicht: (2023)
AncientBench: Towards Comprehensive Evaluation on Excavated and Transmitted Chinese Corpora
von: Zhou, Zhihan, et al.
Veröffentlicht: (2025)
von: Zhou, Zhihan, et al.
Veröffentlicht: (2025)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
von: Chen, Yelin, et al.
Veröffentlicht: (2026)
von: Chen, Yelin, et al.
Veröffentlicht: (2026)
EmoMeta: A Multimodal Dataset for Fine-grained Emotion Classification in Chinese Metaphors
von: Lu, Xingyuan, et al.
Veröffentlicht: (2025)
von: Lu, Xingyuan, et al.
Veröffentlicht: (2025)
Towards Comprehensive Detection of Chinese Harmful Memes
von: Lu, Junyu, et al.
Veröffentlicht: (2024)
von: Lu, Junyu, et al.
Veröffentlicht: (2024)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2026)
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2026)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
von: Wei, Jianhui, et al.
Veröffentlicht: (2025)
von: Wei, Jianhui, et al.
Veröffentlicht: (2025)
FineSurE: Fine-grained Summarization Evaluation using LLMs
von: Song, Hwanjun, et al.
Veröffentlicht: (2024)
von: Song, Hwanjun, et al.
Veröffentlicht: (2024)
HiQA: A Hierarchical Contextual Augmentation RAG for Multi-Documents QA
von: Chen, Xinyue, et al.
Veröffentlicht: (2024)
von: Chen, Xinyue, et al.
Veröffentlicht: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
DGRC: An Effective Fine-tuning Framework for Distractor Generation in Chinese Multi-choice Reading Comprehension
von: Lin, Runfeng, et al.
Veröffentlicht: (2024)
von: Lin, Runfeng, et al.
Veröffentlicht: (2024)
Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation
von: Luo, Wenzhen, et al.
Veröffentlicht: (2025)
von: Luo, Wenzhen, et al.
Veröffentlicht: (2025)
Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems
von: Wu, Wanxing, et al.
Veröffentlicht: (2026)
von: Wu, Wanxing, et al.
Veröffentlicht: (2026)
Code-Based English Models Surprising Performance on Chinese QA Pair Extraction Task
von: Zheng, Linghan, et al.
Veröffentlicht: (2024)
von: Zheng, Linghan, et al.
Veröffentlicht: (2024)
LMUnit: Fine-grained Evaluation with Natural Language Unit Tests
von: Saad-Falcon, Jon, et al.
Veröffentlicht: (2024)
von: Saad-Falcon, Jon, et al.
Veröffentlicht: (2024)
QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization
von: Zhang, Shiyue, et al.
Veröffentlicht: (2024)
von: Zhang, Shiyue, et al.
Veröffentlicht: (2024)
Towards Coarse-to-Fine Evaluation of Inference Efficiency for Large Language Models
von: Chen, Yushuo, et al.
Veröffentlicht: (2024)
von: Chen, Yushuo, et al.
Veröffentlicht: (2024)
FFN: a Fine-grained Chinese-English Financial Domain Parallel Corpus
von: Fu, Yuxin, et al.
Veröffentlicht: (2024)
von: Fu, Yuxin, et al.
Veröffentlicht: (2024)
C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
von: Zhang, Xu, et al.
Veröffentlicht: (2025)
von: Zhang, Xu, et al.
Veröffentlicht: (2025)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
von: Wang, Minzheng, et al.
Veröffentlicht: (2024)
von: Wang, Minzheng, et al.
Veröffentlicht: (2024)
Fennec: Fine-grained Language Model Evaluation and Correction Extended through Branching and Bridging
von: Liang, Xiaobo, et al.
Veröffentlicht: (2024)
von: Liang, Xiaobo, et al.
Veröffentlicht: (2024)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
von: Doris, Anna C., et al.
Veröffentlicht: (2024)
von: Doris, Anna C., et al.
Veröffentlicht: (2024)
DocMEdit: Towards Document-Level Model Editing
von: Zeng, Li, et al.
Veröffentlicht: (2025)
von: Zeng, Li, et al.
Veröffentlicht: (2025)
CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark
von: Zhang, Junzhao, et al.
Veröffentlicht: (2026)
von: Zhang, Junzhao, et al.
Veröffentlicht: (2026)
Towards Optimizing and Evaluating a Retrieval Augmented QA Chatbot using LLMs with Human in the Loop
von: Afzal, Anum, et al.
Veröffentlicht: (2024)
von: Afzal, Anum, et al.
Veröffentlicht: (2024)
FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets
von: Ye, Seonghyeon, et al.
Veröffentlicht: (2023)
von: Ye, Seonghyeon, et al.
Veröffentlicht: (2023)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
PFME: A Modular Approach for Fine-grained Hallucination Detection and Editing of Large Language Models
von: Deng, Kunquan, et al.
Veröffentlicht: (2024)
von: Deng, Kunquan, et al.
Veröffentlicht: (2024)
SciQAG: A Framework for Auto-Generated Science Question Answering Dataset with Fine-grained Evaluation
von: Wan, Yuwei, et al.
Veröffentlicht: (2024)
von: Wan, Yuwei, et al.
Veröffentlicht: (2024)
CMB: A Comprehensive Medical Benchmark in Chinese
von: Wang, Xidong, et al.
Veröffentlicht: (2023)
von: Wang, Xidong, et al.
Veröffentlicht: (2023)
Can LLM Substitute Human Labeling? A Case Study of Fine-grained Chinese Address Entity Recognition Dataset for UAV Delivery
von: Yao, Yuxuan, et al.
Veröffentlicht: (2024)
von: Yao, Yuxuan, et al.
Veröffentlicht: (2024)
Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning
von: Wang, Kaipeng, et al.
Veröffentlicht: (2024)
von: Wang, Kaipeng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation
von: Huang, Tiancheng, et al.
Veröffentlicht: (2025) -
ChiEngMixBench: Evaluating Large Language Models on Spontaneous and Natural Chinese-English Code-Mixed Generation
von: Yang, Qingyan, et al.
Veröffentlicht: (2026) -
Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA
von: Li, Zhanli, et al.
Veröffentlicht: (2026) -
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
von: Li, Chuhan, et al.
Veröffentlicht: (2024) -
LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
von: Bonomo, Tommaso, et al.
Veröffentlicht: (2025)