OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Yijiong, Dai, Ziyun, Wang, Zekun, Wang, Wei, Chen, Ran, Pei, Ji |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CHisIEC: An Information Extraction Corpus for Ancient Chinese History
by: Tang, Xuemei, et al.
Published: (2024)
by: Tang, Xuemei, et al.
Published: (2024)
Long-context Language Models Fail in Basic Retrieval Tasks Without Sufficient Reasoning Steps
by: Yu, Yijiong, et al.
Published: (2024)
by: Yu, Yijiong, et al.
Published: (2024)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
by: Geng, Xuelong, et al.
Published: (2024)
by: Geng, Xuelong, et al.
Published: (2024)
Density-aware Soft Context Compression with Semi-Dynamic Compression Ratio
by: Yu, Yijiong, et al.
Published: (2026)
by: Yu, Yijiong, et al.
Published: (2026)
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
by: Yu, Yijiong, et al.
Published: (2026)
by: Yu, Yijiong, et al.
Published: (2026)
Patience Is The Key to Large Language Model Reasoning
by: Yu, Yijiong
Published: (2024)
by: Yu, Yijiong
Published: (2024)
An Effective Framework to Help Large Language Models Handle Numeric-involved Long-context Tasks
by: Yu, Yijiong
Published: (2024)
by: Yu, Yijiong
Published: (2024)
Accelerate Parallelizable Reasoning via Parallel Decoding within One Sequence
by: Yu, Yijiong
Published: (2025)
by: Yu, Yijiong
Published: (2025)
A Topic-aware Comparable Corpus of Chinese Variations
by: Lian, Da-Chen, et al.
Published: (2024)
by: Lian, Da-Chen, et al.
Published: (2024)
ORCHID: A Chinese Debate Corpus for Target-Independent Stance Detection and Argumentative Dialogue Summarization
by: Zhao, Xiutian, et al.
Published: (2024)
by: Zhao, Xiutian, et al.
Published: (2024)
SWAA: Sliding Window Attention Adaptation for Efficient and Quality Preserving Long Context Processing
by: Yu, Yijiong, et al.
Published: (2025)
by: Yu, Yijiong, et al.
Published: (2025)
Do LLMs Really Think Step-by-step In Implicit Reasoning?
by: Yu, Yijiong
Published: (2024)
by: Yu, Yijiong
Published: (2024)
Training With "Paraphrasing the Original Text" Teaches LLM to Better Retrieve in Long-context Tasks
by: Yu, Yijiong, et al.
Published: (2023)
by: Yu, Yijiong, et al.
Published: (2023)
MedFact: A Large-scale Chinese Dataset for Evidence-based Medical Fact-checking of LLM Responses
by: Chen, Tong, et al.
Published: (2025)
by: Chen, Tong, et al.
Published: (2025)
Can AI Write Classical Chinese Poetry like Humans? An Empirical Study Inspired by Turing Test
by: Deng, Zekun, et al.
Published: (2024)
by: Deng, Zekun, et al.
Published: (2024)
COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values
by: P Team, et al.
Published: (2025)
by: P Team, et al.
Published: (2025)
LLM-Detector: Improving AI-Generated Chinese Text Detection with Open-Source LLM Instruction Tuning
by: Wang, Rongsheng, et al.
Published: (2024)
by: Wang, Rongsheng, et al.
Published: (2024)
CMNER: A Chinese Multimodal NER Dataset based on Social Media
by: Ji, Yuanze, et al.
Published: (2024)
by: Ji, Yuanze, et al.
Published: (2024)
NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation
by: Wang, Xiaoyang, et al.
Published: (2021)
by: Wang, Xiaoyang, et al.
Published: (2021)
A Corpus for Named Entity Recognition in Chinese Novels with Multi-genres
by: Zhao, Hanjie, et al.
Published: (2023)
by: Zhao, Hanjie, et al.
Published: (2023)
A Japanese-Chinese Parallel Corpus Using Crowdsourcing for Web Mining
by: Nagata, Masaaki, et al.
Published: (2024)
by: Nagata, Masaaki, et al.
Published: (2024)
SCCD: A Session-based Dataset for Chinese Cyberbullying Detection
by: Yang, Qingpo, et al.
Published: (2025)
by: Yang, Qingpo, et al.
Published: (2025)
C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models
by: Wu, Ping, et al.
Published: (2025)
by: Wu, Ping, et al.
Published: (2025)
C-MTCSD: A Chinese Multi-Turn Conversational Stance Detection Dataset
by: Niu, Fuqiang, et al.
Published: (2025)
by: Niu, Fuqiang, et al.
Published: (2025)
MultiJustice: A Chinese Dataset for Multi-Party, Multi-Charge Legal Prediction
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
by: Wang, Yuxuan, et al.
Published: (2024)
by: Wang, Yuxuan, et al.
Published: (2024)
MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus
by: Du, Yexing, et al.
Published: (2026)
by: Du, Yexing, et al.
Published: (2026)
CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
by: Wu, Chengwei, et al.
Published: (2025)
by: Wu, Chengwei, et al.
Published: (2025)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
by: Zhang, Hengxiang, et al.
Published: (2024)
by: Zhang, Hengxiang, et al.
Published: (2024)
CMNEE: A Large-Scale Document-Level Event Extraction Dataset based on Open-Source Chinese Military News
by: Zhu, Mengna, et al.
Published: (2024)
by: Zhu, Mengna, et al.
Published: (2024)
MCTS: A Multi-Reference Chinese Text Simplification Dataset
by: Chong, Ruining, et al.
Published: (2023)
by: Chong, Ruining, et al.
Published: (2023)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
by: Wang, Yuxia, et al.
Published: (2024)
by: Wang, Yuxia, et al.
Published: (2024)
CTourLLM: Enhancing LLMs with Chinese Tourism Knowledge
by: Wei, Qikai, et al.
Published: (2024)
by: Wei, Qikai, et al.
Published: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
by: Zhou, Chengfeng, et al.
Published: (2025)
by: Zhou, Chengfeng, et al.
Published: (2025)
CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis
by: Xu, Xinzhe, et al.
Published: (2025)
by: Xu, Xinzhe, et al.
Published: (2025)
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
by: Du, Xinrun, et al.
Published: (2024)
by: Du, Xinrun, et al.
Published: (2024)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
by: Zhang, Qian, et al.
Published: (2024)
by: Zhang, Qian, et al.
Published: (2024)
A Training-free LLM-based Approach to General Chinese Character Error Correction
by: Zhou, Houquan, et al.
Published: (2025)
by: Zhou, Houquan, et al.
Published: (2025)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
by: Yu, Ping, et al.
Published: (2024)
by: Yu, Ping, et al.
Published: (2024)
Towards Multimodal Metaphor Understanding: A Chinese Dataset and Model for Metaphor Mapping Identification
by: Zhang, Dongyu, et al.
Published: (2025)
by: Zhang, Dongyu, et al.
Published: (2025)
Similar Items
-
CHisIEC: An Information Extraction Corpus for Ancient Chinese History
by: Tang, Xuemei, et al.
Published: (2024) -
Long-context Language Models Fail in Basic Retrieval Tasks Without Sufficient Reasoning Steps
by: Yu, Yijiong, et al.
Published: (2024) -
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
by: Geng, Xuelong, et al.
Published: (2024) -
Density-aware Soft Context Compression with Semi-Dynamic Compression Ratio
by: Yu, Yijiong, et al.
Published: (2026) -
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
by: Yu, Yijiong, et al.
Published: (2026)