CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wang, Liangdong, Zhang, Bo-Wen, Wu, Chengwei, Zhao, Hanyu, Shi, Xiaofeng, Gu, Shuhao, Li, Jijie, Ma, Quanyue, Pan, TengFei, Liu, Guang
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!