CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Liangdong, Zhang, Bo-Wen, Wu, Chengwei, Zhao, Hanyu, Shi, Xiaofeng, Gu, Shuhao, Li, Jijie, Ma, Quanyue, Pan, TengFei, Liu, Guang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model
by: Gu, Shuhao, et al.
Published: (2024)
by: Gu, Shuhao, et al.
Published: (2024)
CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models
by: Liu, Guang, et al.
Published: (2025)
by: Liu, Guang, et al.
Published: (2025)
SLEEPING-DISCO 9M: A large-scale pre-training dataset for generative music modeling
by: Ahmed, Tawsif, et al.
Published: (2025)
by: Ahmed, Tawsif, et al.
Published: (2025)
Aquila2 Technical Report
by: Zhang, Bo-Wen, et al.
Published: (2024)
by: Zhang, Bo-Wen, et al.
Published: (2024)
Qwen-BIM: developing large language model for BIM-based design with domain-specific benchmark and dataset
by: Lin, Jia-Rui, et al.
Published: (2026)
by: Lin, Jia-Rui, et al.
Published: (2026)
DataCube: A Video Retrieval Platform via Natural Language Semantic Profiling
by: Ju, Yiming, et al.
Published: (2026)
by: Ju, Yiming, et al.
Published: (2026)
InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization
by: Wang, Yunan, et al.
Published: (2025)
by: Wang, Yunan, et al.
Published: (2025)
Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models
by: Li, Jijie, et al.
Published: (2025)
by: Li, Jijie, et al.
Published: (2025)
WizardLM: Empowering large pre-trained language models to follow complex instructions
by: Xu, Can, et al.
Published: (2023)
by: Xu, Can, et al.
Published: (2023)
Bringing legal knowledge to the public by constructing a legal question bank using large-scale pre-trained language model
by: Yuan, Mingruo, et al.
Published: (2025)
by: Yuan, Mingruo, et al.
Published: (2025)
A large-scale dataset for end-to-end table recognition in the wild
by: Yang, Fan, et al.
Published: (2023)
by: Yang, Fan, et al.
Published: (2023)
OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network
by: Zhao, Tiancheng, et al.
Published: (2022)
by: Zhao, Tiancheng, et al.
Published: (2022)
A large-scale evaluation of commonsense knowledge in humans and large language models
by: Nguyen, Tuan Dung, et al.
Published: (2025)
by: Nguyen, Tuan Dung, et al.
Published: (2025)
Mimicking the large-scale structure of the Local Universe. Synthetic pre-labelled galaxies in large-scale structures
by: Alcázar-Laynez, M., et al.
Published: (2026)
by: Alcázar-Laynez, M., et al.
Published: (2026)
An evaluation of Deep Learning based stereo dense matching dataset shift from aerial images and a large scale stereo dataset
by: Wu, Teng, et al.
Published: (2024)
by: Wu, Teng, et al.
Published: (2024)
AquilaMoE: Efficient Training for MoE Models with Scale-Up and Scale-Out Strategies
by: Zhang, Bo-Wen, et al.
Published: (2024)
by: Zhang, Bo-Wen, et al.
Published: (2024)
LargeSHS: A large-scale dataset of music adaptation
by: Tan, Chih-Pin, et al.
Published: (2025)
by: Tan, Chih-Pin, et al.
Published: (2025)
Hyacinth6B: A large language model for Traditional Chinese
by: Song, Chih-Wei, et al.
Published: (2024)
by: Song, Chih-Wei, et al.
Published: (2024)
CENSUS-HWR: a large training dataset for offline handwriting recognition
by: Joshi, Chetan, et al.
Published: (2023)
by: Joshi, Chetan, et al.
Published: (2023)
Beyond designer's knowledge: Generating materials design hypotheses via large language models
by: Liu, Quanliang, et al.
Published: (2024)
by: Liu, Quanliang, et al.
Published: (2024)
Large-scale moral machine experiment on large language models
by: Ahmad, Muhammad Shahrul Zaim bin, et al.
Published: (2024)
by: Ahmad, Muhammad Shahrul Zaim bin, et al.
Published: (2024)
KNOW: Developing large-scale multilingual technologies for language understanding
by: Eneko Agirre
Published: (2009)
by: Eneko Agirre
Published: (2009)
The current status of large language models in summarizing radiology report impressions
by: Hu, Danqing, et al.
Published: (2024)
by: Hu, Danqing, et al.
Published: (2024)
Post-training makes large language models less human-like
by: Binz, Marcel, et al.
Published: (2026)
by: Binz, Marcel, et al.
Published: (2026)
A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models
by: Li, Kunning, et al.
Published: (2025)
by: Li, Kunning, et al.
Published: (2025)
A dataset and benchmark for hospital course summarization with adapted large language models
by: Aali, Asad, et al.
Published: (2024)
by: Aali, Asad, et al.
Published: (2024)
A benchmark multimodal oro-dental dataset for large vision-language models
by: Lv, Haoxin, et al.
Published: (2025)
by: Lv, Haoxin, et al.
Published: (2025)
Automating quantum feature map design via large language models
by: Sakka, Kenya, et al.
Published: (2025)
by: Sakka, Kenya, et al.
Published: (2025)
Fine-tuning large language models for domain adaptation: Exploration of training strategies, scaling, model merging and synergistic capabilities
by: Lu, Wei, et al.
Published: (2024)
by: Lu, Wei, et al.
Published: (2024)
A large-scale nanocrystal database with aligned synthesis and properties enabling generative inverse design
by: Gu, Kai, et al.
Published: (2026)
by: Gu, Kai, et al.
Published: (2026)
GLeMM: A large-scale multilingual dataset for morphological research
by: Nabil, Hathout, et al.
Published: (2026)
by: Nabil, Hathout, et al.
Published: (2026)
A large-scale complexity-graded dataset of neuronal images and annotations
by: Chen, Wu, et al.
Published: (2025)
by: Chen, Wu, et al.
Published: (2025)
MolPILE -- large-scale, diverse dataset for molecular representation learning
by: Adamczyk, Jakub, et al.
Published: (2025)
by: Adamczyk, Jakub, et al.
Published: (2025)
A large-scale image-text dataset benchmark for farmland segmentation
by: Tao, Chao, et al.
Published: (2025)
by: Tao, Chao, et al.
Published: (2025)
MidiCaps: A large-scale MIDI dataset with text captions
by: Melechovsky, Jan, et al.
Published: (2024)
by: Melechovsky, Jan, et al.
Published: (2024)
A general tensor-structured compression scheme for efficient large language models
by: Lu, Ying, et al.
Published: (2026)
by: Lu, Ying, et al.
Published: (2026)
Emergent effects of scaling on the functional hierarchies within large language models
by: Bogdan, Paul C.
Published: (2025)
by: Bogdan, Paul C.
Published: (2025)
ECG-LLM -- training and evaluation of domain-specific large language models for electrocardiography
by: Ahrens, Lara, et al.
Published: (2025)
by: Ahrens, Lara, et al.
Published: (2025)
TAGLAS: An atlas of text-attributed graph datasets in the era of large graph and language models
by: Feng, Jiarui, et al.
Published: (2024)
by: Feng, Jiarui, et al.
Published: (2024)
Question answering system of bridge design specification based on large language model
by: Zhang, Leye, et al.
Published: (2024)
by: Zhang, Leye, et al.
Published: (2024)
Similar Items
-
ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model
by: Gu, Shuhao, et al.
Published: (2024) -
CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models
by: Liu, Guang, et al.
Published: (2025) -
SLEEPING-DISCO 9M: A large-scale pre-training dataset for generative music modeling
by: Ahmed, Tawsif, et al.
Published: (2025) -
Aquila2 Technical Report
by: Zhang, Bo-Wen, et al.
Published: (2024) -
Qwen-BIM: developing large language model for BIM-based design with domain-specific benchmark and dataset
by: Lin, Jia-Rui, et al.
Published: (2026)