CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Guang, Wang, Liangdong, Li, Jijie, Yu, Yang, Xu, Yao, Chen, Jiabei, Bai, Yu, Liao, Feng, Lin, Yonghua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model
di: Gu, Shuhao, et al.
Pubblicazione: (2024)
di: Gu, Shuhao, et al.
Pubblicazione: (2024)
Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models
di: Li, Jijie, et al.
Pubblicazione: (2025)
di: Li, Jijie, et al.
Pubblicazione: (2025)
CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models
di: Wang, Liangdong, et al.
Pubblicazione: (2024)
di: Wang, Liangdong, et al.
Pubblicazione: (2024)
InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization
di: Wang, Yunan, et al.
Pubblicazione: (2025)
di: Wang, Yunan, et al.
Pubblicazione: (2025)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
di: Yu, Huimu, et al.
Pubblicazione: (2024)
di: Yu, Huimu, et al.
Pubblicazione: (2024)
BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
LLaSA: Large Language and Structured Data Assistant
di: Xu, Yao, et al.
Pubblicazione: (2024)
di: Xu, Yao, et al.
Pubblicazione: (2024)
Large Language Models are In-context Teachers for Knowledge Reasoning
di: Zhao, Jiachen, et al.
Pubblicazione: (2023)
di: Zhao, Jiachen, et al.
Pubblicazione: (2023)
Aquila2 Technical Report
di: Zhang, Bo-Wen, et al.
Pubblicazione: (2024)
di: Zhang, Bo-Wen, et al.
Pubblicazione: (2024)
EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
di: Bae, Kyunghoon, et al.
Pubblicazione: (2025)
di: Bae, Kyunghoon, et al.
Pubblicazione: (2025)
Cross-Domain Bilingual Lexicon Induction via Pretrained Language Models
di: Ding, Qiuyu, et al.
Pubblicazione: (2025)
di: Ding, Qiuyu, et al.
Pubblicazione: (2025)
SeniorTalk: A Chinese Conversation Dataset with Rich Annotations for Super-Aged Seniors
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
IPEval: A Bilingual Intellectual Property Agency Consultation Evaluation Benchmark for Large Language Models
di: Wang, Qiyao, et al.
Pubblicazione: (2024)
di: Wang, Qiyao, et al.
Pubblicazione: (2024)
LLM Reasoning Engine: Specialized Training for Enhanced Mathematical Reasoning
di: Chen, Shuguang, et al.
Pubblicazione: (2024)
di: Chen, Shuguang, et al.
Pubblicazione: (2024)
Binary Neural Networks for Large Language Model: A Survey
di: Liu, Liangdong, et al.
Pubblicazione: (2025)
di: Liu, Liangdong, et al.
Pubblicazione: (2025)
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
di: Shao, Jiandong, et al.
Pubblicazione: (2026)
di: Shao, Jiandong, et al.
Pubblicazione: (2026)
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
di: Yang, Haotong, et al.
Pubblicazione: (2023)
di: Yang, Haotong, et al.
Pubblicazione: (2023)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
di: Wu, Yanan, et al.
Pubblicazione: (2024)
di: Wu, Yanan, et al.
Pubblicazione: (2024)
RARE: Retrieval-Augmented Reasoning Enhancement for Large Language Models
di: Tran, Hieu, et al.
Pubblicazione: (2024)
di: Tran, Hieu, et al.
Pubblicazione: (2024)
S$^4$C: Speculative Sampling with Syntactic and Semantic Coherence for Efficient Inference of Large Language Models
di: He, Tao, et al.
Pubblicazione: (2025)
di: He, Tao, et al.
Pubblicazione: (2025)
Large Language Model-Enhanced Symbolic Reasoning for Knowledge Base Completion
di: He, Qiyuan, et al.
Pubblicazione: (2025)
di: He, Qiyuan, et al.
Pubblicazione: (2025)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
di: Gao, Jian, et al.
Pubblicazione: (2025)
di: Gao, Jian, et al.
Pubblicazione: (2025)
Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models
di: Ruis, Laura, et al.
Pubblicazione: (2024)
di: Ruis, Laura, et al.
Pubblicazione: (2024)
Enhancing Distractor Generation for Multiple-Choice Questions with Retrieval Augmented Pretraining and Knowledge Graph Integration
di: Yu, Han-Cheng, et al.
Pubblicazione: (2024)
di: Yu, Han-Cheng, et al.
Pubblicazione: (2024)
Patience Is The Key to Large Language Model Reasoning
di: Yu, Yijiong
Pubblicazione: (2024)
di: Yu, Yijiong
Pubblicazione: (2024)
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models
di: Yu, Zeping, et al.
Pubblicazione: (2025)
di: Yu, Zeping, et al.
Pubblicazione: (2025)
Enhance Reasoning for Large Language Models in the Game Werewolf
di: Wu, Shuang, et al.
Pubblicazione: (2024)
di: Wu, Shuang, et al.
Pubblicazione: (2024)
Probing Large Language Models in Reasoning and Translating Complex Linguistic Puzzles
di: Lin, Zheng-Lin, et al.
Pubblicazione: (2025)
di: Lin, Zheng-Lin, et al.
Pubblicazione: (2025)
RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine
di: Huang, Jiatan, et al.
Pubblicazione: (2024)
di: Huang, Jiatan, et al.
Pubblicazione: (2024)
Exchange of Perspective Prompting Enhances Reasoning in Large Language Models
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Pretraining Large Language Models with NVFP4
di: NVIDIA, et al.
Pubblicazione: (2025)
di: NVIDIA, et al.
Pubblicazione: (2025)
The Impact of Language Mixing on Bilingual LLM Reasoning
di: Li, Yihao, et al.
Pubblicazione: (2025)
di: Li, Yihao, et al.
Pubblicazione: (2025)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
BAMBINO-LM: (Bilingual-)Human-Inspired Continual Pretraining of BabyLM
di: Shen, Zhewen, et al.
Pubblicazione: (2024)
di: Shen, Zhewen, et al.
Pubblicazione: (2024)
Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised Pretraining
di: Lin, Licong, et al.
Pubblicazione: (2023)
di: Lin, Licong, et al.
Pubblicazione: (2023)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
An Explicit Syllogistic Legal Reasoning Framework for Large Language Models
di: Zhang, Kepu, et al.
Pubblicazione: (2025)
di: Zhang, Kepu, et al.
Pubblicazione: (2025)
Taiyi: A Bilingual Fine-Tuned Large Language Model for Diverse Biomedical Tasks
di: Luo, Ling, et al.
Pubblicazione: (2023)
di: Luo, Ling, et al.
Pubblicazione: (2023)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
di: Fu, Lingyue, et al.
Pubblicazione: (2023)
di: Fu, Lingyue, et al.
Pubblicazione: (2023)
Documenti analoghi
-
ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model
di: Gu, Shuhao, et al.
Pubblicazione: (2024) -
Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models
di: Li, Jijie, et al.
Pubblicazione: (2025) -
CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models
di: Wang, Liangdong, et al.
Pubblicazione: (2024) -
InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization
di: Wang, Yunan, et al.
Pubblicazione: (2025) -
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
di: Yu, Huimu, et al.
Pubblicazione: (2024)