GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | van Oort, Jesse, Brinkkemper, Frank, de Graaf, Erik, Vanroy, Bram, Lensink, Saskia |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fietje: An open, efficient LLM for Dutch
par: Vanroy, Bram
Publié: (2024)
par: Vanroy, Bram
Publié: (2024)
GEITje 7B Ultra: A Conversational Model for Dutch
par: Vanroy, Bram
Publié: (2024)
par: Vanroy, Bram
Publié: (2024)
Everyone deserves their voice to be heard: Analyzing Predictive Gender Bias in ASR Models Applied to Dutch Speech Data
par: Raes, Rik, et autres
Publié: (2024)
par: Raes, Rik, et autres
Publié: (2024)
MTEB-NL and E5-NL: Embedding Benchmark and Models for Dutch
par: Banar, Nikolay, et autres
Publié: (2025)
par: Banar, Nikolay, et autres
Publié: (2025)
Biomedical Entity Linking for Dutch: Fine-tuning a Self-alignment BERT Model on an Automatically Generated Wikipedia Corpus
par: Hartendorp, Fons, et autres
Publié: (2024)
par: Hartendorp, Fons, et autres
Publié: (2024)
BEIR-NL: Zero-shot Information Retrieval Benchmark for the Dutch Language
par: Banar, Nikolay, et autres
Publié: (2024)
par: Banar, Nikolay, et autres
Publié: (2024)
PhoGPT: Generative Pre-training for Vietnamese
par: Nguyen, Dat Quoc, et autres
Publié: (2023)
par: Nguyen, Dat Quoc, et autres
Publié: (2023)
Enhancing Summarization Performance through Transformer-Based Prompt Engineering in Automated Medical Reporting
par: van Zandvoort, Daphne, et autres
Publié: (2023)
par: van Zandvoort, Daphne, et autres
Publié: (2023)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
par: Shekoufandeh, Golshid, et autres
Publié: (2025)
par: Shekoufandeh, Golshid, et autres
Publié: (2025)
Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training
par: Langlais, Pierre-Carl, et autres
Publié: (2025)
par: Langlais, Pierre-Carl, et autres
Publié: (2025)
RecGPT: Generative Pre-training for Text-based Recommendation
par: Ngo, Hoang, et autres
Publié: (2024)
par: Ngo, Hoang, et autres
Publié: (2024)
Comparative Experimentation of Accuracy Metrics in Automated Medical Reporting: The Case of Otitis Consultations
par: Faber, Wouter, et autres
Publié: (2023)
par: Faber, Wouter, et autres
Publié: (2023)
Hybrid-NL2SVA: Integrating RAG and Finetuning for LLM-based NL2SVA
par: Xiao, Weihua, et autres
Publié: (2025)
par: Xiao, Weihua, et autres
Publié: (2025)
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
par: Yadav, Sumit, et autres
Publié: (2025)
par: Yadav, Sumit, et autres
Publié: (2025)
Pre-training and Diagnosing Knowledge Base Completion Models
par: Kocijan, Vid, et autres
Publié: (2024)
par: Kocijan, Vid, et autres
Publié: (2024)
TransGPT: Multi-modal Generative Pre-trained Transformer for Transportation
par: Wang, Peng, et autres
Publié: (2024)
par: Wang, Peng, et autres
Publié: (2024)
The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text
par: Kandpal, Nikhil, et autres
Publié: (2025)
par: Kandpal, Nikhil, et autres
Publié: (2025)
Permissive-Washing in the Open AI Supply Chain: A Large-Scale Audit of License Integrity
par: Jewitt, James, et autres
Publié: (2026)
par: Jewitt, James, et autres
Publié: (2026)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
par: Joshi, Raviraj, et autres
Publié: (2024)
par: Joshi, Raviraj, et autres
Publié: (2024)
Summarizing long regulatory documents with a multi-step pipeline
par: Sie, Mika, et autres
Publié: (2024)
par: Sie, Mika, et autres
Publié: (2024)
Scaling LLM Pre-training with Vocabulary Curriculum
par: Yu, Fangyuan
Publié: (2025)
par: Yu, Fangyuan
Publié: (2025)
LicenseGPT: A Fine-tuned Foundation Model for Publicly Available Dataset License Compliance
par: Tan, Jingwen, et autres
Publié: (2024)
par: Tan, Jingwen, et autres
Publié: (2024)
Phonological Neighbourhood Density in Dutch Verbs: From Classification to Corpus Annotation
par: Zimianiti, Eleni, et autres
Publié: (2025)
par: Zimianiti, Eleni, et autres
Publié: (2025)
QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation
par: Min, Dehai, et autres
Publié: (2025)
par: Min, Dehai, et autres
Publié: (2025)
NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions
par: Hou, Shizheng, et autres
Publié: (2026)
par: Hou, Shizheng, et autres
Publié: (2026)
GPTEval: A Survey on Assessments of ChatGPT and GPT-4
par: Mao, Rui, et autres
Publié: (2023)
par: Mao, Rui, et autres
Publié: (2023)
NITP: Next Implicit Token Prediction for LLM Pre-training
par: Zhang, Xiangdong, et autres
Publié: (2026)
par: Zhang, Xiangdong, et autres
Publié: (2026)
Dutch CrowS-Pairs: Adapting a Challenge Dataset for Measuring Social Biases in Language Models for Dutch
par: Strazda, Elza, et autres
Publié: (2025)
par: Strazda, Elza, et autres
Publié: (2025)
Evaluating LLMs and Pre-trained Models for Text Summarization Across Diverse Datasets
par: Rehman, Tohida, et autres
Publié: (2025)
par: Rehman, Tohida, et autres
Publié: (2025)
SpikeGPT: Generative Pre-trained Language Model with Spiking Neural Networks
par: Zhu, Rui-Jie, et autres
Publié: (2023)
par: Zhu, Rui-Jie, et autres
Publié: (2023)
OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training
par: Yu, Yijiong, et autres
Publié: (2025)
par: Yu, Yijiong, et autres
Publié: (2025)
More on Maximally Permissive Similarity Control of Discrete Event Systems
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
SparseLLM: Towards Global Pruning for Pre-trained Language Models
par: Bai, Guangji, et autres
Publié: (2024)
par: Bai, Guangji, et autres
Publié: (2024)
MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
par: Nguyen, Huu, et autres
Publié: (2025)
par: Nguyen, Huu, et autres
Publié: (2025)
Variance Control via Weight Rescaling in LLM Pre-training
par: Owen, Louis, et autres
Publié: (2025)
par: Owen, Louis, et autres
Publié: (2025)
FD-NL2SQL: Feedback-Driven Clinical NL2SQL that Improves with Use
par: Chowdhury, Suparno Roy, et autres
Publié: (2026)
par: Chowdhury, Suparno Roy, et autres
Publié: (2026)
Granting GPT-4 License and Opportunity: Enhancing Accuracy and Confidence Estimation for Few-Shot Event Detection
par: Fincke, Steven, et autres
Publié: (2024)
par: Fincke, Steven, et autres
Publié: (2024)
Enhancing LLM Language Adaption through Cross-lingual In-Context Pre-training
par: Wu, Linjuan, et autres
Publié: (2025)
par: Wu, Linjuan, et autres
Publié: (2025)
Beyond Public Access in LLM Pre-Training Data
par: Rosenblat, Sruly, et autres
Publié: (2025)
par: Rosenblat, Sruly, et autres
Publié: (2025)
Tibyan Corpus: Balanced and Comprehensive Error Coverage Corpus Using ChatGPT for Arabic Grammatical Error Correction
par: Alrehili, Ahlam, et autres
Publié: (2024)
par: Alrehili, Ahlam, et autres
Publié: (2024)
Documents similaires
-
Fietje: An open, efficient LLM for Dutch
par: Vanroy, Bram
Publié: (2024) -
GEITje 7B Ultra: A Conversational Model for Dutch
par: Vanroy, Bram
Publié: (2024) -
Everyone deserves their voice to be heard: Analyzing Predictive Gender Bias in ASR Models Applied to Dutch Speech Data
par: Raes, Rik, et autres
Publié: (2024) -
MTEB-NL and E5-NL: Embedding Benchmark and Models for Dutch
par: Banar, Nikolay, et autres
Publié: (2025) -
Biomedical Entity Linking for Dutch: Fine-tuning a Self-alignment BERT Model on an Automatically Generated Wikipedia Corpus
par: Hartendorp, Fons, et autres
Publié: (2024)