Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering
Fuente:
arXiv
Guardado en:
| Autores principales: | Negoita, Vlad, Masala, Mihai, Rebedea, Traian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Legal Judgement Prediction in Romanian with Long Text Encoders
por: Masala, Mihai, et al.
Publicado: (2024)
por: Masala, Mihai, et al.
Publicado: (2024)
"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models
por: Masala, Mihai, et al.
Publicado: (2026)
por: Masala, Mihai, et al.
Publicado: (2026)
OpenLLM-Ro -- Technical Report on Open-source Romanian LLMs
por: Masala, Mihai, et al.
Publicado: (2024)
por: Masala, Mihai, et al.
Publicado: (2024)
"Vorbeşti Româneşte?" A Recipe to Train Powerful Romanian LLMs with English Instructions
por: Masala, Mihai, et al.
Publicado: (2024)
por: Masala, Mihai, et al.
Publicado: (2024)
FuLG: 150B Romanian Corpus for Language Model Pretraining
por: Bădoiu, Vlad-Andrei, et al.
Publicado: (2024)
por: Bădoiu, Vlad-Andrei, et al.
Publicado: (2024)
Unsupervised Extraction of Dialogue Policies from Conversations
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2024)
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2024)
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2025)
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2025)
Aegis2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM Guardrails
por: Ghosh, Shaona, et al.
Publicado: (2025)
por: Ghosh, Shaona, et al.
Publicado: (2025)
Semi-Supervised Learning for Large Language Models Safety and Content Moderation
por: Dinuta, Eduard Stefan, et al.
Publicado: (2025)
por: Dinuta, Eduard Stefan, et al.
Publicado: (2025)
Towards Inference-time Category-wise Safety Steering for Large Language Models
por: Bhattacharjee, Amrita, et al.
Publicado: (2024)
por: Bhattacharjee, Amrita, et al.
Publicado: (2024)
Training a General Purpose Automated Red Teaming Model
por: Padmakumar, Aishwarya, et al.
Publicado: (2026)
por: Padmakumar, Aishwarya, et al.
Publicado: (2026)
LLMic: Romanian Foundation Language Model
por: Bădoiu, Vlad-Andrei, et al.
Publicado: (2025)
por: Bădoiu, Vlad-Andrei, et al.
Publicado: (2025)
Towards Zero-Shot & Explainable Video Description by Reasoning over Graphs of Events in Space and Time
por: Masala, Mihai, et al.
Publicado: (2025)
por: Masala, Mihai, et al.
Publicado: (2025)
From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach
por: Masala, Mihai, et al.
Publicado: (2025)
por: Masala, Mihai, et al.
Publicado: (2025)
The Data-Quality Illusion: Rethinking Classifier-Based Quality Filtering for LLM Pretraining
por: Saada, Thiziri Nait, et al.
Publicado: (2025)
por: Saada, Thiziri Nait, et al.
Publicado: (2025)
SmellBench: Evaluating LLM Agents on Architectural Code Smell Repair
por: Dinu, Ion George, et al.
Publicado: (2026)
por: Dinu, Ion George, et al.
Publicado: (2026)
GIT-CXR: End-to-End Transformer for Chest X-Ray Report Generation
por: Sîrbu, Iustin, et al.
Publicado: (2025)
por: Sîrbu, Iustin, et al.
Publicado: (2025)
CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2024)
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2024)
QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining
por: Liu, Fengze, et al.
Publicado: (2025)
por: Liu, Fengze, et al.
Publicado: (2025)
Neural Grammatical Error Correction for Romanian
por: Cotet, Teodor-Mihai, et al.
Publicado: (2026)
por: Cotet, Teodor-Mihai, et al.
Publicado: (2026)
Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies
por: Varshney, Prasoon, et al.
Publicado: (2025)
por: Varshney, Prasoon, et al.
Publicado: (2025)
HistNERo: Historical Named Entity Recognition for the Romanian Language
por: Avram, Andrei-Marius, et al.
Publicado: (2024)
por: Avram, Andrei-Marius, et al.
Publicado: (2024)
Enhancing Romanian Offensive Language Detection through Knowledge Distillation, Multi-Task Learning, and Data Augmentation
por: Matei, Vlad-Cristian, et al.
Publicado: (2024)
por: Matei, Vlad-Cristian, et al.
Publicado: (2024)
Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
por: Nadas, Mihai, et al.
Publicado: (2025)
por: Nadas, Mihai, et al.
Publicado: (2025)
MultiMatch: Multihead Consistency Regularization Matching for Semi-Supervised Text Classification
por: Sirbu, Iustin, et al.
Publicado: (2025)
por: Sirbu, Iustin, et al.
Publicado: (2025)
Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
por: Troshin, Sergey, et al.
Publicado: (2025)
por: Troshin, Sergey, et al.
Publicado: (2025)
Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents
por: Fujinuma, Yoshinari, et al.
Publicado: (2026)
por: Fujinuma, Yoshinari, et al.
Publicado: (2026)
RoIt-XMASA: Multi-Domain Multilingual Sentiment Analysis Dataset for Romanian and Italian
por: Avram, Andrei-Marius, et al.
Publicado: (2026)
por: Avram, Andrei-Marius, et al.
Publicado: (2026)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
por: Huang, Han, et al.
Publicado: (2024)
por: Huang, Han, et al.
Publicado: (2024)
Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data
por: Wang, Yudong, et al.
Publicado: (2025)
por: Wang, Yudong, et al.
Publicado: (2025)
Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
por: Ali, Mehdi, et al.
Publicado: (2025)
por: Ali, Mehdi, et al.
Publicado: (2025)
RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams
por: Man, Andrei Vlad, et al.
Publicado: (2025)
por: Man, Andrei Vlad, et al.
Publicado: (2025)
IFDID: Information Filter upon Diversity-Improved Decoding for Diversity-Faithfulness Tradeoff in NLG
por: Meng, Han, et al.
Publicado: (2022)
por: Meng, Han, et al.
Publicado: (2022)
TF3-RO-50M: Training Compact Romanian Language Models from Scratch on Synthetic Moral Microfiction
por: Nadas, Mihai Dan, et al.
Publicado: (2026)
por: Nadas, Mihai Dan, et al.
Publicado: (2026)
Building Large-Scale English-Romanian Literary Translation Resources with Open Models
por: Nadas, Mihai, et al.
Publicado: (2025)
por: Nadas, Mihai, et al.
Publicado: (2025)
Improving Pretraining Data Using Perplexity Correlations
por: Thrush, Tristan, et al.
Publicado: (2024)
por: Thrush, Tristan, et al.
Publicado: (2024)
AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters
por: Lucy, Li, et al.
Publicado: (2024)
por: Lucy, Li, et al.
Publicado: (2024)
Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning
por: Cudlenco, Nicolae, et al.
Publicado: (2026)
por: Cudlenco, Nicolae, et al.
Publicado: (2026)
What Are They Filtering Out? An Experimental Benchmark of Filtering Strategies for Harm Reduction in Pretraining Datasets
por: Stranisci, Marco Antonio, et al.
Publicado: (2025)
por: Stranisci, Marco Antonio, et al.
Publicado: (2025)
Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining
por: Fan, Dongyang, et al.
Publicado: (2025)
por: Fan, Dongyang, et al.
Publicado: (2025)
Ejemplares similares
-
Improving Legal Judgement Prediction in Romanian with Long Text Encoders
por: Masala, Mihai, et al.
Publicado: (2024) -
"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models
por: Masala, Mihai, et al.
Publicado: (2026) -
OpenLLM-Ro -- Technical Report on Open-source Romanian LLMs
por: Masala, Mihai, et al.
Publicado: (2024) -
"Vorbeşti Româneşte?" A Recipe to Train Powerful Romanian LLMs with English Instructions
por: Masala, Mihai, et al.
Publicado: (2024) -
FuLG: 150B Romanian Corpus for Language Model Pretraining
por: Bădoiu, Vlad-Andrei, et al.
Publicado: (2024)