TF3-RO-50M: Training Compact Romanian Language Models from Scratch on Synthetic Moral Microfiction
Fuente:
arXiv
Salvato in:
| Autori principali: | Nadas, Mihai Dan, Diosan, Laura, Tomescu, Andreea, Piscoran, Andrei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
Building Large-Scale English-Romanian Literary Translation Resources with Open Models
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
Synthetic Data Generation Using Large Language Models: Advances in Text and Code
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
LLMic: Romanian Foundation Language Model
di: Bădoiu, Vlad-Andrei, et al.
Pubblicazione: (2025)
di: Bădoiu, Vlad-Andrei, et al.
Pubblicazione: (2025)
"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models
di: Masala, Mihai, et al.
Pubblicazione: (2026)
di: Masala, Mihai, et al.
Pubblicazione: (2026)
FuLG: 150B Romanian Corpus for Language Model Pretraining
di: Bădoiu, Vlad-Andrei, et al.
Pubblicazione: (2024)
di: Bădoiu, Vlad-Andrei, et al.
Pubblicazione: (2024)
HistNERo: Historical Named Entity Recognition for the Romanian Language
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2024)
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2024)
RELATE: A Modern Processing Platform for Romanian Language
di: Păiş, Vasile, et al.
Pubblicazione: (2024)
di: Păiş, Vasile, et al.
Pubblicazione: (2024)
RoQLlama: A Lightweight Romanian Adapted Language Model
di: Dima, George-Andrei, et al.
Pubblicazione: (2024)
di: Dima, George-Andrei, et al.
Pubblicazione: (2024)
"Vorbeşti Româneşte?" A Recipe to Train Powerful Romanian LLMs with English Instructions
di: Masala, Mihai, et al.
Pubblicazione: (2024)
di: Masala, Mihai, et al.
Pubblicazione: (2024)
Neural Grammatical Error Correction for Romanian
di: Cotet, Teodor-Mihai, et al.
Pubblicazione: (2026)
di: Cotet, Teodor-Mihai, et al.
Pubblicazione: (2026)
Can Artificial Intelligence Write Like Borges? An Evaluation Protocol for Spanish Microfiction
di: Manzanarez, Gerardo Aleman, et al.
Pubblicazione: (2025)
di: Manzanarez, Gerardo Aleman, et al.
Pubblicazione: (2025)
Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
Value-Aware Numerical Representations for Transformer Language Models
di: Dutulescu, Andreea, et al.
Pubblicazione: (2026)
di: Dutulescu, Andreea, et al.
Pubblicazione: (2026)
PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch
di: Yin, Shangjian, et al.
Pubblicazione: (2025)
di: Yin, Shangjian, et al.
Pubblicazione: (2025)
Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models
di: Dima, George-Andrei, et al.
Pubblicazione: (2025)
di: Dima, George-Andrei, et al.
Pubblicazione: (2025)
RO-N3WS: Enhancing Generalization in Low-Resource ASR with Diverse Romanian Speech Benchmarks
di: Diaconu, Alexandra, et al.
Pubblicazione: (2026)
di: Diaconu, Alexandra, et al.
Pubblicazione: (2026)
Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering
di: Negoita, Vlad, et al.
Pubblicazione: (2025)
di: Negoita, Vlad, et al.
Pubblicazione: (2025)
F5-TTS-RO: Extending F5-TTS to Romanian TTS via Lightweight Input Adaptation
di: Chivereanu, Radu-Gabriel, et al.
Pubblicazione: (2025)
di: Chivereanu, Radu-Gabriel, et al.
Pubblicazione: (2025)
MuSaRoNews: A Multidomain, Multimodal Satire Dataset from Romanian News Articles
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
LLäMmlein: Transparent, Compact and Competitive German-Only Language Models from Scratch
di: Pfister, Jan, et al.
Pubblicazione: (2024)
di: Pfister, Jan, et al.
Pubblicazione: (2024)
Improving Legal Judgement Prediction in Romanian with Long Text Encoders
di: Masala, Mihai, et al.
Pubblicazione: (2024)
di: Masala, Mihai, et al.
Pubblicazione: (2024)
OpenLLM-Ro -- Technical Report on Open-source Romanian LLMs
di: Masala, Mihai, et al.
Pubblicazione: (2024)
di: Masala, Mihai, et al.
Pubblicazione: (2024)
A Retrieval-Based Approach to Medical Procedure Matching in Romanian
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
SozKZ: Training Efficient Small Language Models for Kazakh from Scratch
di: Tukenov, Saken
Pubblicazione: (2026)
di: Tukenov, Saken
Pubblicazione: (2026)
A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian
di: Rogoz, Ana-Cristina, et al.
Pubblicazione: (2025)
di: Rogoz, Ana-Cristina, et al.
Pubblicazione: (2025)
RoLargeSum: A Large Dialect-Aware Romanian News Dataset for Summary, Headline, and Keyword Generation
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2024)
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2024)
RoIt-XMASA: Multi-Domain Multilingual Sentiment Analysis Dataset for Romanian and Italian
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2026)
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2026)
MoRoVoc: A Large Dataset for Geographical Variation Identification of the Spoken Romanian Language
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2025)
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2025)
Training Language Models with homotokens Leads to Delayed Overfitting
di: Cosma, Adrian, et al.
Pubblicazione: (2026)
di: Cosma, Adrian, et al.
Pubblicazione: (2026)
SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain
di: Uğur, Özgür, et al.
Pubblicazione: (2026)
di: Uğur, Özgür, et al.
Pubblicazione: (2026)
WILDCHAT-50M: A Deep Dive Into the Role of Synthetic Data in Post-Training
di: Feuer, Benjamin, et al.
Pubblicazione: (2025)
di: Feuer, Benjamin, et al.
Pubblicazione: (2025)
Dr.Copilot: A Multi-Agent Prompt Optimized Assistant for Improving Patient-Doctor Communication in Romanian
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
Building Dialogue Understanding Models for Low-resource Language Indonesian from Scratch
di: Di, Donglin, et al.
Pubblicazione: (2024)
di: Di, Donglin, et al.
Pubblicazione: (2024)
The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text
di: Guo, Yanzhu, et al.
Pubblicazione: (2023)
di: Guo, Yanzhu, et al.
Pubblicazione: (2023)
On the Diversity of Synthetic Data and its Impact on Training Large Language Models
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
Synthetic Dataset for Evaluating Complex Compositional Knowledge for Natural Language Inference
di: Akoju, Sushma Anand, et al.
Pubblicazione: (2023)
di: Akoju, Sushma Anand, et al.
Pubblicazione: (2023)
Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data
di: Guo, Xu, et al.
Pubblicazione: (2026)
di: Guo, Xu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models
di: Nadas, Mihai, et al.
Pubblicazione: (2025) -
Building Large-Scale English-Romanian Literary Translation Resources with Open Models
di: Nadas, Mihai, et al.
Pubblicazione: (2025) -
Synthetic Data Generation Using Large Language Models: Advances in Text and Code
di: Nadas, Mihai, et al.
Pubblicazione: (2025) -
Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
di: Nadas, Mihai, et al.
Pubblicazione: (2025) -
LLMic: Romanian Foundation Language Model
di: Bădoiu, Vlad-Andrei, et al.
Pubblicazione: (2025)