Saved in:
| Main Authors: | Plotnikov, Nikolay, Antonov, Alexander |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2407.11982 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
No One-Size-Fits-All: Building Systems For Translation to Bashkir, Kazakh, Kyrgyz, Tatar and Chuvash Using Synthetic And Original Data
by: Karpov, Dmitry
Published: (2026)
by: Karpov, Dmitry
Published: (2026)
EmoBench-UA: A Benchmark Dataset for Emotion Detection in Ukrainian
by: Dementieva, Daryna, et al.
Published: (2025)
by: Dementieva, Daryna, et al.
Published: (2025)
MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages
by: Dementieva, Daryna, et al.
Published: (2024)
by: Dementieva, Daryna, et al.
Published: (2024)
Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
by: Gao, Xin, et al.
Published: (2025)
by: Gao, Xin, et al.
Published: (2025)
Lightweight Latent Reasoning for Narrative Tasks
by: Gurung, Alexander, et al.
Published: (2025)
by: Gurung, Alexander, et al.
Published: (2025)
KazQAD: Kazakh Open-Domain Question Answering Dataset
by: Yeshpanov, Rustem, et al.
Published: (2024)
by: Yeshpanov, Rustem, et al.
Published: (2024)
OpenNER 1.0: Standardized Open-Access Named Entity Recognition Datasets in 50+ Languages
by: Palen-Michel, Chester, et al.
Published: (2024)
by: Palen-Michel, Chester, et al.
Published: (2024)
PARROT: An Open Multilingual Radiology Reports Dataset
by: Guellec, Bastien Le, et al.
Published: (2025)
by: Guellec, Bastien Le, et al.
Published: (2025)
Evaluating Text Style Transfer: A Nine-Language Benchmark for Text Detoxification
by: Protasov, Vitaly, et al.
Published: (2025)
by: Protasov, Vitaly, et al.
Published: (2025)
Datasets, Documents, and Repetitions: The Practicalities of Unequal Data Quality
by: Fang, Alex, et al.
Published: (2025)
by: Fang, Alex, et al.
Published: (2025)
Enabling ASR for Low-Resource Languages: A Comprehensive Dataset Creation Approach
by: Yeroyan, Ara, et al.
Published: (2024)
by: Yeroyan, Ara, et al.
Published: (2024)
MetaphorShare: A Dynamic Collaborative Repository of Open Metaphor Datasets
by: Boisson, Joanne, et al.
Published: (2024)
by: Boisson, Joanne, et al.
Published: (2024)
OpenPI2.0: An Improved Dataset for Entity Tracking in Texts
by: Zhang, Li, et al.
Published: (2023)
by: Zhang, Li, et al.
Published: (2023)
OasisSimp: An Open-source Asian-English Sentence Simplification Dataset
by: Liu, Hannah, et al.
Published: (2026)
by: Liu, Hannah, et al.
Published: (2026)
Estimating Text Temperature with Language Models
by: Mikhaylovskiy, Nikolay
Published: (2026)
by: Mikhaylovskiy, Nikolay
Published: (2026)
OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report
by: Fedorova, Mariia, et al.
Published: (2026)
by: Fedorova, Mariia, et al.
Published: (2026)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
by: Zhang, Hanning, et al.
Published: (2025)
by: Zhang, Hanning, et al.
Published: (2025)
The Evolution of Darija Open Dataset: Introducing Version 2
by: Outchakoucht, Aissam, et al.
Published: (2024)
by: Outchakoucht, Aissam, et al.
Published: (2024)
DCAD-2000: A Multilingual Dataset across 2000+ Languages with Data Cleaning as Anomaly Detection
by: Shen, Yingli, et al.
Published: (2025)
by: Shen, Yingli, et al.
Published: (2025)
CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset
by: Libovický, Jindřich, et al.
Published: (2025)
by: Libovický, Jindřich, et al.
Published: (2025)
OpenChat: Advancing Open-source Language Models with Mixed-Quality Data
by: Wang, Guan, et al.
Published: (2023)
by: Wang, Guan, et al.
Published: (2023)
Data, Data Everywhere: A Guide for Pretraining Dataset Construction
by: Parmar, Jupinder, et al.
Published: (2024)
by: Parmar, Jupinder, et al.
Published: (2024)
Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
Zyda: A 1.3T Dataset for Open Language Modeling
by: Tokpanov, Yury, et al.
Published: (2024)
by: Tokpanov, Yury, et al.
Published: (2024)
RedPajama: an Open Dataset for Training Large Language Models
by: Weber, Maurice, et al.
Published: (2024)
by: Weber, Maurice, et al.
Published: (2024)
iLSU-T: an Open Dataset for Uruguayan Sign Language Translation
by: Stassi, Ariel E., et al.
Published: (2025)
by: Stassi, Ariel E., et al.
Published: (2025)
UltraLink: An Open-Source Knowledge-Enhanced Multilingual Supervised Fine-tuning Dataset
by: Wang, Haoyu, et al.
Published: (2024)
by: Wang, Haoyu, et al.
Published: (2024)
Eye-Tracking-while-Reading: A Living Survey of Datasets with Open Library Support
by: Jakobi, Deborah N., et al.
Published: (2026)
by: Jakobi, Deborah N., et al.
Published: (2026)
Towards Best Practices for Open Datasets for LLM Training
by: Baack, Stefan, et al.
Published: (2025)
by: Baack, Stefan, et al.
Published: (2025)
DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs
by: Ru, Jinghan, et al.
Published: (2026)
by: Ru, Jinghan, et al.
Published: (2026)
WanJuan-CC: A Safe and High-Quality Open-sourced English Webtext Dataset
by: Qiu, Jiantao, et al.
Published: (2024)
by: Qiu, Jiantao, et al.
Published: (2024)
OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training
by: Yu, Yijiong, et al.
Published: (2025)
by: Yu, Yijiong, et al.
Published: (2025)
EVENT5Ws: A Large Dataset for Open-Domain Event Extraction from Documents
by: Sharma, Praval, et al.
Published: (2026)
by: Sharma, Praval, et al.
Published: (2026)
A Dataset of Open-Domain Question Answering with Multiple-Span Answers
by: Luo, Zhiyi, et al.
Published: (2024)
by: Luo, Zhiyi, et al.
Published: (2024)
Better Synthetic Data by Retrieving and Transforming Existing Datasets
by: Gandhi, Saumya, et al.
Published: (2024)
by: Gandhi, Saumya, et al.
Published: (2024)
Data Checklist: On Unit-Testing Datasets with Usable Information
by: Zhang, Heidi C., et al.
Published: (2024)
by: Zhang, Heidi C., et al.
Published: (2024)
ACADATA: Parallel Dataset of Academic Data for Machine Translation
by: Lacunza, Iñaki, et al.
Published: (2025)
by: Lacunza, Iñaki, et al.
Published: (2025)
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
by: Dekoninck, Jasper, et al.
Published: (2025)
by: Dekoninck, Jasper, et al.
Published: (2025)
TIM: A Large-Scale Dataset and large Timeline Intelligence Model for Open-domain Timeline Summarization
by: Hu, Chuanrui, et al.
Published: (2025)
by: Hu, Chuanrui, et al.
Published: (2025)
Multilingual Substitution-based Word Sense Induction
by: Kokosinskii, Denis, et al.
Published: (2024)
by: Kokosinskii, Denis, et al.
Published: (2024)
Similar Items
-
No One-Size-Fits-All: Building Systems For Translation to Bashkir, Kazakh, Kyrgyz, Tatar and Chuvash Using Synthetic And Original Data
by: Karpov, Dmitry
Published: (2026) -
EmoBench-UA: A Benchmark Dataset for Emotion Detection in Ukrainian
by: Dementieva, Daryna, et al.
Published: (2025) -
MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages
by: Dementieva, Daryna, et al.
Published: (2024) -
Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
by: Gao, Xin, et al.
Published: (2025) -
Lightweight Latent Reasoning for Narrative Tasks
by: Gurung, Alexander, et al.
Published: (2025)