New Textual Corpora for Serbian Language Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Škorić, Mihailo, Janković, Nikola |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Wiki Dumps to Training Corpora: South Slavic Case
by: Škorić, Mihailo, et al.
Published: (2026)
by: Škorić, Mihailo, et al.
Published: (2026)
Novi jezički modeli za srpski jezik
by: Škorić, Mihailo
Published: (2024)
by: Škorić, Mihailo
Published: (2024)
ParlaSpeech 3.0: Richly Annotated Spoken Parliamentary Corpora of Croatian, Czech, Polish, and Serbian
by: Ljubešić, Nikola, et al.
Published: (2025)
by: Ljubešić, Nikola, et al.
Published: (2025)
CLASSLA-web: Comparable Web Corpora of South Slavic Languages Enriched with Linguistic and Genre Annotation
by: Ljubešić, Nikola, et al.
Published: (2024)
by: Ljubešić, Nikola, et al.
Published: (2024)
Multilingual transformer and BERTopic for short text topic modeling: The case of Serbian
by: Medvecki, Darija, et al.
Published: (2024)
by: Medvecki, Darija, et al.
Published: (2024)
The Growing Gains and Pains of Iterative Web Corpora Crawling: Insights from South Slavic CLASSLA-web 2.0 Corpora
by: Pungeršek, Taja Kuzman, et al.
Published: (2026)
by: Pungeršek, Taja Kuzman, et al.
Published: (2026)
Do Language Models Care About Text Quality? Evaluating Web-Crawled Corpora Across 11 Languages
by: van Noord, Rik, et al.
Published: (2024)
by: van Noord, Rik, et al.
Published: (2024)
From Outliers to Topics in Language Models: Anticipating Trends in News Corpora
by: Zve, Evangelia, et al.
Published: (2025)
by: Zve, Evangelia, et al.
Published: (2025)
Between Text and Knowledge Graphs: A Knowledge-Aligned Serbian QA Dataset
by: Stanković, Ranka, et al.
Published: (2026)
by: Stanković, Ranka, et al.
Published: (2026)
Bias in News Summarization: Measures, Pitfalls and Corpora
by: Steen, Julius, et al.
Published: (2023)
by: Steen, Julius, et al.
Published: (2023)
Comparable Corpora: Opportunities for New Research Directions
by: Church, Kenneth
Published: (2025)
by: Church, Kenneth
Published: (2025)
From Data Scarcity to Data Care: Reimagining Language Technologies for Serbian and other Low-Resource Languages
by: Ubois, Smiljana Antonijevic
Published: (2025)
by: Ubois, Smiljana Antonijevic
Published: (2025)
Synthetic Dataset Creation and Fine-Tuning of Transformer Models for Question Answering in Serbian
by: Cvetanović, Aleksa, et al.
Published: (2024)
by: Cvetanović, Aleksa, et al.
Published: (2024)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
by: Lin, Peiqin, et al.
Published: (2024)
by: Lin, Peiqin, et al.
Published: (2024)
Leveraging Large Language Models to Measure Gender Representation Bias in Gendered Language Corpora
by: Derner, Erik, et al.
Published: (2024)
by: Derner, Erik, et al.
Published: (2024)
EgyBERT: A Large Language Model Pretrained on Egyptian Dialect Corpora
by: Qarah, Faisal
Published: (2024)
by: Qarah, Faisal
Published: (2024)
Data Caricatures: On the Representation of African American Language in Pretraining Corpora
by: Deas, Nicholas, et al.
Published: (2025)
by: Deas, Nicholas, et al.
Published: (2025)
A Survey on Multilingual Large Language Models: Corpora, Alignment, and Bias
by: Xu, Yuemei, et al.
Published: (2024)
by: Xu, Yuemei, et al.
Published: (2024)
Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora
by: Majurski, Michael, et al.
Published: (2025)
by: Majurski, Michael, et al.
Published: (2025)
Exploring Large Language Models in Healthcare: Insights into Corpora Sources, Customization Strategies, and Evaluation Metrics
by: Yang, Shuqi, et al.
Published: (2025)
by: Yang, Shuqi, et al.
Published: (2025)
Reap the Wild Wind: Detecting Media Storms in Large-Scale News Corpora
by: Markus, Dror K., et al.
Published: (2024)
by: Markus, Dror K., et al.
Published: (2024)
SaudiBERT: A Large Language Model Pretrained on Saudi Dialect Corpora
by: Qarah, Faisal
Published: (2024)
by: Qarah, Faisal
Published: (2024)
Efficient Tuning and Inference for Large Language Models on Textual Graphs
by: Zhu, Yun, et al.
Published: (2024)
by: Zhu, Yun, et al.
Published: (2024)
Adam's Law: Textual Frequency Law on Large Language Models
by: Lu, Hongyuan Adam, et al.
Published: (2026)
by: Lu, Hongyuan Adam, et al.
Published: (2026)
A Review of the Challenges with Massive Web-mined Corpora Used in Large Language Models Pre-Training
by: Perełkiewicz, Michał, et al.
Published: (2024)
by: Perełkiewicz, Michał, et al.
Published: (2024)
Validating and Exploring Large Geographic Corpora
by: Dunn, Jonathan
Published: (2024)
by: Dunn, Jonathan
Published: (2024)
Textual Aesthetics in Large Language Models
by: Jiang, Lingjie, et al.
Published: (2024)
by: Jiang, Lingjie, et al.
Published: (2024)
Steering Large Language Models between Code Execution and Textual Reasoning
by: Chen, Yongchao, et al.
Published: (2024)
by: Chen, Yongchao, et al.
Published: (2024)
Identifying Emerging Concepts in Large Corpora
by: Ma, Sibo, et al.
Published: (2025)
by: Ma, Sibo, et al.
Published: (2025)
Empowering Large Language Models for Textual Data Augmentation
by: Li, Yichuan, et al.
Published: (2024)
by: Li, Yichuan, et al.
Published: (2024)
Overcoming Data Scarcity in Generative Language Modelling for Low-Resource Languages: A Systematic Review
by: McGiff, Josh, et al.
Published: (2025)
by: McGiff, Josh, et al.
Published: (2025)
Test-Time Alignment for Large Language Models via Textual Model Predictive Control
by: Wang, Kuang-Da, et al.
Published: (2025)
by: Wang, Kuang-Da, et al.
Published: (2025)
Semiparametric Latent Topic Modeling on Consumer-Generated Corpora
by: Dayta, Dominic B., et al.
Published: (2021)
by: Dayta, Dominic B., et al.
Published: (2021)
Low-Resource, High-Impact: Building Corpora for Inclusive Language Technologies
by: Artemova, Ekaterina, et al.
Published: (2025)
by: Artemova, Ekaterina, et al.
Published: (2025)
Scientific Computing with Large Language Models
by: Culver, Christopher, et al.
Published: (2024)
by: Culver, Christopher, et al.
Published: (2024)
Mathematical Entities: Corpora and Benchmarks
by: Collard, Jacob, et al.
Published: (2024)
by: Collard, Jacob, et al.
Published: (2024)
Towards Aligning Language Models with Textual Feedback
by: Lloret, Saüc Abadal, et al.
Published: (2024)
by: Lloret, Saüc Abadal, et al.
Published: (2024)
Refining Corpora from a Model Calibration Perspective for Chinese Spelling Correction
by: Yu, Dingyao, et al.
Published: (2024)
by: Yu, Dingyao, et al.
Published: (2024)
Performance Trade-offs of Optimizing Small Language Models for E-Commerce
by: Licardo, Josip Tomo, et al.
Published: (2025)
by: Licardo, Josip Tomo, et al.
Published: (2025)
LLM Teacher-Student Framework for Text Classification With No Manually Annotated Data: A Case Study in IPTC News Topic Classification
by: Kuzman, Taja, et al.
Published: (2024)
by: Kuzman, Taja, et al.
Published: (2024)
Similar Items
-
Wiki Dumps to Training Corpora: South Slavic Case
by: Škorić, Mihailo, et al.
Published: (2026) -
Novi jezički modeli za srpski jezik
by: Škorić, Mihailo
Published: (2024) -
ParlaSpeech 3.0: Richly Annotated Spoken Parliamentary Corpora of Croatian, Czech, Polish, and Serbian
by: Ljubešić, Nikola, et al.
Published: (2025) -
CLASSLA-web: Comparable Web Corpora of South Slavic Languages Enriched with Linguistic and Genre Annotation
by: Ljubešić, Nikola, et al.
Published: (2024) -
Multilingual transformer and BERTopic for short text topic modeling: The case of Serbian
by: Medvecki, Darija, et al.
Published: (2024)