Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Senaratna, Nuwan I. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset
par: Samir, Farhan, et autres
Publié: (2024)
par: Samir, Farhan, et autres
Publié: (2024)
Scaling Laws for Multilingual Language Models
par: He, Yifei, et autres
Publié: (2024)
par: He, Yifei, et autres
Publié: (2024)
Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)
par: Liu, Jiarui, et autres
Publié: (2024)
par: Liu, Jiarui, et autres
Publié: (2024)
ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality
par: Longpre, Shayne, et autres
Publié: (2025)
par: Longpre, Shayne, et autres
Publié: (2025)
EventSum: A Large-Scale Event-Centric Summarization Dataset for Chinese Multi-News Documents
par: Zhu, Mengna, et autres
Publié: (2024)
par: Zhu, Mengna, et autres
Publié: (2024)
A Multilingual Similarity Dataset for News Article Frame
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
OleSpeech-IV: A Large-Scale Multispeaker and Multilingual Conversational Speech Dataset with Diverse Topics
par: Chu, Wei, et autres
Publié: (2025)
par: Chu, Wei, et autres
Publié: (2025)
DocHPLT: A Massively Multilingual Document-Level Translation Dataset
par: O'Brien, Dayyán, et autres
Publié: (2025)
par: O'Brien, Dayyán, et autres
Publié: (2025)
CMNEE: A Large-Scale Document-Level Event Extraction Dataset based on Open-Source Chinese Military News
par: Zhu, Mengna, et autres
Publié: (2024)
par: Zhu, Mengna, et autres
Publié: (2024)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
par: He, Haorui, et autres
Publié: (2025)
par: He, Haorui, et autres
Publié: (2025)
Factors Influencing the Sustainability of Resource Use and Management Within Multiple Use Marine Protected Areas
par: Senaratna, S.
Publié: (1999)
par: Senaratna, S.
Publié: (1999)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
par: He, Haorui, et autres
Publié: (2024)
par: He, Haorui, et autres
Publié: (2024)
SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
par: Xie, Peng, et autres
Publié: (2025)
par: Xie, Peng, et autres
Publié: (2025)
A New Massive Multilingual Dataset for High-Performance Language Technologies
par: de Gibert, Ona, et autres
Publié: (2024)
par: de Gibert, Ona, et autres
Publié: (2024)
A diverse Multilingual News Headlines Dataset from around the World
par: Leeb, Felix, et autres
Publié: (2024)
par: Leeb, Felix, et autres
Publié: (2024)
HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models
par: Oepen, Stephan, et autres
Publié: (2025)
par: Oepen, Stephan, et autres
Publié: (2025)
Provision of Periodicals in the Libraries of Sri Lanka
par: Bandara, S. B.
Publié: (1975)
par: Bandara, S. B.
Publié: (1975)
BETA-Labeling for Multilingual Dataset Construction in Low-Resource IR
par: Hasan, Md. Najib, et autres
Publié: (2026)
par: Hasan, Md. Najib, et autres
Publié: (2026)
A Study on Scaling Up Multilingual News Framing Analysis
par: Akter, Syeda Sabrina, et autres
Publié: (2024)
par: Akter, Syeda Sabrina, et autres
Publié: (2024)
Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers
par: Qin, Libo, et autres
Publié: (2024)
par: Qin, Libo, et autres
Publié: (2024)
ADAB: Arabic Dataset for Automated Politeness Benchmarking -- A Large-Scale Resource for Computational Sociopragmatics
par: Al-Khalifa, Hend, et autres
Publié: (2026)
par: Al-Khalifa, Hend, et autres
Publié: (2026)
CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages
par: Zhuang, Wenhao, et autres
Publié: (2025)
par: Zhuang, Wenhao, et autres
Publié: (2025)
Scaling Laws of Decoder-Only Models on the Multilingual Machine Translation Task
par: Caillaut, Gaëtan, et autres
Publié: (2024)
par: Caillaut, Gaëtan, et autres
Publié: (2024)
Large Language Models: A New Approach for Privacy Policy Analysis at Scale
par: Rodriguez, David, et autres
Publié: (2024)
par: Rodriguez, David, et autres
Publié: (2024)
FineFreq: A Multilingual Character Frequency Dataset from Web-Scale Text
par: Xu, Binbin
Publié: (2025)
par: Xu, Binbin
Publié: (2025)
TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
par: Xuan, Xi, et autres
Publié: (2025)
par: Xuan, Xi, et autres
Publié: (2025)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
par: Mutisya, Hillary, et autres
Publié: (2026)
par: Mutisya, Hillary, et autres
Publié: (2026)
Temporal Scaling Law for Large Language Models
par: Xiong, Yizhe, et autres
Publié: (2024)
par: Xiong, Yizhe, et autres
Publié: (2024)
TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling
par: Huang, Cheng, et autres
Publié: (2025)
par: Huang, Cheng, et autres
Publié: (2025)
SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-Tuning
par: Pandey, Prabhat, et autres
Publié: (2025)
par: Pandey, Prabhat, et autres
Publié: (2025)
LEMONADE: A Large Multilingual Expert-Annotated Abstractive Event Dataset for the Real World
par: Semnani, Sina J., et autres
Publié: (2025)
par: Semnani, Sina J., et autres
Publié: (2025)
M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction
par: Liu, Jiang, et autres
Publié: (2024)
par: Liu, Jiang, et autres
Publié: (2024)
Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
par: Sinha, Samridhi Raj, et autres
Publié: (2025)
par: Sinha, Samridhi Raj, et autres
Publié: (2025)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
par: Puranegedara, Imalsha, et autres
Publié: (2025)
par: Puranegedara, Imalsha, et autres
Publié: (2025)
Multilingual Contextualization of Large Language Models for Document-Level Machine Translation
par: Ramos, Miguel Moura, et autres
Publié: (2025)
par: Ramos, Miguel Moura, et autres
Publié: (2025)
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
par: Shao, Jiandong, et autres
Publié: (2026)
par: Shao, Jiandong, et autres
Publié: (2026)
Scaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation
par: Spravil, Julian, et autres
Publié: (2025)
par: Spravil, Julian, et autres
Publié: (2025)
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
par: Khan, Shaharukh, et autres
Publié: (2026)
par: Khan, Shaharukh, et autres
Publié: (2026)
Scaling Laws for Fact Memorization of Large Language Models
par: Lu, Xingyu, et autres
Publié: (2024)
par: Lu, Xingyu, et autres
Publié: (2024)
The 2021 Tokyo Olympics Multilingual News Article Dataset
par: Novak, Erik, et autres
Publié: (2025)
par: Novak, Erik, et autres
Publié: (2025)
Documents similaires
-
Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset
par: Samir, Farhan, et autres
Publié: (2024) -
Scaling Laws for Multilingual Language Models
par: He, Yifei, et autres
Publié: (2024) -
Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)
par: Liu, Jiarui, et autres
Publié: (2024) -
ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality
par: Longpre, Shayne, et autres
Publié: (2025) -
EventSum: A Large-Scale Event-Centric Summarization Dataset for Chinese Multi-News Documents
par: Zhu, Mengna, et autres
Publié: (2024)