SWEb: A Large Web Dataset for the Scandinavian Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Norlund, Tobias, Isbister, Tim, Gyllensten, Amaru Cuba, Santos, Paul Dos, Petrelli, Danila, Ekgren, Ariel, Sahlgren, Magnus |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GPT-SW3: An Autoregressive Language Model for the Nordic Languages
di: Ekgren, Ariel, et al.
Pubblicazione: (2023)
di: Ekgren, Ariel, et al.
Pubblicazione: (2023)
BiaSWE: An Expert Annotated Dataset for Misogyny Detection in Swedish
di: Kukk, Kätriin, et al.
Pubblicazione: (2025)
di: Kukk, Kätriin, et al.
Pubblicazione: (2025)
Multi-label Scandinavian Language Identification (SLIDE)
di: Fedorova, Mariia, et al.
Pubblicazione: (2025)
di: Fedorova, Mariia, et al.
Pubblicazione: (2025)
Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models
di: Schreieder, Tobias, et al.
Pubblicazione: (2025)
di: Schreieder, Tobias, et al.
Pubblicazione: (2025)
Natural Language Processing for Electronic Health Records in Scandinavian Languages: Norwegian, Swedish, and Danish
di: Woldaregay, Ashenafi Zebene, et al.
Pubblicazione: (2025)
di: Woldaregay, Ashenafi Zebene, et al.
Pubblicazione: (2025)
AutoWebGLM: A Large Language Model-based Web Navigating Agent
di: Lai, Hanyu, et al.
Pubblicazione: (2024)
di: Lai, Hanyu, et al.
Pubblicazione: (2024)
Durghotona GPT: A Web Scraping and Large Language Model Based Framework to Generate Road Accident Dataset Automatically in Bangladesh
di: Chowdhury, MD Thamed Bin Zaman, et al.
Pubblicazione: (2025)
di: Chowdhury, MD Thamed Bin Zaman, et al.
Pubblicazione: (2025)
Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large Language Model Datasets
di: Gowtham, et al.
Pubblicazione: (2025)
di: Gowtham, et al.
Pubblicazione: (2025)
Evaluating Machine Translation Datasets for Low-Web Data Languages: A Gendered Lens
di: Nigatu, Hellina Hailu, et al.
Pubblicazione: (2025)
di: Nigatu, Hellina Hailu, et al.
Pubblicazione: (2025)
Motivation in Large Language Models
di: Nahum, Omer, et al.
Pubblicazione: (2026)
di: Nahum, Omer, et al.
Pubblicazione: (2026)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
di: Lin, Zhiyu, et al.
Pubblicazione: (2025)
di: Lin, Zhiyu, et al.
Pubblicazione: (2025)
A Dataset for the Detection of Dehumanizing Language
di: Engelmann, Paul, et al.
Pubblicazione: (2024)
di: Engelmann, Paul, et al.
Pubblicazione: (2024)
The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale
di: Penedo, Guilherme, et al.
Pubblicazione: (2024)
di: Penedo, Guilherme, et al.
Pubblicazione: (2024)
The Scandinavian Embedding Benchmarks: Comprehensive Assessment of Multilingual and Monolingual Text Embedding
di: Enevoldsen, Kenneth, et al.
Pubblicazione: (2024)
di: Enevoldsen, Kenneth, et al.
Pubblicazione: (2024)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
Leaking LoRa: An Evaluation of Password Leaks and Knowledge Storage in Large Language Models
di: Marinelli, Ryan, et al.
Pubblicazione: (2025)
di: Marinelli, Ryan, et al.
Pubblicazione: (2025)
CASTILLO: Characterizing Response Length Distributions of Large Language Models
di: Perez-Ramirez, Daniel F., et al.
Pubblicazione: (2025)
di: Perez-Ramirez, Daniel F., et al.
Pubblicazione: (2025)
Contextual Memory Reweaving in Large Language Models Using Layered Latent State Reconstruction
di: Dillon, Frederick, et al.
Pubblicazione: (2025)
di: Dillon, Frederick, et al.
Pubblicazione: (2025)
Building a Large Japanese Web Corpus for Large Language Models
di: Okazaki, Naoaki, et al.
Pubblicazione: (2024)
di: Okazaki, Naoaki, et al.
Pubblicazione: (2024)
CHBench: A Chinese Dataset for Evaluating Health in Large Language Models
di: Guo, Chenlu, et al.
Pubblicazione: (2024)
di: Guo, Chenlu, et al.
Pubblicazione: (2024)
iLSU-T: an Open Dataset for Uruguayan Sign Language Translation
di: Stassi, Ariel E., et al.
Pubblicazione: (2025)
di: Stassi, Ariel E., et al.
Pubblicazione: (2025)
Indications of Belief-Guided Agency and Meta-Cognitive Monitoring in Large Language Models
di: Yalon, Noam Steinmetz, et al.
Pubblicazione: (2026)
di: Yalon, Noam Steinmetz, et al.
Pubblicazione: (2026)
BQA: Body Language Question Answering Dataset for Video Large Language Models
di: Ozaki, Shintaro, et al.
Pubblicazione: (2024)
di: Ozaki, Shintaro, et al.
Pubblicazione: (2024)
Datasets for Large Language Models: A Comprehensive Survey
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2026)
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2026)
AGGA: A Dataset of Academic Guidelines for Generative AI and Large Language Models
di: Jiao, Junfeng, et al.
Pubblicazione: (2025)
di: Jiao, Junfeng, et al.
Pubblicazione: (2025)
BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese
di: Zhou, Peilin, et al.
Pubblicazione: (2025)
di: Zhou, Peilin, et al.
Pubblicazione: (2025)
A Review of the Challenges with Massive Web-mined Corpora Used in Large Language Models Pre-Training
di: Perełkiewicz, Michał, et al.
Pubblicazione: (2024)
di: Perełkiewicz, Michał, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Web Scraping
di: Ahluwalia, Aman, et al.
Pubblicazione: (2024)
di: Ahluwalia, Aman, et al.
Pubblicazione: (2024)
PrimeX: A Dataset of Worldview, Opinion, and Explanation
di: Koncel-Kedziorski, Rik, et al.
Pubblicazione: (2025)
di: Koncel-Kedziorski, Rik, et al.
Pubblicazione: (2025)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
di: Yu, Linhao, et al.
Pubblicazione: (2024)
di: Yu, Linhao, et al.
Pubblicazione: (2024)
SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
di: Röttger, Paul, et al.
Pubblicazione: (2024)
di: Röttger, Paul, et al.
Pubblicazione: (2024)
Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Models
di: Domhan, Tobias, et al.
Pubblicazione: (2025)
di: Domhan, Tobias, et al.
Pubblicazione: (2025)
Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges
di: Ma, Bolei, et al.
Pubblicazione: (2025)
di: Ma, Bolei, et al.
Pubblicazione: (2025)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
di: Dang, Quy-Anh, et al.
Pubblicazione: (2026)
di: Dang, Quy-Anh, et al.
Pubblicazione: (2026)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
di: Zhang, Qian, et al.
Pubblicazione: (2024)
di: Zhang, Qian, et al.
Pubblicazione: (2024)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
di: Yu, Ping, et al.
Pubblicazione: (2024)
di: Yu, Ping, et al.
Pubblicazione: (2024)
PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines
di: Vir, Reya, et al.
Pubblicazione: (2025)
di: Vir, Reya, et al.
Pubblicazione: (2025)
A Benchmark Dataset and Evaluation Framework for Vietnamese Large Language Models in Customer Support
di: Nguyen, Long S. T., et al.
Pubblicazione: (2025)
di: Nguyen, Long S. T., et al.
Pubblicazione: (2025)
Large Language Models in Legislative Content Analysis: A Dataset from the Polish Parliament
di: Bryłkowski, Arkadiusz, et al.
Pubblicazione: (2025)
di: Bryłkowski, Arkadiusz, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GPT-SW3: An Autoregressive Language Model for the Nordic Languages
di: Ekgren, Ariel, et al.
Pubblicazione: (2023) -
BiaSWE: An Expert Annotated Dataset for Misogyny Detection in Swedish
di: Kukk, Kätriin, et al.
Pubblicazione: (2025) -
Multi-label Scandinavian Language Identification (SLIDE)
di: Fedorova, Mariia, et al.
Pubblicazione: (2025) -
Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models
di: Schreieder, Tobias, et al.
Pubblicazione: (2025) -
Natural Language Processing for Electronic Health Records in Scandinavian Languages: Norwegian, Swedish, and Danish
di: Woldaregay, Ashenafi Zebene, et al.
Pubblicazione: (2025)