NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mikhailov, Vladislav, Enstad, Tita, Samuel, David, Farsethås, Hans Christian, Kutuzov, Andrey, Velldal, Erik, Øvrelid, Lilja |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
par: Samuel, David, et autres
Publié: (2025)
par: Samuel, David, et autres
Publié: (2025)
Benchmarking Abstractive Summarisation: A Dataset of Human-authored Summaries of Norwegian News Articles
par: Touileb, Samia, et autres
Publié: (2025)
par: Touileb, Samia, et autres
Publié: (2025)
Small Languages, Big Models: A Study of Continual Training on Languages of Norway
par: Samuel, David, et autres
Publié: (2024)
par: Samuel, David, et autres
Publié: (2024)
A Collection of Question Answering Datasets for Norwegian
par: Mikhailov, Vladislav, et autres
Publié: (2025)
par: Mikhailov, Vladislav, et autres
Publié: (2025)
The Impact of Copyrighted Material on Large Language Models: A Norwegian Perspective
par: de la Rosa, Javier, et autres
Publié: (2024)
par: de la Rosa, Javier, et autres
Publié: (2024)
Event-based evaluation of abstractive news summarization
par: You, Huiling, et autres
Publié: (2025)
par: You, Huiling, et autres
Publié: (2025)
Entity-Level Sentiment: More than the Sum of Its Parts
par: Rønningstad, Egil, et autres
Publié: (2024)
par: Rønningstad, Egil, et autres
Publié: (2024)
Mixed Feelings: Cross-Domain Sentiment Classification of Patient Feedback
par: Rønningstad, Egil, et autres
Publié: (2025)
par: Rønningstad, Egil, et autres
Publié: (2025)
Compositional Generalization with Grounded Language Models
par: Wold, Sondre, et autres
Publié: (2024)
par: Wold, Sondre, et autres
Publié: (2024)
It's Difficult to be Neutral -- Human and LLM-based Sentiment Annotation of Patient Comments
par: Mæhlum, Petter, et autres
Publié: (2024)
par: Mæhlum, Petter, et autres
Publié: (2024)
NLEBench+NorGLM: A Comprehensive Empirical Analysis and Benchmark Dataset for Generative Language Models in Norwegian
par: Liu, Peng, et autres
Publié: (2023)
par: Liu, Peng, et autres
Publié: (2023)
AIpom at SemEval-2024 Task 8: Detecting AI-produced Outputs in M4
par: Shirnin, Alexander, et autres
Publié: (2024)
par: Shirnin, Alexander, et autres
Publié: (2024)
LUNA: A Framework for Language Understanding and Naturalness Assessment
par: Saidov, Marat, et autres
Publié: (2024)
par: Saidov, Marat, et autres
Publié: (2024)
A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models
par: Chen, Huiyao, et autres
Publié: (2025)
par: Chen, Huiyao, et autres
Publié: (2025)
REPA: Russian Error Types Annotation for Evaluating Text Generation and Judgment Capabilities
par: Pugachev, Alexander, et autres
Publié: (2025)
par: Pugachev, Alexander, et autres
Publié: (2025)
Comparative analysis of optical character recognition methods for Sámi texts from the National Library of Norway
par: Enstad, Tita, et autres
Publié: (2025)
par: Enstad, Tita, et autres
Publié: (2025)
DHPLT: large-scale multilingual diachronic corpora and word representations for semantic change modelling
par: Fedorova, Mariia, et autres
Publié: (2026)
par: Fedorova, Mariia, et autres
Publié: (2026)
Definition generation for lexical semantic change detection
par: Fedorova, Mariia, et autres
Publié: (2024)
par: Fedorova, Mariia, et autres
Publié: (2024)
HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs
par: Cheng, Tsz Chung, et autres
Publié: (2025)
par: Cheng, Tsz Chung, et autres
Publié: (2025)
RuBLiMP: Russian Benchmark of Linguistic Minimal Pairs
par: Taktasheva, Ekaterina, et autres
Publié: (2024)
par: Taktasheva, Ekaterina, et autres
Publié: (2024)
Enriching Word Usage Graphs with Cluster Definitions
par: Fedorova, Mariia, et autres
Publié: (2024)
par: Fedorova, Mariia, et autres
Publié: (2024)
Explaining novel senses using definition generation with open language models
par: Fedorova, Mariia, et autres
Publié: (2025)
par: Fedorova, Mariia, et autres
Publié: (2025)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
par: Raihan, Nishat, et autres
Publié: (2024)
par: Raihan, Nishat, et autres
Publié: (2024)
Beemo: Benchmark of Expert-edited Machine-generated Outputs
par: Artemova, Ekaterina, et autres
Publié: (2024)
par: Artemova, Ekaterina, et autres
Publié: (2024)
ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language Understanding
par: Azime, Israel Abebe, et autres
Publié: (2024)
par: Azime, Israel Abebe, et autres
Publié: (2024)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
par: Jubair, Sheikh, et autres
Publié: (2025)
par: Jubair, Sheikh, et autres
Publié: (2025)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
par: Hosseini, Mohammad, et autres
Publié: (2025)
par: Hosseini, Mohammad, et autres
Publié: (2025)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
par: Shen, Tianhao, et autres
Publié: (2023)
par: Shen, Tianhao, et autres
Publié: (2023)
Papilusion at DAGPap24: Paper or Illusion? Detecting AI-generated Scientific Papers
par: Andreev, Nikita, et autres
Publié: (2024)
par: Andreev, Nikita, et autres
Publié: (2024)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
par: Du, Junjia, et autres
Publié: (2025)
par: Du, Junjia, et autres
Publié: (2025)
SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation
par: Petrukha, Ivan, et autres
Publié: (2025)
par: Petrukha, Ivan, et autres
Publié: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2024)
par: Kwan, Wai-Chung, et autres
Publié: (2024)
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
par: Qiu, Zexuan, et autres
Publié: (2024)
par: Qiu, Zexuan, et autres
Publié: (2024)
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
par: Peng, Qiwei, et autres
Publié: (2024)
par: Peng, Qiwei, et autres
Publié: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
COLE: a Comprehensive Benchmark for French Language Understanding Evaluation
par: Beauchemin, David, et autres
Publié: (2025)
par: Beauchemin, David, et autres
Publié: (2025)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
par: Cui, Wenqian, et autres
Publié: (2025)
par: Cui, Wenqian, et autres
Publié: (2025)
KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding
par: Hwang, Bokwang, et autres
Publié: (2025)
par: Hwang, Bokwang, et autres
Publié: (2025)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
par: Guo, Xin, et autres
Publié: (2023)
par: Guo, Xin, et autres
Publié: (2023)
Documents similaires
-
Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
par: Samuel, David, et autres
Publié: (2025) -
Benchmarking Abstractive Summarisation: A Dataset of Human-authored Summaries of Norwegian News Articles
par: Touileb, Samia, et autres
Publié: (2025) -
Small Languages, Big Models: A Study of Continual Training on Languages of Norway
par: Samuel, David, et autres
Publié: (2024) -
A Collection of Question Answering Datasets for Norwegian
par: Mikhailov, Vladislav, et autres
Publié: (2025) -
The Impact of Copyrighted Material on Large Language Models: A Norwegian Perspective
par: de la Rosa, Javier, et autres
Publié: (2024)