Saved in:
| Main Authors: | Kurfalı, Murathan, Zahra, Shorouq, Nivre, Joakim, Messori, Gabriele |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2505.18653 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VUB-HYDR/Wikimpacts: Wikimpacts 1.0 database
by: Shorouq, et al.
Published: (2025)
by: Shorouq, et al.
Published: (2025)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
by: Carlsson, Fredrik, et al.
Published: (2024)
by: Carlsson, Fredrik, et al.
Published: (2024)
Can LLMs Detect Intrinsic Hallucinations in Paraphrasing and Machine Translation?
by: Gogoulou, Evangelia, et al.
Published: (2025)
by: Gogoulou, Evangelia, et al.
Published: (2025)
Language Bias under Conflicting Information in Multilingual LLMs
by: Östling, Robert, et al.
Published: (2026)
by: Östling, Robert, et al.
Published: (2026)
Assessing socio-economic climate impacts from text data
by: de Brito, Mariana Madruga, et al.
Published: (2026)
by: de Brito, Mariana Madruga, et al.
Published: (2026)
Lightweight Connective Detection Using Gradient Boosting
by: Er, Mustafa Erolcan, et al.
Published: (2024)
by: Er, Mustafa Erolcan, et al.
Published: (2024)
MultiBLiMP 1.0: A Massively Multilingual Benchmark of Linguistic Minimal Pairs
by: Jumelet, Jaap, et al.
Published: (2025)
by: Jumelet, Jaap, et al.
Published: (2025)
Continual Learning Under Language Shift
by: Gogoulou, Evangelia, et al.
Published: (2023)
by: Gogoulou, Evangelia, et al.
Published: (2023)
LLM Benchmark-User Need Misalignment for Climate Change
by: Liu, Oucheng, et al.
Published: (2026)
by: Liu, Oucheng, et al.
Published: (2026)
HausaNLP at SemEval-2025 Task 11: Hausa Text Emotion Detection
by: Sani, Sani Abdullahi, et al.
Published: (2025)
by: Sani, Sani Abdullahi, et al.
Published: (2025)
EvalxNLP: A Framework for Benchmarking Post-Hoc Explainability Methods on NLP Models
by: Dhaini, Mahdi, et al.
Published: (2025)
by: Dhaini, Mahdi, et al.
Published: (2025)
MultiClimate: Multimodal Stance Detection on Climate Change Videos
by: Wang, Jiawen, et al.
Published: (2024)
by: Wang, Jiawen, et al.
Published: (2024)
TartuNLP at SemEval-2025 Task 5: Subject Tagging as Two-Stage Information Retrieval
by: Dorkin, Aleksei, et al.
Published: (2025)
by: Dorkin, Aleksei, et al.
Published: (2025)
Retrieving Climate Change Disinformation by Narrative
by: Upravitelev, Max, et al.
Published: (2026)
by: Upravitelev, Max, et al.
Published: (2026)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
by: Lu, Yuchen, et al.
Published: (2025)
by: Lu, Yuchen, et al.
Published: (2025)
GateNLP at SemEval-2025 Task 10: Hierarchical Three-Step Prompting for Multilingual Narrative Classification
by: Singh, Iknoor, et al.
Published: (2025)
by: Singh, Iknoor, et al.
Published: (2025)
D-NLP at SemEval-2024 Task 2: Evaluating Clinical Inference Capabilities of Large Language Models
by: Altinok, Duygu
Published: (2024)
by: Altinok, Duygu
Published: (2024)
Overview of MWE history, challenges, and horizons: standing at the 20th anniversary of the MWE workshop series via MWE-UD2024
by: Han, Lifeng, et al.
Published: (2024)
by: Han, Lifeng, et al.
Published: (2024)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
by: Hosseini, Mohammad, et al.
Published: (2025)
by: Hosseini, Mohammad, et al.
Published: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
Climate Change from Large Language Models
by: Zhu, Hongyin, et al.
Published: (2023)
by: Zhu, Hongyin, et al.
Published: (2023)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
by: Yan, Lian, et al.
Published: (2025)
by: Yan, Lian, et al.
Published: (2025)
UoB-NLP at SemEval-2025 Task 11: Leveraging Adapters for Multilingual and Cross-Lingual Emotion Detection
by: De Leon, Frances Laureano, et al.
Published: (2025)
by: De Leon, Frances Laureano, et al.
Published: (2025)
MaiNLP at SemEval-2024 Task 1: Analyzing Source Language Selection in Cross-Lingual Textual Relatedness
by: Zhou, Shijia, et al.
Published: (2024)
by: Zhou, Shijia, et al.
Published: (2024)
ClimateGPT: Towards AI Synthesizing Interdisciplinary Research on Climate Change
by: Thulke, David, et al.
Published: (2024)
by: Thulke, David, et al.
Published: (2024)
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
by: Kang, Zhaolu, et al.
Published: (2026)
by: Kang, Zhaolu, et al.
Published: (2026)
SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation
by: Sumanathilaka, Deshan, et al.
Published: (2026)
by: Sumanathilaka, Deshan, et al.
Published: (2026)
DFKI-NLP at SemEval-2024 Task 2: Towards Robust LLMs Using Data Perturbations and MinMax Training
by: Verma, Bhuvanesh, et al.
Published: (2024)
by: Verma, Bhuvanesh, et al.
Published: (2024)
Team UTSA-NLP at SemEval 2024 Task 5: Prompt Ensembling for Argument Reasoning in Civil Procedures with GPT4
by: Schumacher, Dan, et al.
Published: (2024)
by: Schumacher, Dan, et al.
Published: (2024)
HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs
by: Cheng, Tsz Chung, et al.
Published: (2025)
by: Cheng, Tsz Chung, et al.
Published: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
DIALECTBENCH: A NLP Benchmark for Dialects, Varieties, and Closely-Related Languages
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
CLIMATELI: Evaluating Entity Linking on Climate Change Data
by: Zhou, Shijia, et al.
Published: (2024)
by: Zhou, Shijia, et al.
Published: (2024)
Assessing Generative Language Models in Classification Tasks: Performance and Self-Evaluation Capabilities in the Environmental and Climate Change Domain
by: Grasso, Francesca, et al.
Published: (2024)
by: Grasso, Francesca, et al.
Published: (2024)
ClimateChat: Designing Data and Methods for Instruction Tuning LLMs to Answer Climate Change Queries
by: Chen, Zhou, et al.
Published: (2025)
by: Chen, Zhou, et al.
Published: (2025)
NLP-ADBench: NLP Anomaly Detection Benchmark
by: Li, Yuangang, et al.
Published: (2024)
by: Li, Yuangang, et al.
Published: (2024)
SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLP
by: Duan, Decheng, et al.
Published: (2025)
by: Duan, Decheng, et al.
Published: (2025)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
by: Jiang, Jiyue, et al.
Published: (2025)
by: Jiang, Jiyue, et al.
Published: (2025)
HausaNLP at SemEval-2025 Task 3: Towards a Fine-Grained Model-Aware Hallucination Detection
by: Bala, Maryam, et al.
Published: (2025)
by: Bala, Maryam, et al.
Published: (2025)
CLINB: A Climate Intelligence Benchmark for Foundational Models
by: Huebscher, Michelle Chen, et al.
Published: (2025)
by: Huebscher, Michelle Chen, et al.
Published: (2025)
Similar Items
-
VUB-HYDR/Wikimpacts: Wikimpacts 1.0 database
by: Shorouq, et al.
Published: (2025) -
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
by: Carlsson, Fredrik, et al.
Published: (2024) -
Can LLMs Detect Intrinsic Hallucinations in Paraphrasing and Machine Translation?
by: Gogoulou, Evangelia, et al.
Published: (2025) -
Language Bias under Conflicting Information in Multilingual LLMs
by: Östling, Robert, et al.
Published: (2026) -
Assessing socio-economic climate impacts from text data
by: de Brito, Mariana Madruga, et al.
Published: (2026)