FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kytöniemi, Joona, Piha, Jousia, Reunamo, Akseli, Vitiugin, Fedor, Mehryary, Farrokh, Pyysalo, Sampo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pretraining Finnish ModernBERTs
par: Reunamo, Akseli, et autres
Publié: (2025)
par: Reunamo, Akseli, et autres
Publié: (2025)
Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models
par: Saukkoriipi, Mikko, et autres
Publié: (2026)
par: Saukkoriipi, Mikko, et autres
Publié: (2026)
RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors
par: Dugan, Liam, et autres
Publié: (2024)
par: Dugan, Liam, et autres
Publié: (2024)
Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis
par: Purushothama, Abhishek, et autres
Publié: (2025)
par: Purushothama, Abhishek, et autres
Publié: (2025)
Comonadic Morphophonology: A Compositional Framework for Context-Dependent Morphological Rules in Finnish
par: Jang, Yongseok
Publié: (2026)
par: Jang, Yongseok
Publié: (2026)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks
par: Young, Richard J.
Publié: (2025)
par: Young, Richard J.
Publié: (2025)
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
par: Palit, Sayon, et autres
Publié: (2025)
par: Palit, Sayon, et autres
Publié: (2025)
GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering
par: Muller, Sacha, et autres
Publié: (2024)
par: Muller, Sacha, et autres
Publié: (2024)
Robustness of Large Language Models to Perturbations in Text
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Toward Architecture-Aware Evaluation Metrics for LLM Agents
par: Souza, Débora, et autres
Publié: (2026)
par: Souza, Débora, et autres
Publié: (2026)
Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
par: Er, Yakup Abrek, et autres
Publié: (2025)
par: Er, Yakup Abrek, et autres
Publié: (2025)
ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks
par: Tanguturi, Samuel Sameer
Publié: (2026)
par: Tanguturi, Samuel Sameer
Publié: (2026)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
par: Schesch, Benedikt, et autres
Publié: (2026)
par: Schesch, Benedikt, et autres
Publié: (2026)
Automated Bug Triaging using Instruction-Tuned Large Language Models
par: Kiashemshaki, Kiana, et autres
Publié: (2025)
par: Kiashemshaki, Kiana, et autres
Publié: (2025)
LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output
par: Karinshak, Elise, et autres
Publié: (2024)
par: Karinshak, Elise, et autres
Publié: (2024)
BOUQuET: dataset, Benchmark and Open initiative for Universal Quality Evaluation in Translation
par: The Omnilingual MT Team, et autres
Publié: (2025)
par: The Omnilingual MT Team, et autres
Publié: (2025)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
par: Li, Bowen, et autres
Publié: (2026)
par: Li, Bowen, et autres
Publié: (2026)
Benchmarking Energy Efficiency of Large Language Models Using vLLM
par: Pronk, K., et autres
Publié: (2025)
par: Pronk, K., et autres
Publié: (2025)
EnDive: A Cross-Dialect Benchmark for Fairness and Performance in Large Language Models
par: Gupta, Abhay, et autres
Publié: (2025)
par: Gupta, Abhay, et autres
Publié: (2025)
Hidden Failures in Robustness: Why Supervised Uncertainty Quantification Needs Better Evaluation
par: Stacey, Joe, et autres
Publié: (2026)
par: Stacey, Joe, et autres
Publié: (2026)
OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs
par: Wang, Yuxia, et autres
Publié: (2024)
par: Wang, Yuxia, et autres
Publié: (2024)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
par: Dinh, Tu Anh, et autres
Publié: (2024)
par: Dinh, Tu Anh, et autres
Publié: (2024)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
par: Halpern, Bence Mark, et autres
Publié: (2026)
par: Halpern, Bence Mark, et autres
Publié: (2026)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
par: Jiang, Yilin, et autres
Publié: (2025)
par: Jiang, Yilin, et autres
Publié: (2025)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
par: Pan, Leyi, et autres
Publié: (2025)
par: Pan, Leyi, et autres
Publié: (2025)
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
par: Yu, Jinzheng, et autres
Publié: (2025)
par: Yu, Jinzheng, et autres
Publié: (2025)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
par: Tu, Songjun, et autres
Publié: (2026)
par: Tu, Songjun, et autres
Publié: (2026)
BEATS: Bias Evaluation and Assessment Test Suite for Large Language Models
par: Abhishek, Alok, et autres
Publié: (2025)
par: Abhishek, Alok, et autres
Publié: (2025)
A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models
par: Christop, Iwona, et autres
Publié: (2026)
par: Christop, Iwona, et autres
Publié: (2026)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text
par: Le, Van-Truong
Publié: (2026)
par: Le, Van-Truong
Publié: (2026)
Evaluating Input Feature Explanations through a Unified Diagnostic Evaluation Framework
par: Sun, Jingyi, et autres
Publié: (2024)
par: Sun, Jingyi, et autres
Publié: (2024)
ToolGen: Unified Tool Retrieval and Calling via Generation
par: Wang, Renxi, et autres
Publié: (2024)
par: Wang, Renxi, et autres
Publié: (2024)
Evaluating Large Language Models for Zero-Shot Disease Labeling in CT Radiology Reports Across Organ Systems
par: Garcia-Alcoser, Michael E., et autres
Publié: (2025)
par: Garcia-Alcoser, Michael E., et autres
Publié: (2025)
Evaluating the Systematic Reasoning Abilities of Large Language Models through Graph Coloring
par: Heyman, Alex, et autres
Publié: (2025)
par: Heyman, Alex, et autres
Publié: (2025)
AllMetrics: A Unified Python Library for Standardized Metric Evaluation and Robust Data Validation in Machine Learning
par: Alizadeh, Morteza, et autres
Publié: (2025)
par: Alizadeh, Morteza, et autres
Publié: (2025)
Documents similaires
-
Pretraining Finnish ModernBERTs
par: Reunamo, Akseli, et autres
Publié: (2025) -
Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models
par: Saukkoriipi, Mikko, et autres
Publié: (2026) -
RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors
par: Dugan, Liam, et autres
Publié: (2024) -
Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis
par: Purushothama, Abhishek, et autres
Publié: (2025) -
Comonadic Morphophonology: A Compositional Framework for Context-Dependent Morphological Rules in Finnish
par: Jang, Yongseok
Publié: (2026)