Evaluating Large Language Models with Human Feedback: Establishing a Swedish Benchmark
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Moell, Birger |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Comparing the Efficacy of GPT-4 and Chat-GPT in Mental Health Care: A Blind Assessment of Large Language Models for Psychological Support
von: Moell, Birger
Veröffentlicht: (2024)
von: Moell, Birger
Veröffentlicht: (2024)
Language Complexity Measurement as a Noisy Zero-Shot Proxy for Evaluating LLM Performance
von: Moell, Birger, et al.
Veröffentlicht: (2025)
von: Moell, Birger, et al.
Veröffentlicht: (2025)
Large Language Models and Mathematical Reasoning Failures
von: Boye, Johan, et al.
Veröffentlicht: (2025)
von: Boye, Johan, et al.
Veröffentlicht: (2025)
The order in speech disorder: a scoping review of state of the art machine learning methods for clinical speech classification
von: Moell, Birger, et al.
Veröffentlicht: (2025)
von: Moell, Birger, et al.
Veröffentlicht: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
von: Li, Zheqing, et al.
Veröffentlicht: (2025)
von: Li, Zheqing, et al.
Veröffentlicht: (2025)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
von: Toraman, Çağrı, et al.
Veröffentlicht: (2026)
von: Toraman, Çağrı, et al.
Veröffentlicht: (2026)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
von: Jung, Dahyun, et al.
Veröffentlicht: (2025)
von: Jung, Dahyun, et al.
Veröffentlicht: (2025)
ConSiDERS-The-Human Evaluation Framework: Rethinking Human Evaluation for Generative Large Language Models
von: Elangovan, Aparna, et al.
Veröffentlicht: (2024)
von: Elangovan, Aparna, et al.
Veröffentlicht: (2024)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
von: Li, Youquan, et al.
Veröffentlicht: (2024)
von: Li, Youquan, et al.
Veröffentlicht: (2024)
Codenames as a Benchmark for Large Language Models
von: Stephenson, Matthew, et al.
Veröffentlicht: (2024)
von: Stephenson, Matthew, et al.
Veröffentlicht: (2024)
Evaluating Creative Short Story Generation in Humans and Large Language Models
von: Ismayilzada, Mete, et al.
Veröffentlicht: (2024)
von: Ismayilzada, Mete, et al.
Veröffentlicht: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
von: Chen, Andong, et al.
Veröffentlicht: (2024)
von: Chen, Andong, et al.
Veröffentlicht: (2024)
PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models
von: Song, Inpyo, et al.
Veröffentlicht: (2025)
von: Song, Inpyo, et al.
Veröffentlicht: (2025)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
von: Amjad, Husnain, et al.
Veröffentlicht: (2026)
von: Amjad, Husnain, et al.
Veröffentlicht: (2026)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
von: Fu, Lingyue, et al.
Veröffentlicht: (2023)
von: Fu, Lingyue, et al.
Veröffentlicht: (2023)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
von: Zhu, Jie, et al.
Veröffentlicht: (2024)
von: Zhu, Jie, et al.
Veröffentlicht: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
You don't understand me!: Comparing ASR results for L1 and L2 speakers of Swedish
von: Cumbal, Ronald, et al.
Veröffentlicht: (2024)
von: Cumbal, Ronald, et al.
Veröffentlicht: (2024)
Enterprise Benchmarks for Large Language Model Evaluation
von: Zhang, Bing, et al.
Veröffentlicht: (2024)
von: Zhang, Bing, et al.
Veröffentlicht: (2024)
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
von: Singh, Abhinav Kumar, et al.
Veröffentlicht: (2026)
von: Singh, Abhinav Kumar, et al.
Veröffentlicht: (2026)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
von: Ni, Shiwen, et al.
Veröffentlicht: (2024)
von: Ni, Shiwen, et al.
Veröffentlicht: (2024)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
von: Ning, Kangyun, et al.
Veröffentlicht: (2024)
von: Ning, Kangyun, et al.
Veröffentlicht: (2024)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
von: Chen, Kedi, et al.
Veröffentlicht: (2024)
von: Chen, Kedi, et al.
Veröffentlicht: (2024)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
von: Jahan, Israt, et al.
Veröffentlicht: (2023)
von: Jahan, Israt, et al.
Veröffentlicht: (2023)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
von: Kim, Dongjun, et al.
Veröffentlicht: (2025)
von: Kim, Dongjun, et al.
Veröffentlicht: (2025)
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
von: Guo, Qianhong, et al.
Veröffentlicht: (2025)
von: Guo, Qianhong, et al.
Veröffentlicht: (2025)
CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics
von: Somasekharan, Nithin, et al.
Veröffentlicht: (2025)
von: Somasekharan, Nithin, et al.
Veröffentlicht: (2025)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models
von: Daynauth, Roland, et al.
Veröffentlicht: (2025)
von: Daynauth, Roland, et al.
Veröffentlicht: (2025)
Rapidly Developing High-quality Instruction Data and Evaluation Benchmark for Large Language Models with Minimal Human Effort: A Case Study on Japanese
von: Sun, Yikun, et al.
Veröffentlicht: (2024)
von: Sun, Yikun, et al.
Veröffentlicht: (2024)
K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic Reasoning
von: Zhang, Yadong, et al.
Veröffentlicht: (2024)
von: Zhang, Yadong, et al.
Veröffentlicht: (2024)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
von: Moell, Birger, et al.
Veröffentlicht: (2025)
von: Moell, Birger, et al.
Veröffentlicht: (2025)
Generating Benchmarks for Factuality Evaluation of Language Models
von: Muhlgay, Dor, et al.
Veröffentlicht: (2023)
von: Muhlgay, Dor, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Comparing the Efficacy of GPT-4 and Chat-GPT in Mental Health Care: A Blind Assessment of Large Language Models for Psychological Support
von: Moell, Birger
Veröffentlicht: (2024) -
Language Complexity Measurement as a Noisy Zero-Shot Proxy for Evaluating LLM Performance
von: Moell, Birger, et al.
Veröffentlicht: (2025) -
Large Language Models and Mathematical Reasoning Failures
von: Boye, Johan, et al.
Veröffentlicht: (2025) -
The order in speech disorder: a scoping review of state of the art machine learning methods for clinical speech classification
von: Moell, Birger, et al.
Veröffentlicht: (2025) -
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)