A Transparent Fairness Evaluation Protocol for Open-Source Language Model Benchmarking on the Blockchain
Fuente:
arXiv
Guardado en:
| Autores principales: | Massaroli, Hugo, Iara, Leonardo, Iarussi, Emmanuel, Siless, Viviana |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Validating Deep Models for Alzheimer's 18F-FDG PET Diagnosis Across Populations: A Study with Latin American Data
por: Massaroli, Hugo, et al.
Publicado: (2025)
por: Massaroli, Hugo, et al.
Publicado: (2025)
Do Large Language Models Understand Data Visualization Rules?
por: Sinnona, Martin, et al.
Publicado: (2026)
por: Sinnona, Martin, et al.
Publicado: (2026)
Do Large Language Models Understand Data Visualization Principles?
por: Sinnona, Martin, et al.
Publicado: (2026)
por: Sinnona, Martin, et al.
Publicado: (2026)
De-rendering, Reasoning, and Repairing Charts with Vision-Language Models
por: Bonas, Valentin, et al.
Publicado: (2026)
por: Bonas, Valentin, et al.
Publicado: (2026)
DUDF: Differentiable Unsigned Distance Fields with Hyperbolic Scaling
por: Fainstein, Miguel, et al.
Publicado: (2024)
por: Fainstein, Miguel, et al.
Publicado: (2024)
VesselGPT: Autoregressive Modeling of Vascular Geometry
por: Feldman, Paula, et al.
Publicado: (2025)
por: Feldman, Paula, et al.
Publicado: (2025)
Recursive Variational Autoencoders for 3D Blood Vessel Generative Modeling
por: Feldman, Paula, et al.
Publicado: (2025)
por: Feldman, Paula, et al.
Publicado: (2025)
VesselVAE: Recursive Variational Autoencoders for 3D Blood Vessel Synthesis
por: Feldman, Paula, et al.
Publicado: (2023)
por: Feldman, Paula, et al.
Publicado: (2023)
Pitfalls of Evaluating Language Models with Open Benchmarks
por: Hasan, Md. Najib, et al.
Publicado: (2025)
por: Hasan, Md. Najib, et al.
Publicado: (2025)
BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
por: Jung, Dahyun, et al.
Publicado: (2025)
por: Jung, Dahyun, et al.
Publicado: (2025)
OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models
por: Özen, Yıldırım, et al.
Publicado: (2025)
por: Özen, Yıldırım, et al.
Publicado: (2025)
CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models
por: Wang, Song, et al.
Publicado: (2024)
por: Wang, Song, et al.
Publicado: (2024)
Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
por: Kim, Seungone, et al.
Publicado: (2024)
por: Kim, Seungone, et al.
Publicado: (2024)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
por: Harsh, Reetu Raj, et al.
Publicado: (2026)
por: Harsh, Reetu Raj, et al.
Publicado: (2026)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek
por: Zhang, Yang, et al.
Publicado: (2026)
por: Zhang, Yang, et al.
Publicado: (2026)
Benchmarking Open-Source Large Language Models on Healthcare Text Classification Tasks
por: Guo, Yuting, et al.
Publicado: (2025)
por: Guo, Yuting, et al.
Publicado: (2025)
Social Bias Probing: Fairness Benchmarking for Language Models
por: Manerba, Marta Marchiori, et al.
Publicado: (2023)
por: Manerba, Marta Marchiori, et al.
Publicado: (2023)
Benchmark Transparency: Measuring the Impact of Data on Evaluation
por: Kovatchev, Venelin, et al.
Publicado: (2024)
por: Kovatchev, Venelin, et al.
Publicado: (2024)
DEP: A Decentralized Large Language Model Evaluation Protocol
por: Peng, Jianxiang, et al.
Publicado: (2026)
por: Peng, Jianxiang, et al.
Publicado: (2026)
Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
por: Bi, Ziqian, et al.
Publicado: (2025)
por: Bi, Ziqian, et al.
Publicado: (2025)
Test-Time Fairness and Robustness in Large Language Models
por: Cotta, Leonardo, et al.
Publicado: (2024)
por: Cotta, Leonardo, et al.
Publicado: (2024)
Benchmarking Open-Source Large Language Models for Persian in Zero-Shot and Few-Shot Learning
por: Cherakhloo, Mahdi, et al.
Publicado: (2025)
por: Cherakhloo, Mahdi, et al.
Publicado: (2025)
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
por: Singh, Abhinav Kumar, et al.
Publicado: (2026)
por: Singh, Abhinav Kumar, et al.
Publicado: (2026)
Lynx: An Open Source Hallucination Evaluation Model
por: Ravi, Selvan Sunitha, et al.
Publicado: (2024)
por: Ravi, Selvan Sunitha, et al.
Publicado: (2024)
An Open-Source Web-Based Tool for Evaluating Open-Source Large Language Models Leveraging Information Retrieval from Custom Documents
por: I, Godfrey
Publicado: (2025)
por: I, Godfrey
Publicado: (2025)
Leveraging Open-Source Large Language Models for Native Language Identification
por: Ng, Yee Man, et al.
Publicado: (2024)
por: Ng, Yee Man, et al.
Publicado: (2024)
FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
por: Rumiantsev, Pavel, et al.
Publicado: (2025)
por: Rumiantsev, Pavel, et al.
Publicado: (2025)
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
por: Zhang, Ming, et al.
Publicado: (2025)
por: Zhang, Ming, et al.
Publicado: (2025)
Evaluating Open-Source Large Language Models for Technical Telecom Question Answering
por: Caraus, Arina, et al.
Publicado: (2025)
por: Caraus, Arina, et al.
Publicado: (2025)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
por: Amjad, Husnain, et al.
Publicado: (2026)
por: Amjad, Husnain, et al.
Publicado: (2026)
BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains
por: Labrak, Yanis, et al.
Publicado: (2024)
por: Labrak, Yanis, et al.
Publicado: (2024)
A Trip Towards Fairness: Bias and De-Biasing in Large Language Models
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
LLMs on Trial: Evaluating Judicial Fairness for Large Language Models
por: Hu, Yiran, et al.
Publicado: (2025)
por: Hu, Yiran, et al.
Publicado: (2025)
Narrative Context Protocol: An Open-Source Storytelling Framework for Generative AI
por: Gerba, Hank
Publicado: (2025)
por: Gerba, Hank
Publicado: (2025)
OpenThaiGPT 1.5: A Thai-Centric Open Source Large Language Model
por: Yuenyong, Sumeth, et al.
Publicado: (2024)
por: Yuenyong, Sumeth, et al.
Publicado: (2024)
Evalita-LLM: Benchmarking Large Language Models on Italian
por: Magnini, Bernardo, et al.
Publicado: (2025)
por: Magnini, Bernardo, et al.
Publicado: (2025)
Fine-Tuning and Evaluating Open-Source Large Language Models for the Army Domain
por: Ruiz, Daniel C., et al.
Publicado: (2024)
por: Ruiz, Daniel C., et al.
Publicado: (2024)
OpenLearnLM Benchmark: A Unified Framework for Evaluating Knowledge, Skill, and Attitude in Educational Large Language Models
por: Lee, Unggi, et al.
Publicado: (2026)
por: Lee, Unggi, et al.
Publicado: (2026)
Ejemplares similares
-
Validating Deep Models for Alzheimer's 18F-FDG PET Diagnosis Across Populations: A Study with Latin American Data
por: Massaroli, Hugo, et al.
Publicado: (2025) -
Do Large Language Models Understand Data Visualization Rules?
por: Sinnona, Martin, et al.
Publicado: (2026) -
Do Large Language Models Understand Data Visualization Principles?
por: Sinnona, Martin, et al.
Publicado: (2026) -
De-rendering, Reasoning, and Repairing Charts with Vision-Language Models
por: Bonas, Valentin, et al.
Publicado: (2026) -
DUDF: Differentiable Unsigned Distance Fields with Hyperbolic Scaling
por: Fainstein, Miguel, et al.
Publicado: (2024)