Saved in:
| Main Authors: | Massaroli, Hugo, Iara, Leonardo, Iarussi, Emmanuel, Siless, Viviana |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2508.09993 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Validating Deep Models for Alzheimer's 18F-FDG PET Diagnosis Across Populations: A Study with Latin American Data
by: Massaroli, Hugo, et al.
Published: (2025)
by: Massaroli, Hugo, et al.
Published: (2025)
Do Large Language Models Understand Data Visualization Rules?
by: Sinnona, Martin, et al.
Published: (2026)
by: Sinnona, Martin, et al.
Published: (2026)
Do Large Language Models Understand Data Visualization Principles?
by: Sinnona, Martin, et al.
Published: (2026)
by: Sinnona, Martin, et al.
Published: (2026)
De-rendering, Reasoning, and Repairing Charts with Vision-Language Models
by: Bonas, Valentin, et al.
Published: (2026)
by: Bonas, Valentin, et al.
Published: (2026)
DUDF: Differentiable Unsigned Distance Fields with Hyperbolic Scaling
by: Fainstein, Miguel, et al.
Published: (2024)
by: Fainstein, Miguel, et al.
Published: (2024)
VesselGPT: Autoregressive Modeling of Vascular Geometry
by: Feldman, Paula, et al.
Published: (2025)
by: Feldman, Paula, et al.
Published: (2025)
Recursive Variational Autoencoders for 3D Blood Vessel Generative Modeling
by: Feldman, Paula, et al.
Published: (2025)
by: Feldman, Paula, et al.
Published: (2025)
VesselVAE: Recursive Variational Autoencoders for 3D Blood Vessel Synthesis
by: Feldman, Paula, et al.
Published: (2023)
by: Feldman, Paula, et al.
Published: (2023)
Pitfalls of Evaluating Language Models with Open Benchmarks
by: Hasan, Md. Najib, et al.
Published: (2025)
by: Hasan, Md. Najib, et al.
Published: (2025)
BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
by: Jung, Dahyun, et al.
Published: (2025)
by: Jung, Dahyun, et al.
Published: (2025)
CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models
by: Wang, Song, et al.
Published: (2024)
by: Wang, Song, et al.
Published: (2024)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
by: Harsh, Reetu Raj, et al.
Published: (2026)
by: Harsh, Reetu Raj, et al.
Published: (2026)
OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models
by: Özen, Yıldırım, et al.
Published: (2025)
by: Özen, Yıldırım, et al.
Published: (2025)
Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
by: Kim, Seungone, et al.
Published: (2024)
by: Kim, Seungone, et al.
Published: (2024)
Benchmarking Open-Source Large Language Models on Healthcare Text Classification Tasks
by: Guo, Yuting, et al.
Published: (2025)
by: Guo, Yuting, et al.
Published: (2025)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek
by: Zhang, Yang, et al.
Published: (2026)
by: Zhang, Yang, et al.
Published: (2026)
Social Bias Probing: Fairness Benchmarking for Language Models
by: Manerba, Marta Marchiori, et al.
Published: (2023)
by: Manerba, Marta Marchiori, et al.
Published: (2023)
Test-Time Fairness and Robustness in Large Language Models
by: Cotta, Leonardo, et al.
Published: (2024)
by: Cotta, Leonardo, et al.
Published: (2024)
Benchmark Transparency: Measuring the Impact of Data on Evaluation
by: Kovatchev, Venelin, et al.
Published: (2024)
by: Kovatchev, Venelin, et al.
Published: (2024)
Lynx: An Open Source Hallucination Evaluation Model
by: Ravi, Selvan Sunitha, et al.
Published: (2024)
by: Ravi, Selvan Sunitha, et al.
Published: (2024)
BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains
by: Labrak, Yanis, et al.
Published: (2024)
by: Labrak, Yanis, et al.
Published: (2024)
Benchmarking Open-Source Large Language Models for Persian in Zero-Shot and Few-Shot Learning
by: Cherakhloo, Mahdi, et al.
Published: (2025)
by: Cherakhloo, Mahdi, et al.
Published: (2025)
DEP: A Decentralized Large Language Model Evaluation Protocol
by: Peng, Jianxiang, et al.
Published: (2026)
by: Peng, Jianxiang, et al.
Published: (2026)
FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
by: Rumiantsev, Pavel, et al.
Published: (2025)
by: Rumiantsev, Pavel, et al.
Published: (2025)
An Open-Source Web-Based Tool for Evaluating Open-Source Large Language Models Leveraging Information Retrieval from Custom Documents
by: I, Godfrey
Published: (2025)
by: I, Godfrey
Published: (2025)
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
by: Singh, Abhinav Kumar, et al.
Published: (2026)
by: Singh, Abhinav Kumar, et al.
Published: (2026)
Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
by: Bi, Ziqian, et al.
Published: (2025)
by: Bi, Ziqian, et al.
Published: (2025)
Evalita-LLM: Benchmarking Large Language Models on Italian
by: Magnini, Bernardo, et al.
Published: (2025)
by: Magnini, Bernardo, et al.
Published: (2025)
A Trip Towards Fairness: Bias and De-Biasing in Large Language Models
by: Ranaldi, Leonardo, et al.
Published: (2023)
by: Ranaldi, Leonardo, et al.
Published: (2023)
Evaluating Open-Source Large Language Models for Technical Telecom Question Answering
by: Caraus, Arina, et al.
Published: (2025)
by: Caraus, Arina, et al.
Published: (2025)
Leveraging Open-Source Large Language Models for Native Language Identification
by: Ng, Yee Man, et al.
Published: (2024)
by: Ng, Yee Man, et al.
Published: (2024)
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
by: Zhang, Ming, et al.
Published: (2025)
by: Zhang, Ming, et al.
Published: (2025)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
by: Amjad, Husnain, et al.
Published: (2026)
by: Amjad, Husnain, et al.
Published: (2026)
Narrative Context Protocol: An Open-Source Storytelling Framework for Generative AI
by: Gerba, Hank
Published: (2025)
by: Gerba, Hank
Published: (2025)
Fine-Tuning and Evaluating Open-Source Large Language Models for the Army Domain
by: Ruiz, Daniel C., et al.
Published: (2024)
by: Ruiz, Daniel C., et al.
Published: (2024)
LLMs on Trial: Evaluating Judicial Fairness for Large Language Models
by: Hu, Yiran, et al.
Published: (2025)
by: Hu, Yiran, et al.
Published: (2025)
OpenThaiGPT 1.5: A Thai-Centric Open Source Large Language Model
by: Yuenyong, Sumeth, et al.
Published: (2024)
by: Yuenyong, Sumeth, et al.
Published: (2024)
Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese
by: Kawai, Masataka, et al.
Published: (2026)
by: Kawai, Masataka, et al.
Published: (2026)
Similar Items
-
Validating Deep Models for Alzheimer's 18F-FDG PET Diagnosis Across Populations: A Study with Latin American Data
by: Massaroli, Hugo, et al.
Published: (2025) -
Do Large Language Models Understand Data Visualization Rules?
by: Sinnona, Martin, et al.
Published: (2026) -
Do Large Language Models Understand Data Visualization Principles?
by: Sinnona, Martin, et al.
Published: (2026) -
De-rendering, Reasoning, and Repairing Charts with Vision-Language Models
by: Bonas, Valentin, et al.
Published: (2026) -
DUDF: Differentiable Unsigned Distance Fields with Hyperbolic Scaling
by: Fainstein, Miguel, et al.
Published: (2024)