Sapiens Benchmarking: A Rigorous Mathematical Framework for Automated and Scalable Language Model Evaluation
Fuente:
Zenodo
Saved in:
| Main Author: | Ben-Hur Varriano |
|---|---|
| Format: | Recurso digital |
| Published: |
Zenodo
2026
|
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Novel Multi-Layer HurNet Architecture: A Fast Alternative to Traditional Deep Neural Networks
by: Ben-Hur Varriano
Published: (2026)
by: Ben-Hur Varriano
Published: (2026)
An Evaluation of the Infinite Fractal Descent Framework: Scientific Validity, Mathematical Rigor, and Authorship Analysis
by: Nasanjargal, Enkhamgalan
Published: (2026)
by: Nasanjargal, Enkhamgalan
Published: (2026)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
by: Ukai, Mahiro, et al.
Published: (2025)
by: Ukai, Mahiro, et al.
Published: (2025)
Rolandion Algebra as a Mathematically Rigorous Framework for Quantum Gravity
by: Caulfield, Thomas
Published: (2025)
by: Caulfield, Thomas
Published: (2025)
Zero-shot Benchmarking: A Framework for Flexible and Scalable Automatic Evaluation of Language Models
by: Pombal, José, et al.
Published: (2025)
by: Pombal, José, et al.
Published: (2025)
JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models
by: Geng, Saibo, et al.
Published: (2025)
by: Geng, Saibo, et al.
Published: (2025)
Stop Automating Peer Review Without Rigorous Evaluation
by: Baumann, Joachim, et al.
Published: (2026)
by: Baumann, Joachim, et al.
Published: (2026)
Spark-LLM-Eval: A Distributed Framework for Statistically Rigorous Large Language Model Evaluation
by: Mitra, Subhadip
Published: (2026)
by: Mitra, Subhadip
Published: (2026)
Graduated Panpsychism with Information-Integration Spectrum: A Mathematically Rigorous Framework for Consciousness
by: TAN, Kwan Hong
Published: (2026)
by: TAN, Kwan Hong
Published: (2026)
A Scalable Framework for Evaluating Health Language Models
by: Mallinar, Neil, et al.
Published: (2025)
by: Mallinar, Neil, et al.
Published: (2025)
Sapiens2
by: Khirodkar, Rawal, et al.
Published: (2026)
by: Khirodkar, Rawal, et al.
Published: (2026)
Vianna Sapiens
Published: (2019)
Published: (2019)
DaisyRec 2.0: Benchmarking Recommendation for Rigorous Evaluation
by: Sun, Zhu, et al.
Published: (2022)
by: Sun, Zhu, et al.
Published: (2022)
Sapiens: Foundation for Human Vision Models
by: Khirodkar, Rawal, et al.
Published: (2024)
by: Khirodkar, Rawal, et al.
Published: (2024)
Planetarium: A Rigorous Benchmark for Translating Text to Structured Planning Languages
by: Zuo, Max, et al.
Published: (2024)
by: Zuo, Max, et al.
Published: (2024)
An Interpretable and Scalable Framework for Evaluating Large Language Models
by: Qu, Xinhao, et al.
Published: (2026)
by: Qu, Xinhao, et al.
Published: (2026)
RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
by: Zhang, Jie, et al.
Published: (2025)
by: Zhang, Jie, et al.
Published: (2025)
DeepMath-Creative: A Benchmark for Evaluating Mathematical Creativity of Large Language Models
by: Chen, Xiaoyang, et al.
Published: (2025)
by: Chen, Xiaoyang, et al.
Published: (2025)
Birthing Techno-Sapiens
Published: (2023)
Published: (2023)
A Comprehensive Assessment Benchmark for Rigorously Evaluating Deep Learning Image Classifiers
by: Spratling, Michael W.
Published: (2023)
by: Spratling, Michael W.
Published: (2023)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
by: Amjad, Husnain, et al.
Published: (2026)
by: Amjad, Husnain, et al.
Published: (2026)
Naná Vasconcelos - o berimbau global
by: Ben-Hur Demeneck
Published: (2013)
by: Ben-Hur Demeneck
Published: (2013)
Inodoro Pereyra: um gaúcho separado por Tordesilhas
by: Ben-Hur Demeneck
Published: (2012)
by: Ben-Hur Demeneck
Published: (2012)
Desenvolvimento e transição de habilidades dos trabalhadores para a diversificação industrial inteligente: um estudo de caso para Santa Catarina
by: Ben-Hur Cardoso
Published: (2025)
by: Ben-Hur Cardoso
Published: (2025)
¿Homo Sapiens u Ogro Sapiens? Los jefes duros de roer
by: Franco Lotito Catino
Published: (2016)
by: Franco Lotito Catino
Published: (2016)
Prompt Risk Control: A Rigorous Framework for Responsible Deployment of Large Language Models
by: Zollo, Thomas P., et al.
Published: (2023)
by: Zollo, Thomas P., et al.
Published: (2023)
Beurling and Model subspaces invariant under a universal operator
by: Eidt, Ben Hur, et al.
Published: (2024)
by: Eidt, Ben Hur, et al.
Published: (2024)
Beyond Memorization: A Rigorous Evaluation Framework for Medical Knowledge Editing
by: Chen, Shigeng, et al.
Published: (2025)
by: Chen, Shigeng, et al.
Published: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
by: Liu, Yan, et al.
Published: (2024)
by: Liu, Yan, et al.
Published: (2024)
Episodic Memories Generation and Evaluation Benchmark for Large Language Models
by: Huet, Alexis, et al.
Published: (2025)
by: Huet, Alexis, et al.
Published: (2025)
Boletín Científico Sapiens Research
Published: (2012)
Published: (2012)
Sapiens: In the path of the human being
by: Jordi Agustí
Published: (2018)
by: Jordi Agustí
Published: (2018)
ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation
by: Meng, Qianru, et al.
Published: (2025)
by: Meng, Qianru, et al.
Published: (2025)
AGENTCL: Toward Rigorous Evaluation of Continual Learning in Language Agents
by: Shu, Yiheng, et al.
Published: (2026)
by: Shu, Yiheng, et al.
Published: (2026)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
by: Zou, Chengke, et al.
Published: (2024)
by: Zou, Chengke, et al.
Published: (2024)
Aportes sobre el correlato neuroanatómico de la personalidad
by: Ben-Hur Palma H.
Published: (2016)
by: Ben-Hur Palma H.
Published: (2016)
Improve Mathematical Reasoning in Language Models by Automated Process Supervision
by: Luo, Liangchen, et al.
Published: (2024)
by: Luo, Liangchen, et al.
Published: (2024)
CausalProfiler: Generating Synthetic Benchmarks for Rigorous and Transparent Evaluation of Causal Machine Learning
by: Panayiotou, Panayiotis, et al.
Published: (2025)
by: Panayiotou, Panayiotis, et al.
Published: (2025)
Towards Scalable Automated Grading: Leveraging Large Language Models for Conceptual Question Evaluation in Engineering
by: Gao, Rujun, et al.
Published: (2024)
by: Gao, Rujun, et al.
Published: (2024)
Toward Automated Robustness Evaluation of Mathematical Reasoning
by: Hou, Yutao, et al.
Published: (2025)
by: Hou, Yutao, et al.
Published: (2025)
Similar Items
-
A Novel Multi-Layer HurNet Architecture: A Fast Alternative to Traditional Deep Neural Networks
by: Ben-Hur Varriano
Published: (2026) -
An Evaluation of the Infinite Fractal Descent Framework: Scientific Validity, Mathematical Rigor, and Authorship Analysis
by: Nasanjargal, Enkhamgalan
Published: (2026) -
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
by: Ukai, Mahiro, et al.
Published: (2025) -
Rolandion Algebra as a Mathematically Rigorous Framework for Quantum Gravity
by: Caulfield, Thomas
Published: (2025) -
Zero-shot Benchmarking: A Framework for Flexible and Scalable Automatic Evaluation of Language Models
by: Pombal, José, et al.
Published: (2025)