BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Metcalf, Sara, Schoenberg, William |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Well Can AI Build SD Models?
por: Schoenberg, William, et al.
Publicado: (2025)
por: Schoenberg, William, et al.
Publicado: (2025)
BEExAI: Benchmark to Evaluate Explainable AI
por: Sithakoul, Samuel, et al.
Publicado: (2024)
por: Sithakoul, Samuel, et al.
Publicado: (2024)
The Qualitative Engine: Creating and Evaluating an Iterative AI Modeling Tool
por: William Schoenberg, et al.
Publicado: (2026)
por: William Schoenberg, et al.
Publicado: (2026)
Building and Learning With Models Using AI
por: William Schoenberg
Publicado: (2026)
por: William Schoenberg
Publicado: (2026)
MDGYM: Benchmarking AI Agents on Molecular Simulations
por: Kumar, Vinay, et al.
Publicado: (2026)
por: Kumar, Vinay, et al.
Publicado: (2026)
TRIAGE: Ethical Benchmarking of AI Models Through Mass Casualty Simulations
por: Kirch, Nathalie Maria, et al.
Publicado: (2024)
por: Kirch, Nathalie Maria, et al.
Publicado: (2024)
Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines
por: Gulati, Akshay, et al.
Publicado: (2026)
por: Gulati, Akshay, et al.
Publicado: (2026)
FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
por: Glazer, Elliot, et al.
Publicado: (2024)
por: Glazer, Elliot, et al.
Publicado: (2024)
AI Act Evaluation Benchmark: An Open, Transparent, and Reproducible Evaluation Dataset for NLP and RAG Systems
por: Davvetas, Athanasios, et al.
Publicado: (2026)
por: Davvetas, Athanasios, et al.
Publicado: (2026)
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
por: Liu, Yi, et al.
Publicado: (2026)
por: Liu, Yi, et al.
Publicado: (2026)
Enterprise Large Language Model Evaluation Benchmark
por: Wang, Liya, et al.
Publicado: (2025)
por: Wang, Liya, et al.
Publicado: (2025)
A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents
por: Li, Miles Q., et al.
Publicado: (2025)
por: Li, Miles Q., et al.
Publicado: (2025)
Unsteady Metrics and Benchmarking Cultures of AI Model Builders
por: Baack, Stefan, et al.
Publicado: (2026)
por: Baack, Stefan, et al.
Publicado: (2026)
AI Benchmarks and Datasets for LLM Evaluation
por: Ivanov, Todor, et al.
Publicado: (2024)
por: Ivanov, Todor, et al.
Publicado: (2024)
Evaluation of Agents under Simulated AI Marketplace Dynamics
por: Kim, To Eun, et al.
Publicado: (2026)
por: Kim, To Eun, et al.
Publicado: (2026)
Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows
por: Dalal, Dhairya, et al.
Publicado: (2026)
por: Dalal, Dhairya, et al.
Publicado: (2026)
AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models
por: Yao, Fanglong, et al.
Publicado: (2024)
por: Yao, Fanglong, et al.
Publicado: (2024)
The Validity Gap in Health AI Evaluation: A Cross-Sectional Analysis of Benchmark Composition
por: Rajkomar, Alvin, et al.
Publicado: (2026)
por: Rajkomar, Alvin, et al.
Publicado: (2026)
SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems
por: Yang, Zonglin, et al.
Publicado: (2026)
por: Yang, Zonglin, et al.
Publicado: (2026)
Benchmarking and Evaluation of AI Models in Biology: Outcomes and Recommendations from the CZI Virtual Cells Workshop
por: Fahsbender, Elizabeth, et al.
Publicado: (2025)
por: Fahsbender, Elizabeth, et al.
Publicado: (2025)
LegalScore: Development of a Benchmark for Evaluating AI Models in Legal Career Exams in Brazil
por: Caparroz, Roberto, et al.
Publicado: (2025)
por: Caparroz, Roberto, et al.
Publicado: (2025)
AI Playing Business Games: Benchmarking Large Language Models on Managerial Decision-Making in Dynamic Simulations
por: Ovezmyradov, Berdymyrat
Publicado: (2025)
por: Ovezmyradov, Berdymyrat
Publicado: (2025)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
por: Jin, Tengjun, et al.
Publicado: (2025)
por: Jin, Tengjun, et al.
Publicado: (2025)
Efficient Benchmarking of AI Agents
por: Ndzomga, Franck
Publicado: (2026)
por: Ndzomga, Franck
Publicado: (2026)
Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning
por: Li, Fangjun, et al.
Publicado: (2024)
por: Li, Fangjun, et al.
Publicado: (2024)
AIReg-Bench: Benchmarking Language Models That Assess AI Regulation Compliance
por: Marino, Bill, et al.
Publicado: (2025)
por: Marino, Bill, et al.
Publicado: (2025)
Benchmarking Large Language Models for Personalized Guidance in AI-Enhanced Learning
por: Yuan, Bo, et al.
Publicado: (2025)
por: Yuan, Bo, et al.
Publicado: (2025)
PREDICT: Preference Reasoning by Evaluating Decomposed preferences Inferred from Candidate Trajectories
por: Aroca-Ouellette, Stephane, et al.
Publicado: (2024)
por: Aroca-Ouellette, Stephane, et al.
Publicado: (2024)
Large Legislative Models: Towards Efficient AI Policymaking in Economic Simulations
por: Gasztowtt, Henry, et al.
Publicado: (2024)
por: Gasztowtt, Henry, et al.
Publicado: (2024)
Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models II: Benchmark Generation Process
por: Ackerman, Gary, et al.
Publicado: (2025)
por: Ackerman, Gary, et al.
Publicado: (2025)
A Survey on Multimodal Benchmarks: In the Era of Large AI Models
por: Li, Lin, et al.
Publicado: (2024)
por: Li, Lin, et al.
Publicado: (2024)
When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation
por: Akhtar, Mubashara, et al.
Publicado: (2026)
por: Akhtar, Mubashara, et al.
Publicado: (2026)
AIDABench: AI Data Analytics Benchmark
por: Yang, Yibo, et al.
Publicado: (2026)
por: Yang, Yibo, et al.
Publicado: (2026)
A Rosetta Stone for AI Benchmarks
por: Ho, Anson, et al.
Publicado: (2025)
por: Ho, Anson, et al.
Publicado: (2025)
Beyond Benchmarks: The Economics of AI Inference
por: Zhuang, Boqin, et al.
Publicado: (2025)
por: Zhuang, Boqin, et al.
Publicado: (2025)
Generating Benchmarks for Factuality Evaluation of Language Models
por: Muhlgay, Dor, et al.
Publicado: (2023)
por: Muhlgay, Dor, et al.
Publicado: (2023)
Towards Competent AI for Fundamental Analysis in Finance: A Benchmark Dataset and Evaluation
por: Wu, Zonghan, et al.
Publicado: (2025)
por: Wu, Zonghan, et al.
Publicado: (2025)
FreshBrew: A Benchmark for Evaluating AI Agents on Java Code Migration
por: May, Victor, et al.
Publicado: (2025)
por: May, Victor, et al.
Publicado: (2025)
Toward Trustworthy Evaluation of Sustainability Rating Methodologies: A Human-AI Collaborative Framework for Benchmark Dataset Construction
por: Cai, Xiaoran, et al.
Publicado: (2026)
por: Cai, Xiaoran, et al.
Publicado: (2026)
Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation
por: Lee, Huije, et al.
Publicado: (2026)
por: Lee, Huije, et al.
Publicado: (2026)
Ejemplares similares
-
How Well Can AI Build SD Models?
por: Schoenberg, William, et al.
Publicado: (2025) -
BEExAI: Benchmark to Evaluate Explainable AI
por: Sithakoul, Samuel, et al.
Publicado: (2024) -
The Qualitative Engine: Creating and Evaluating an Iterative AI Modeling Tool
por: William Schoenberg, et al.
Publicado: (2026) -
Building and Learning With Models Using AI
por: William Schoenberg
Publicado: (2026) -
MDGYM: Benchmarking AI Agents on Molecular Simulations
por: Kumar, Vinay, et al.
Publicado: (2026)