Saved in:
| Main Author: | Henry, Jazmia |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2604.17573 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Prompting Fairness: Artificial Intelligence as Game Players
by: Henry, Jazmia
Published: (2024)
by: Henry, Jazmia
Published: (2024)
Beyond Static Snapshots: Dynamic Modeling and Forecasting of Group-Level Value Evolution with Large Language Models
by: Pi, Qiankun, et al.
Published: (2026)
by: Pi, Qiankun, et al.
Published: (2026)
Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine
by: Viviers, Christiaan G. A., et al.
Published: (2026)
by: Viviers, Christiaan G. A., et al.
Published: (2026)
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
by: Ritchie, Logan, et al.
Published: (2026)
by: Ritchie, Logan, et al.
Published: (2026)
Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design
by: Jacob, Bruno, et al.
Published: (2025)
by: Jacob, Bruno, et al.
Published: (2025)
Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems
by: Mehta, Sushant
Published: (2025)
by: Mehta, Sushant
Published: (2025)
Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier
by: Badrinath, Anirudhan, et al.
Published: (2024)
by: Badrinath, Anirudhan, et al.
Published: (2024)
The Evaluation Game: Beyond Static LLM Benchmarking
by: Wang, Paul, et al.
Published: (2026)
by: Wang, Paul, et al.
Published: (2026)
Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems
by: Akshathala, Sreemaee, et al.
Published: (2025)
by: Akshathala, Sreemaee, et al.
Published: (2025)
TeachBench: A Syllabus-Grounded Framework for Evaluating Teaching Ability in Large Language Models
by: Li, Zheng, et al.
Published: (2026)
by: Li, Zheng, et al.
Published: (2026)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
by: Wang, Yixu, et al.
Published: (2025)
by: Wang, Yixu, et al.
Published: (2025)
ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence
by: Foundation, ARC Prize
Published: (2026)
by: Foundation, ARC Prize
Published: (2026)
A Unified Framework for the Evaluation of LLM Agentic Capabilities
by: Zhu, Pengyu, et al.
Published: (2026)
by: Zhu, Pengyu, et al.
Published: (2026)
Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation
by: Chen, Xupeng, et al.
Published: (2026)
by: Chen, Xupeng, et al.
Published: (2026)
Beyond SMILES: Evaluating Agentic Systems for Drug Discovery
by: Wijaya, Edward
Published: (2026)
by: Wijaya, Edward
Published: (2026)
LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation
by: Kim, Eunsu, et al.
Published: (2024)
by: Kim, Eunsu, et al.
Published: (2024)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
by: Wang, Haibo, et al.
Published: (2026)
by: Wang, Haibo, et al.
Published: (2026)
Beyond Metrics: A Critical Analysis of the Variability in Large Language Model Evaluation Frameworks
by: Pimentel, Marco AF, et al.
Published: (2024)
by: Pimentel, Marco AF, et al.
Published: (2024)
Beyond Static Assumptions: the Predictive Justified Perspective Model for Epistemic Planning
by: Hu, Guang, et al.
Published: (2024)
by: Hu, Guang, et al.
Published: (2024)
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
by: Jia, Furong, et al.
Published: (2026)
by: Jia, Furong, et al.
Published: (2026)
Evaluating Small Language Models for Agentic On-Farm Decision Support Systems
by: Liu, Enhong, et al.
Published: (2025)
by: Liu, Enhong, et al.
Published: (2025)
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
by: Chu, Meng, et al.
Published: (2026)
by: Chu, Meng, et al.
Published: (2026)
PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
by: Imani, Shima, et al.
Published: (2025)
by: Imani, Shima, et al.
Published: (2025)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
by: Shi, Zhichao, et al.
Published: (2025)
by: Shi, Zhichao, et al.
Published: (2025)
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
by: Gu, Zheyuan, et al.
Published: (2026)
by: Gu, Zheyuan, et al.
Published: (2026)
Sabotage Evaluations for Frontier Models
by: Benton, Joe, et al.
Published: (2024)
by: Benton, Joe, et al.
Published: (2024)
Governing AI Beyond the Pretraining Frontier
by: Caputo, Nicholas A.
Published: (2025)
by: Caputo, Nicholas A.
Published: (2025)
Frontier AI Ethics: Anticipating and Evaluating the Societal Impacts of Language Model Agents
by: Lazar, Seth
Published: (2024)
by: Lazar, Seth
Published: (2024)
Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search
by: Chen, Yiqun, et al.
Published: (2026)
by: Chen, Yiqun, et al.
Published: (2026)
Knowledge-Grounded Agentic Large Language Models for Multi-Hazard Understanding from Reconnaissance Reports
by: Kuai, Chenchen, et al.
Published: (2025)
by: Kuai, Chenchen, et al.
Published: (2025)
Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games
by: Su, Chris, et al.
Published: (2025)
by: Su, Chris, et al.
Published: (2025)
How NOT to benchmark your SITE metric: Beyond Static Leaderboards and Towards Realistic Evaluation
by: Singh, Prabhant, et al.
Published: (2025)
by: Singh, Prabhant, et al.
Published: (2025)
An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc
by: Zhang, Hong, et al.
Published: (2026)
by: Zhang, Hong, et al.
Published: (2026)
A Frontier AI Risk Management Framework: Bridging the Gap Between Current AI Practices and Established Risk Management
by: Campos, Simeon, et al.
Published: (2025)
by: Campos, Simeon, et al.
Published: (2025)
Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning
by: Sobhani, Mahbub E, et al.
Published: (2025)
by: Sobhani, Mahbub E, et al.
Published: (2025)
GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support
by: Sheikh, Muhammad Umer, et al.
Published: (2026)
by: Sheikh, Muhammad Umer, et al.
Published: (2026)
Exploring the Frontiers of Softmax: Provable Optimization, Applications in Diffusion Model, and Beyond
by: Cao, Yang, et al.
Published: (2024)
by: Cao, Yang, et al.
Published: (2024)
Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization
by: Yao, Yihang, et al.
Published: (2026)
by: Yao, Yihang, et al.
Published: (2026)
Are Frontier Large Language Models Suitable for Q&A in Science Centres?
by: Watson, Jacob, et al.
Published: (2024)
by: Watson, Jacob, et al.
Published: (2024)
Modeling Expert AI Diagnostic Alignment via Immutable Inference Snapshots
by: Panagoulias, Dimitrios P., et al.
Published: (2026)
by: Panagoulias, Dimitrios P., et al.
Published: (2026)
Similar Items
-
Prompting Fairness: Artificial Intelligence as Game Players
by: Henry, Jazmia
Published: (2024) -
Beyond Static Snapshots: Dynamic Modeling and Forecasting of Group-Level Value Evolution with Large Language Models
by: Pi, Qiankun, et al.
Published: (2026) -
Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine
by: Viviers, Christiaan G. A., et al.
Published: (2026) -
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
by: Ritchie, Logan, et al.
Published: (2026) -
Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design
by: Jacob, Bruno, et al.
Published: (2025)