What should an AI assessor optimise for?
Fuente:
arXiv
Salvato in:
| Autori principali: | Romero-Alvarado, Daniel, Martínez-Plumed, Fernando, Hernández-Orallo, José |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Capabilities Ain't All You Need: Measuring Propensities in AI
di: Romero-Alvarado, Daniel, et al.
Pubblicazione: (2026)
di: Romero-Alvarado, Daniel, et al.
Pubblicazione: (2026)
PredictaBoard: Benchmarking LLM Score Predictability
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2025)
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2025)
Measuring What AI Systems Might Do: Towards A Measurement Science in AI
di: Voudouris, Konstantinos, et al.
Pubblicazione: (2026)
di: Voudouris, Konstantinos, et al.
Pubblicazione: (2026)
Paradigms of AI Evaluation: Mapping Goals, Methodologies and Culture
di: Burden, John, et al.
Pubblicazione: (2025)
di: Burden, John, et al.
Pubblicazione: (2025)
100 instances is all you need: predicting the success of a new LLM on unseen data by testing on a few instances
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2024)
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2024)
Cognitive Science-Inspired Evaluation of Core Capabilities for Object Understanding in AI
di: Rutar, Danaja, et al.
Pubblicazione: (2025)
di: Rutar, Danaja, et al.
Pubblicazione: (2025)
Position: agentic AI orchestration should be Bayes-consistent
di: Papamarkou, Theodore, et al.
Pubblicazione: (2026)
di: Papamarkou, Theodore, et al.
Pubblicazione: (2026)
Leveraging AI modelling for FDS with Simvue: monitor and optimise for more sustainable simulations
di: Panayis, James, et al.
Pubblicazione: (2025)
di: Panayis, James, et al.
Pubblicazione: (2025)
Which LIME should I trust? Concepts, Challenges, and Solutions
di: Knab, Patrick, et al.
Pubblicazione: (2025)
di: Knab, Patrick, et al.
Pubblicazione: (2025)
Digital Twins for forecasting and decision optimisation with machine learning: applications in wastewater treatment
di: Colwell, Matthew, et al.
Pubblicazione: (2024)
di: Colwell, Matthew, et al.
Pubblicazione: (2024)
Clifford Algebraic Rotor Embeddings : Maybe embeddings should start to CARE
di: Sriram, Sameeksha, et al.
Pubblicazione: (2025)
di: Sriram, Sameeksha, et al.
Pubblicazione: (2025)
When should we prefer Decision Transformers for Offline Reinforcement Learning?
di: Bhargava, Prajjwal, et al.
Pubblicazione: (2023)
di: Bhargava, Prajjwal, et al.
Pubblicazione: (2023)
From Human-Level AI Tales to AI Leveling Human Scales
di: Romero, Peter, et al.
Pubblicazione: (2026)
di: Romero, Peter, et al.
Pubblicazione: (2026)
Graders should cheat: privileged information enables expert-level automated evaluations
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
Understanding Likelihood Over-optimisation in Direct Alignment Algorithms
di: Shi, Zhengyan, et al.
Pubblicazione: (2024)
di: Shi, Zhengyan, et al.
Pubblicazione: (2024)
What's documented in AI? Systematic Analysis of 32K AI Model Cards
di: Liang, Weixin, et al.
Pubblicazione: (2024)
di: Liang, Weixin, et al.
Pubblicazione: (2024)
xAI-Drop: Don't Use What You Cannot Explain
di: De Luca, Vincenzo Marco, et al.
Pubblicazione: (2024)
di: De Luca, Vincenzo Marco, et al.
Pubblicazione: (2024)
Open Problems in Machine Unlearning for AI Safety
di: Barez, Fazl, et al.
Pubblicazione: (2025)
di: Barez, Fazl, et al.
Pubblicazione: (2025)
Seven simple steps for log analysis in AI systems
di: Dubois, Magda, et al.
Pubblicazione: (2026)
di: Dubois, Magda, et al.
Pubblicazione: (2026)
On Safer Reinforcement Learning for Sedation and Analgesia in Intensive Care
di: Romero-Hernandez, Joel, et al.
Pubblicazione: (2026)
di: Romero-Hernandez, Joel, et al.
Pubblicazione: (2026)
GLAI: GreenLightningAI for Accelerated Training through Knowledge Decoupling
di: Mestre, Jose I., et al.
Pubblicazione: (2025)
di: Mestre, Jose I., et al.
Pubblicazione: (2025)
What Cohort INRs Encode and Where to Freeze Them
di: Sideri-Lampretsa, Vasiliki, et al.
Pubblicazione: (2026)
di: Sideri-Lampretsa, Vasiliki, et al.
Pubblicazione: (2026)
Sheaf-Theoretic Transport and Obstruction for Detecting Scientific Theory Shift in AI Agents
di: Olivieri, David N., et al.
Pubblicazione: (2026)
di: Olivieri, David N., et al.
Pubblicazione: (2026)
Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research
di: Cooper, A. Feder, et al.
Pubblicazione: (2024)
di: Cooper, A. Feder, et al.
Pubblicazione: (2024)
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
di: Hoang, Huy, et al.
Pubblicazione: (2025)
di: Hoang, Huy, et al.
Pubblicazione: (2025)
What LLMs Think When You Don't Tell Them What to Think About?
di: Kwon, Yongchan, et al.
Pubblicazione: (2026)
di: Kwon, Yongchan, et al.
Pubblicazione: (2026)
What Understanding Means in AI-Laden Astronomy
di: Ting, Yuan-Sen, et al.
Pubblicazione: (2026)
di: Ting, Yuan-Sen, et al.
Pubblicazione: (2026)
Optimisation Is Not What You Need
di: Ibias, Alfredo
Pubblicazione: (2025)
di: Ibias, Alfredo
Pubblicazione: (2025)
What Causes Postoperative Aspiration?
di: Nagesh, Supriya, et al.
Pubblicazione: (2025)
di: Nagesh, Supriya, et al.
Pubblicazione: (2025)
What is the Alignment Objective of GRPO?
di: Vojnovic, Milan, et al.
Pubblicazione: (2025)
di: Vojnovic, Milan, et al.
Pubblicazione: (2025)
What Matters in Data for DPO?
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
What type of inference is planning?
di: Lázaro-Gredilla, Miguel, et al.
Pubblicazione: (2024)
di: Lázaro-Gredilla, Miguel, et al.
Pubblicazione: (2024)
Agentic AI for Mobile Network RAN Management and Optimization
di: Pellejero, Jorge, et al.
Pubblicazione: (2025)
di: Pellejero, Jorge, et al.
Pubblicazione: (2025)
Framing AI System Benchmarking as a Learning Task: FlexBench and the Open MLPerf Dataset
di: Fursin, Grigori, et al.
Pubblicazione: (2025)
di: Fursin, Grigori, et al.
Pubblicazione: (2025)
Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents
di: Testini, Irene, et al.
Pubblicazione: (2025)
di: Testini, Irene, et al.
Pubblicazione: (2025)
What Limits Agentic Systems Efficiency?
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
What Do Learned Models Measure?
di: Žliobaitė, Indrė
Pubblicazione: (2026)
di: Žliobaitė, Indrė
Pubblicazione: (2026)
From What Ifs to Insights: Counterfactuals in Causal Inference vs. Explainable AI
di: Shmueli, Galit, et al.
Pubblicazione: (2025)
di: Shmueli, Galit, et al.
Pubblicazione: (2025)
What on Earth is AlphaEarth? Hierarchical structure and functional interpretability for global land cover
di: Benavides-Martinez, Ivan Felipe, et al.
Pubblicazione: (2026)
di: Benavides-Martinez, Ivan Felipe, et al.
Pubblicazione: (2026)
Language model developers should report train-test overlap
di: Zhang, Andy K, et al.
Pubblicazione: (2024)
di: Zhang, Andy K, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Capabilities Ain't All You Need: Measuring Propensities in AI
di: Romero-Alvarado, Daniel, et al.
Pubblicazione: (2026) -
PredictaBoard: Benchmarking LLM Score Predictability
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2025) -
Measuring What AI Systems Might Do: Towards A Measurement Science in AI
di: Voudouris, Konstantinos, et al.
Pubblicazione: (2026) -
Paradigms of AI Evaluation: Mapping Goals, Methodologies and Culture
di: Burden, John, et al.
Pubblicazione: (2025) -
100 instances is all you need: predicting the success of a new LLM on unseen data by testing on a few instances
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2024)