Agent Benchmarks Fail Public Sector Requirements
Fuente:
arXiv
Salvato in:
| Autori principali: | Rystrøm, Jonathan, Schmitz, Chris, Korgul, Karolina, Batzner, Jan, Russell, Chris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Oversight Structures for Agentic AI in Public-Sector Organizations
di: Schmitz, Chris, et al.
Pubblicazione: (2025)
di: Schmitz, Chris, et al.
Pubblicazione: (2025)
Grounding Text Embeddings in Stakeholder Associations
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2026)
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2026)
OxEnsemble: Fair Ensembles for Low-Data Classification
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
di: Korgul, Karolina, et al.
Pubblicazione: (2025)
di: Korgul, Karolina, et al.
Pubblicazione: (2025)
Exposing Assumptions in AI Benchmarks through Cognitive Modelling
di: Rystrøm, Jonathan H., et al.
Pubblicazione: (2024)
di: Rystrøm, Jonathan H., et al.
Pubblicazione: (2024)
A Systems Thinking Approach to Algorithmic Fairness
di: Lam, Chris
Pubblicazione: (2024)
di: Lam, Chris
Pubblicazione: (2024)
Deepfakes on Demand: the rise of accessible non-consensual deepfake image generators
di: Hawkins, Will, et al.
Pubblicazione: (2025)
di: Hawkins, Will, et al.
Pubblicazione: (2025)
Societal Impacts Research Requires Benchmarks for Creative Composition Tasks
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2025)
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2025)
Perceptions of AI Across Sectors: A Comparative Review of Public Attitudes
di: Bialy, Filip, et al.
Pubblicazione: (2025)
di: Bialy, Filip, et al.
Pubblicazione: (2025)
The Term 'Agent' Has Been Diluted Beyond Utility and Requires Redefinition
di: Bent, Brinnae
Pubblicazione: (2025)
di: Bent, Brinnae
Pubblicazione: (2025)
OxonFair: A Flexible Toolkit for Algorithmic Fairness
di: Delaney, Eoin, et al.
Pubblicazione: (2024)
di: Delaney, Eoin, et al.
Pubblicazione: (2024)
Algorithmic Administration and the EU AI Act: Legal Principles for Public Sector Use of AI
di: Pavlidis, Georgios, et al.
Pubblicazione: (2026)
di: Pavlidis, Georgios, et al.
Pubblicazione: (2026)
Responsible AI Adoption in the Public Sector: A Data-Centric Taxonomy of AI Adoption Challenges
di: Nikiforova, Anastasija, et al.
Pubblicazione: (2025)
di: Nikiforova, Anastasija, et al.
Pubblicazione: (2025)
SAIF: A Comprehensive Framework for Evaluating the Risks of Generative AI in the Public Sector
di: Lee, Kyeongryul, et al.
Pubblicazione: (2025)
di: Lee, Kyeongryul, et al.
Pubblicazione: (2025)
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents
di: Li, Miles Q., et al.
Pubblicazione: (2026)
di: Li, Miles Q., et al.
Pubblicazione: (2026)
Failing on Bias Mitigation: A Case Study on the Challenges of Fairness in Government Data
di: Bo, Hongbo, et al.
Pubblicazione: (2026)
di: Bo, Hongbo, et al.
Pubblicazione: (2026)
No Transfers Required: Integrating Last Mile with Public Transit Using Opti-Mile
di: Altaf, Raashid, et al.
Pubblicazione: (2023)
di: Altaf, Raashid, et al.
Pubblicazione: (2023)
Accountability Capture: How Record-Keeping to Support AI Transparency and Accountability (Re)shapes Algorithmic Oversight
di: Chappidi, Shreya, et al.
Pubblicazione: (2025)
di: Chappidi, Shreya, et al.
Pubblicazione: (2025)
Technical Requirements for Halting Dangerous AI Activities
di: Barnett, Peter, et al.
Pubblicazione: (2025)
di: Barnett, Peter, et al.
Pubblicazione: (2025)
E-LENS: User Requirements-Oriented AI Ethics Assurance
di: Zhou, Jianlong, et al.
Pubblicazione: (2025)
di: Zhou, Jianlong, et al.
Pubblicazione: (2025)
When AI Fails, What Works? A Data-Driven Taxonomy of Real-World AI Risk Mitigation Strategies
di: Popchanovska, Evgenija, et al.
Pubblicazione: (2026)
di: Popchanovska, Evgenija, et al.
Pubblicazione: (2026)
HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning
di: Li, Chance Jiajie, et al.
Pubblicazione: (2025)
di: Li, Chance Jiajie, et al.
Pubblicazione: (2025)
Trademark Search, Artificial Intelligence and the Role of the Private Sector
di: Katyal, Sonia, et al.
Pubblicazione: (2026)
di: Katyal, Sonia, et al.
Pubblicazione: (2026)
AI-Mediated Communication Can Steer Collective Opinion
di: Tsirtsis, Stratis, et al.
Pubblicazione: (2026)
di: Tsirtsis, Stratis, et al.
Pubblicazione: (2026)
Towards an AI Observatory for the Nuclear Sector: A tool for anticipatory governance
di: Verma, Aditi, et al.
Pubblicazione: (2025)
di: Verma, Aditi, et al.
Pubblicazione: (2025)
Initial results of the Digital Consciousness Model
di: Shiller, Derek, et al.
Pubblicazione: (2026)
di: Shiller, Derek, et al.
Pubblicazione: (2026)
Agents of Chaos
di: Shapira, Natalie, et al.
Pubblicazione: (2026)
di: Shapira, Natalie, et al.
Pubblicazione: (2026)
Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs
di: Cheng, Myra, et al.
Pubblicazione: (2026)
di: Cheng, Myra, et al.
Pubblicazione: (2026)
Assessing Model-Agnostic XAI Methods against EU AI Act Explainability Requirements
di: Sovrano, Francesco, et al.
Pubblicazione: (2026)
di: Sovrano, Francesco, et al.
Pubblicazione: (2026)
How should AI decisions be explained? Requirements for Explanations from the Perspective of European Law
di: Fresz, Benjamin, et al.
Pubblicazione: (2024)
di: Fresz, Benjamin, et al.
Pubblicazione: (2024)
The Human Condition as Reflected in Contemporary Large Language Models
di: Neuman, W. Russell
Pubblicazione: (2026)
di: Neuman, W. Russell
Pubblicazione: (2026)
An Ontology for Representing Curriculum and Learning Material
di: Christou, Antrea, et al.
Pubblicazione: (2025)
di: Christou, Antrea, et al.
Pubblicazione: (2025)
AI and the Future of Digital Public Squares
di: Goldberg, Beth, et al.
Pubblicazione: (2024)
di: Goldberg, Beth, et al.
Pubblicazione: (2024)
Education in the Era of Neurosymbolic AI
di: Jaldi, Chris Davis, et al.
Pubblicazione: (2024)
di: Jaldi, Chris Davis, et al.
Pubblicazione: (2024)
Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition
di: Zou, Andy, et al.
Pubblicazione: (2025)
di: Zou, Andy, et al.
Pubblicazione: (2025)
STREAM (ChemBio): A Standard for Transparently Reporting Evaluations in AI Model Reports
di: McCaslin, Tegan, et al.
Pubblicazione: (2025)
di: McCaslin, Tegan, et al.
Pubblicazione: (2025)
AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations
di: Bowen, Dillon, et al.
Pubblicazione: (2025)
di: Bowen, Dillon, et al.
Pubblicazione: (2025)
Simulating Society Requires Simulating Thought
di: Li, Chance Jiajie, et al.
Pubblicazione: (2025)
di: Li, Chance Jiajie, et al.
Pubblicazione: (2025)
Analyzing the Ethical Logic of Six Large Language Models
di: Neuman, W. Russell, et al.
Pubblicazione: (2025)
di: Neuman, W. Russell, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Oversight Structures for Agentic AI in Public-Sector Organizations
di: Schmitz, Chris, et al.
Pubblicazione: (2025) -
Grounding Text Embeddings in Stakeholder Associations
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2026) -
OxEnsemble: Fair Ensembles for Low-Data Classification
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025) -
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025) -
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
di: Korgul, Karolina, et al.
Pubblicazione: (2025)