Street-Level AI: Are Large Language Models Ready for Real-World Judgments?
Fuente:
arXiv
Saved in:
| Main Authors: | Pokharel, Gaurab, Farabi, Shafkat, Fowler, Patrick J., Das, Sanmay |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Budgeting Discretion: Theory and Evidence on Street-Level Decision-Making
by: Pokharel, Gaurab, et al.
Published: (2026)
by: Pokharel, Gaurab, et al.
Published: (2026)
Who Pays the RENT? Implications of Spatial Inequality for Prediction-Based Allocation Policies
by: Mashiat, Tasfia, et al.
Published: (2025)
by: Mashiat, Tasfia, et al.
Published: (2025)
Fixed Points and Stochastic Meritocracies: A Long-Term Perspective
by: Pokharel, Gaurab, et al.
Published: (2025)
by: Pokharel, Gaurab, et al.
Published: (2025)
Active Geospatial Search for Efficient Tenant Eviction Outreach
by: Sarkar, Anindya, et al.
Published: (2024)
by: Sarkar, Anindya, et al.
Published: (2024)
Converging to Stability in Two-Sided Bandits: The Case of Unknown Preferences on Both Sides of a Matching Market
by: Pokharel, Gaurab, et al.
Published: (2023)
by: Pokharel, Gaurab, et al.
Published: (2023)
Increasing the Value of Information During Planning in Uncertain Environments
by: Pokharel, Gaurab
Published: (2024)
by: Pokharel, Gaurab
Published: (2024)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
by: Zhou, Han, et al.
Published: (2024)
by: Zhou, Han, et al.
Published: (2024)
Assessing the Pedagogical Readiness of Large Language Models as AI Tutors in Low-Resource Contexts: A Case Study of Nepal's K-10 Curriculum
by: Acharya, Pratyush, et al.
Published: (2026)
by: Acharya, Pratyush, et al.
Published: (2026)
The AI Model Risk Catalog: What Developers and Researchers Miss About Real-World AI Harms
by: Rao, Pooja S. B., et al.
Published: (2025)
by: Rao, Pooja S. B., et al.
Published: (2025)
EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions
by: Sun, Weiyu, et al.
Published: (2026)
by: Sun, Weiyu, et al.
Published: (2026)
Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology
by: Jiang, Roy, et al.
Published: (2026)
by: Jiang, Roy, et al.
Published: (2026)
SMaRT: Online Reusable Resource Assignment and an Application to Mediation in the Kenyan Judiciary
by: Farabi, Shafkat, et al.
Published: (2026)
by: Farabi, Shafkat, et al.
Published: (2026)
PsychBench: Auditing Epidemiological Fidelity in Large Language Model Mental Health Simulations
by: Keough, Patrick
Published: (2026)
by: Keough, Patrick
Published: (2026)
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
by: Patwardhan, Tejal, et al.
Published: (2025)
by: Patwardhan, Tejal, et al.
Published: (2025)
Reality Check: A New Evaluation Ecosystem Is Necessary to Understand AI's Real World Effects
by: Schwartz, Reva, et al.
Published: (2025)
by: Schwartz, Reva, et al.
Published: (2025)
Street Review: A Participatory AI-Based Framework for Assessing Streetscape Inclusivity
by: Mushkani, Rashid, et al.
Published: (2025)
by: Mushkani, Rashid, et al.
Published: (2025)
Topic Classification of Case Law Using a Large Language Model and a New Taxonomy for UK Law: AI Insights into Summary Judgment
by: Sargeant, Holli, et al.
Published: (2024)
by: Sargeant, Holli, et al.
Published: (2024)
PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm
by: Li, Jing-Jing, et al.
Published: (2026)
by: Li, Jing-Jing, et al.
Published: (2026)
AIDRIN 2.0: A Framework to Assess Data Readiness for AI
by: Hiniduma, Kaveen, et al.
Published: (2025)
by: Hiniduma, Kaveen, et al.
Published: (2025)
Conversational Medical AI: Ready for Practice
by: Lizée, Antoine, et al.
Published: (2024)
by: Lizée, Antoine, et al.
Published: (2024)
ClarityEthic: Explainable Moral Judgment Utilizing Contrastive Ethical Insights from Large Language Models
by: Sun, Yuxi, et al.
Published: (2024)
by: Sun, Yuxi, et al.
Published: (2024)
When AI Fails, What Works? A Data-Driven Taxonomy of Real-World AI Risk Mitigation Strategies
by: Popchanovska, Evgenija, et al.
Published: (2026)
by: Popchanovska, Evgenija, et al.
Published: (2026)
RealHarm: A Collection of Real-World Language Model Application Failures
by: Jeune, Pierre Le, et al.
Published: (2025)
by: Jeune, Pierre Le, et al.
Published: (2025)
A Large-Scale Real-World Evaluation of LLM-Based Virtual Teaching Assistant
by: Kweon, Sunjun, et al.
Published: (2025)
by: Kweon, Sunjun, et al.
Published: (2025)
Towards Trustworthy AI: A Review of Ethical and Robust Large Language Models
by: Ferdaus, Md Meftahul, et al.
Published: (2024)
by: Ferdaus, Md Meftahul, et al.
Published: (2024)
Real-World AI Evaluation: How FRAME Generates Systematic Evidence to Resolve the Decision-Maker's Dilemma
by: Schwartz, Reva, et al.
Published: (2026)
by: Schwartz, Reva, et al.
Published: (2026)
Classroom AI: Large Language Models as Grade-Specific Teachers
by: Oh, Jio, et al.
Published: (2026)
by: Oh, Jio, et al.
Published: (2026)
Beyond Eviction Prediction: Leveraging Local Spatiotemporal Public Records to Inform Action
by: Mashiat, Tasfia, et al.
Published: (2024)
by: Mashiat, Tasfia, et al.
Published: (2024)
An Investigation of Large Language Models for Real-World Hate Speech Detection
by: Guo, Keyan, et al.
Published: (2024)
by: Guo, Keyan, et al.
Published: (2024)
AI-washing: The Asymmetric Effects of Its Two Types on Consumer Moral Judgments
by: Nyilasy, Greg, et al.
Published: (2025)
by: Nyilasy, Greg, et al.
Published: (2025)
The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers
by: Chen, Benjamin Minhao, et al.
Published: (2026)
by: Chen, Benjamin Minhao, et al.
Published: (2026)
Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest
by: Wu, Addison J., et al.
Published: (2026)
by: Wu, Addison J., et al.
Published: (2026)
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
by: Lin, Justin W., et al.
Published: (2025)
by: Lin, Justin W., et al.
Published: (2025)
Generative AI Purpose-built for Social and Mental Health: A Real-World Pilot
by: Hull, Thomas D., et al.
Published: (2025)
by: Hull, Thomas D., et al.
Published: (2025)
The global landscape of academic guidelines for generative AI and Large Language Models
by: Jiao, Junfeng, et al.
Published: (2024)
by: Jiao, Junfeng, et al.
Published: (2024)
Documenting Deployment with Fabric: A Repository of Real-World AI Governance
by: Jorgensen, Mackenzie, et al.
Published: (2025)
by: Jorgensen, Mackenzie, et al.
Published: (2025)
Large Language Models Can Be a Viable Substitute for Expert Political Surveys When a Shock Disrupts Traditional Measurement Approaches
by: Wu, Patrick Y.
Published: (2025)
by: Wu, Patrick Y.
Published: (2025)
GLARE: Agentic Reasoning for Legal Judgment Prediction
by: Yang, Xinyu, et al.
Published: (2025)
by: Yang, Xinyu, et al.
Published: (2025)
Justice in Judgment: Unveiling (Hidden) Bias in LLM-assisted Peer Reviews
by: Vasu, Sai Suresh Macharla, et al.
Published: (2025)
by: Vasu, Sai Suresh Macharla, et al.
Published: (2025)
Sparks of Rationality: Do Reasoning LLMs Align with Human Judgment and Choice?
by: Tak, Ala N., et al.
Published: (2026)
by: Tak, Ala N., et al.
Published: (2026)
Similar Items
-
Budgeting Discretion: Theory and Evidence on Street-Level Decision-Making
by: Pokharel, Gaurab, et al.
Published: (2026) -
Who Pays the RENT? Implications of Spatial Inequality for Prediction-Based Allocation Policies
by: Mashiat, Tasfia, et al.
Published: (2025) -
Fixed Points and Stochastic Meritocracies: A Long-Term Perspective
by: Pokharel, Gaurab, et al.
Published: (2025) -
Active Geospatial Search for Efficient Tenant Eviction Outreach
by: Sarkar, Anindya, et al.
Published: (2024) -
Converging to Stability in Two-Sided Bandits: The Case of Unknown Preferences on Both Sides of a Matching Market
by: Pokharel, Gaurab, et al.
Published: (2023)