Saved in:
| Main Authors: | Ju, Da, Williams, Adina, Karrer, Brian, Nickel, Maximilian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2412.05093 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Geographic Inclusion in the Evaluation of Text-to-Image Models
by: Hall, Melissa, et al.
Published: (2024)
by: Hall, Melissa, et al.
Published: (2024)
Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework
by: Jain, Shomik, et al.
Published: (2025)
by: Jain, Shomik, et al.
Published: (2025)
Bilingual Bias in Large Language Models: A Taiwan Sovereignty Benchmark Study
by: Ko, Ju-Chun
Published: (2026)
by: Ko, Ju-Chun
Published: (2026)
Are Female Carpenters like Blue Bananas? A Corpus Investigation of Occupation Gender Typicality
by: Ju, Da, et al.
Published: (2024)
by: Ju, Da, et al.
Published: (2024)
Domain Regeneration: How well do LLMs match syntactic properties of text domains?
by: Ju, Da, et al.
Published: (2025)
by: Ju, Da, et al.
Published: (2025)
Creator Incentives in Recommender Systems: A Cooperative Game-Theoretic Approach for Stable and Fair Collaboration in Multi-Agent Bandits
by: Krishnamurthy, Ramakrishnan, et al.
Published: (2026)
by: Krishnamurthy, Ramakrishnan, et al.
Published: (2026)
Small Models Achieve Large Language Model Performance: Evaluating Reasoning-Enabled AI for Secure Child Welfare Research
by: Qi, Zia, et al.
Published: (2025)
by: Qi, Zia, et al.
Published: (2025)
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
by: Morabito, Robert, et al.
Published: (2024)
by: Morabito, Robert, et al.
Published: (2024)
Evaluating Large Language Models for Fair and Reliable Organ Allocation
by: Kim, Brian Hyeongseok, et al.
Published: (2025)
by: Kim, Brian Hyeongseok, et al.
Published: (2025)
Leveraging Knowledge Graphs and Large Language Models to Track and Analyze Learning Trajectories
by: Chen, Yu-Hxiang, et al.
Published: (2025)
by: Chen, Yu-Hxiang, et al.
Published: (2025)
Navigating the Cultural Kaleidoscope: A Hitchhiker's Guide to Sensitivity in Large Language Models
by: Banerjee, Somnath, et al.
Published: (2024)
by: Banerjee, Somnath, et al.
Published: (2024)
Extrinsic Evaluation of Cultural Competence in Large Language Models
by: Bhatt, Shaily, et al.
Published: (2024)
by: Bhatt, Shaily, et al.
Published: (2024)
Evaluating Proactive Risk Awareness of Large Language Models
by: Luo, Xuan, et al.
Published: (2026)
by: Luo, Xuan, et al.
Published: (2026)
QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models
by: Kreutner, Maximilian, et al.
Published: (2025)
by: Kreutner, Maximilian, et al.
Published: (2025)
Large Language Models as symbolic DNA of cultural dynamics
by: Pourdavood, Parham, et al.
Published: (2025)
by: Pourdavood, Parham, et al.
Published: (2025)
Are Language Models Sensitive to Morally Irrelevant Distractors?
by: Shaw, Andrew, et al.
Published: (2026)
by: Shaw, Andrew, et al.
Published: (2026)
Evaluating Large Language Models for Detecting Antisemitism
by: Patel, Jay, et al.
Published: (2025)
by: Patel, Jay, et al.
Published: (2025)
Evaluating Psychological Safety of Large Language Models
by: Li, Xingxuan, et al.
Published: (2022)
by: Li, Xingxuan, et al.
Published: (2022)
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
by: Christian, Brian, et al.
Published: (2026)
by: Christian, Brian, et al.
Published: (2026)
Evaluating Large Language Models in Theory of Mind Tasks
by: Kosinski, Michal
Published: (2023)
by: Kosinski, Michal
Published: (2023)
Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
by: Jotautaitė, Monika, et al.
Published: (2025)
by: Jotautaitė, Monika, et al.
Published: (2025)
Evaluating open-source Large Language Models for automated fact-checking
by: Fontana, Nicolo', et al.
Published: (2025)
by: Fontana, Nicolo', et al.
Published: (2025)
Fitting the Message to the Moment: Designing Calendar-Aware Stress Messaging with Large Language Models
by: Rao, Pranav, et al.
Published: (2025)
by: Rao, Pranav, et al.
Published: (2025)
Large Language Models as Partners in Student Essay Evaluation
by: Ishida, Toru, et al.
Published: (2024)
by: Ishida, Toru, et al.
Published: (2024)
Making Sense of the Unsensible: Reflection, Survey, and Challenges for XAI in Large Language Models Toward Human-Centered AI
by: Herrera, Francisco
Published: (2025)
by: Herrera, Francisco
Published: (2025)
GreedLlama: Performance of Financial Value-Aligned Large Language Models in Moral Reasoning
by: Yu, Jeffy, et al.
Published: (2024)
by: Yu, Jeffy, et al.
Published: (2024)
DeliberationBench: A Normative Benchmark for the Influence of Large Language Models on Users' Views
by: Hewitt, Luke, et al.
Published: (2026)
by: Hewitt, Luke, et al.
Published: (2026)
Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards
by: Liu, Geng, et al.
Published: (2025)
by: Liu, Geng, et al.
Published: (2025)
Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking
by: Huang, Chutian, et al.
Published: (2026)
by: Huang, Chutian, et al.
Published: (2026)
Leveraging Large Language Models for Actionable Course Evaluation Student Feedback to Lecturers
by: Zhang, Mike, et al.
Published: (2024)
by: Zhang, Mike, et al.
Published: (2024)
Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions
by: Zhu, Wang Bill, et al.
Published: (2025)
by: Zhu, Wang Bill, et al.
Published: (2025)
Not All Jokes Land: Evaluating Large Language Models Understanding of Workplace Humor
by: Shafiei, Mohammadamin, et al.
Published: (2025)
by: Shafiei, Mohammadamin, et al.
Published: (2025)
Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
Understanding and Evaluating Trust in Generative AI and Large Language Models for Spreadsheets
by: Thorne, Simon
Published: (2024)
by: Thorne, Simon
Published: (2024)
An Exploration of Higher Education Course Evaluation by Large Language Models
by: Yuan, Bo, et al.
Published: (2024)
by: Yuan, Bo, et al.
Published: (2024)
Authorship Without Writing: Large Language Models and the Senior Author Analogy
by: Hurshman, Clint, et al.
Published: (2025)
by: Hurshman, Clint, et al.
Published: (2025)
How Large Language Models play humans in online conversations: a simulated study of the 2016 US politics on Reddit
by: Cirulli, Daniele, et al.
Published: (2025)
by: Cirulli, Daniele, et al.
Published: (2025)
Evidence of conceptual mastery in the application of rules by Large Language Models
by: Nunes, José Luiz, et al.
Published: (2025)
by: Nunes, José Luiz, et al.
Published: (2025)
Development of Application-Specific Large Language Models to Facilitate Research Ethics Review
by: Mann, Sebastian Porsdam, et al.
Published: (2025)
by: Mann, Sebastian Porsdam, et al.
Published: (2025)
Evaluation of Bias Towards Medical Professionals in Large Language Models
by: Chen, Xi, et al.
Published: (2024)
by: Chen, Xi, et al.
Published: (2024)
Similar Items
-
Towards Geographic Inclusion in the Evaluation of Text-to-Image Models
by: Hall, Melissa, et al.
Published: (2024) -
Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework
by: Jain, Shomik, et al.
Published: (2025) -
Bilingual Bias in Large Language Models: A Taiwan Sovereignty Benchmark Study
by: Ko, Ju-Chun
Published: (2026) -
Are Female Carpenters like Blue Bananas? A Corpus Investigation of Occupation Gender Typicality
by: Ju, Da, et al.
Published: (2024) -
Domain Regeneration: How well do LLMs match syntactic properties of text domains?
by: Ju, Da, et al.
Published: (2025)