STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
Fuente:
arXiv
Guardado en:
| Autores principales: | Morabito, Robert, Madhusudan, Sangmitra, McDonald, Tyler, Emami, Ali |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts
por: Madhusudan, Sangmitra, et al.
Publicado: (2025)
por: Madhusudan, Sangmitra, et al.
Publicado: (2025)
Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
por: McDonald, Tyler, et al.
Publicado: (2025)
por: McDonald, Tyler, et al.
Publicado: (2025)
MirrorStories: Reflecting Diversity through Personalized Narrative Generation with Large Language Models
por: Yunusov, Sarfaroz, et al.
Publicado: (2024)
por: Yunusov, Sarfaroz, et al.
Publicado: (2024)
Fine-Tuned LLMs are "Time Capsules" for Tracking Societal Bias Through Books
por: Madhusudan, Sangmitra, et al.
Publicado: (2025)
por: Madhusudan, Sangmitra, et al.
Publicado: (2025)
NYT-Connections: A Deceptively Simple Text Classification Task that Stumps System-1 Thinkers
por: Lopez, Angel Yahir Loredo, et al.
Publicado: (2024)
por: Lopez, Angel Yahir Loredo, et al.
Publicado: (2024)
Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language Models
por: Kumar, Abhishek, et al.
Publicado: (2024)
por: Kumar, Abhishek, et al.
Publicado: (2024)
Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models
por: Kumar, Abhishek, et al.
Publicado: (2024)
por: Kumar, Abhishek, et al.
Publicado: (2024)
Navigating the Cultural Kaleidoscope: A Hitchhiker's Guide to Sensitivity in Large Language Models
por: Banerjee, Somnath, et al.
Publicado: (2024)
por: Banerjee, Somnath, et al.
Publicado: (2024)
AccessEval: Benchmarking Disability Bias in Large Language Models
por: Panda, Srikant, et al.
Publicado: (2025)
por: Panda, Srikant, et al.
Publicado: (2025)
DarkBench: Benchmarking Dark Patterns in Large Language Models
por: Kran, Esben, et al.
Publicado: (2025)
por: Kran, Esben, et al.
Publicado: (2025)
Which Words Matter Most in Zero-Shot Prompts?
por: Sadr, Nikta Gohari, et al.
Publicado: (2025)
por: Sadr, Nikta Gohari, et al.
Publicado: (2025)
The Unequal Opportunities of Large Language Models: Revealing Demographic Bias through Job Recommendations
por: Salinas, Abel, et al.
Publicado: (2023)
por: Salinas, Abel, et al.
Publicado: (2023)
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
JobFair: A Framework for Benchmarking Gender Hiring Bias in Large Language Models
por: Wang, Ze, et al.
Publicado: (2024)
por: Wang, Ze, et al.
Publicado: (2024)
Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing
por: Jiang, Han, et al.
Publicado: (2024)
por: Jiang, Han, et al.
Publicado: (2024)
Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence
por: McIntosh, Timothy R., et al.
Publicado: (2024)
por: McIntosh, Timothy R., et al.
Publicado: (2024)
Metamorphic Testing for Fairness Evaluation in Large Language Models: Identifying Intersectional Bias in LLaMA and GPT
por: Reddy, Harishwar, et al.
Publicado: (2025)
por: Reddy, Harishwar, et al.
Publicado: (2025)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
por: Hijazi, Faris, et al.
Publicado: (2024)
por: Hijazi, Faris, et al.
Publicado: (2024)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
AustroTox: A Dataset for Target-Based Austrian German Offensive Language Detection
por: Pachinger, Pia, et al.
Publicado: (2024)
por: Pachinger, Pia, et al.
Publicado: (2024)
From Individuals to Interactions: Benchmarking Gender Bias in Multimodal Large Language Models from the Lens of Social Relationship
por: Xu, Yue, et al.
Publicado: (2025)
por: Xu, Yue, et al.
Publicado: (2025)
On the Creativity of Large Language Models
por: Franceschelli, Giorgio, et al.
Publicado: (2023)
por: Franceschelli, Giorgio, et al.
Publicado: (2023)
Cross-Language Bias Examination in Large Language Models
por: Liang, Yuxuan, et al.
Publicado: (2025)
por: Liang, Yuxuan, et al.
Publicado: (2025)
Attacks on Third-Party APIs of Large Language Models
por: Zhao, Wanru, et al.
Publicado: (2024)
por: Zhao, Wanru, et al.
Publicado: (2024)
LocalValueBench: A Collaboratively Built and Extensible Benchmark for Evaluating Localized Value Alignment and Ethical Safety in Large Language Models
por: Meadows, Gwenyth Isobel, et al.
Publicado: (2024)
por: Meadows, Gwenyth Isobel, et al.
Publicado: (2024)
Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translations
por: Zahraei, Pardis Sadat, et al.
Publicado: (2025)
por: Zahraei, Pardis Sadat, et al.
Publicado: (2025)
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
por: Shin, Jisu, et al.
Publicado: (2025)
por: Shin, Jisu, et al.
Publicado: (2025)
Topic-aware Large Language Models for Summarizing the Lived Healthcare Experiences Described in Health Stories
por: Bilalpur, Maneesh, et al.
Publicado: (2025)
por: Bilalpur, Maneesh, et al.
Publicado: (2025)
Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models
por: Song, Kefan, et al.
Publicado: (2025)
por: Song, Kefan, et al.
Publicado: (2025)
Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models
por: Dahl, Matthew, et al.
Publicado: (2024)
por: Dahl, Matthew, et al.
Publicado: (2024)
Open-Ended Wargames with Large Language Models
por: Hogan, Daniel P., et al.
Publicado: (2024)
por: Hogan, Daniel P., et al.
Publicado: (2024)
Large Language Models for Education: A Survey
por: Xu, Hanyi, et al.
Publicado: (2024)
por: Xu, Hanyi, et al.
Publicado: (2024)
Large Language Models as Misleading Assistants in Conversation
por: Hou, Betty Li, et al.
Publicado: (2024)
por: Hou, Betty Li, et al.
Publicado: (2024)
Large Language Models for Medicine: A Survey
por: Zheng, Yanxin, et al.
Publicado: (2024)
por: Zheng, Yanxin, et al.
Publicado: (2024)
Are Large Language Models Good Essay Graders?
por: Kundu, Anindita, et al.
Publicado: (2024)
por: Kundu, Anindita, et al.
Publicado: (2024)
Evaluating Large Language Models for Detecting Antisemitism
por: Patel, Jay, et al.
Publicado: (2025)
por: Patel, Jay, et al.
Publicado: (2025)
Anticipating Innovation Using Large Language Models
por: Fenoaltea, Enrico Maria, et al.
Publicado: (2026)
por: Fenoaltea, Enrico Maria, et al.
Publicado: (2026)
How Large Language Models are Designed to Hallucinate
por: Ackermann, Richard, et al.
Publicado: (2025)
por: Ackermann, Richard, et al.
Publicado: (2025)
Evaluating Psychological Safety of Large Language Models
por: Li, Xingxuan, et al.
Publicado: (2022)
por: Li, Xingxuan, et al.
Publicado: (2022)
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
Ejemplares similares
-
The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts
por: Madhusudan, Sangmitra, et al.
Publicado: (2025) -
Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
por: McDonald, Tyler, et al.
Publicado: (2025) -
MirrorStories: Reflecting Diversity through Personalized Narrative Generation with Large Language Models
por: Yunusov, Sarfaroz, et al.
Publicado: (2024) -
Fine-Tuned LLMs are "Time Capsules" for Tracking Societal Bias Through Books
por: Madhusudan, Sangmitra, et al.
Publicado: (2025) -
NYT-Connections: A Deceptively Simple Text Classification Task that Stumps System-1 Thinkers
por: Lopez, Angel Yahir Loredo, et al.
Publicado: (2024)