Red-Teaming for Inducing Societal Bias in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Luo, Chu Fei, Ghawanmeh, Ahmad, Bhimshetty, Bharat, Murali, Kashyap, Jadhav, Murli, Zhu, Xiaodan, Khattak, Faiza Khan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Soft-prompt Tuning for Large Language Models to Evaluate Bias
by: Tian, Jacob-Junqi, et al.
Published: (2023)
by: Tian, Jacob-Junqi, et al.
Published: (2023)
Mitigating Social Biases in Language Models through Unlearning
by: Dige, Omkar, et al.
Published: (2024)
by: Dige, Omkar, et al.
Published: (2024)
Misinformation with Legal Consequences (MisLC): A New Task Towards Harnessing Societal Harm of Misinformation
by: Luo, Chu Fei, et al.
Published: (2024)
by: Luo, Chu Fei, et al.
Published: (2024)
Gradient-Based Language Model Red Teaming
by: Wichers, Nevan, et al.
Published: (2024)
by: Wichers, Nevan, et al.
Published: (2024)
RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
by: Asad, Ali, et al.
Published: (2025)
by: Asad, Ali, et al.
Published: (2025)
Template-Based Probes Are Imperfect Lenses for Counterfactual Bias Evaluation in LLMs
by: Kohankhaki, Farnaz, et al.
Published: (2024)
by: Kohankhaki, Farnaz, et al.
Published: (2024)
What Am I Missing? Question-Answering as Hidden State Probing
by: Luo, Chu Fei, et al.
Published: (2026)
by: Luo, Chu Fei, et al.
Published: (2026)
Towards Low-Resource Alignment to Diverse Perspectives with Sparse Feedback
by: Luo, Chu Fei, et al.
Published: (2025)
by: Luo, Chu Fei, et al.
Published: (2025)
Red Teaming Large Language Models for Healthcare
by: Balazadeh, Vahid, et al.
Published: (2025)
by: Balazadeh, Vahid, et al.
Published: (2025)
On The Role of Reasoning in the Identification of Subtle Stereotypes in Natural Language
by: Tian, Jacob-Junqi, et al.
Published: (2023)
by: Tian, Jacob-Junqi, et al.
Published: (2023)
Anecdoctoring: Automated Red-Teaming Across Language and Place
by: Cuevas, Alejandro, et al.
Published: (2025)
by: Cuevas, Alejandro, et al.
Published: (2025)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
by: Dang, Quy-Anh, et al.
Published: (2026)
by: Dang, Quy-Anh, et al.
Published: (2026)
Resource Consumption Red-Teaming for Large Vision-Language Models
by: Gao, Haoran, et al.
Published: (2025)
by: Gao, Haoran, et al.
Published: (2025)
RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
by: Liu, Yifei, et al.
Published: (2025)
by: Liu, Yifei, et al.
Published: (2025)
TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesis
by: Wu, Xiaorui, et al.
Published: (2025)
by: Wu, Xiaorui, et al.
Published: (2025)
Implicit Grading Bias in Large Language Models: How Writing Style Affects Automated Assessment Across Math, Programming, and Essay Tasks
by: Jadhav, Rudra, et al.
Published: (2026)
by: Jadhav, Rudra, et al.
Published: (2026)
KLAAD: Refining Attention Mechanisms to Reduce Societal Bias in Generative Language Models
by: Kim, Seorin, et al.
Published: (2025)
by: Kim, Seorin, et al.
Published: (2025)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
by: Xu, Huiyu, et al.
Published: (2024)
by: Xu, Huiyu, et al.
Published: (2024)
Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models
by: Purpura, Alberto, et al.
Published: (2025)
by: Purpura, Alberto, et al.
Published: (2025)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
by: Ding, Jiale, et al.
Published: (2025)
by: Ding, Jiale, et al.
Published: (2025)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
by: Wei, Zhang, et al.
Published: (2025)
by: Wei, Zhang, et al.
Published: (2025)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
by: Liu, Yanjiang, et al.
Published: (2025)
by: Liu, Yanjiang, et al.
Published: (2025)
Robust Utility-Preserving Text Anonymization Based on Large Language Models
by: Yang, Tianyu, et al.
Published: (2024)
by: Yang, Tianyu, et al.
Published: (2024)
Large Language Models as Search Engines: Societal Challenges
by: Sadeddine, Zacchary, et al.
Published: (2025)
by: Sadeddine, Zacchary, et al.
Published: (2025)
Red Teaming Visual Language Models
by: Li, Mukai, et al.
Published: (2024)
by: Li, Mukai, et al.
Published: (2024)
CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment
by: Shayanfar, Radin, et al.
Published: (2025)
by: Shayanfar, Radin, et al.
Published: (2025)
Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)
by: Verma, Apurv, et al.
Published: (2024)
by: Verma, Apurv, et al.
Published: (2024)
GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models
by: Wang, Zilong, et al.
Published: (2025)
by: Wang, Zilong, et al.
Published: (2025)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
by: Shamsi, Zafir, et al.
Published: (2026)
by: Shamsi, Zafir, et al.
Published: (2026)
Red Teaming Language Models for Processing Contradictory Dialogues
by: Wen, Xiaofei, et al.
Published: (2024)
by: Wen, Xiaofei, et al.
Published: (2024)
Large Language Models as Mirrors of Societal Moral Standards
by: Papadopoulou, Evi, et al.
Published: (2024)
by: Papadopoulou, Evi, et al.
Published: (2024)
Red Teaming for Large Language Models At Scale: Tackling Hallucinations on Mathematics Tasks
by: Buszydlik, Aleksander, et al.
Published: (2023)
by: Buszydlik, Aleksander, et al.
Published: (2023)
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
by: Sathe, Ashutosh, et al.
Published: (2024)
by: Sathe, Ashutosh, et al.
Published: (2024)
Promptception: How Sensitive Are Large Multimodal Models to Prompts?
by: Ismithdeen, Mohamed Insaf, et al.
Published: (2025)
by: Ismithdeen, Mohamed Insaf, et al.
Published: (2025)
Assessing Agentic Large Language Models in Multilingual National Bias
by: Liu, Qianying, et al.
Published: (2025)
by: Liu, Qianying, et al.
Published: (2025)
On The Conceptualization and Societal Impact of Cross-Cultural Bias
by: Bhandari, Vitthal
Published: (2025)
by: Bhandari, Vitthal
Published: (2025)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
by: Hu, Kai, et al.
Published: (2025)
by: Hu, Kai, et al.
Published: (2025)
Representation Bias in Political Sample Simulations with Large Language Models
by: Qi, Weihong, et al.
Published: (2024)
by: Qi, Weihong, et al.
Published: (2024)
CSLV: Cross-Source Logical Validation for Reducing Source-Induced Reasoning Bias in Large Language Models
by: Khan, Alim ul haq
Published: (2026)
by: Khan, Alim ul haq
Published: (2026)
Large Language Model Agent as a Mechanical Designer
by: Jadhav, Yayati, et al.
Published: (2024)
by: Jadhav, Yayati, et al.
Published: (2024)
Similar Items
-
Soft-prompt Tuning for Large Language Models to Evaluate Bias
by: Tian, Jacob-Junqi, et al.
Published: (2023) -
Mitigating Social Biases in Language Models through Unlearning
by: Dige, Omkar, et al.
Published: (2024) -
Misinformation with Legal Consequences (MisLC): A New Task Towards Harnessing Societal Harm of Misinformation
by: Luo, Chu Fei, et al.
Published: (2024) -
Gradient-Based Language Model Red Teaming
by: Wichers, Nevan, et al.
Published: (2024) -
RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
by: Asad, Ali, et al.
Published: (2025)