STAR: SocioTechnical Approach to Red Teaming Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Weidinger, Laura, Mellor, John, Pegueroles, Bernat Guillen, Marchal, Nahema, Kumar, Ravin, Lum, Kristian, Akbulut, Canfer, Diaz, Mark, Bergman, Stevie, Rodriguez, Mikel, Rieser, Verena, Isaac, William |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
(Unfair) Norms in Fairness Research: A Meta-Analysis
by: Chien, Jennifer, et al.
Published: (2024)
by: Chien, Jennifer, et al.
Published: (2024)
Evaluating Language Models for Harmful Manipulation
by: Akbulut, Canfer, et al.
Published: (2026)
by: Akbulut, Canfer, et al.
Published: (2026)
Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation
by: Garcia, Adriana Alvarado, et al.
Published: (2026)
by: Garcia, Adriana Alvarado, et al.
Published: (2026)
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
by: Jung, MinJae, et al.
Published: (2026)
by: Jung, MinJae, et al.
Published: (2026)
APTx Neuron: A Unified Trainable Neuron Architecture Integrating Activation and Computation
by: Kumar, Ravin
Published: (2025)
by: Kumar, Ravin
Published: (2025)
APTx: better activation function than MISH, SWISH, and ReLU's variants used in deep learning
by: Kumar, Ravin
Published: (2022)
by: Kumar, Ravin
Published: (2022)
A Mechanism-Based Approach to Mitigating Harms from Persuasive Generative AI
by: El-Sayed, Seliem, et al.
Published: (2024)
by: El-Sayed, Seliem, et al.
Published: (2024)
The Ethics of Advanced AI Assistants
by: Gabriel, Iason, et al.
Published: (2024)
by: Gabriel, Iason, et al.
Published: (2024)
ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming
by: Tedeschi, Simone, et al.
Published: (2024)
by: Tedeschi, Simone, et al.
Published: (2024)
Consistency is Key: Disentangling Label Variation in Natural Language Processing with Intra-Annotator Agreement
by: Abercrombie, Gavin, et al.
Published: (2023)
by: Abercrombie, Gavin, et al.
Published: (2023)
Red Teaming AI Red Teaming
by: Majumdar, Subhabrata, et al.
Published: (2025)
by: Majumdar, Subhabrata, et al.
Published: (2025)
The Impossibility of Fair LLMs
by: Anthis, Jacy, et al.
Published: (2024)
by: Anthis, Jacy, et al.
Published: (2024)
The Missing Variable: Socio-Technical Alignment in Risk Evaluation
by: Flehmig, Niclas, et al.
Published: (2025)
by: Flehmig, Niclas, et al.
Published: (2025)
PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI
by: Deng, Wesley Hanwen, et al.
Published: (2026)
by: Deng, Wesley Hanwen, et al.
Published: (2026)
Opportunities and Barriers for AI Feedback on Meeting Inclusion in Socioorganizational Teams
by: Houtti, Mo, et al.
Published: (2026)
by: Houtti, Mo, et al.
Published: (2026)
Red Teaming Visual Language Models
by: Li, Mukai, et al.
Published: (2024)
by: Li, Mukai, et al.
Published: (2024)
Towards Red Teaming in Multimodal and Multilingual Translation
by: Ropers, Christophe, et al.
Published: (2024)
by: Ropers, Christophe, et al.
Published: (2024)
Anecdoctoring: Automated Red-Teaming Across Language and Place
by: Cuevas, Alejandro, et al.
Published: (2025)
by: Cuevas, Alejandro, et al.
Published: (2025)
Effective Automation to Support the Human Infrastructure in AI Red Teaming
by: Zhang, Alice Qian, et al.
Published: (2025)
by: Zhang, Alice Qian, et al.
Published: (2025)
CulturalTeaming: AI-Assisted Interactive Red-Teaming for Challenging LLMs' (Lack of) Multicultural Knowledge
by: Chiu, Yu Ying, et al.
Published: (2024)
by: Chiu, Yu Ying, et al.
Published: (2024)
Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
by: Chae, Kyubyung, et al.
Published: (2025)
by: Chae, Kyubyung, et al.
Published: (2025)
Demographic Benchmarking: Bridging Socio-Technical Gaps in Bias Detection
by: Clavell, Gemma Galdon, et al.
Published: (2025)
by: Clavell, Gemma Galdon, et al.
Published: (2025)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
by: Ding, Jiale, et al.
Published: (2025)
by: Ding, Jiale, et al.
Published: (2025)
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
by: Han, Vernon Toh Yan, et al.
Published: (2024)
by: Han, Vernon Toh Yan, et al.
Published: (2024)
Automated Progressive Red Teaming
by: Jiang, Bojian, et al.
Published: (2024)
by: Jiang, Bojian, et al.
Published: (2024)
Generative AI Enhances Team Performance and Reduces Need for Traditional Teams
by: Li, Ning, et al.
Published: (2024)
by: Li, Ning, et al.
Published: (2024)
Gradient-Based Language Model Red Teaming
by: Wichers, Nevan, et al.
Published: (2024)
by: Wichers, Nevan, et al.
Published: (2024)
Red-Teaming for Generative AI: Silver Bullet or Security Theater?
by: Feffer, Michael, et al.
Published: (2024)
by: Feffer, Michael, et al.
Published: (2024)
RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
by: Asad, Ali, et al.
Published: (2025)
by: Asad, Ali, et al.
Published: (2025)
AI-Simulated Expert Panels for Socio-Technical Scenarios and Decision Guidance
by: Ross, Andrew G., et al.
Published: (2026)
by: Ross, Andrew G., et al.
Published: (2026)
Organizational Practices and Socio-Technical Design of Human-Centered AI
by: Herrmann, Thomas
Published: (2026)
by: Herrmann, Thomas
Published: (2026)
CASTLE2026 Team WDL Technical Report
by: Li, Zhengyang, et al.
Published: (2026)
by: Li, Zhengyang, et al.
Published: (2026)
For Those Who May Find Themselves on the Red Team
by: Shoemaker, Tyler
Published: (2025)
by: Shoemaker, Tyler
Published: (2025)
Exploring Straightforward Conversational Red-Teaming
by: Kour, George, et al.
Published: (2024)
by: Kour, George, et al.
Published: (2024)
Bias in Language Models: Beyond Trick Tests and Toward RUTEd Evaluation
by: Lum, Kristian, et al.
Published: (2024)
by: Lum, Kristian, et al.
Published: (2024)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
by: Dang, Quy-Anh, et al.
Published: (2026)
by: Dang, Quy-Anh, et al.
Published: (2026)
AgenticRed: Evolving Agentic Systems for Red-Teaming
by: Yuan, Jiayi, et al.
Published: (2026)
by: Yuan, Jiayi, et al.
Published: (2026)
A Unifying Bias-aware Multidisciplinary Framework for Investigating Socio-Technical Issues
by: Hasan, Sacha, et al.
Published: (2025)
by: Hasan, Sacha, et al.
Published: (2025)
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
by: Dimino, Fabrizio, et al.
Published: (2026)
by: Dimino, Fabrizio, et al.
Published: (2026)
Similar Items
-
Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
by: Ibrahim, Lujain, et al.
Published: (2025) -
(Unfair) Norms in Fairness Research: A Meta-Analysis
by: Chien, Jennifer, et al.
Published: (2024) -
Evaluating Language Models for Harmful Manipulation
by: Akbulut, Canfer, et al.
Published: (2026) -
Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation
by: Garcia, Adriana Alvarado, et al.
Published: (2026) -
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
by: Jung, MinJae, et al.
Published: (2026)