CulturalTeaming: AI-Assisted Interactive Red-Teaming for Challenging LLMs' (Lack of) Multicultural Knowledge
Fuente:
arXiv
Guardado en:
| Autores principales: | Chiu, Yu Ying, Jiang, Liwei, Antoniak, Maria, Park, Chan Young, Li, Shuyue Stella, Bhatia, Mehar, Ravi, Sahithya, Tsvetkov, Yulia, Shwartz, Vered, Choi, Yejin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming
por: Chiu, Yu Ying, et al.
Publicado: (2024)
por: Chiu, Yu Ying, et al.
Publicado: (2024)
From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models
por: Bhatia, Mehar, et al.
Publicado: (2024)
por: Bhatia, Mehar, et al.
Publicado: (2024)
InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning
por: Taranukhin, Maksym, et al.
Publicado: (2026)
por: Taranukhin, Maksym, et al.
Publicado: (2026)
Locating Information Gaps and Narrative Inconsistencies Across Languages: A Case Study of LGBT People Portrayals on Wikipedia
por: Samir, Farhan, et al.
Publicado: (2024)
por: Samir, Farhan, et al.
Publicado: (2024)
SPIKE-RL: Video-LLMs meet Bayesian Surprise
por: Ravi, Sahithya, et al.
Publicado: (2025)
por: Ravi, Sahithya, et al.
Publicado: (2025)
Is It Bad to Work All the Time? Cross-Cultural Evaluation of Social Norm Biases in GPT-4
por: Liu, Zhuozhuo Joy, et al.
Publicado: (2025)
por: Liu, Zhuozhuo Joy, et al.
Publicado: (2025)
Spotlight: Identifying and Localizing Video Generation Errors Using VLMs
por: Chinchure, Aditya, et al.
Publicado: (2025)
por: Chinchure, Aditya, et al.
Publicado: (2025)
Empowering Air Travelers: A Chatbot for Canadian Air Passenger Rights
por: Taranukhin, Maksym, et al.
Publicado: (2024)
por: Taranukhin, Maksym, et al.
Publicado: (2024)
Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events
por: Chinchure, Aditya, et al.
Publicado: (2024)
por: Chinchure, Aditya, et al.
Publicado: (2024)
Value Drifts: Tracing Value Alignment During LLM Post-Training
por: Bhatia, Mehar, et al.
Publicado: (2025)
por: Bhatia, Mehar, et al.
Publicado: (2025)
Small But Funny: A Feedback-Driven Approach to Humor Distillation
por: Ravi, Sahithya, et al.
Publicado: (2024)
por: Ravi, Sahithya, et al.
Publicado: (2024)
ValueScope: Unveiling Implicit Norms and Values via Return Potential Model of Social Interactions
por: Park, Chan Young, et al.
Publicado: (2024)
por: Park, Chan Young, et al.
Publicado: (2024)
Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting
por: Sclar, Melanie, et al.
Publicado: (2023)
por: Sclar, Melanie, et al.
Publicado: (2023)
Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
Team ACK at SemEval-2025 Task 2: Beyond Word-for-Word Machine Translation for English-Korean Pairs
por: Lee, Daniel, et al.
Publicado: (2025)
por: Lee, Daniel, et al.
Publicado: (2025)
Red Teaming AI Red Teaming
por: Majumdar, Subhabrata, et al.
Publicado: (2025)
por: Majumdar, Subhabrata, et al.
Publicado: (2025)
Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest
por: Wu, Addison J., et al.
Publicado: (2026)
por: Wu, Addison J., et al.
Publicado: (2026)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
por: Xin, Rui, et al.
Publicado: (2025)
por: Xin, Rui, et al.
Publicado: (2025)
DailyDilemmas: Revealing Value Preferences of LLMs with Quandaries of Daily Life
por: Chiu, Yu Ying, et al.
Publicado: (2024)
por: Chiu, Yu Ying, et al.
Publicado: (2024)
PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI
por: Deng, Wesley Hanwen, et al.
Publicado: (2026)
por: Deng, Wesley Hanwen, et al.
Publicado: (2026)
WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models
por: Jiang, Liwei, et al.
Publicado: (2024)
por: Jiang, Liwei, et al.
Publicado: (2024)
Tuning Language Models by Proxy
por: Liu, Alisa, et al.
Publicado: (2024)
por: Liu, Alisa, et al.
Publicado: (2024)
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
Red Teaming Visual Language Models
por: Li, Mukai, et al.
Publicado: (2024)
por: Li, Mukai, et al.
Publicado: (2024)
Automated Progressive Red Teaming
por: Jiang, Bojian, et al.
Publicado: (2024)
por: Jiang, Bojian, et al.
Publicado: (2024)
CAGE: A Framework for Culturally Adaptive Red-Teaming Benchmark Generation
por: Kim, Chaeyun, et al.
Publicado: (2026)
por: Kim, Chaeyun, et al.
Publicado: (2026)
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
por: Chin, Zhi-Yi, et al.
Publicado: (2023)
por: Chin, Zhi-Yi, et al.
Publicado: (2023)
Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)
por: Jiang, Liwei, et al.
Publicado: (2025)
por: Jiang, Liwei, et al.
Publicado: (2025)
Towards Red Teaming in Multimodal and Multilingual Translation
por: Ropers, Christophe, et al.
Publicado: (2024)
por: Ropers, Christophe, et al.
Publicado: (2024)
Trust No Bot: Discovering Personal Disclosures in Human-LLM Conversations in the Wild
por: Mireshghallah, Niloofar, et al.
Publicado: (2024)
por: Mireshghallah, Niloofar, et al.
Publicado: (2024)
Stance Reasoner: Zero-Shot Stance Detection on Social Media with Explicit Reasoning
por: Taranukhin, Maksym, et al.
Publicado: (2024)
por: Taranukhin, Maksym, et al.
Publicado: (2024)
Exploring Straightforward Conversational Red-Teaming
por: Kour, George, et al.
Publicado: (2024)
por: Kour, George, et al.
Publicado: (2024)
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
por: Jung, MinJae, et al.
Publicado: (2026)
por: Jung, MinJae, et al.
Publicado: (2026)
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
por: Chin, Zhi-Yi, et al.
Publicado: (2024)
por: Chin, Zhi-Yi, et al.
Publicado: (2024)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
por: Rahman, Salman, et al.
Publicado: (2025)
por: Rahman, Salman, et al.
Publicado: (2025)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2024)
por: Li, Shuyue Stella, et al.
Publicado: (2024)
Gradient-Based Language Model Red Teaming
por: Wichers, Nevan, et al.
Publicado: (2024)
por: Wichers, Nevan, et al.
Publicado: (2024)
Anecdoctoring: Automated Red-Teaming Across Language and Place
por: Cuevas, Alejandro, et al.
Publicado: (2025)
por: Cuevas, Alejandro, et al.
Publicado: (2025)
BottleHumor: Self-Informed Humor Explanation using the Information Bottleneck Principle
por: Hwang, EunJeong, et al.
Publicado: (2025)
por: Hwang, EunJeong, et al.
Publicado: (2025)
Political Neutrality in AI Is Impossible- But Here Is How to Approximate It
por: Fisher, Jillian, et al.
Publicado: (2025)
por: Fisher, Jillian, et al.
Publicado: (2025)
Ejemplares similares
-
CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming
por: Chiu, Yu Ying, et al.
Publicado: (2024) -
From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models
por: Bhatia, Mehar, et al.
Publicado: (2024) -
InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning
por: Taranukhin, Maksym, et al.
Publicado: (2026) -
Locating Information Gaps and Narrative Inconsistencies Across Languages: A Case Study of LGBT People Portrayals on Wikipedia
por: Samir, Farhan, et al.
Publicado: (2024) -
SPIKE-RL: Video-LLMs meet Bayesian Surprise
por: Ravi, Sahithya, et al.
Publicado: (2025)