GenderCARE: A Comprehensive Framework for Assessing and Reducing Gender Bias in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Kunsheng, Zhou, Wenbo, Zhang, Jie, Liu, Aishan, Deng, Gelei, Li, Shuai, Qi, Peigui, Zhang, Weiming, Zhang, Tianwei, Yu, Nenghai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
por: Qi, Peigui, et al.
Publicado: (2025)
por: Qi, Peigui, et al.
Publicado: (2025)
PoseGuard: Pose-Guided Generation with Safety Guardrails
por: Wang, Kongxin, et al.
Publicado: (2025)
por: Wang, Kongxin, et al.
Publicado: (2025)
VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts
por: Qi, Peigui, et al.
Publicado: (2026)
por: Qi, Peigui, et al.
Publicado: (2026)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
por: Li, Shuai, et al.
Publicado: (2023)
por: Li, Shuai, et al.
Publicado: (2023)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
por: Su, Yanghao, et al.
Publicado: (2026)
por: Su, Yanghao, et al.
Publicado: (2026)
When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models
por: Wang, Cheng, et al.
Publicado: (2025)
por: Wang, Cheng, et al.
Publicado: (2025)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
por: Li, Pengcheng, et al.
Publicado: (2026)
por: Li, Pengcheng, et al.
Publicado: (2026)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
por: Tong, Meng, et al.
Publicado: (2023)
por: Tong, Meng, et al.
Publicado: (2023)
Clean Image May be Dangerous: Data Poisoning Attacks Against Deep Hashing
por: Li, Shuai, et al.
Publicado: (2025)
por: Li, Shuai, et al.
Publicado: (2025)
FaceTracer: Unveiling Source Identities from Swapped Face Images and Videos for Fraud Prevention
por: Zhang, Zhongyi, et al.
Publicado: (2024)
por: Zhang, Zhongyi, et al.
Publicado: (2024)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
por: Wu, Jialin, et al.
Publicado: (2026)
por: Wu, Jialin, et al.
Publicado: (2026)
IRCopilot: Automated Incident Response with Large Language Models
por: Lin, Xihuan, et al.
Publicado: (2025)
por: Lin, Xihuan, et al.
Publicado: (2025)
GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing
por: Xiao, Yisong, et al.
Publicado: (2024)
por: Xiao, Yisong, et al.
Publicado: (2024)
Model X-ray:Detecting Backdoored Models via Decision Boundary
por: Su, Yanghao, et al.
Publicado: (2024)
por: Su, Yanghao, et al.
Publicado: (2024)
When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models
por: Ou, Haoran, et al.
Publicado: (2025)
por: Ou, Haoran, et al.
Publicado: (2025)
AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRA
por: Feng, Weitao, et al.
Publicado: (2024)
por: Feng, Weitao, et al.
Publicado: (2024)
BURN: Backdoor Unlearning via Adversarial Boundary Analysis
por: Su, Yanghao, et al.
Publicado: (2025)
por: Su, Yanghao, et al.
Publicado: (2025)
Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges
por: Yang, Xianglin, et al.
Publicado: (2026)
por: Yang, Xianglin, et al.
Publicado: (2026)
GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
EditMark: Watermarking Large Language Models based on Model Editing
por: Li, Shuai, et al.
Publicado: (2025)
por: Li, Shuai, et al.
Publicado: (2025)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
Assessing Gender and Racial Bias in Large Language Model‐Powered Virtual Reference
por: Jieli Liu, et al.
Publicado: (2024)
por: Jieli Liu, et al.
Publicado: (2024)
Oedipus: LLM-enchanced Reasoning CAPTCHA Solver
por: Deng, Gelei, et al.
Publicado: (2024)
por: Deng, Gelei, et al.
Publicado: (2024)
Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
Leveraging Large Language Models to Measure Gender Representation Bias in Gendered Language Corpora
por: Derner, Erik, et al.
Publicado: (2024)
por: Derner, Erik, et al.
Publicado: (2024)
Correction to “Assessing Gender and Racial Bias in Large Language Model‐Powered Virtual Reference”
Publicado: (2025)
Publicado: (2025)
Evaluating Gender Bias in Large Language Models
por: Döll, Michael, et al.
Publicado: (2024)
por: Döll, Michael, et al.
Publicado: (2024)
Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models
por: Zhao, Jiawei, et al.
Publicado: (2023)
por: Zhao, Jiawei, et al.
Publicado: (2023)
BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models
por: Shang, Xiuwei, et al.
Publicado: (2025)
por: Shang, Xiuwei, et al.
Publicado: (2025)
Gender-Neutral Large Language Models for Medical Applications: Reducing Bias in PubMed Abstracts
por: Schaefer, Elizabeth, et al.
Publicado: (2025)
por: Schaefer, Elizabeth, et al.
Publicado: (2025)
Think Before You Act: A Two-Stage Framework for Mitigating Gender Bias Towards Vision-Language Tasks
por: Zhang, Yunqi, et al.
Publicado: (2024)
por: Zhang, Yunqi, et al.
Publicado: (2024)
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
por: Cui, Chenhang, et al.
Publicado: (2024)
por: Cui, Chenhang, et al.
Publicado: (2024)
MES-RAG: Bringing Multi-modal, Entity-Storage, and Secure Enhancements to RAG
por: Wu, Pingyu, et al.
Publicado: (2025)
por: Wu, Pingyu, et al.
Publicado: (2025)
Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
In-Contextual Gender Bias Suppression for Large Language Models
por: Oba, Daisuke, et al.
Publicado: (2023)
por: Oba, Daisuke, et al.
Publicado: (2023)
Locating and Mitigating Gender Bias in Large Language Models
por: Cai, Yuchen, et al.
Publicado: (2024)
por: Cai, Yuchen, et al.
Publicado: (2024)
Benchmarking Gender and Political Bias in Large Language Models
por: Yang, Jinrui, et al.
Publicado: (2025)
por: Yang, Jinrui, et al.
Publicado: (2025)
Gender Bias in Emotion Recognition by Large Language Models
por: Herbert, Maureen, et al.
Publicado: (2025)
por: Herbert, Maureen, et al.
Publicado: (2025)
Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study
por: Bouchouchi, Nour, et al.
Publicado: (2026)
por: Bouchouchi, Nour, et al.
Publicado: (2026)
Gender Bias in Large Language Models across Multiple Languages
por: Zhao, Jinman, et al.
Publicado: (2024)
por: Zhao, Jinman, et al.
Publicado: (2024)
Ejemplares similares
-
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
por: Qi, Peigui, et al.
Publicado: (2025) -
PoseGuard: Pose-Guided Generation with Safety Guardrails
por: Wang, Kongxin, et al.
Publicado: (2025) -
VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts
por: Qi, Peigui, et al.
Publicado: (2026) -
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
por: Li, Shuai, et al.
Publicado: (2023) -
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
por: Su, Yanghao, et al.
Publicado: (2026)