Do Gender Cues Affect LLM Value Trade-offs? Evidence from a Controlled Decision Benchmark
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yangyang, Yu, Dong, Liu, Pengyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models
por: Su, Binxian, et al.
Publicado: (2026)
por: Su, Binxian, et al.
Publicado: (2026)
Exploring Stability-Plasticity Trade-offs for Continual Named Entity Recognition
por: Zhang, Duzhen, et al.
Publicado: (2025)
por: Zhang, Duzhen, et al.
Publicado: (2025)
When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents
por: Qian, Lingfei, et al.
Publicado: (2025)
por: Qian, Lingfei, et al.
Publicado: (2025)
Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes
por: Liu, Guangliang, et al.
Publicado: (2025)
por: Liu, Guangliang, et al.
Publicado: (2025)
Gender-Neutral Rewriting in Italian: Models, Approaches, and Trade-offs
por: Piergentili, Andrea, et al.
Publicado: (2025)
por: Piergentili, Andrea, et al.
Publicado: (2025)
A Functional Trade-off between Prosodic and Semantic Cues in Conveying Sarcasm
por: Li, Zhu, et al.
Publicado: (2024)
por: Li, Zhu, et al.
Publicado: (2024)
Gender and Positional Biases in LLM-Based Hiring Decisions: Evidence from Comparative CV/Résumé Evaluations
por: Rozado, David
Publicado: (2025)
por: Rozado, David
Publicado: (2025)
Evaluating Moral Beliefs across LLMs through a Pluralistic Framework
por: Liu, Xuelin, et al.
Publicado: (2024)
por: Liu, Xuelin, et al.
Publicado: (2024)
Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream Effects
por: Handa, Gunmay, et al.
Publicado: (2025)
por: Handa, Gunmay, et al.
Publicado: (2025)
Gender Inflected or Bias Inflicted: On Using Grammatical Gender Cues for Bias Evaluation in Machine Translation
por: Singh, Pushpdeep
Publicado: (2023)
por: Singh, Pushpdeep
Publicado: (2023)
SOLAR: Towards Characterizing Subjectivity of Individuals through Modeling Value Conflicts and Trade-offs
por: Lee, Younghun, et al.
Publicado: (2025)
por: Lee, Younghun, et al.
Publicado: (2025)
VIVA: A Benchmark for Vision-Grounded Decision-Making with Human Values
por: Hu, Zhe, et al.
Publicado: (2024)
por: Hu, Zhe, et al.
Publicado: (2024)
The Extractive-Abstractive Spectrum: Uncovering Verifiability Trade-offs in LLM Generations
por: Worledge, Theodora, et al.
Publicado: (2024)
por: Worledge, Theodora, et al.
Publicado: (2024)
Is She Even Relevant? When BERT Ignores Explicit Gender Cues
por: Klein, Jonas, et al.
Publicado: (2026)
por: Klein, Jonas, et al.
Publicado: (2026)
Do Large Language Models Discriminate in Hiring Decisions on the Basis of Race, Ethnicity, and Gender?
por: An, Haozhe, et al.
Publicado: (2024)
por: An, Haozhe, et al.
Publicado: (2024)
SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents
por: Zhan, Qiusi, et al.
Publicado: (2025)
por: Zhan, Qiusi, et al.
Publicado: (2025)
Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation
por: Gong, Ziwei, et al.
Publicado: (2026)
por: Gong, Ziwei, et al.
Publicado: (2026)
One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM Personalization
por: Weeber, Franziska, et al.
Publicado: (2026)
por: Weeber, Franziska, et al.
Publicado: (2026)
ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions
por: Ding, Xianzhong, et al.
Publicado: (2026)
por: Ding, Xianzhong, et al.
Publicado: (2026)
Do These LLM Benchmarks Agree? Fixing Benchmark Evaluation with BenchBench
por: Perlitz, Yotam, et al.
Publicado: (2024)
por: Perlitz, Yotam, et al.
Publicado: (2024)
Do Bias Benchmarks Generalise? Evidence from Voice-based Evaluation of Gender Bias in SpeechLLMs
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models
por: Luo, Sha, et al.
Publicado: (2026)
por: Luo, Sha, et al.
Publicado: (2026)
MatPlotAgent: Method and Evaluation for LLM-Based Agentic Scientific Data Visualization
por: Yang, Zhiyu, et al.
Publicado: (2024)
por: Yang, Zhiyu, et al.
Publicado: (2024)
An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs
por: Zhu, Qian, et al.
Publicado: (2026)
por: Zhu, Qian, et al.
Publicado: (2026)
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
por: Liu, Yujian, et al.
Publicado: (2026)
por: Liu, Yujian, et al.
Publicado: (2026)
Conformal Linguistic Calibration: Trading-off between Factuality and Specificity
por: Jiang, Zhengping, et al.
Publicado: (2025)
por: Jiang, Zhengping, et al.
Publicado: (2025)
WaterSearch: Exploring Seed Pooling for Improving the Quality-Detectability Trade-off in LLM Watermarking
por: Lin, Yukang, et al.
Publicado: (2025)
por: Lin, Yukang, et al.
Publicado: (2025)
A Comparative Analysis of Word-Level Metric Differential Privacy: Benchmarking The Privacy-Utility Trade-off
por: Meisenbacher, Stephen, et al.
Publicado: (2024)
por: Meisenbacher, Stephen, et al.
Publicado: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
por: Ma, Zhiqing, et al.
Publicado: (2026)
por: Ma, Zhiqing, et al.
Publicado: (2026)
Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checks
por: Chen, Yanran, et al.
Publicado: (2025)
por: Chen, Yanran, et al.
Publicado: (2025)
LLM-based Medical Assistant Personalization with Short- and Long-Term Memory Coordination
por: Zhang, Kai, et al.
Publicado: (2023)
por: Zhang, Kai, et al.
Publicado: (2023)
Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning
por: Javaji, Shashidhar Reddy, et al.
Publicado: (2025)
por: Javaji, Shashidhar Reddy, et al.
Publicado: (2025)
ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems
por: Liu, Jinnuo, et al.
Publicado: (2026)
por: Liu, Jinnuo, et al.
Publicado: (2026)
Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation
por: Chen, Junjie, et al.
Publicado: (2026)
por: Chen, Junjie, et al.
Publicado: (2026)
FinCon: A Synthesized LLM Multi-Agent System with Conceptual Verbal Reinforcement for Enhanced Financial Decision Making
por: Yu, Yangyang, et al.
Publicado: (2024)
por: Yu, Yangyang, et al.
Publicado: (2024)
Controlling Large Language Model with Latent Actions
por: Jia, Chengxing, et al.
Publicado: (2025)
por: Jia, Chengxing, et al.
Publicado: (2025)
Do LLMs Really Memorize Personally Identifiable Information? Revisiting PII Leakage with a Cue-Controlled Memorization Framework
por: Luo, Xiaoyu, et al.
Publicado: (2026)
por: Luo, Xiaoyu, et al.
Publicado: (2026)
ECBD: Evidence-Centered Benchmark Design for NLP
por: Liu, Yu Lu, et al.
Publicado: (2024)
por: Liu, Yu Lu, et al.
Publicado: (2024)
VocalBench-DF: A Benchmark for Evaluating Speech LLM Robustness to Disfluency
por: Liu, Hongcheng, et al.
Publicado: (2025)
por: Liu, Hongcheng, et al.
Publicado: (2025)
GRU: Mitigating the Trade-off between Unlearning and Retention for LLMs
por: Wang, Yue, et al.
Publicado: (2025)
por: Wang, Yue, et al.
Publicado: (2025)
Ejemplares similares
-
SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models
por: Su, Binxian, et al.
Publicado: (2026) -
Exploring Stability-Plasticity Trade-offs for Continual Named Entity Recognition
por: Zhang, Duzhen, et al.
Publicado: (2025) -
When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents
por: Qian, Lingfei, et al.
Publicado: (2025) -
Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes
por: Liu, Guangliang, et al.
Publicado: (2025) -
Gender-Neutral Rewriting in Italian: Models, Approaches, and Trade-offs
por: Piergentili, Andrea, et al.
Publicado: (2025)