SocioEval: A Template-Based Framework for Evaluating Socioeconomic Status Bias in Foundation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumar, Divyanshu, Gupta, Ishita, Birur, Nitin Aravind, Baswa, Tanay, Agarwal, Sahil, Harshangi, Prashanth |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments
par: Kumar, Divyanshu, et autres
Publié: (2026)
par: Kumar, Divyanshu, et autres
Publié: (2026)
Beyond Western Politics: Cross-Cultural Benchmarks for Evaluating Partisan Associations in LLMs
par: Kumar, Divyanshu, et autres
Publié: (2025)
par: Kumar, Divyanshu, et autres
Publié: (2025)
VERA: Validation and Enhancement for Retrieval Augmented systems
par: Birur, Nitin Aravind, et autres
Publié: (2024)
par: Birur, Nitin Aravind, et autres
Publié: (2024)
No Free Lunch with Guardrails
par: Kumar, Divyanshu, et autres
Publié: (2025)
par: Kumar, Divyanshu, et autres
Publié: (2025)
Quantifying CBRN Risk in Frontier Models
par: Kumar, Divyanshu, et autres
Publié: (2025)
par: Kumar, Divyanshu, et autres
Publié: (2025)
SAGE-RT: Synthetic Alignment data Generation for Safety Evaluation and Red Teaming
par: Kumar, Anurakt, et autres
Publié: (2024)
par: Kumar, Anurakt, et autres
Publié: (2024)
Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations
par: Kumar, Divyanshu, et autres
Publié: (2025)
par: Kumar, Divyanshu, et autres
Publié: (2025)
Investigating Implicit Bias in Large Language Models: A Large-Scale Study of Over 50 LLMs
par: Kumar, Divyanshu, et autres
Publié: (2024)
par: Kumar, Divyanshu, et autres
Publié: (2024)
Fine-Tuning, Quantization, and LLMs: Navigating Unintended Outcomes
par: Kumar, Divyanshu, et autres
Publié: (2024)
par: Kumar, Divyanshu, et autres
Publié: (2024)
AccessEval: Benchmarking Disability Bias in Large Language Models
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
VHDL-Eval: A Framework for Evaluating Large Language Models in VHDL Code Generation
par: Vijayaraghavan, Prashanth, et autres
Publié: (2024)
par: Vijayaraghavan, Prashanth, et autres
Publié: (2024)
Socio-Culturally Aware Evaluation Framework for LLM-Based Content Moderation
par: Kumar, Shanu, et autres
Publié: (2024)
par: Kumar, Shanu, et autres
Publié: (2024)
'Since Lawyers are Males..': Examining Implicit Gender Bias in Hindi Language Generation by LLMs
par: Joshi, Ishika, et autres
Publié: (2024)
par: Joshi, Ishika, et autres
Publié: (2024)
GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs
par: Gupta, Nitin, et autres
Publié: (2025)
par: Gupta, Nitin, et autres
Publié: (2025)
Template-Based Probes Are Imperfect Lenses for Counterfactual Bias Evaluation in LLMs
par: Kohankhaki, Farnaz, et autres
Publié: (2024)
par: Kohankhaki, Farnaz, et autres
Publié: (2024)
MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models
par: Dihan, Mahir Labib, et autres
Publié: (2024)
par: Dihan, Mahir Labib, et autres
Publié: (2024)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
par: Garg, Madhav Krishan, et autres
Publié: (2025)
par: Garg, Madhav Krishan, et autres
Publié: (2025)
Team A at SemEval-2025 Task 11: Breaking Language Barriers in Emotion Detection with Multilingual Models
par: Sahil, P Sam, et autres
Publié: (2025)
par: Sahil, P Sam, et autres
Publié: (2025)
Personality Shapes Gender Bias in Persona-Conditioned LLM Narratives Across English and Hindi: An Empirical Investigation
par: Kumar, Tanay, et autres
Publié: (2026)
par: Kumar, Tanay, et autres
Publié: (2026)
Eval4Sim: An Evaluation Framework for Persona Simulation
par: Bao, Eliseo, et autres
Publié: (2026)
par: Bao, Eliseo, et autres
Publié: (2026)
The AI Gap: How Socioeconomic Status Affects Language Technology Interactions
par: Bassignana, Elisa, et autres
Publié: (2025)
par: Bassignana, Elisa, et autres
Publié: (2025)
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains
par: Ramesh, Krithika, et autres
Publié: (2025)
par: Ramesh, Krithika, et autres
Publié: (2025)
Towards a Multidimensional Evaluation Framework for Empathetic Conversational Systems
par: Raamkumar, Aravind Sesagiri, et autres
Publié: (2024)
par: Raamkumar, Aravind Sesagiri, et autres
Publié: (2024)
Do Large Language Models Adapt to Language Variation across Socioeconomic Status?
par: Bassignana, Elisa, et autres
Publié: (2026)
par: Bassignana, Elisa, et autres
Publié: (2026)
GraphEval: A Knowledge-Graph Based LLM Hallucination Evaluation Framework
par: Sansford, Hannah, et autres
Publié: (2024)
par: Sansford, Hannah, et autres
Publié: (2024)
BITS Pilani at SemEval-2026 Task 9: Structured Supervised Fine-Tuning with DPO Refinement for Polarization Detection
par: Gupta, Atharva, et autres
Publié: (2026)
par: Gupta, Atharva, et autres
Publié: (2026)
EvalSense: A Framework for Domain-Specific LLM (Meta-)Evaluation
par: Dejl, Adam, et autres
Publié: (2026)
par: Dejl, Adam, et autres
Publié: (2026)
What is in a name? Mitigating Name Bias in Text Embeddings via Anonymization
par: Manchanda, Sahil, et autres
Publié: (2025)
par: Manchanda, Sahil, et autres
Publié: (2025)
EvalCards: A Framework for Standardized Evaluation Reporting
par: Dhar, Ruchira, et autres
Publié: (2025)
par: Dhar, Ruchira, et autres
Publié: (2025)
Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries
par: Gondil, Tanay
Publié: (2026)
par: Gondil, Tanay
Publié: (2026)
MAPLE: Multilingual Evaluation of Parameter Efficient Finetuning of Large Language Models
par: Aggarwal, Divyanshu, et autres
Publié: (2024)
par: Aggarwal, Divyanshu, et autres
Publié: (2024)
Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
par: Sinha, Samridhi Raj, et autres
Publié: (2025)
par: Sinha, Samridhi Raj, et autres
Publié: (2025)
Tau-Eval: A Unified Evaluation Framework for Useful and Private Text Anonymization
par: Loiseau, Gabriel, et autres
Publié: (2025)
par: Loiseau, Gabriel, et autres
Publié: (2025)
Linguistic Complexity and Socio-cultural Patterns in Hip-Hop Lyrics
par: Bansal, Aayam, et autres
Publié: (2025)
par: Bansal, Aayam, et autres
Publié: (2025)
MedRiskEval: Medical Risk Evaluation Benchmark of Language Models, On the Importance of User Perspectives in Healthcare Settings
par: Corbeil, Jean-Philippe, et autres
Publié: (2025)
par: Corbeil, Jean-Philippe, et autres
Publié: (2025)
CreativEval: Evaluating Creativity of LLM-Based Hardware Code Generation
par: DeLorenzo, Matthew, et autres
Publié: (2024)
par: DeLorenzo, Matthew, et autres
Publié: (2024)
HintEval: A Comprehensive Framework for Hint Generation and Evaluation for Questions
par: Mozafari, Jamshid, et autres
Publié: (2025)
par: Mozafari, Jamshid, et autres
Publié: (2025)
CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-Judges
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
par: Wang, Ganghua, et autres
Publié: (2025)
par: Wang, Ganghua, et autres
Publié: (2025)
Documents similaires
-
Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments
par: Kumar, Divyanshu, et autres
Publié: (2026) -
Beyond Western Politics: Cross-Cultural Benchmarks for Evaluating Partisan Associations in LLMs
par: Kumar, Divyanshu, et autres
Publié: (2025) -
VERA: Validation and Enhancement for Retrieval Augmented systems
par: Birur, Nitin Aravind, et autres
Publié: (2024) -
No Free Lunch with Guardrails
par: Kumar, Divyanshu, et autres
Publié: (2025) -
Quantifying CBRN Risk in Frontier Models
par: Kumar, Divyanshu, et autres
Publié: (2025)