PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Farsi, Farhan, Bali, Shayan, Valeh, Fatemeh, Ghofrani, Parsa, Pakniat, Alireza, Kashfipour, Kian, Payberah, Amir H. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
par: Farsi, Farhan, et autres
Publié: (2025)
par: Farsi, Farhan, et autres
Publié: (2025)
RFBES at SemEval-2024 Task 8: Investigating Syntactic and Semantic Features for Distinguishing AI-Generated and Human-Written Texts
par: Rad, Mohammad Heydari, et autres
Publié: (2024)
par: Rad, Mohammad Heydari, et autres
Publié: (2024)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
par: Hosseini, Mohammad, et autres
Publié: (2025)
par: Hosseini, Mohammad, et autres
Publié: (2025)
Who Gets the Mic? Investigating Gender Bias in the Speaker Assignment of a Speech-LLM
par: Puhach, Dariia, et autres
Publié: (2025)
par: Puhach, Dariia, et autres
Publié: (2025)
An Empirical Study of Accuracy-Robustness Tradeoff and Training Efficiency in Self-Supervised Learning
par: Ghofrani, Fatemeh, et autres
Publié: (2025)
par: Ghofrani, Fatemeh, et autres
Publié: (2025)
LRW-Persian: Lip-reading in the Wild Dataset for Persian Language
par: Taghizadeh, Zahra, et autres
Publié: (2025)
par: Taghizadeh, Zahra, et autres
Publié: (2025)
Human-AI Collaborative Uncertainty Quantification
par: Noorani, Sima, et autres
Publié: (2025)
par: Noorani, Sima, et autres
Publié: (2025)
ParsiPy: NLP Toolkit for Historical Persian Texts in Python
par: Farsi, Farhan, et autres
Publié: (2025)
par: Farsi, Farhan, et autres
Publié: (2025)
Single molecule localization microscopy challenge: a biologically inspired benchmark for long-sequence modeling
par: Valeh, Fatemeh, et autres
Publié: (2026)
par: Valeh, Fatemeh, et autres
Publié: (2026)
Features of manufacturing case of hydraulic cylinders of structural powder steel
par: Aynur Valeh Sharifova
Publié: (2024)
par: Aynur Valeh Sharifova
Publié: (2024)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
par: Qharabagh, Muhammad Fetrat, et autres
Publié: (2024)
par: Qharabagh, Muhammad Fetrat, et autres
Publié: (2024)
EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models
par: Mirbagheri, Mohammad Reza, et autres
Publié: (2025)
par: Mirbagheri, Mohammad Reza, et autres
Publié: (2025)
PARSE: An Open-Domain Reasoning Question Answering Benchmark for Persian
par: Mozafari, Jamshid, et autres
Publié: (2026)
par: Mozafari, Jamshid, et autres
Publié: (2026)
Multi-Round Human-AI Collaboration with User-Specified Requirements
par: Noorani, Sima, et autres
Publié: (2026)
par: Noorani, Sima, et autres
Publié: (2026)
CombiGraph-Vis: A Curated Multimodal Olympiad Benchmark for Discrete Mathematical Reasoning
par: Mahdavi, Hamed, et autres
Publié: (2025)
par: Mahdavi, Hamed, et autres
Publié: (2025)
Accelerate Model Parallel Training by Using Efficient Graph Traversal Order in Device Placement
par: Wang, Tianze, et autres
Publié: (2022)
par: Wang, Tianze, et autres
Publié: (2022)
ELAB: Extensive LLM Alignment Benchmark in Persian Language
par: Pourbahman, Zahra, et autres
Publié: (2025)
par: Pourbahman, Zahra, et autres
Publié: (2025)
A Comparative Evaluation of Large Language Models for Persian Sentiment Analysis and Emotion Detection in Social Media Texts
par: Tohidi, Kian, et autres
Publié: (2025)
par: Tohidi, Kian, et autres
Publié: (2025)
Combining Trained Models in Reinforcement Learning
par: Patil, Ujjwal, et autres
Publié: (2026)
par: Patil, Ujjwal, et autres
Publié: (2026)
Desde la Literatura Vanguardista hasta el Diseño cultural: Entrevista a Amir Parsa. Un dialogo sobre el Alzheimer ’s Project y el Programa Meet me at MoMA
par: Amir Parsa
Publié: (2014)
par: Amir Parsa
Publié: (2014)
Designing Human-AI Systems: Anthropomorphism and Framing Bias on Human-AI Collaboration
par: Olszewski, Samuel Aleksander Sánchez
Publié: (2024)
par: Olszewski, Samuel Aleksander Sánchez
Publié: (2024)
When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets
par: Djuhera, Aladin, et autres
Publié: (2025)
par: Djuhera, Aladin, et autres
Publié: (2025)
DCA-Bench: A Benchmark for Dataset Curation Agents
par: Huang, Benhao, et autres
Publié: (2024)
par: Huang, Benhao, et autres
Publié: (2024)
Guided By AI: Navigating Trust, Bias, and Data Exploration in AI-Guided Visual Analytics
par: Ha, Sunwoo, et autres
Publié: (2024)
par: Ha, Sunwoo, et autres
Publié: (2024)
Guided By AI: Navigating Trust, Bias, and Data Exploration in AI‐Guided Visual Analytics
par: Sunwoo Ha, et autres
Publié: (2024)
par: Sunwoo Ha, et autres
Publié: (2024)
BERTCaps: BERT Capsule for Persian Multi-Domain Sentiment Analysis
par: Memari, Mohammadali, et autres
Publié: (2024)
par: Memari, Mohammadali, et autres
Publié: (2024)
BioTrove: A Large Curated Image Dataset Enabling AI for Biodiversity
par: Yang, Chih-Hsuan, et autres
Publié: (2024)
par: Yang, Chih-Hsuan, et autres
Publié: (2024)
An Optimization Framework for the Time-Dependent Electric Vehicle Routing Problem with Shared Mobility: A Step Toward Smart Cities
par: Yazdiani, Alireza, et autres
Publié: (2025)
par: Yazdiani, Alireza, et autres
Publié: (2025)
Rhodium(II)‐Catalyzed Denitrogenative Transformations of N‐Sulfonyl‐1,2,3‐Triazoles
par: Fatemeh Doraghi, et autres
Publié: (2024)
par: Fatemeh Doraghi, et autres
Publié: (2024)
OPSD: an Offensive Persian Social media Dataset and its baseline evaluations
par: Safayani, Mehran, et autres
Publié: (2024)
par: Safayani, Mehran, et autres
Publié: (2024)
Combined Cycle Power Plants Water Purification Unit Life Cycle Assessment for Replacing Water Wastage
par: Alireza A. Majidy, et autres
Publié: (2025)
par: Alireza A. Majidy, et autres
Publié: (2025)
AquaCluster: Using Satellite Images And Self-supervised Machine Learning Networks To Detect Water Hidden Under Vegetation
par: Iakovidis, Ioannis, et autres
Publié: (2025)
par: Iakovidis, Ioannis, et autres
Publié: (2025)
Using a Human-AI Teaming Approach to Create and Curate Scientific Datasets with the SCILIRE System
par: Bölücü, Necva, et autres
Publié: (2026)
par: Bölücü, Necva, et autres
Publié: (2026)
Charging While Driving Lanes: A Boon to Electric Vehicle Owners or a Disruption to Traffic Flow
par: Bafandkar, Shayan, et autres
Publié: (2025)
par: Bafandkar, Shayan, et autres
Publié: (2025)
Publish‐Review‐Curate Modelling for Data Paper and Dataset: A Collaborative Approach
par: Youngim Jung, et autres
Publié: (2025)
par: Youngim Jung, et autres
Publié: (2025)
PAPPL: Personalized AI-Powered Progressive Learning Platform
par: Bafandkar, Shayan, et autres
Publié: (2025)
par: Bafandkar, Shayan, et autres
Publié: (2025)
Postmodern rendition of myth in Ashbery's ‘Syringa’
par: Roghayeh Farsi
Publié: (2022)
par: Roghayeh Farsi
Publié: (2022)
Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints
par: Xiong, Raymond M., et autres
Publié: (2025)
par: Xiong, Raymond M., et autres
Publié: (2025)
SynRXN: An Open Benchmark and Curated Dataset for Computational Reaction Modeling
par: Phan, Tieu-Long, et autres
Publié: (2026)
par: Phan, Tieu-Long, et autres
Publié: (2026)
MIMIC-Sepsis: A Curated Benchmark for Modeling and Learning from Sepsis Trajectories in the ICU
par: Huang, Yong, et autres
Publié: (2025)
par: Huang, Yong, et autres
Publié: (2025)
Documents similaires
-
MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
par: Farsi, Farhan, et autres
Publié: (2025) -
RFBES at SemEval-2024 Task 8: Investigating Syntactic and Semantic Features for Distinguishing AI-Generated and Human-Written Texts
par: Rad, Mohammad Heydari, et autres
Publié: (2024) -
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
par: Hosseini, Mohammad, et autres
Publié: (2025) -
Who Gets the Mic? Investigating Gender Bias in the Speaker Assignment of a Speech-LLM
par: Puhach, Dariia, et autres
Publié: (2025) -
An Empirical Study of Accuracy-Robustness Tradeoff and Training Efficiency in Self-Supervised Learning
par: Ghofrani, Fatemeh, et autres
Publié: (2025)