Extracting PAC Decision Trees from Black Box Binary Classifiers: The Gender Bias Case Study on BERT-based Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ozaki, Ana, Confalonieri, Roberto, Guimarães, Ricardo, Imenes, Anders |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding the Interplay of Scale, Data, and Bias in Language Models: A Case Study with BERT
di: Ali, Muhammad, et al.
Pubblicazione: (2024)
di: Ali, Muhammad, et al.
Pubblicazione: (2024)
Shortcut Learning in Binary Classifier Black Boxes: Applications to Voice Anti-Spoofing and Biometrics
di: Sahidullah, Md, et al.
Pubblicazione: (2026)
di: Sahidullah, Md, et al.
Pubblicazione: (2026)
OptunaHub: A Platform for Black-Box Optimization
di: Ozaki, Yoshihiko, et al.
Pubblicazione: (2025)
di: Ozaki, Yoshihiko, et al.
Pubblicazione: (2025)
Argumentation-Based Explainability for Legal AI: Comparative and Regulatory Perspectives
di: Prajescu, Andrada Iulia, et al.
Pubblicazione: (2025)
di: Prajescu, Andrada Iulia, et al.
Pubblicazione: (2025)
Multiple Different Black Box Explanations for Image Classifiers
di: Chockler, Hana, et al.
Pubblicazione: (2023)
di: Chockler, Hana, et al.
Pubblicazione: (2023)
High Risk of Political Bias in Black Box Emotion Inference Models
di: Plisiecki, Hubert, et al.
Pubblicazione: (2024)
di: Plisiecki, Hubert, et al.
Pubblicazione: (2024)
CUBIC: Concept Embeddings for Unsupervised Bias Identification using VLMs
di: Méndez, David, et al.
Pubblicazione: (2025)
di: Méndez, David, et al.
Pubblicazione: (2025)
Efficient Non-Parametric Uncertainty Quantification for Black-Box Large Language Models and Decision Planning
di: Tsai, Yao-Hung Hubert, et al.
Pubblicazione: (2024)
di: Tsai, Yao-Hung Hubert, et al.
Pubblicazione: (2024)
Binary Classifier Optimization for Large Language Model Alignment
di: Jung, Seungjae, et al.
Pubblicazione: (2024)
di: Jung, Seungjae, et al.
Pubblicazione: (2024)
In Search of Trees: Decision-Tree Policy Synthesis for Black-Box Systems via Search
di: Demirović, Emir, et al.
Pubblicazione: (2024)
di: Demirović, Emir, et al.
Pubblicazione: (2024)
Locally Interpretable Individualized Treatment Rules for Black-Box Decision Models
di: Charvadeh, Yasin Khadem, et al.
Pubblicazione: (2026)
di: Charvadeh, Yasin Khadem, et al.
Pubblicazione: (2026)
Looking into Black Box Code Language Models
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2024)
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2024)
Unpacking the Black Box: Regulating Algorithmic Decisions
di: Blattner, Laura, et al.
Pubblicazione: (2021)
di: Blattner, Laura, et al.
Pubblicazione: (2021)
Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software
di: Kordonsky, Tomer, et al.
Pubblicazione: (2026)
di: Kordonsky, Tomer, et al.
Pubblicazione: (2026)
GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
Locating and Mitigating Gender Bias in Large Language Models
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
It's All in The [MASK]: Simple Instruction-Tuning Enables BERT-like Masked Language Models As Generative Classifiers
di: Clavié, Benjamin, et al.
Pubblicazione: (2025)
di: Clavié, Benjamin, et al.
Pubblicazione: (2025)
GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing
di: Xiao, Yisong, et al.
Pubblicazione: (2024)
di: Xiao, Yisong, et al.
Pubblicazione: (2024)
What You See is What You Classify: Black Box Attributions
di: Stalder, Steven, et al.
Pubblicazione: (2022)
di: Stalder, Steven, et al.
Pubblicazione: (2022)
Knowledge Base Embeddings: Semantics and Theoretical Properties
di: Bourgaux, Camille, et al.
Pubblicazione: (2024)
di: Bourgaux, Camille, et al.
Pubblicazione: (2024)
Black-Box On-Policy Distillation of Large Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
A ACESSIBILIDADE DE IDOSOS E AS UNIDADES DE CONSERVAÇÃO: REFLEXÕES RUMO À DEMOCRATIZAÇÃO DOS ESPAÇOS PÚBLICOS DE LAZER.
di: Fabiane Imenes Luiz
Pubblicazione: (2016)
di: Fabiane Imenes Luiz
Pubblicazione: (2016)
Diffusion Large Language Models for Black-Box Optimization
di: Yuan, Ye, et al.
Pubblicazione: (2026)
di: Yuan, Ye, et al.
Pubblicazione: (2026)
Debiasing Classifiers by Amplifying Bias with Latent Diffusion and Large Language Models
di: Ko, Donggeun, et al.
Pubblicazione: (2024)
di: Ko, Donggeun, et al.
Pubblicazione: (2024)
A Novel BERT-based Classifier to Detect Political Leaning of YouTube Videos based on their Titles
di: AlDahoul, Nouar, et al.
Pubblicazione: (2024)
di: AlDahoul, Nouar, et al.
Pubblicazione: (2024)
Knowledgeable Language Models as Black-Box Optimizers for Personalized Medicine
di: Yao, Michael S., et al.
Pubblicazione: (2025)
di: Yao, Michael S., et al.
Pubblicazione: (2025)
Jailbreaking Black Box Large Language Models in Twenty Queries
di: Chao, Patrick, et al.
Pubblicazione: (2023)
di: Chao, Patrick, et al.
Pubblicazione: (2023)
GenderCARE: A Comprehensive Framework for Assessing and Reducing Gender Bias in Large Language Models
di: Tang, Kunsheng, et al.
Pubblicazione: (2024)
di: Tang, Kunsheng, et al.
Pubblicazione: (2024)
Gender Bias in Machine Translation and The Era of Large Language Models
di: Vanmassenhove, Eva
Pubblicazione: (2024)
di: Vanmassenhove, Eva
Pubblicazione: (2024)
Benchmarking Gender and Political Bias in Large Language Models
di: Yang, Jinrui, et al.
Pubblicazione: (2025)
di: Yang, Jinrui, et al.
Pubblicazione: (2025)
On the Compression of Language Models for Code: An Empirical Study on CodeBERT
di: d'Aloisio, Giordano, et al.
Pubblicazione: (2024)
di: d'Aloisio, Giordano, et al.
Pubblicazione: (2024)
Model Change for Description Logic Concepts
di: Ozaki, Ana, et al.
Pubblicazione: (2026)
di: Ozaki, Ana, et al.
Pubblicazione: (2026)
Bias Similarity Measurement: A Black-Box Audit of Fairness Across LLMs
di: Jeong, Hyejun, et al.
Pubblicazione: (2024)
di: Jeong, Hyejun, et al.
Pubblicazione: (2024)
Beyond the Prompt: Gender Bias in Text-to-Image Models, with a Case Study on Hospital Professions
di: Vandewiele, Franck, et al.
Pubblicazione: (2025)
di: Vandewiele, Franck, et al.
Pubblicazione: (2025)
Classifier-to-Bias: Toward Unsupervised Automatic Bias Detection for Visual Classifiers
di: Guimard, Quentin, et al.
Pubblicazione: (2025)
di: Guimard, Quentin, et al.
Pubblicazione: (2025)
Advanced Black-Box Tuning of Large Language Models with Limited API Calls
di: Xie, Zhikang, et al.
Pubblicazione: (2025)
di: Xie, Zhikang, et al.
Pubblicazione: (2025)
Boundary on the Table: Efficient Black-Box Decision-Based Attacks for Structured Data
di: Kazoom, Roie, et al.
Pubblicazione: (2025)
di: Kazoom, Roie, et al.
Pubblicazione: (2025)
RETRACTION: Garment Design Models Combining Bayesian Classifier and Decision Tree Algorithm
di: Computational Intelligence and Neuroscience
Pubblicazione: (2024)
di: Computational Intelligence and Neuroscience
Pubblicazione: (2024)
Mitigating Gender Bias in Code Large Language Models via Model Editing
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
ADBA:Approximation Decision Boundary Approach for Black-Box Adversarial Attacks
di: Wang, Feiyang, et al.
Pubblicazione: (2024)
di: Wang, Feiyang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Understanding the Interplay of Scale, Data, and Bias in Language Models: A Case Study with BERT
di: Ali, Muhammad, et al.
Pubblicazione: (2024) -
Shortcut Learning in Binary Classifier Black Boxes: Applications to Voice Anti-Spoofing and Biometrics
di: Sahidullah, Md, et al.
Pubblicazione: (2026) -
OptunaHub: A Platform for Black-Box Optimization
di: Ozaki, Yoshihiko, et al.
Pubblicazione: (2025) -
Argumentation-Based Explainability for Legal AI: Comparative and Regulatory Perspectives
di: Prajescu, Andrada Iulia, et al.
Pubblicazione: (2025) -
Multiple Different Black Box Explanations for Image Classifiers
di: Chockler, Hana, et al.
Pubblicazione: (2023)