Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Yujie, Li, Kunquan, Liao, Yixuan, Chen, Xiaoxin, Su, Jinsong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
por: Lin, Yujie, et al.
Publicado: (2026)
por: Lin, Yujie, et al.
Publicado: (2026)
PFME: A Modular Approach for Fine-grained Hallucination Detection and Editing of Large Language Models
por: Deng, Kunquan, et al.
Publicado: (2024)
por: Deng, Kunquan, et al.
Publicado: (2024)
Causal-Guided Active Learning for Debiasing Large Language Models
por: Du, Li, et al.
Publicado: (2024)
por: Du, Li, et al.
Publicado: (2024)
Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought
por: Li, Bowen, et al.
Publicado: (2026)
por: Li, Bowen, et al.
Publicado: (2026)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
por: Sun, Zhouhao, et al.
Publicado: (2025)
por: Sun, Zhouhao, et al.
Publicado: (2025)
BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation
por: Li, Minchong, et al.
Publicado: (2024)
por: Li, Minchong, et al.
Publicado: (2024)
BayesPrompt: Prompting Large-Scale Pre-Trained Language Models on Few-shot Inference via Debiased Domain Abstraction
por: Li, Jiangmeng, et al.
Publicado: (2024)
por: Li, Jiangmeng, et al.
Publicado: (2024)
Prompt Programming for Cultural Bias and Alignment of Large Language Models
por: Eren, Maksim, et al.
Publicado: (2026)
por: Eren, Maksim, et al.
Publicado: (2026)
UGID: Unified Graph Isomorphism for Debiasing Large Language Models
por: Ding, Zikang, et al.
Publicado: (2026)
por: Ding, Zikang, et al.
Publicado: (2026)
Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuning
por: Salemi, Hossein, et al.
Publicado: (2026)
por: Salemi, Hossein, et al.
Publicado: (2026)
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
por: Huang, Jianheng, et al.
Publicado: (2024)
por: Huang, Jianheng, et al.
Publicado: (2024)
Are Large Language Models Really Bias-Free? Jailbreak Prompts for Assessing Adversarial Robustness to Bias Elicitation
por: Cantini, Riccardo, et al.
Publicado: (2024)
por: Cantini, Riccardo, et al.
Publicado: (2024)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
DeCAP: Context-Adaptive Prompt Generation for Debiasing Zero-shot Question Answering in Large Language Models
por: Bae, Suyoung, et al.
Publicado: (2025)
por: Bae, Suyoung, et al.
Publicado: (2025)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
por: Mu, Lin, et al.
Publicado: (2025)
por: Mu, Lin, et al.
Publicado: (2025)
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
por: Li, Loka, et al.
Publicado: (2024)
por: Li, Loka, et al.
Publicado: (2024)
DeFrame: Debiasing Large Language Models Against Framing Effects
por: Lim, Kahee, et al.
Publicado: (2026)
por: Lim, Kahee, et al.
Publicado: (2026)
Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
por: Zou, Hongjian, et al.
Publicado: (2026)
por: Zou, Hongjian, et al.
Publicado: (2026)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
por: Shi, Bingkang, et al.
Publicado: (2023)
por: Shi, Bingkang, et al.
Publicado: (2023)
More Women, Same Stereotypes: Unpacking the Gender Bias Paradox in Large Language Models
por: Chen, Evan, et al.
Publicado: (2025)
por: Chen, Evan, et al.
Publicado: (2025)
Position is Power: System Prompts as a Mechanism of Bias in Large Language Models (LLMs)
por: Neumann, Anna, et al.
Publicado: (2025)
por: Neumann, Anna, et al.
Publicado: (2025)
Large Language Model Bias Mitigation from the Perspective of Knowledge Editing
por: Chen, Ruizhe, et al.
Publicado: (2024)
por: Chen, Ruizhe, et al.
Publicado: (2024)
Safety-Aware Fine-Tuning of Large Language Models
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
DR.GAP: Mitigating Bias in Large Language Models using Gender-Aware Prompting with Demonstration and Reasoning
por: Qiu, Hongye, et al.
Publicado: (2025)
por: Qiu, Hongye, et al.
Publicado: (2025)
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
por: Wang, Yaxuan, et al.
Publicado: (2025)
por: Wang, Yaxuan, et al.
Publicado: (2025)
DocTER: Evaluating Document-based Knowledge Editing
por: Wu, Suhang, et al.
Publicado: (2023)
por: Wu, Suhang, et al.
Publicado: (2023)
PICLe: Eliciting Diverse Behaviors from Large Language Models with Persona In-Context Learning
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
One2set + Large Language Model: Best Partners for Keyphrase Generation
por: Shao, Liangying, et al.
Publicado: (2024)
por: Shao, Liangying, et al.
Publicado: (2024)
Regional Bias in Large Language Models
por: Gopinadh, M P V S, et al.
Publicado: (2026)
por: Gopinadh, M P V S, et al.
Publicado: (2026)
Debiasing Large Language Models in Thai Political Stance Detection via Counterfactual Calibration
por: Sermsri, Kasidit, et al.
Publicado: (2025)
por: Sermsri, Kasidit, et al.
Publicado: (2025)
Using Large Language Model for End-to-End Chinese ASR and NER
por: Li, Yuang, et al.
Publicado: (2024)
por: Li, Yuang, et al.
Publicado: (2024)
Locating and Mitigating Gender Bias in Large Language Models
por: Cai, Yuchen, et al.
Publicado: (2024)
por: Cai, Yuchen, et al.
Publicado: (2024)
Prompt and Parameter Co-Optimization for Large Language Models
por: Bo, Xiaohe, et al.
Publicado: (2025)
por: Bo, Xiaohe, et al.
Publicado: (2025)
Enhancing Chain-of-Thoughts Prompting with Iterative Bootstrapping in Large Language Models
por: Sun, Jiashuo, et al.
Publicado: (2023)
por: Sun, Jiashuo, et al.
Publicado: (2023)
APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts
por: Dong, Honghua, et al.
Publicado: (2024)
por: Dong, Honghua, et al.
Publicado: (2024)
BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models
por: Lin, Feng, et al.
Publicado: (2024)
por: Lin, Feng, et al.
Publicado: (2024)
Multi-Persona Thinking for Bias Mitigation in Large Language Models
por: Chen, Yuxing, et al.
Publicado: (2026)
por: Chen, Yuxing, et al.
Publicado: (2026)
Large, Small or Both: A Novel Data Augmentation Framework Based on Language Models for Debiasing Opinion Summarization
por: Zhang, Yanyue, et al.
Publicado: (2024)
por: Zhang, Yanyue, et al.
Publicado: (2024)
Logical Negation Augmenting and Debiasing for Prompt-based Methods
por: Li, Yitian, et al.
Publicado: (2024)
por: Li, Yitian, et al.
Publicado: (2024)
Are Large Language Models Good Prompt Optimizers?
por: Ma, Ruotian, et al.
Publicado: (2024)
por: Ma, Ruotian, et al.
Publicado: (2024)
Ejemplares similares
-
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
por: Lin, Yujie, et al.
Publicado: (2026) -
PFME: A Modular Approach for Fine-grained Hallucination Detection and Editing of Large Language Models
por: Deng, Kunquan, et al.
Publicado: (2024) -
Causal-Guided Active Learning for Debiasing Large Language Models
por: Du, Li, et al.
Publicado: (2024) -
Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought
por: Li, Bowen, et al.
Publicado: (2026) -
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
por: Sun, Zhouhao, et al.
Publicado: (2025)