Towards Understanding Task-agnostic Debiasing Through the Lenses of Intrinsic Bias and Forgetfulness
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Guangliang, Afshari, Milad, Zhang, Xitong, Xue, Zhiyu, Ghosh, Avrajit, Bashyal, Bidhan, Wang, Rongrong, Johnson, Kristen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Smaller Large Language Models Can Do Moral Self-Correction
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
Improving Generalization of Complex Models under Unbounded Loss Using PAC-Bayes Bounds
di: Zhang, Xitong, et al.
Pubblicazione: (2023)
di: Zhang, Xitong, et al.
Pubblicazione: (2023)
On the Convergence of Moral Self-Correction in Large Language Models
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
A Survey to Recent Progress Towards Understanding In-Context Learning
di: Mao, Haitao, et al.
Pubblicazione: (2024)
di: Mao, Haitao, et al.
Pubblicazione: (2024)
Discourse Heuristics For Paradoxically Moral Self-Correction
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Pragmatic Inference for Moral Reasoning Acquisition: Generalization via Metapragmatic Links
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Diagnosing Moral Reasoning Acquisition in Language Models: Pragmatics and Generalization
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Self-correction is Not An Innate Capability in Language Models
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
Learning to Diagnose and Correct Errors: Towards Moral Sensitivity Acquisition in Large Language Models
di: Chen, Bocheng, et al.
Pubblicazione: (2026)
di: Chen, Bocheng, et al.
Pubblicazione: (2026)
Applying Intrinsic Debiasing on Downstream Tasks: Challenges and Considerations for Machine Translation
di: Iluz, Bar, et al.
Pubblicazione: (2024)
di: Iluz, Bar, et al.
Pubblicazione: (2024)
Towards Multimodal Sentiment Analysis Debiasing via Bias Purification
di: Yang, Dingkang, et al.
Pubblicazione: (2024)
di: Yang, Dingkang, et al.
Pubblicazione: (2024)
Optimal Eye Surgeon: Finding Image Priors through Sparse Generators at Initialization
di: Ghosh, Avrajit, et al.
Pubblicazione: (2024)
di: Ghosh, Avrajit, et al.
Pubblicazione: (2024)
Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models
di: Parihar, Shweta, et al.
Pubblicazione: (2026)
di: Parihar, Shweta, et al.
Pubblicazione: (2026)
OffsetBias: Leveraging Debiased Data for Tuning Evaluators
di: Park, Junsoo, et al.
Pubblicazione: (2024)
di: Park, Junsoo, et al.
Pubblicazione: (2024)
Understanding Untrained Deep Models for Inverse Problems: Algorithms and Theory
di: Alkhouri, Ismail, et al.
Pubblicazione: (2025)
di: Alkhouri, Ismail, et al.
Pubblicazione: (2025)
Bias Beyond English: Evaluating Social Bias and Debiasing Methods in a Low-Resource Setting
di: Zhou, Ej, et al.
Pubblicazione: (2025)
di: Zhou, Ej, et al.
Pubblicazione: (2025)
On Bias and Fairness in NLP: Investigating the Impact of Bias and Debiasing in Language Models on the Fairness of Toxicity Detection
di: Elsafoury, Fatma, et al.
Pubblicazione: (2023)
di: Elsafoury, Fatma, et al.
Pubblicazione: (2023)
Towards representation agnostic probabilistic programming
di: Fenske, Ole, et al.
Pubblicazione: (2025)
di: Fenske, Ole, et al.
Pubblicazione: (2025)
Bias Dynamics in BabyLMs: Towards a Compute-Efficient Sandbox for Democratising Pre-Training Debiasing
di: Trhlik, Filip, et al.
Pubblicazione: (2026)
di: Trhlik, Filip, et al.
Pubblicazione: (2026)
BiasFilter: An Inference-Time Debiasing Framework for Large Language Models
di: Cheng, Xiaoqing, et al.
Pubblicazione: (2025)
di: Cheng, Xiaoqing, et al.
Pubblicazione: (2025)
The Gaps between Pre-train and Downstream Settings in Bias Evaluation and Debiasing
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
Unboxing Occupational Bias: Grounded Debiasing of LLMs with U.S. Labor Data
di: Gorti, Atmika, et al.
Pubblicazione: (2024)
di: Gorti, Atmika, et al.
Pubblicazione: (2024)
Debiasing CLIP: Interpreting and Correcting Bias in Attention Heads
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
On Debiasing Text Embeddings Through Context Injection
di: Uriot, Thomas
Pubblicazione: (2024)
di: Uriot, Thomas
Pubblicazione: (2024)
Task-agnostic Prompt Compression with Context-aware Sentence Embedding and Reward-guided Task Descriptor
di: Liskavets, Barys, et al.
Pubblicazione: (2025)
di: Liskavets, Barys, et al.
Pubblicazione: (2025)
Religious Bias Landscape in Language and Text-to-Image Models: Analysis, Detection, and Debiasing Strategies
di: Abrar, Ajwad, et al.
Pubblicazione: (2025)
di: Abrar, Ajwad, et al.
Pubblicazione: (2025)
Measuring Bias or Measuring the Task: Understanding the Brittle Nature of LLM Gender Biases
di: Gao, Bufan, et al.
Pubblicazione: (2025)
di: Gao, Bufan, et al.
Pubblicazione: (2025)
LIDAO: Towards Limited Interventions for Debiasing (Large) Language Models
di: Liu, Tianci, et al.
Pubblicazione: (2024)
di: Liu, Tianci, et al.
Pubblicazione: (2024)
From Measurement to Mitigation: Exploring the Transferability of Debiasing Approaches to Gender Bias in Maltese Language Models
di: Galea, Melanie, et al.
Pubblicazione: (2025)
di: Galea, Melanie, et al.
Pubblicazione: (2025)
A Language-agnostic Model of Child Language Acquisition
di: Mahon, Louis, et al.
Pubblicazione: (2024)
di: Mahon, Louis, et al.
Pubblicazione: (2024)
Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
di: Xue, Zhiyu, et al.
Pubblicazione: (2026)
di: Xue, Zhiyu, et al.
Pubblicazione: (2026)
FLARE: Task-agnostic embedding model evaluation through a normalization process
di: Jiang, Jingzhou, et al.
Pubblicazione: (2026)
di: Jiang, Jingzhou, et al.
Pubblicazione: (2026)
Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
EtiCor++: Towards Understanding Etiquettical Bias in LLMs
di: Dwivedi, Ashutosh, et al.
Pubblicazione: (2025)
di: Dwivedi, Ashutosh, et al.
Pubblicazione: (2025)
Towards Universal Debiasing for Language Models-based Tabular Data Generation
di: Li, Tianchun, et al.
Pubblicazione: (2025)
di: Li, Tianchun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Smaller Large Language Models Can Do Moral Self-Correction
di: Liu, Guangliang, et al.
Pubblicazione: (2024) -
On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept
di: Liu, Guangliang, et al.
Pubblicazione: (2024) -
Improving Generalization of Complex Models under Unbounded Loss Using PAC-Bayes Bounds
di: Zhang, Xitong, et al.
Pubblicazione: (2023) -
On the Convergence of Moral Self-Correction in Large Language Models
di: Liu, Guangliang, et al.
Pubblicazione: (2025) -
A Survey to Recent Progress Towards Understanding In-Context Learning
di: Mao, Haitao, et al.
Pubblicazione: (2024)