fairBERTs: Erasing Sensitive Information Through Semantic and Fairness-aware Perturbations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jinfeng, Chen, Yuefeng, Liu, Xiangyu, Huang, Longtao, Zhang, Rong, Xue, Hui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BERTs are Generative In-Context Learners
par: Samuel, David
Publié: (2024)
par: Samuel, David
Publié: (2024)
Exploring Linguistic Properties of Monolingual BERTs with Typological Classification among Languages
par: Ruzzetti, Elena Sofia, et autres
Publié: (2023)
par: Ruzzetti, Elena Sofia, et autres
Publié: (2023)
QExplorer: Large Language Model Based Query Extraction for Toxic Content Exploration
par: Ren, Shaola, et autres
Publié: (2025)
par: Ren, Shaola, et autres
Publié: (2025)
Towards the Resistance of Neural Network Watermarking to Fine-tuning
par: Tang, Ling, et autres
Publié: (2025)
par: Tang, Ling, et autres
Publié: (2025)
UniErase: Towards Balanced and Precise Unlearning in Language Models
par: Yu, Miao, et autres
Publié: (2025)
par: Yu, Miao, et autres
Publié: (2025)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
par: Shi, Bingkang, et autres
Publié: (2023)
par: Shi, Bingkang, et autres
Publié: (2023)
Confidence-aware Self-Semantic Distillation on Knowledge Graph Embedding
par: Liu, Yichen, et autres
Publié: (2022)
par: Liu, Yichen, et autres
Publié: (2022)
DOPRA: Decoding Over-accumulation Penalization and Re-allocation in Specific Weighting Layer
par: Wei, Jinfeng, et autres
Publié: (2024)
par: Wei, Jinfeng, et autres
Publié: (2024)
Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs
par: Wang, Ziliang, et autres
Publié: (2025)
par: Wang, Ziliang, et autres
Publié: (2025)
Improving Fairness in LLMs Through Testing-Time Adversaries
par: Gregio, Isabela Pereira, et autres
Publié: (2025)
par: Gregio, Isabela Pereira, et autres
Publié: (2025)
How LoRA Remembers? A Parametric Memory Law for LLM Finetuning
par: Xu, Ziwen, et autres
Publié: (2026)
par: Xu, Ziwen, et autres
Publié: (2026)
RedacBench: Can AI Erase Your Secrets?
par: Jeon, Hyunjun, et autres
Publié: (2026)
par: Jeon, Hyunjun, et autres
Publié: (2026)
Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation
par: Cheng, Yinjie, et autres
Publié: (2025)
par: Cheng, Yinjie, et autres
Publié: (2025)
SePer: Measure Retrieval Utility Through The Lens Of Semantic Perplexity Reduction
par: Dai, Lu, et autres
Publié: (2025)
par: Dai, Lu, et autres
Publié: (2025)
Enhancing the QA Model through a Multi-domain Debiasing Framework
par: Wang, Yuefeng, et autres
Publié: (2026)
par: Wang, Yuefeng, et autres
Publié: (2026)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
par: Huang, Kaixuan, et autres
Publié: (2025)
par: Huang, Kaixuan, et autres
Publié: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
par: Yang, Junxiao, et autres
Publié: (2026)
par: Yang, Junxiao, et autres
Publié: (2026)
Fairness of Automatic Speech Recognition: Looking Through a Philosophical Lens
par: Choi, Anna Seo Gyeong, et autres
Publié: (2025)
par: Choi, Anna Seo Gyeong, et autres
Publié: (2025)
VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
UP5: Unbiased Foundation Model for Fairness-aware Recommendation
par: Hua, Wenyue, et autres
Publié: (2023)
par: Hua, Wenyue, et autres
Publié: (2023)
LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction
par: Zhang, Jensen, et autres
Publié: (2025)
par: Zhang, Jensen, et autres
Publié: (2025)
Understanding Fairness-Accuracy Trade-offs in Machine Learning Models: Does Promoting Fairness Undermine Performance?
par: Liu, Junhua, et autres
Publié: (2024)
par: Liu, Junhua, et autres
Publié: (2024)
True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning
par: Tan, Weihao, et autres
Publié: (2024)
par: Tan, Weihao, et autres
Publié: (2024)
Are AI-Generated Text Detectors Robust to Adversarial Perturbations?
par: Huang, Guanhua, et autres
Publié: (2024)
par: Huang, Guanhua, et autres
Publié: (2024)
DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection
par: Li, Yuxin, et autres
Publié: (2026)
par: Li, Yuxin, et autres
Publié: (2026)
Outraged AI: Large language models prioritise emotion over cost in fairness enforcement
par: Liu, Hao, et autres
Publié: (2025)
par: Liu, Hao, et autres
Publié: (2025)
DiscoSum: Discourse-aware News Summarization
par: Spangher, Alexander, et autres
Publié: (2025)
par: Spangher, Alexander, et autres
Publié: (2025)
Advancing and Benchmarking Personalized Tool Invocation for LLMs
par: Huang, Xu, et autres
Publié: (2025)
par: Huang, Xu, et autres
Publié: (2025)
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
par: Wang, Dongwei, et autres
Publié: (2024)
par: Wang, Dongwei, et autres
Publié: (2024)
Causal-aware Large Language Models: Enhancing Decision-Making Through Learning, Adapting and Acting
par: Chen, Wei, et autres
Publié: (2025)
par: Chen, Wei, et autres
Publié: (2025)
On Fairness of Unified Multimodal Large Language Model for Image Generation
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
$μ$KE: Matryoshka Unstructured Knowledge Editing of Large Language Models
par: Su, Zian, et autres
Publié: (2025)
par: Su, Zian, et autres
Publié: (2025)
Enhancing Essay Scoring with Adversarial Weights Perturbation and Metric-specific AttentionPooling
par: Huang, Jiaxin, et autres
Publié: (2024)
par: Huang, Jiaxin, et autres
Publié: (2024)
ProtSAE: Disentangling and Interpreting Protein Language Models via Semantically-Guided Sparse Autoencoders
par: Liu, Xiangyu, et autres
Publié: (2025)
par: Liu, Xiangyu, et autres
Publié: (2025)
ICDM 2020 Knowledge Graph Contest: Consumer Event-Cause Extraction
par: He, Congqing, et autres
Publié: (2021)
par: He, Congqing, et autres
Publié: (2021)
The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuning
par: He, Bingxiang, et autres
Publié: (2024)
par: He, Bingxiang, et autres
Publié: (2024)
The Other Side of the Coin: Exploring Fairness in Retrieval-Augmented Generation
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
par: Xu, Haolei, et autres
Publié: (2026)
par: Xu, Haolei, et autres
Publié: (2026)
OTESGN: Optimal Transport-Enhanced Syntactic-Semantic Graph Networks for Aspect-Based Sentiment Analysis
par: Liao, Xinfeng, et autres
Publié: (2025)
par: Liao, Xinfeng, et autres
Publié: (2025)
RoSA: Enhancing Parameter-Efficient Fine-Tuning via RoPE-aware Selective Adaptation in Large Language Models
par: Pan, Dayan, et autres
Publié: (2025)
par: Pan, Dayan, et autres
Publié: (2025)
Documents similaires
-
BERTs are Generative In-Context Learners
par: Samuel, David
Publié: (2024) -
Exploring Linguistic Properties of Monolingual BERTs with Typological Classification among Languages
par: Ruzzetti, Elena Sofia, et autres
Publié: (2023) -
QExplorer: Large Language Model Based Query Extraction for Toxic Content Exploration
par: Ren, Shaola, et autres
Publié: (2025) -
Towards the Resistance of Neural Network Watermarking to Fine-tuning
par: Tang, Ling, et autres
Publié: (2025) -
UniErase: Towards Balanced and Precise Unlearning in Language Models
par: Yu, Miao, et autres
Publié: (2025)