Probe-based Fine-tuning for Reducing Toxicity
Fuente:
arXiv
Saved in:
| Main Authors: | Wehner, Jan, Fritz, Mario |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Understanding Linear Probing then Fine-tuning Language Models from NTK Perspective
by: Tomihari, Akiyoshi, et al.
Published: (2024)
by: Tomihari, Akiyoshi, et al.
Published: (2024)
Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models
by: Wehner, Jan, et al.
Published: (2025)
by: Wehner, Jan, et al.
Published: (2025)
DAPI: Domain Adaptive Toxicity Probe Vector Intervention for Fine-Grained Detoxification
by: Hyeonsu, Cho, et al.
Published: (2025)
by: Hyeonsu, Cho, et al.
Published: (2025)
SoK: Reducing the Vulnerability of Fine-tuned Language Models to Membership Inference Attacks
by: Amit, Guy, et al.
Published: (2024)
by: Amit, Guy, et al.
Published: (2024)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
by: Zhou, Huichi, et al.
Published: (2025)
by: Zhou, Huichi, et al.
Published: (2025)
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
by: Hsu, Chia-Yi, et al.
Published: (2024)
by: Hsu, Chia-Yi, et al.
Published: (2024)
Can We Use Probing to Better Understand Fine-tuning and Knowledge Distillation of the BERT NLU?
by: Hościłowicz, Jakub, et al.
Published: (2023)
by: Hościłowicz, Jakub, et al.
Published: (2023)
HOFT: Householder Orthogonal Fine-tuning
by: Arcas, Alejandro Moreno, et al.
Published: (2025)
by: Arcas, Alejandro Moreno, et al.
Published: (2025)
Bayesian Fine-tuning in Projected Subspaces
by: Dubovik, Viktar, et al.
Published: (2026)
by: Dubovik, Viktar, et al.
Published: (2026)
Open-Vocabulary Calibration for Fine-tuned CLIP
by: Wang, Shuoyuan, et al.
Published: (2024)
by: Wang, Shuoyuan, et al.
Published: (2024)
Analyzing the Effect of Noise in LLM Fine-tuning
by: Li, Lingfang, et al.
Published: (2026)
by: Li, Lingfang, et al.
Published: (2026)
A General Framework to Enhance Fine-tuning-based LLM Unlearning
by: Ren, Jie, et al.
Published: (2025)
by: Ren, Jie, et al.
Published: (2025)
Automatic Pruning of Fine-tuning Datasets for Transformer-based Language Models
by: Tayaranian, Mohammadreza, et al.
Published: (2024)
by: Tayaranian, Mohammadreza, et al.
Published: (2024)
Can Muon Fine-tune Adam-Pretrained Models?
by: Qu, Xingyu, et al.
Published: (2026)
by: Qu, Xingyu, et al.
Published: (2026)
Online Joint Fine-tuning of Multi-Agent Flows
by: Mineiro, Paul
Published: (2024)
by: Mineiro, Paul
Published: (2024)
Efficient Adjoint Matching for Fine-tuning Diffusion Models
by: Shin, Jeongwoo, et al.
Published: (2026)
by: Shin, Jeongwoo, et al.
Published: (2026)
Grow, Don't Overwrite: Fine-tuning Without Forgetting
by: Adila, Dyah, et al.
Published: (2026)
by: Adila, Dyah, et al.
Published: (2026)
ReFine: Boosting Time Series Prediction of Extreme Events by Reweighting and Fine-tuning
by: Shi, Jimeng, et al.
Published: (2024)
by: Shi, Jimeng, et al.
Published: (2024)
BMFT: Achieving Fairness via Bias-based Weight Masking Fine-tuning
by: Xue, Yuyang, et al.
Published: (2024)
by: Xue, Yuyang, et al.
Published: (2024)
Episode-specific Fine-tuning for Metric-based Few-shot Learners with Optimization-based Training
by: Zhuang, Xuanyu, et al.
Published: (2025)
by: Zhuang, Xuanyu, et al.
Published: (2025)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
by: Chen, Kang, et al.
Published: (2025)
by: Chen, Kang, et al.
Published: (2025)
Efficiently Estimating Data Efficiency for Language Model Fine-tuning
by: Je, Gyung Hyun, et al.
Published: (2025)
by: Je, Gyung Hyun, et al.
Published: (2025)
A Study of Optimizations for Fine-tuning Large Language Models
by: Singh, Arjun, et al.
Published: (2024)
by: Singh, Arjun, et al.
Published: (2024)
Understanding Fine-tuning in Approximate Unlearning: A Theoretical Perspective
by: Ding, Meng, et al.
Published: (2024)
by: Ding, Meng, et al.
Published: (2024)
Model Balancing Helps Low-data Training and Fine-tuning
by: Liu, Zihang, et al.
Published: (2024)
by: Liu, Zihang, et al.
Published: (2024)
Functional-level Uncertainty Quantification for Calibrated Fine-tuning on LLMs
by: Niu, Ruijia, et al.
Published: (2024)
by: Niu, Ruijia, et al.
Published: (2024)
FDPP: Fine-tune Diffusion Policy with Human Preference
by: Chen, Yuxin, et al.
Published: (2025)
by: Chen, Yuxin, et al.
Published: (2025)
SMART Fine-tuning Factor Augmented Neural Lasso
by: Chai, Jinhang, et al.
Published: (2026)
by: Chai, Jinhang, et al.
Published: (2026)
Explaining Learned Reward Functions with Counterfactual Trajectories
by: Wehner, Jan, et al.
Published: (2024)
by: Wehner, Jan, et al.
Published: (2024)
Selective Pre-training for Private Fine-tuning
by: Yu, Da, et al.
Published: (2023)
by: Yu, Da, et al.
Published: (2023)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
by: Jan, Essa, et al.
Published: (2024)
by: Jan, Essa, et al.
Published: (2024)
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
by: Zhang, Jiale, et al.
Published: (2025)
by: Zhang, Jiale, et al.
Published: (2025)
Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks
by: Youstra, Jack, et al.
Published: (2025)
by: Youstra, Jack, et al.
Published: (2025)
Fine-tuning on simulated data outperforms prompting for agent tone of voice
by: Marquardt, Ingo, et al.
Published: (2025)
by: Marquardt, Ingo, et al.
Published: (2025)
DP-MicroAdam: Private and Frugal Algorithm for Training and Fine-tuning
by: Hudişteanu, Mihaela, et al.
Published: (2025)
by: Hudişteanu, Mihaela, et al.
Published: (2025)
TuneShift-KD: Knowledge Distillation and Transfer for Fine-tuned Models
by: Guan, Yushi, et al.
Published: (2026)
by: Guan, Yushi, et al.
Published: (2026)
Reliable and Compact Graph Fine-tuning via GraphSparse Prompting
by: Jiang, Bo, et al.
Published: (2024)
by: Jiang, Bo, et al.
Published: (2024)
Kaizen: Practical Self-supervised Continual Learning with Continual Fine-tuning
by: Tang, Chi Ian, et al.
Published: (2023)
by: Tang, Chi Ian, et al.
Published: (2023)
Fine-tuned In-Context Learning Transformers are Excellent Tabular Data Classifiers
by: Breejen, Felix den, et al.
Published: (2024)
by: Breejen, Felix den, et al.
Published: (2024)
Mechanistic Fine-tuning for In-context Learning
by: Cho, Hakaze, et al.
Published: (2025)
by: Cho, Hakaze, et al.
Published: (2025)
Similar Items
-
Understanding Linear Probing then Fine-tuning Language Models from NTK Perspective
by: Tomihari, Akiyoshi, et al.
Published: (2024) -
Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models
by: Wehner, Jan, et al.
Published: (2025) -
DAPI: Domain Adaptive Toxicity Probe Vector Intervention for Fine-Grained Detoxification
by: Hyeonsu, Cho, et al.
Published: (2025) -
SoK: Reducing the Vulnerability of Fine-tuned Language Models to Membership Inference Attacks
by: Amit, Guy, et al.
Published: (2024) -
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
by: Zhou, Huichi, et al.
Published: (2025)