Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification
Fuente:
arXiv
Saved in:
| Main Authors: | Meng, Tao, Mehrabi, Ninareh, Goyal, Palash, Ramakrishna, Anil, Galstyan, Aram, Zemel, Richard, Chang, Kai-Wei, Gupta, Rahul, Peris, Charith |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On the steerability of large language models toward data-driven personas
by: Li, Junyi, et al.
Published: (2023)
by: Li, Junyi, et al.
Published: (2023)
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
by: Kumarage, Tharindu, et al.
Published: (2025)
by: Kumarage, Tharindu, et al.
Published: (2025)
K-Edit: Language Model Editing with Contextual Knowledge Awareness
by: Markowitz, Elan, et al.
Published: (2025)
by: Markowitz, Elan, et al.
Published: (2025)
Tree-of-Traversals: A Zero-Shot Reasoning Algorithm for Augmenting Black-box Language Models with Knowledge Graphs
by: Markowitz, Elan, et al.
Published: (2024)
by: Markowitz, Elan, et al.
Published: (2024)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
by: Wang, Fei, et al.
Published: (2024)
by: Wang, Fei, et al.
Published: (2024)
Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies
by: Ovalle, Anaelia, et al.
Published: (2023)
by: Ovalle, Anaelia, et al.
Published: (2023)
FLIRT: Feedback Loop In-context Red Teaming
by: Mehrabi, Ninareh, et al.
Published: (2023)
by: Mehrabi, Ninareh, et al.
Published: (2023)
SWAN: Semantic Watermarking with Abstract Meaning Representation
by: Ye, Ziping, et al.
Published: (2026)
by: Ye, Ziping, et al.
Published: (2026)
Kaleidoscopic Teaming in Multi Agent Simulations
by: Mehrabi, Ninareh, et al.
Published: (2025)
by: Mehrabi, Ninareh, et al.
Published: (2025)
Partial Federated Learning
by: Feng, Tiantian, et al.
Published: (2024)
by: Feng, Tiantian, et al.
Published: (2024)
ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System
by: Liang, Jiacheng, et al.
Published: (2026)
by: Liang, Jiacheng, et al.
Published: (2026)
Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
by: Kumarage, Tharindu, et al.
Published: (2026)
by: Kumarage, Tharindu, et al.
Published: (2026)
Prompt Perturbation Consistency Learning for Robust Language Models
by: Qiang, Yao, et al.
Published: (2024)
by: Qiang, Yao, et al.
Published: (2024)
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
by: Wan, Yixin, et al.
Published: (2025)
by: Wan, Yixin, et al.
Published: (2025)
Faithful Model Evaluation for Model-Based Metrics
by: Goyal, Palash, et al.
Published: (2023)
by: Goyal, Palash, et al.
Published: (2023)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
by: Mushtaq, Erum, et al.
Published: (2025)
by: Mushtaq, Erum, et al.
Published: (2025)
Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning
by: Chen, Si, et al.
Published: (2025)
by: Chen, Si, et al.
Published: (2025)
DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning
by: Parekh, Tanmay, et al.
Published: (2025)
by: Parekh, Tanmay, et al.
Published: (2025)
Robust Persona-Aware Toxicity Detection with Prompt Optimization and Learned Ensembling
by: Atil, Berk, et al.
Published: (2026)
by: Atil, Berk, et al.
Published: (2026)
Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time
by: Li, Huihan, et al.
Published: (2025)
by: Li, Huihan, et al.
Published: (2025)
Evaluating the Critical Risks of Amazon's Nova Premier under the Frontier Model Safety Framework
by: Krishna, Satyapriya, et al.
Published: (2025)
by: Krishna, Satyapriya, et al.
Published: (2025)
Toward Informal Language Processing: Knowledge of Slang in Large Language Models
by: Sun, Zhewei, et al.
Published: (2024)
by: Sun, Zhewei, et al.
Published: (2024)
Asymmetric Phase Coding Audio Watermarking
by: Yang, Guang, et al.
Published: (2026)
by: Yang, Guang, et al.
Published: (2026)
FERRET: Framework for Expansion Reliant Red Teaming
by: Mehrabi, Ninareh, et al.
Published: (2026)
by: Mehrabi, Ninareh, et al.
Published: (2026)
Breaking mBad! Supervised Fine-tuning for Cross-Lingual Detoxification
by: Beniwal, Himanshu, et al.
Published: (2025)
by: Beniwal, Himanshu, et al.
Published: (2025)
Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models
by: Tsaprazlis, Efthymios, et al.
Published: (2025)
by: Tsaprazlis, Efthymios, et al.
Published: (2025)
SemEval-2025 Task 4: Unlearning sensitive content from Large Language Models
by: Ramakrishna, Anil, et al.
Published: (2025)
by: Ramakrishna, Anil, et al.
Published: (2025)
Making Sense Of Distributed Representations With Activation Spectroscopy
by: Reing, Kyle, et al.
Published: (2025)
by: Reing, Kyle, et al.
Published: (2025)
Learning Morphisms with Gauss-Newton Approximation for Growing Networks
by: Lawton, Neal, et al.
Published: (2024)
by: Lawton, Neal, et al.
Published: (2024)
Test-Time Warmup for Multimodal Large Language Models
by: Rajaneesh, Nikita, et al.
Published: (2025)
by: Rajaneesh, Nikita, et al.
Published: (2025)
Toward More Accurate and Generalizable Evaluation Metrics for Task-Oriented Dialogs
by: Komma, Abishek, et al.
Published: (2023)
by: Komma, Abishek, et al.
Published: (2023)
LUME: LLM Unlearning with Multitask Evaluations
by: Ramakrishna, Anil, et al.
Published: (2025)
by: Ramakrishna, Anil, et al.
Published: (2025)
Asking Back: Interaction-Layer Antidistillation Watermarks
by: Yang, Guang, et al.
Published: (2026)
by: Yang, Guang, et al.
Published: (2026)
Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs
by: Tsaprazlis, Efthymios, et al.
Published: (2026)
by: Tsaprazlis, Efthymios, et al.
Published: (2026)
SeRA: Self-Reviewing and Alignment of Large Language Models using Implicit Reward Margins
by: Ko, Jongwoo, et al.
Published: (2024)
by: Ko, Jongwoo, et al.
Published: (2024)
KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs
by: Markowitz, Elan, et al.
Published: (2025)
by: Markowitz, Elan, et al.
Published: (2025)
Fine-Grained Detoxification via Instance-Level Prefixes for Large Language Models
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
Online Algorithmic Recourse by Collective Action
by: Creager, Elliot, et al.
Published: (2023)
by: Creager, Elliot, et al.
Published: (2023)
Fine-tuning Language Models for Recipe Generation: A Comparative Analysis and Benchmark Study
by: Vij, Anneketh, et al.
Published: (2025)
by: Vij, Anneketh, et al.
Published: (2025)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
by: Wang, Yian, et al.
Published: (2026)
by: Wang, Yian, et al.
Published: (2026)
Similar Items
-
On the steerability of large language models toward data-driven personas
by: Li, Junyi, et al.
Published: (2023) -
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
by: Kumarage, Tharindu, et al.
Published: (2025) -
K-Edit: Language Model Editing with Contextual Knowledge Awareness
by: Markowitz, Elan, et al.
Published: (2025) -
Tree-of-Traversals: A Zero-Shot Reasoning Algorithm for Augmenting Black-box Language Models with Knowledge Graphs
by: Markowitz, Elan, et al.
Published: (2024) -
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
by: Wang, Fei, et al.
Published: (2024)