Differentially Private Steering for Large Language Model Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Goel, Anmol, Hu, Yaxi, Gurevych, Iryna, Sanyal, Amartya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Auditing Language Model Unlearning via Information Decomposition
di: Goel, Anmol, et al.
Pubblicazione: (2026)
di: Goel, Anmol, et al.
Pubblicazione: (2026)
Provable Privacy with Non-Private Pre-Processing
di: Hu, Yaxi, et al.
Pubblicazione: (2024)
di: Hu, Yaxi, et al.
Pubblicazione: (2024)
How Quantization Shapes Bias in Large Language Models
di: Marcuzzi, Federico, et al.
Pubblicazione: (2025)
di: Marcuzzi, Federico, et al.
Pubblicazione: (2025)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
Online Learning and Unlearning
di: Hu, Yaxi, et al.
Pubblicazione: (2025)
di: Hu, Yaxi, et al.
Pubblicazione: (2025)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
di: Daheim, Nico, et al.
Pubblicazione: (2024)
di: Daheim, Nico, et al.
Pubblicazione: (2024)
Socratic Reasoning Improves Positive Text Rewriting
di: Goel, Anmol, et al.
Pubblicazione: (2024)
di: Goel, Anmol, et al.
Pubblicazione: (2024)
Hierarchical Latent Structures in Data Generation Process Unify Mechanistic Phenomena across Scale
di: Rohweder, Jonas, et al.
Pubblicazione: (2026)
di: Rohweder, Jonas, et al.
Pubblicazione: (2026)
SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
LoRA and Privacy: When Random Projections Help (and When They Don't)
di: Hu, Yaxi, et al.
Pubblicazione: (2026)
di: Hu, Yaxi, et al.
Pubblicazione: (2026)
Differentially Private Zeroth-Order Methods for Scalable Large Language Model Finetuning
di: Liu, Z, et al.
Pubblicazione: (2024)
di: Liu, Z, et al.
Pubblicazione: (2024)
An Iterative Algorithm for Differentially Private $k$-PCA with Adaptive Noise
di: Düngler, Johanna, et al.
Pubblicazione: (2025)
di: Düngler, Johanna, et al.
Pubblicazione: (2025)
Differentially Private Next-Token Prediction of Large Language Models
di: Flemings, James, et al.
Pubblicazione: (2024)
di: Flemings, James, et al.
Pubblicazione: (2024)
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
Differentially Private Tabular Data Synthesis using Large Language Models
di: Tran, Toan V., et al.
Pubblicazione: (2024)
di: Tran, Toan V., et al.
Pubblicazione: (2024)
Uncertainty-Aware Decoding with Minimum Bayes Risk
di: Daheim, Nico, et al.
Pubblicazione: (2025)
di: Daheim, Nico, et al.
Pubblicazione: (2025)
ABCD-LINK: Annotation Bootstrapping for Cross-Document Fine-Grained Links
di: Basch, Serwar, et al.
Pubblicazione: (2025)
di: Basch, Serwar, et al.
Pubblicazione: (2025)
Towards Automated Error Discovery: A Study in Conversational AI
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
DP-Fusion: Token-Level Differentially Private Inference for Large Language Models
di: Thareja, Rushil, et al.
Pubblicazione: (2025)
di: Thareja, Rushil, et al.
Pubblicazione: (2025)
On the Growth of Mistakes in Differentially Private Online Learning: A Lower Bound Perspective
di: Dmitriev, Daniil, et al.
Pubblicazione: (2024)
di: Dmitriev, Daniil, et al.
Pubblicazione: (2024)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
di: Cao, Yuanpu, et al.
Pubblicazione: (2024)
di: Cao, Yuanpu, et al.
Pubblicazione: (2024)
Model Merging by Uncertainty-Based Gradient Matching
di: Daheim, Nico, et al.
Pubblicazione: (2023)
di: Daheim, Nico, et al.
Pubblicazione: (2023)
ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models
di: Li, Chen, et al.
Pubblicazione: (2026)
di: Li, Chen, et al.
Pubblicazione: (2026)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
di: Goel, Naman
Pubblicazione: (2023)
di: Goel, Naman
Pubblicazione: (2023)
LMO-DP: Optimizing the Randomization Mechanism for Differentially Private Fine-Tuning (Large) Language Models
di: Yang, Qin, et al.
Pubblicazione: (2024)
di: Yang, Qin, et al.
Pubblicazione: (2024)
Steering Language Models with Weight Arithmetic
di: Fierro, Constanza, et al.
Pubblicazione: (2025)
di: Fierro, Constanza, et al.
Pubblicazione: (2025)
Steering Language Models With Activation Engineering
di: Turner, Alexander Matt, et al.
Pubblicazione: (2023)
di: Turner, Alexander Matt, et al.
Pubblicazione: (2023)
Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models
di: Mekala, Anmol, et al.
Pubblicazione: (2024)
di: Mekala, Anmol, et al.
Pubblicazione: (2024)
Attribute or Abstain: Large Language Models as Long Document Assistants
di: Buchmann, Jan, et al.
Pubblicazione: (2024)
di: Buchmann, Jan, et al.
Pubblicazione: (2024)
Steering Large Language Models for Machine Translation Personalization
di: Scalena, Daniel, et al.
Pubblicazione: (2025)
di: Scalena, Daniel, et al.
Pubblicazione: (2025)
DP-OPD: Differentially Private On-Policy Distillation for Language Models
di: Khadem, Fatemeh, et al.
Pubblicazione: (2026)
di: Khadem, Fatemeh, et al.
Pubblicazione: (2026)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
di: Huo, Yifu, et al.
Pubblicazione: (2026)
di: Huo, Yifu, et al.
Pubblicazione: (2026)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
di: Sharma, Kartik, et al.
Pubblicazione: (2026)
di: Sharma, Kartik, et al.
Pubblicazione: (2026)
Robust Utility-Preserving Text Anonymization Based on Large Language Models
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
Discovering Implicit Large Language Model Alignment Objectives
di: Chen, Edward, et al.
Pubblicazione: (2026)
di: Chen, Edward, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Auditing Language Model Unlearning via Information Decomposition
di: Goel, Anmol, et al.
Pubblicazione: (2026) -
Provable Privacy with Non-Private Pre-Processing
di: Hu, Yaxi, et al.
Pubblicazione: (2024) -
How Quantization Shapes Bias in Large Language Models
di: Marcuzzi, Federico, et al.
Pubblicazione: (2025) -
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025) -
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)