GradShield: Alignment Preserving Finetuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Zhanhao, Huang, Xiao, Mendoza, Patrick, Alghamdi, Emad A., Alomair, Basel, Popa, Raluca Ada, Wagner, David |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Preventing Prompt Injection with Type-Directed Privilege Separation
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
PromptShield: Deployable Detection for Prompt Injection Attacks
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
par: Piet, Julien, et autres
Publié: (2023)
par: Piet, Julien, et autres
Publié: (2023)
Vulnerability Detection with Code Language Models: How Far Are We?
par: Ding, Yangruibo, et autres
Publié: (2024)
par: Ding, Yangruibo, et autres
Publié: (2024)
Toxicity Detection for Free
par: Hu, Zhanhao, et autres
Publié: (2024)
par: Hu, Zhanhao, et autres
Publié: (2024)
Synthesizing Privacy-Preserving Text Data via Finetuning without Finetuning Billion-Scale LLMs
par: Tan, Bowen, et autres
Publié: (2025)
par: Tan, Bowen, et autres
Publié: (2025)
What makes video‐based academic lectures difficult for language learners to comprehend? The role of multimodal complexity
par: Emad A. Alghamdi
Publié: (2024)
par: Emad A. Alghamdi
Publié: (2024)
Web Agents Should Adopt the Plan-Then-Execute Paradigm
par: Piet, Julien, et autres
Publié: (2026)
par: Piet, Julien, et autres
Publié: (2026)
Can LLMs Follow Simple Rules?
par: Mu, Norman, et autres
Publié: (2023)
par: Mu, Norman, et autres
Publié: (2023)
Budget-aware Test-time Scaling via Discriminative Verification
par: Montgomery, Kyle, et autres
Publié: (2025)
par: Montgomery, Kyle, et autres
Publié: (2025)
Can LLMs Ask Good Questions?
par: Zhang, Yueheng, et autres
Publié: (2025)
par: Zhang, Yueheng, et autres
Publié: (2025)
Robo-Instruct: Simulator-Augmented Instruction Alignment For Finetuning Code LLMs
par: Hu, Zichao, et autres
Publié: (2024)
par: Hu, Zichao, et autres
Publié: (2024)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
LLoCO: Learning Long Contexts Offline
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
Exploring Alignment in Shared Cross-lingual Spaces
par: Mousi, Basel, et autres
Publié: (2024)
par: Mousi, Basel, et autres
Publié: (2024)
GoEX: Perspectives and Designs Towards a Runtime for Autonomous LLM Applications
par: Patil, Shishir G., et autres
Publié: (2024)
par: Patil, Shishir G., et autres
Publié: (2024)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic
par: Alghamdi, Emad A., et autres
Publié: (2024)
par: Alghamdi, Emad A., et autres
Publié: (2024)
SoFA: Shielded On-the-fly Alignment via Priority Rule Following
par: Lu, Xinyu, et autres
Publié: (2024)
par: Lu, Xinyu, et autres
Publié: (2024)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
par: Piet, Julien, et autres
Publié: (2025)
par: Piet, Julien, et autres
Publié: (2025)
OneShield -- the Next Generation of LLM Guardrails
par: DeLuca, Chad, et autres
Publié: (2025)
par: DeLuca, Chad, et autres
Publié: (2025)
Polynomial Regression as a Task for Understanding In-context Learning Through Finetuning and Alignment
par: Wilcoxson, Max, et autres
Publié: (2024)
par: Wilcoxson, Max, et autres
Publié: (2024)
Evaluating Ill-Defined Tasks in Large Language Models
par: Zhou, Yi, et autres
Publié: (2026)
par: Zhou, Yi, et autres
Publié: (2026)
Empirical Evaluation of Public HateSpeech Datasets
par: Jaf, Sadar, et autres
Publié: (2024)
par: Jaf, Sadar, et autres
Publié: (2024)
Editing Across Languages: A Survey of Multilingual Knowledge Editing
par: Durrani, Nadir, et autres
Publié: (2025)
par: Durrani, Nadir, et autres
Publié: (2025)
An Exploration of Knowledge Editing for Arabic
par: Mousi, Basel, et autres
Publié: (2025)
par: Mousi, Basel, et autres
Publié: (2025)
Mitigating Large Language Model Hallucination with Faithful Finetuning
par: Hu, Minda, et autres
Publié: (2024)
par: Hu, Minda, et autres
Publié: (2024)
TextualVerifier: Verify TextGrad Step-by-Step
par: Situmorang, Eugenius Mario, et autres
Publié: (2025)
par: Situmorang, Eugenius Mario, et autres
Publié: (2025)
TextGrad: Automatic "Differentiation" via Text
par: Yuksekgonul, Mert, et autres
Publié: (2024)
par: Yuksekgonul, Mert, et autres
Publié: (2024)
Time is Encoded in the Weights of Finetuned Language Models
par: Nylund, Kai, et autres
Publié: (2023)
par: Nylund, Kai, et autres
Publié: (2023)
The Hallucination Tax of Reinforcement Finetuning
par: Song, Linxin, et autres
Publié: (2025)
par: Song, Linxin, et autres
Publié: (2025)
metaTextGrad: Automatically optimizing language model optimizers
par: Xu, Guowei, et autres
Publié: (2025)
par: Xu, Guowei, et autres
Publié: (2025)
Pre-Finetuning with Impact Duration Awareness for Stock Movement Prediction
par: Chiu, Chr-Jr, et autres
Publié: (2024)
par: Chiu, Chr-Jr, et autres
Publié: (2024)
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
par: Liu, Xinyue, et autres
Publié: (2026)
par: Liu, Xinyue, et autres
Publié: (2026)
SAFENLIDB: A Privacy-Preserving Safety Alignment Framework for LLM-based Natural Language Database Interfaces
par: Liu, Ruiheng, et autres
Publié: (2025)
par: Liu, Ruiheng, et autres
Publié: (2025)
Understanding the Effects of Domain Finetuning on LLMs
par: Tanwar, Eshaan, et autres
Publié: (2025)
par: Tanwar, Eshaan, et autres
Publié: (2025)
Locking Down the Finetuned LLMs Safety
par: Zhu, Minjun, et autres
Publié: (2024)
par: Zhu, Minjun, et autres
Publié: (2024)
Finetuning LLMs for Comparative Assessment Tasks
par: Raina, Vatsal, et autres
Publié: (2024)
par: Raina, Vatsal, et autres
Publié: (2024)
GradMAP: Faster Layer Pruning with Gradient Metric and Projection Compensation
par: Liu, Hao, et autres
Publié: (2026)
par: Liu, Hao, et autres
Publié: (2026)
ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
Documents similaires
-
Preventing Prompt Injection with Type-Directed Privilege Separation
par: Jacob, Dennis, et autres
Publié: (2025) -
PromptShield: Deployable Detection for Prompt Injection Attacks
par: Jacob, Dennis, et autres
Publié: (2025) -
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
par: Piet, Julien, et autres
Publié: (2023) -
Vulnerability Detection with Code Language Models: How Far Are We?
par: Ding, Yangruibo, et autres
Publié: (2024) -
Toxicity Detection for Free
par: Hu, Zhanhao, et autres
Publié: (2024)