Shape it Up! Restoring LLM Safety during Finetuning
Fuente:
arXiv
Saved in:
| Main Authors: | Peng, ShengYun, Chen, Pin-Yu, Chi, Jianfeng, Lee, Seongmin, Chau, Duen Horng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models
by: Peng, ShengYun, et al.
Published: (2024)
by: Peng, ShengYun, et al.
Published: (2024)
UniTable: Towards a Unified Framework for Table Recognition via Self-Supervised Pretraining
by: Peng, ShengYun, et al.
Published: (2024)
by: Peng, ShengYun, et al.
Published: (2024)
LLM Attributor: Interactive Visual Attribution for LLM Generation
by: Lee, Seongmin, et al.
Published: (2024)
by: Lee, Seongmin, et al.
Published: (2024)
Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety
by: Lee, Seongmin, et al.
Published: (2025)
by: Lee, Seongmin, et al.
Published: (2025)
Large Reasoning Models Learn Better Alignment from Flawed Thinking
by: Peng, ShengYun, et al.
Published: (2025)
by: Peng, ShengYun, et al.
Published: (2025)
Self-Supervised Pre-Training for Table Structure Recognition Transformer
by: Peng, ShengYun, et al.
Published: (2024)
by: Peng, ShengYun, et al.
Published: (2024)
SuperNOVA: Design Strategies and Opportunities for Interactive Visualization in Computational Notebooks
by: Wang, Zijie J., et al.
Published: (2023)
by: Wang, Zijie J., et al.
Published: (2023)
Diffusion Explorer: Interactive Exploration of Diffusion Models
by: Helbling, Alec, et al.
Published: (2025)
by: Helbling, Alec, et al.
Published: (2025)
Diffusion Explainer: Visual Explanation for Text-to-image Stable Diffusion
by: Lee, Seongmin, et al.
Published: (2023)
by: Lee, Seongmin, et al.
Published: (2023)
UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks
by: Phute, Mansi, et al.
Published: (2025)
by: Phute, Mansi, et al.
Published: (2025)
MeMemo: On-device Retrieval Augmentation for Private and Personalized Text Generation
by: Wang, Zijie J., et al.
Published: (2024)
by: Wang, Zijie J., et al.
Published: (2024)
Mobile Fitting Room: On-device Virtual Try-on via Diffusion Models
by: Blalock, Justin, et al.
Published: (2024)
by: Blalock, Justin, et al.
Published: (2024)
Effective Guidance for Model Attention with Simple Yes-no Annotations
by: Lee, Seongmin, et al.
Published: (2024)
by: Lee, Seongmin, et al.
Published: (2024)
Probing LLM Hallucination from Within: Perturbation-Driven Approach via Internal Knowledge
by: Lee, Seongmin, et al.
Published: (2024)
by: Lee, Seongmin, et al.
Published: (2024)
LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked
by: Phute, Mansi, et al.
Published: (2023)
by: Phute, Mansi, et al.
Published: (2023)
Dense Associative Memory Through the Lens of Random Features
by: Hoover, Benjamin, et al.
Published: (2024)
by: Hoover, Benjamin, et al.
Published: (2024)
What Time Is It? How Data Geometry Makes Time Conditioning Optional for Flow Matching
by: Helbling, Alec, et al.
Published: (2026)
by: Helbling, Alec, et al.
Published: (2026)
Wordflow: Social Prompt Engineering for Large Language Models
by: Wang, Zijie J., et al.
Published: (2024)
by: Wang, Zijie J., et al.
Published: (2024)
Transformer Explainer: Interactive Learning of Text-Generative Models
by: Cho, Aeree, et al.
Published: (2024)
by: Cho, Aeree, et al.
Published: (2024)
ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features
by: Helbling, Alec, et al.
Published: (2025)
by: Helbling, Alec, et al.
Published: (2025)
Memory in Plain Sight: Surveying the Uncanny Resemblances of Associative Memories and Diffusion Models
by: Hoover, Benjamin, et al.
Published: (2023)
by: Hoover, Benjamin, et al.
Published: (2023)
From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers
by: Runwal, Bharat, et al.
Published: (2024)
by: Runwal, Bharat, et al.
Published: (2024)
Invisible Safety Threat: Malicious Finetuning for LLM via Steganography
by: Wan, Guangnian, et al.
Published: (2026)
by: Wan, Guangnian, et al.
Published: (2026)
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
by: Ko, Ching-Yun, et al.
Published: (2026)
by: Ko, Ching-Yun, et al.
Published: (2026)
Computational Safety for Generative AI: A Signal Processing Perspective
by: Chen, Pin-Yu
Published: (2025)
by: Chen, Pin-Yu
Published: (2025)
SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection
by: Shen, Han, et al.
Published: (2024)
by: Shen, Han, et al.
Published: (2024)
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
by: Lee, Yu-Ang, et al.
Published: (2026)
by: Lee, Yu-Ang, et al.
Published: (2026)
LLM-Enhanced Linear Autoencoders for Recommendation
by: Moon, Jaewan, et al.
Published: (2025)
by: Moon, Jaewan, et al.
Published: (2025)
ComplicitSplat: Downstream Models are Vulnerable to Blackbox Attacks by 3D Gaussian Splat Camouflages
by: Hull, Matthew, et al.
Published: (2025)
by: Hull, Matthew, et al.
Published: (2025)
Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning
by: Zhang, Ling, et al.
Published: (2025)
by: Zhang, Ling, et al.
Published: (2025)
LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization
by: Zhang, Zishi, et al.
Published: (2026)
by: Zhang, Zishi, et al.
Published: (2026)
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
by: Zhang, Biao, et al.
Published: (2024)
by: Zhang, Biao, et al.
Published: (2024)
Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning
by: Chen, Yanda, et al.
Published: (2024)
by: Chen, Yanda, et al.
Published: (2024)
How Much is Unseen Depends Chiefly on Information About the Seen
by: Lee, Seongmin, et al.
Published: (2024)
by: Lee, Seongmin, et al.
Published: (2024)
Learning Dynamics of LLM Finetuning
by: Ren, Yi, et al.
Published: (2024)
by: Ren, Yi, et al.
Published: (2024)
The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data
by: Baek, Christina, et al.
Published: (2026)
by: Baek, Christina, et al.
Published: (2026)
Defining and Evaluating Physical Safety for Large Language Models
by: Tang, Yung-Chen, et al.
Published: (2024)
by: Tang, Yung-Chen, et al.
Published: (2024)
CHILL at SemEval-2025 Task 2: You Can't Just Throw Entities and Hope -- Make Your LLM to Get Them Right
by: Lee, Jaebok, et al.
Published: (2025)
by: Lee, Jaebok, et al.
Published: (2025)
Fundamental Limitations in Pointwise Defences of LLM Finetuning APIs
by: Davies, Xander, et al.
Published: (2025)
by: Davies, Xander, et al.
Published: (2025)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
by: Chen, Pin-Yu, et al.
Published: (2025)
by: Chen, Pin-Yu, et al.
Published: (2025)
Similar Items
-
Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models
by: Peng, ShengYun, et al.
Published: (2024) -
UniTable: Towards a Unified Framework for Table Recognition via Self-Supervised Pretraining
by: Peng, ShengYun, et al.
Published: (2024) -
LLM Attributor: Interactive Visual Attribution for LLM Generation
by: Lee, Seongmin, et al.
Published: (2024) -
Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety
by: Lee, Seongmin, et al.
Published: (2025) -
Large Reasoning Models Learn Better Alignment from Flawed Thinking
by: Peng, ShengYun, et al.
Published: (2025)