Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Peng, ShengYun, Chen, Pin-Yu, Hull, Matthew, Chau, Duen Horng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Shape it Up! Restoring LLM Safety during Finetuning
by: Peng, ShengYun, et al.
Published: (2025)
by: Peng, ShengYun, et al.
Published: (2025)
Large Reasoning Models Learn Better Alignment from Flawed Thinking
by: Peng, ShengYun, et al.
Published: (2025)
by: Peng, ShengYun, et al.
Published: (2025)
UniTable: Towards a Unified Framework for Table Recognition via Self-Supervised Pretraining
by: Peng, ShengYun, et al.
Published: (2024)
by: Peng, ShengYun, et al.
Published: (2024)
UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks
by: Phute, Mansi, et al.
Published: (2025)
by: Phute, Mansi, et al.
Published: (2025)
Diffusion Explorer: Interactive Exploration of Diffusion Models
by: Helbling, Alec, et al.
Published: (2025)
by: Helbling, Alec, et al.
Published: (2025)
Wordflow: Social Prompt Engineering for Large Language Models
by: Wang, Zijie J., et al.
Published: (2024)
by: Wang, Zijie J., et al.
Published: (2024)
LLM Attributor: Interactive Visual Attribution for LLM Generation
by: Lee, Seongmin, et al.
Published: (2024)
by: Lee, Seongmin, et al.
Published: (2024)
LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked
by: Phute, Mansi, et al.
Published: (2023)
by: Phute, Mansi, et al.
Published: (2023)
Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety
by: Lee, Seongmin, et al.
Published: (2025)
by: Lee, Seongmin, et al.
Published: (2025)
MeMemo: On-device Retrieval Augmentation for Private and Personalized Text Generation
by: Wang, Zijie J., et al.
Published: (2024)
by: Wang, Zijie J., et al.
Published: (2024)
Self-Supervised Pre-Training for Table Structure Recognition Transformer
by: Peng, ShengYun, et al.
Published: (2024)
by: Peng, ShengYun, et al.
Published: (2024)
Diffusion Explainer: Visual Explanation for Text-to-image Stable Diffusion
by: Lee, Seongmin, et al.
Published: (2023)
by: Lee, Seongmin, et al.
Published: (2023)
Dense Associative Memory Through the Lens of Random Features
by: Hoover, Benjamin, et al.
Published: (2024)
by: Hoover, Benjamin, et al.
Published: (2024)
SuperNOVA: Design Strategies and Opportunities for Interactive Visualization in Computational Notebooks
by: Wang, Zijie J., et al.
Published: (2023)
by: Wang, Zijie J., et al.
Published: (2023)
What Time Is It? How Data Geometry Makes Time Conditioning Optional for Flow Matching
by: Helbling, Alec, et al.
Published: (2026)
by: Helbling, Alec, et al.
Published: (2026)
ComplicitSplat: Downstream Models are Vulnerable to Blackbox Attacks by 3D Gaussian Splat Camouflages
by: Hull, Matthew, et al.
Published: (2025)
by: Hull, Matthew, et al.
Published: (2025)
Memory in Plain Sight: Surveying the Uncanny Resemblances of Associative Memories and Diffusion Models
by: Hoover, Benjamin, et al.
Published: (2023)
by: Hoover, Benjamin, et al.
Published: (2023)
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
by: Hsu, Chia-Yi, et al.
Published: (2024)
by: Hsu, Chia-Yi, et al.
Published: (2024)
Defining and Evaluating Physical Safety for Large Language Models
by: Tang, Yung-Chen, et al.
Published: (2024)
by: Tang, Yung-Chen, et al.
Published: (2024)
ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features
by: Helbling, Alec, et al.
Published: (2025)
by: Helbling, Alec, et al.
Published: (2025)
Mobile Fitting Room: On-device Virtual Try-on via Diffusion Models
by: Blalock, Justin, et al.
Published: (2024)
by: Blalock, Justin, et al.
Published: (2024)
Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
by: Mukherjee, Sagnik, et al.
Published: (2025)
by: Mukherjee, Sagnik, et al.
Published: (2025)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
by: Chen, Pin-Yu, et al.
Published: (2025)
by: Chen, Pin-Yu, et al.
Published: (2025)
From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers
by: Runwal, Bharat, et al.
Published: (2024)
by: Runwal, Bharat, et al.
Published: (2024)
CompCap: Improving Multimodal Large Language Models with Composite Captions
by: Chen, Xiaohui, et al.
Published: (2024)
by: Chen, Xiaohui, et al.
Published: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
by: Hu, Xiaomeng, et al.
Published: (2024)
by: Hu, Xiaomeng, et al.
Published: (2024)
CoBa: Convergence Balancer for Multitask Finetuning of Large Language Models
by: Gong, Zi, et al.
Published: (2024)
by: Gong, Zi, et al.
Published: (2024)
Computational Safety for Generative AI: A Signal Processing Perspective
by: Chen, Pin-Yu
Published: (2025)
by: Chen, Pin-Yu
Published: (2025)
Transfer Learning for Finetuning Large Language Models
by: Strangmann, Tobias, et al.
Published: (2024)
by: Strangmann, Tobias, et al.
Published: (2024)
Large Language Models to Diffusion Finetuning
by: Cetin, Edoardo, et al.
Published: (2025)
by: Cetin, Edoardo, et al.
Published: (2025)
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
by: Chen, Kejia, et al.
Published: (2025)
by: Chen, Kejia, et al.
Published: (2025)
Transformer Explainer: Interactive Learning of Text-Generative Models
by: Cho, Aeree, et al.
Published: (2024)
by: Cho, Aeree, et al.
Published: (2024)
Multimodal Web Navigation with Instruction-Finetuned Foundation Models
by: Furuta, Hiroki, et al.
Published: (2023)
by: Furuta, Hiroki, et al.
Published: (2023)
Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
by: Nguyen, Manh, et al.
Published: (2025)
by: Nguyen, Manh, et al.
Published: (2025)
Finetuning Large Language Models for Vulnerability Detection
by: Shestov, Alexey, et al.
Published: (2024)
by: Shestov, Alexey, et al.
Published: (2024)
Rethinking the Role of Temperature in Large Language Model Distillation
by: Luong, Hoang-Chau, et al.
Published: (2026)
by: Luong, Hoang-Chau, et al.
Published: (2026)
Effective Guidance for Model Attention with Simple Yes-no Annotations
by: Lee, Seongmin, et al.
Published: (2024)
by: Lee, Seongmin, et al.
Published: (2024)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
by: Mao, Yixiu, et al.
Published: (2026)
by: Mao, Yixiu, et al.
Published: (2026)
Nested Fusion: A Method for Learning High Resolution Latent Structure of Multi-Scale Measurement Data on Mars
by: Wright, Austin P., et al.
Published: (2024)
by: Wright, Austin P., et al.
Published: (2024)
In2Core: Leveraging Influence Functions for Coreset Selection in Instruction Finetuning of Large Language Models
by: Joaquin, Ayrton San, et al.
Published: (2024)
by: Joaquin, Ayrton San, et al.
Published: (2024)
Similar Items
-
Shape it Up! Restoring LLM Safety during Finetuning
by: Peng, ShengYun, et al.
Published: (2025) -
Large Reasoning Models Learn Better Alignment from Flawed Thinking
by: Peng, ShengYun, et al.
Published: (2025) -
UniTable: Towards a Unified Framework for Table Recognition via Self-Supervised Pretraining
by: Peng, ShengYun, et al.
Published: (2024) -
UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks
by: Phute, Mansi, et al.
Published: (2025) -
Diffusion Explorer: Interactive Exploration of Diffusion Models
by: Helbling, Alec, et al.
Published: (2025)