UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Yuhao, Xu, Zhuoer, Cui, Shiwen, Yang, Kun, Yu, Lingyun, Zhang, Yongdong, Xie, Hongtao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Agent Safety Alignment via Reinforcement Learning
by: Sha, Zeyang, et al.
Published: (2025)
by: Sha, Zeyang, et al.
Published: (2025)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
by: Ying, Zonghao, et al.
Published: (2024)
by: Ying, Zonghao, et al.
Published: (2024)
Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models
by: Luo, Weidi, et al.
Published: (2026)
by: Luo, Weidi, et al.
Published: (2026)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
by: Cui, Yu, et al.
Published: (2025)
by: Cui, Yu, et al.
Published: (2025)
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
by: Fang, Xianya, et al.
Published: (2026)
by: Fang, Xianya, et al.
Published: (2026)
Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design
by: Sun, Yuhao, et al.
Published: (2025)
by: Sun, Yuhao, et al.
Published: (2025)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
by: Fang, Junfeng, et al.
Published: (2025)
by: Fang, Junfeng, et al.
Published: (2025)
AutoIoT: Automated IoT Platform Using Large Language Models
by: Cheng, Ye, et al.
Published: (2024)
by: Cheng, Ye, et al.
Published: (2024)
Dataset Ownership in the Era of Large Language Models
by: Li, Kun, et al.
Published: (2025)
by: Li, Kun, et al.
Published: (2025)
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
by: Zhao, Zhengyue, et al.
Published: (2025)
by: Zhao, Zhengyue, et al.
Published: (2025)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
by: Yang, Fan
Published: (2025)
by: Yang, Fan
Published: (2025)
DataSafe: Copyright Protection with PUF Watermarking and Blockchain Tracking
by: Xue, Xiaolong, et al.
Published: (2024)
by: Xue, Xiaolong, et al.
Published: (2024)
Ramp Up NTT in Record Time using GPU-Accelerated Algorithms and LLM-based Code Generation
by: Cui, Yu, et al.
Published: (2025)
by: Cui, Yu, et al.
Published: (2025)
On the Role of Attention Heads in Large Language Model Safety
by: Zhou, Zhenhong, et al.
Published: (2024)
by: Zhou, Zhenhong, et al.
Published: (2024)
GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient Analysis
by: Xie, Yueqi, et al.
Published: (2024)
by: Xie, Yueqi, et al.
Published: (2024)
Exploring the Role of Large Language Models in Cybersecurity: A Systematic Survey
by: Tian, Shuang, et al.
Published: (2025)
by: Tian, Shuang, et al.
Published: (2025)
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
by: Qi, Weiwei, et al.
Published: (2026)
by: Qi, Weiwei, et al.
Published: (2026)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
by: Song, Weiming, et al.
Published: (2026)
by: Song, Weiming, et al.
Published: (2026)
LIFT: Automating Symbolic Execution Optimization with Large Language Models for AI Networks
by: Wang, Ruoxi, et al.
Published: (2025)
by: Wang, Ruoxi, et al.
Published: (2025)
Permit: Permission-Aware Representation Intervention for Controlled Generation in Large Language Models
by: Sun, Pengcheng, et al.
Published: (2026)
by: Sun, Pengcheng, et al.
Published: (2026)
On Protecting the Data Privacy of Large Language Models (LLMs): A Survey
by: Yan, Biwei, et al.
Published: (2024)
by: Yan, Biwei, et al.
Published: (2024)
Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
by: Wu, Jinman, et al.
Published: (2026)
by: Wu, Jinman, et al.
Published: (2026)
SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants
by: Wang, Haoyu, et al.
Published: (2026)
by: Wang, Haoyu, et al.
Published: (2026)
Risks of Practicing Large Language Models in Smart Grid: Threat Modeling and Validation
by: Li, Jiangnan, et al.
Published: (2024)
by: Li, Jiangnan, et al.
Published: (2024)
BERTector: An Intrusion Detection Framework Constructed via Joint-dataset Learning Based on Language Model
by: Hu, Haoyang, et al.
Published: (2025)
by: Hu, Haoyang, et al.
Published: (2025)
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
by: Ren, Jie, et al.
Published: (2023)
by: Ren, Jie, et al.
Published: (2023)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
by: Lin, Weilin, et al.
Published: (2025)
by: Lin, Weilin, et al.
Published: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
GenPTW: Latent Image Watermarking for Provenance Tracing and Tamper Localization
by: Gan, Zhenliang, et al.
Published: (2025)
by: Gan, Zhenliang, et al.
Published: (2025)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
by: Yuan, Zenghui, et al.
Published: (2025)
by: Yuan, Zenghui, et al.
Published: (2025)
CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity
by: Yu, Zhengmin, et al.
Published: (2024)
by: Yu, Zhengmin, et al.
Published: (2024)
SecReEvalBench: A Multi-turned Security Resilience Evaluation Benchmark for Large Language Models
by: Cui, Huining, et al.
Published: (2025)
by: Cui, Huining, et al.
Published: (2025)
SIMD-Aware Homomorphic Compression and Application to Private Database Query
by: Cheon, Jung Hee, et al.
Published: (2024)
by: Cheon, Jung Hee, et al.
Published: (2024)
SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs
by: Xia, Hongfei, et al.
Published: (2025)
by: Xia, Hongfei, et al.
Published: (2025)
SEAL-Tag: Self-Tag Evidence Aggregation with Probabilistic Circuits for PII-Safe Retrieval-Augmented Generation
by: Xie, Jin, et al.
Published: (2026)
by: Xie, Jin, et al.
Published: (2026)
A Fingerprint for Large Language Models
by: Yang, Zhiguang, et al.
Published: (2024)
by: Yang, Zhiguang, et al.
Published: (2024)
Beyond Tag Collision: Cluster-based Memory Management for Tag-based Sanitizers
by: Xie, Mengfei, et al.
Published: (2025)
by: Xie, Mengfei, et al.
Published: (2025)
Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset
by: Kang, Mintong, et al.
Published: (2025)
by: Kang, Mintong, et al.
Published: (2025)
PortGPT: Towards Automated Backporting Using Large Language Models
by: Li, Zhaoyang, et al.
Published: (2025)
by: Li, Zhaoyang, et al.
Published: (2025)
A Practical and Privacy-Preserving Framework for Real-World Large Language Model Services
by: Mao, Yu, et al.
Published: (2024)
by: Mao, Yu, et al.
Published: (2024)
Similar Items
-
Agent Safety Alignment via Reinforcement Learning
by: Sha, Zeyang, et al.
Published: (2025) -
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
by: Ying, Zonghao, et al.
Published: (2024) -
Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models
by: Luo, Weidi, et al.
Published: (2026) -
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
by: Cui, Yu, et al.
Published: (2025) -
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
by: Fang, Xianya, et al.
Published: (2026)