Can LLM Safety Be Ensured by Constraining Parameter Regions?
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zongmin, Su, Jian, Benamara, Farah, Sun, Aixin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ensuring Safety in an Uncertain Environment: Constrained MDPs via Stochastic Thresholds
di: Zuo, Qian, et al.
Pubblicazione: (2025)
di: Zuo, Qian, et al.
Pubblicazione: (2025)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
di: Cao, Chentao, et al.
Pubblicazione: (2025)
di: Cao, Chentao, et al.
Pubblicazione: (2025)
Graph In-Context Operator Networks for Generalizable Spatiotemporal Prediction
di: Wu, Chenghan, et al.
Pubblicazione: (2026)
di: Wu, Chenghan, et al.
Pubblicazione: (2026)
Sparsity-based Safety Conservatism for Constrained Offline Reinforcement Learning
di: Cho, Minjae, et al.
Pubblicazione: (2024)
di: Cho, Minjae, et al.
Pubblicazione: (2024)
Evaluating LLM Adaptation to Sociodemographic Factors: User Profile vs. Dialogue History
di: Zhong, Qishuai, et al.
Pubblicazione: (2025)
di: Zhong, Qishuai, et al.
Pubblicazione: (2025)
Evolutionary Ensemble of Agents
di: Yu, Zongmin, et al.
Pubblicazione: (2026)
di: Yu, Zongmin, et al.
Pubblicazione: (2026)
From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning
di: Wang, Xiao, et al.
Pubblicazione: (2026)
di: Wang, Xiao, et al.
Pubblicazione: (2026)
A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
di: Li, Mengqi, et al.
Pubblicazione: (2025)
di: Li, Mengqi, et al.
Pubblicazione: (2025)
Trust-Region Adaptive Policy Optimization
di: Su, Mingyu, et al.
Pubblicazione: (2025)
di: Su, Mingyu, et al.
Pubblicazione: (2025)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
di: Yue, Bo, et al.
Pubblicazione: (2024)
di: Yue, Bo, et al.
Pubblicazione: (2024)
Ensured: Explanations for Decreasing the Epistemic Uncertainty in Predictions
di: Löfström, Helena, et al.
Pubblicazione: (2024)
di: Löfström, Helena, et al.
Pubblicazione: (2024)
Collapse of Irrelevant Representations (CIR) Ensures Robust and Non-Disruptive LLM Unlearning
di: Sondej, Filip, et al.
Pubblicazione: (2025)
di: Sondej, Filip, et al.
Pubblicazione: (2025)
LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks
di: Kambhampati, Subbarao, et al.
Pubblicazione: (2024)
di: Kambhampati, Subbarao, et al.
Pubblicazione: (2024)
SplitFrozen: Split Learning with Device-side Model Frozen for Fine-Tuning LLM on Heterogeneous Resource-Constrained Devices
di: Ma, Jian, et al.
Pubblicazione: (2025)
di: Ma, Jian, et al.
Pubblicazione: (2025)
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents
di: Verma, Arun, et al.
Pubblicazione: (2025)
di: Verma, Arun, et al.
Pubblicazione: (2025)
Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
di: Chen, Yiwei, et al.
Pubblicazione: (2025)
di: Chen, Yiwei, et al.
Pubblicazione: (2025)
From Parameters to Performance: A Data-Driven Study on LLM Structure and Development
di: Wang, Suqing, et al.
Pubblicazione: (2025)
di: Wang, Suqing, et al.
Pubblicazione: (2025)
Can Past Experience Accelerate LLM Reasoning?
di: Pan, Bo, et al.
Pubblicazione: (2025)
di: Pan, Bo, et al.
Pubblicazione: (2025)
Ensuring Reliability of Curated EHR-Derived Data: The Validation of Accuracy for LLM/ML-Extracted Information and Data (VALID) Framework
di: Estevez, Melissa, et al.
Pubblicazione: (2025)
di: Estevez, Melissa, et al.
Pubblicazione: (2025)
Fair Recourse for All: Ensuring Individual and Group Fairness in Counterfactual Explanations
di: Ezzeddine, Fatima, et al.
Pubblicazione: (2026)
di: Ezzeddine, Fatima, et al.
Pubblicazione: (2026)
Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity
di: Li, Bojie
Pubblicazione: (2026)
di: Li, Bojie
Pubblicazione: (2026)
POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving
di: Li, Shaoang, et al.
Pubblicazione: (2026)
di: Li, Shaoang, et al.
Pubblicazione: (2026)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
di: Li, Jianwei, et al.
Pubblicazione: (2025)
di: Li, Jianwei, et al.
Pubblicazione: (2025)
The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs
di: Zhao, Jiale, et al.
Pubblicazione: (2025)
di: Zhao, Jiale, et al.
Pubblicazione: (2025)
A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
di: Liu, Licheng, et al.
Pubblicazione: (2025)
di: Liu, Licheng, et al.
Pubblicazione: (2025)
Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization
di: Wang, Mingyi, et al.
Pubblicazione: (2026)
di: Wang, Mingyi, et al.
Pubblicazione: (2026)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
di: Si, Wenwen, et al.
Pubblicazione: (2025)
di: Si, Wenwen, et al.
Pubblicazione: (2025)
Understanding and Preserving Safety in Fine-Tuned LLMs
di: Zhang, Jiawen, et al.
Pubblicazione: (2026)
di: Zhang, Jiawen, et al.
Pubblicazione: (2026)
PipeOptim: Ensuring Effective 1F1B Schedule with Optimizer-Dependent Weight Prediction
di: Guan, Lei, et al.
Pubblicazione: (2023)
di: Guan, Lei, et al.
Pubblicazione: (2023)
The Rogue Scalpel: Activation Steering Compromises LLM Safety
di: Korznikov, Anton, et al.
Pubblicazione: (2025)
di: Korznikov, Anton, et al.
Pubblicazione: (2025)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
di: Kim, Minseon, et al.
Pubblicazione: (2025)
di: Kim, Minseon, et al.
Pubblicazione: (2025)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
di: Yeon, Jehyeok, et al.
Pubblicazione: (2025)
di: Yeon, Jehyeok, et al.
Pubblicazione: (2025)
Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
di: Glentis, Athanasios, et al.
Pubblicazione: (2025)
di: Glentis, Athanasios, et al.
Pubblicazione: (2025)
Ensuring Equitable Financial Decisions: Leveraging Counterfactual Fairness and Deep Learning for Bias
di: Shinde, Saish
Pubblicazione: (2024)
di: Shinde, Saish
Pubblicazione: (2024)
NASP-T: A Fuzzy Neuro-Symbolic Transformer for Logic-Constrained Aviation Safety Report Classification
di: Machot, Fadi Al, et al.
Pubblicazione: (2025)
di: Machot, Fadi Al, et al.
Pubblicazione: (2025)
Trust Region Preference Approximation: A simple and stable reinforcement learning algorithm for LLM reasoning
di: Su, Xuerui, et al.
Pubblicazione: (2025)
di: Su, Xuerui, et al.
Pubblicazione: (2025)
PSformer: Parameter-efficient Transformer with Segment Attention for Time Series Forecasting
di: Wang, Yanlong, et al.
Pubblicazione: (2024)
di: Wang, Yanlong, et al.
Pubblicazione: (2024)
Can LLMs Find Fraudsters? Multi-level LLM Enhanced Graph Fraud Detection
di: Huang, Tairan, et al.
Pubblicazione: (2025)
di: Huang, Tairan, et al.
Pubblicazione: (2025)
RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruning
di: Su, Tongrui, et al.
Pubblicazione: (2025)
di: Su, Tongrui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Ensuring Safety in an Uncertain Environment: Constrained MDPs via Stochastic Thresholds
di: Zuo, Qian, et al.
Pubblicazione: (2025) -
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
di: Cao, Chentao, et al.
Pubblicazione: (2025) -
Graph In-Context Operator Networks for Generalizable Spatiotemporal Prediction
di: Wu, Chenghan, et al.
Pubblicazione: (2026) -
Sparsity-based Safety Conservatism for Constrained Offline Reinforcement Learning
di: Cho, Minjae, et al.
Pubblicazione: (2024) -
Evaluating LLM Adaptation to Sociodemographic Factors: User Profile vs. Dialogue History
di: Zhong, Qishuai, et al.
Pubblicazione: (2025)