NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yi, Xing, Wenpeng, Kong, Dezhang, Lin, Changting, Han, Meng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024)
por: Lin, Shi, et al.
Publicado: (2024)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
por: Zhou, Zhanhui, et al.
Publicado: (2024)
por: Zhou, Zhanhui, et al.
Publicado: (2024)
HGMF: A Hierarchical Gaussian Mixture Framework for Scalable Tool Invocation within the Model Context Protocol
por: Xing, Wenpeng, et al.
Publicado: (2025)
por: Xing, Wenpeng, et al.
Publicado: (2025)
LatentAudit: Real-Time White-Box Faithfulness Monitoring for Retrieval-Augmented Generation with Verifiable Deployment
por: Yu, Zhe, et al.
Publicado: (2026)
por: Yu, Zhe, et al.
Publicado: (2026)
DNF: Dual-Layer Nested Fingerprinting for Large Language Model Intellectual Property Protection
por: Xu, Zhenhua, et al.
Publicado: (2026)
por: Xu, Zhenhua, et al.
Publicado: (2026)
Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models
por: Shin, Jeongjin, et al.
Publicado: (2024)
por: Shin, Jeongjin, et al.
Publicado: (2024)
Unlearning's Blind Spots: Over-Unlearning and Prototypical Relearning Attack
por: Ha, SeungBum, et al.
Publicado: (2025)
por: Ha, SeungBum, et al.
Publicado: (2025)
Direct Behavior Optimization: Unlocking the Potential of Lightweight LLMs
por: Yang, Hongming, et al.
Publicado: (2025)
por: Yang, Hongming, et al.
Publicado: (2025)
MO-RiskVAE: A Multi-Omics Variational Autoencoder for Survival Risk Modeling in Multiple MyelomaMO-RiskVAE
por: Chen, Zixuan, et al.
Publicado: (2026)
por: Chen, Zixuan, et al.
Publicado: (2026)
Silencing the Guardrails: Inference-Time Jailbreaking via Dynamic Contextual Representation Ablation
por: Xing, Wenpeng, et al.
Publicado: (2026)
por: Xing, Wenpeng, et al.
Publicado: (2026)
Web Fraud Attacks Against LLM-Driven Multi-Agent Systems
por: Kong, Dezhang, et al.
Publicado: (2025)
por: Kong, Dezhang, et al.
Publicado: (2025)
Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
por: Shen, Sicheng, et al.
Publicado: (2026)
por: Shen, Sicheng, et al.
Publicado: (2026)
InterCorpRel-LLM: Enhancing Financial Relational Understanding with Graph-Language Models
por: Sun, Qianyou, et al.
Publicado: (2025)
por: Sun, Qianyou, et al.
Publicado: (2025)
Rethinking Benign Relearning: Syntax as the Hidden Driver of Unlearning Failures
por: Yoon, Sangyeon, et al.
Publicado: (2026)
por: Yoon, Sangyeon, et al.
Publicado: (2026)
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
por: Kazemi, Hamid, et al.
Publicado: (2026)
por: Kazemi, Hamid, et al.
Publicado: (2026)
SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth
por: Xing, Wenpeng, et al.
Publicado: (2025)
por: Xing, Wenpeng, et al.
Publicado: (2025)
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
por: Lu, Haoran, et al.
Publicado: (2025)
por: Lu, Haoran, et al.
Publicado: (2025)
FedCARE: Federated Unlearning with Conflict-Aware Projection and Relearning-Resistant Recovery
por: Li, Yue, et al.
Publicado: (2026)
por: Li, Yue, et al.
Publicado: (2026)
Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models
por: Guo, Hanze, et al.
Publicado: (2025)
por: Guo, Hanze, et al.
Publicado: (2025)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
por: Han, Bing, et al.
Publicado: (2025)
por: Han, Bing, et al.
Publicado: (2025)
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
por: Wang, Zhebo, et al.
Publicado: (2026)
por: Wang, Zhebo, et al.
Publicado: (2026)
Automatic Calibration for Membership Inference Attack on Large Language Models
por: Zade, Saleh Zare, et al.
Publicado: (2025)
por: Zade, Saleh Zare, et al.
Publicado: (2025)
RelBench: A Benchmark for Deep Learning on Relational Databases
por: Robinson, Joshua, et al.
Publicado: (2024)
por: Robinson, Joshua, et al.
Publicado: (2024)
DIAP: A Decentralized Agent Identity Protocol with Zero-Knowledge Proofs and a Hybrid P2P Stack
por: Liu, Yuanjie, et al.
Publicado: (2025)
por: Liu, Yuanjie, et al.
Publicado: (2025)
Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models
por: Wu, Jinman, et al.
Publicado: (2026)
por: Wu, Jinman, et al.
Publicado: (2026)
WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
por: Chen, Sihan, et al.
Publicado: (2025)
por: Chen, Sihan, et al.
Publicado: (2025)
Learning Safety Constraints for Large Language Models
por: Chen, Xin, et al.
Publicado: (2025)
por: Chen, Xin, et al.
Publicado: (2025)
NeuTSFlow: Modeling Continuous Functions Behind Time Series Forecasting
por: Xu, Huibo, et al.
Publicado: (2025)
por: Xu, Huibo, et al.
Publicado: (2025)
Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text Generation
por: Li, Jin, et al.
Publicado: (2025)
por: Li, Jin, et al.
Publicado: (2025)
Defining and Evaluating Physical Safety for Large Language Models
por: Tang, Yung-Chen, et al.
Publicado: (2024)
por: Tang, Yung-Chen, et al.
Publicado: (2024)
PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models
por: Kothapalli, Vignesh, et al.
Publicado: (2026)
por: Kothapalli, Vignesh, et al.
Publicado: (2026)
SafeSeek: Universal Attribution of Safety Circuits in Language Models
por: Yu, Miao, et al.
Publicado: (2026)
por: Yu, Miao, et al.
Publicado: (2026)
Neuron-Anchored Rule Extraction for Large Language Models via Contrastive Hierarchical Ablation
por: Sovrano, Francesco, et al.
Publicado: (2026)
por: Sovrano, Francesco, et al.
Publicado: (2026)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
por: Oh, Sejoon, et al.
Publicado: (2024)
por: Oh, Sejoon, et al.
Publicado: (2024)
RelGNN: Composite Message Passing for Relational Deep Learning
por: Chen, Tianlang, et al.
Publicado: (2025)
por: Chen, Tianlang, et al.
Publicado: (2025)
Cross-Modal Unlearning via Influential Neuron Path Editing in Multimodal Large Language Models
por: Li, Kunhao, et al.
Publicado: (2025)
por: Li, Kunhao, et al.
Publicado: (2025)
SUA: Stealthy Multimodal Large Language Model Unlearning Attack
por: Zhang, Xianren, et al.
Publicado: (2025)
por: Zhang, Xianren, et al.
Publicado: (2025)
A Generic Method for Fine-grained Category Discovery in Natural Language Texts
por: Tian, Chang, et al.
Publicado: (2024)
por: Tian, Chang, et al.
Publicado: (2024)
Rel-MOSS: Towards Imbalanced Relational Deep Learning on Relational Databases
por: Yin, Jun, et al.
Publicado: (2026)
por: Yin, Jun, et al.
Publicado: (2026)
Wasserstein Distances, Neuronal Entanglement, and Sparsity
por: Sawmya, Shashata, et al.
Publicado: (2024)
por: Sawmya, Shashata, et al.
Publicado: (2024)
Ejemplares similares
-
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024) -
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
por: Zhou, Zhanhui, et al.
Publicado: (2024) -
HGMF: A Hierarchical Gaussian Mixture Framework for Scalable Tool Invocation within the Model Context Protocol
por: Xing, Wenpeng, et al.
Publicado: (2025) -
LatentAudit: Real-Time White-Box Faithfulness Monitoring for Retrieval-Augmented Generation with Verifiable Deployment
por: Yu, Zhe, et al.
Publicado: (2026) -
DNF: Dual-Layer Nested Fingerprinting for Large Language Model Intellectual Property Protection
por: Xu, Zhenhua, et al.
Publicado: (2026)