Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Sicheng, Lv, Mingyang, Shen, Han, Wu, Jialin, Wang, Binghao, Yang, Zhou, Shen, Guobin, Zhao, Dongcheng, Zhao, Feifei, Zeng, Yi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TEFormer: Structured Bidirectional Temporal Enhancement Modeling in Spiking Transformers
by: Shen, Sicheng, et al.
Published: (2026)
by: Shen, Sicheng, et al.
Published: (2026)
TIM: An Efficient Temporal Interaction Module for Spiking Transformer
by: Shen, Sicheng, et al.
Published: (2024)
by: Shen, Sicheng, et al.
Published: (2024)
Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
by: Shen, Guobin, et al.
Published: (2025)
by: Shen, Guobin, et al.
Published: (2025)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
by: Han, Bing, et al.
Published: (2025)
by: Han, Bing, et al.
Published: (2025)
Time Cell Inspired Temporal Codebook in Spiking Neural Networks for Enhanced Image Generation
by: Feng, Linghao, et al.
Published: (2024)
by: Feng, Linghao, et al.
Published: (2024)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
by: Shen, Guobin, et al.
Published: (2024)
by: Shen, Guobin, et al.
Published: (2024)
Efficient LLM Safety Evaluation through Multi-Agent Debate
by: Lin, Dachuan, et al.
Published: (2025)
by: Lin, Dachuan, et al.
Published: (2025)
Learning the Plasticity: Plasticity-Driven Learning Framework in Spiking Neural Networks
by: Shen, Guobin, et al.
Published: (2023)
by: Shen, Guobin, et al.
Published: (2023)
Alignment between Brains and AI: Evidence for Convergent Evolution across Modalities, Scales and Training Trajectories
by: Shen, Guobin, et al.
Published: (2025)
by: Shen, Guobin, et al.
Published: (2025)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
by: Shen, Guobin, et al.
Published: (2025)
by: Shen, Guobin, et al.
Published: (2025)
Developmental Plasticity-inspired Adaptive Pruning for Deep Spiking and Artificial Neural Networks
by: Han, Bing, et al.
Published: (2022)
by: Han, Bing, et al.
Published: (2022)
Biologically Inspired Spiking Diffusion Model with Adaptive Lateral Selection Mechanism
by: Feng, Linghao, et al.
Published: (2025)
by: Feng, Linghao, et al.
Published: (2025)
C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models
by: Wu, Ping, et al.
Published: (2025)
by: Wu, Ping, et al.
Published: (2025)
MVPBench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values
by: Liang, Yao, et al.
Published: (2025)
by: Liang, Yao, et al.
Published: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
by: Tong, Haibo, et al.
Published: (2025)
by: Tong, Haibo, et al.
Published: (2025)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
by: He, Xiang, et al.
Published: (2025)
by: He, Xiang, et al.
Published: (2025)
STEP: A Unified Spiking Transformer Evaluation Platform for Fair and Reproducible Benchmarking
by: Shen, Sicheng, et al.
Published: (2025)
by: Shen, Sicheng, et al.
Published: (2025)
Pushing up to the Limit of Memory Bandwidth and Capacity Utilization for Efficient LLM Decoding on Embedded FPGA
by: Li, Jindong, et al.
Published: (2025)
by: Li, Jindong, et al.
Published: (2025)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
by: Dong, Yiting, et al.
Published: (2024)
by: Dong, Yiting, et al.
Published: (2024)
$SpikePack$: Enhanced Information Flow in Spiking Neural Networks with High Hardware Compatibility
by: Shen, Guobin, et al.
Published: (2025)
by: Shen, Guobin, et al.
Published: (2025)
Brain-Inspired Stepwise Patch Merging for Vision Transformers
by: Yu, Yonghao, et al.
Published: (2024)
by: Yu, Yonghao, et al.
Published: (2024)
Spiking World Model with Multi-Compartment Neurons for Model-based Reinforcement Learning
by: Sun, Yinqian, et al.
Published: (2025)
by: Sun, Yinqian, et al.
Published: (2025)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
by: Shen, Guobin, et al.
Published: (2026)
by: Shen, Guobin, et al.
Published: (2026)
FireFly-S: Exploiting Dual-Side Sparsity for Spiking Neural Networks Acceleration with Reconfigurable Spatial Architecture
by: Li, Tenglong, et al.
Published: (2024)
by: Li, Tenglong, et al.
Published: (2024)
EventZoom: A Progressive Approach to Event-Based Data Augmentation for Enhanced Neuromorphic Vision
by: Dong, Yiting, et al.
Published: (2024)
by: Dong, Yiting, et al.
Published: (2024)
FireFly-T: High-Throughput Sparsity Exploitation for Spiking Transformer Acceleration with Dual-Engine Overlay Architecture
by: Li, Tenglong, et al.
Published: (2025)
by: Li, Tenglong, et al.
Published: (2025)
FireFly-P: FPGA-Accelerated Spiking Neural Network Plasticity for Robust Adaptive Control
by: Li, Tenglong, et al.
Published: (2026)
by: Li, Tenglong, et al.
Published: (2026)
StressPrompt: Does Stress Impact Large Language Models and Human Performance Similarly?
by: Shen, Guobin, et al.
Published: (2024)
by: Shen, Guobin, et al.
Published: (2024)
Revealing Untapped DSP Optimization Potentials for FPGA-Based Systolic Matrix Engines
by: Li, Jindong, et al.
Published: (2024)
by: Li, Jindong, et al.
Published: (2024)
An Efficient Knowledge Transfer Strategy for Spiking Neural Networks from Static to Event Domain
by: He, Xiang, et al.
Published: (2023)
by: He, Xiang, et al.
Published: (2023)
From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation
by: Shen, Guobin, et al.
Published: (2026)
by: Shen, Guobin, et al.
Published: (2026)
Directly Training Temporal Spiking Neural Network with Sparse Surrogate Gradient
by: Li, Yang, et al.
Published: (2024)
by: Li, Yang, et al.
Published: (2024)
Hummingbird: A Smaller and Faster Large Language Model Accelerator on Embedded FPGA
by: Li, Jindong, et al.
Published: (2025)
by: Li, Jindong, et al.
Published: (2025)
CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization
by: He, Xiang, et al.
Published: (2024)
by: He, Xiang, et al.
Published: (2024)
Neuro-Vision to Language: Enhancing Brain Recording-based Visual Reconstruction and Language Interaction
by: Shen, Guobin, et al.
Published: (2024)
by: Shen, Guobin, et al.
Published: (2024)
AI Alignment Amplifies the Role of Race, Gender, and Disability in Hiring Decisions
by: Wang, Ze, et al.
Published: (2026)
by: Wang, Ze, et al.
Published: (2026)
Multi-compartment Neuron and Population Encoding Powered Spiking Neural Network for Deep Distributional Reinforcement Learning
by: Sun, Yinqian, et al.
Published: (2023)
by: Sun, Yinqian, et al.
Published: (2023)
Improving Model Fusion by Training-time Neuron Alignment with Fixed Neuron Anchors
by: Li, Zexi, et al.
Published: (2024)
by: Li, Zexi, et al.
Published: (2024)
Multilingual Safety Alignment via Self-Distillation
by: Qin, Ruiyang, et al.
Published: (2026)
by: Qin, Ruiyang, et al.
Published: (2026)
Brain-inspired and Self-based Artificial Intelligence
by: Zeng, Yi, et al.
Published: (2024)
by: Zeng, Yi, et al.
Published: (2024)
Similar Items
-
TEFormer: Structured Bidirectional Temporal Enhancement Modeling in Spiking Transformers
by: Shen, Sicheng, et al.
Published: (2026) -
TIM: An Efficient Temporal Interaction Module for Spiking Transformer
by: Shen, Sicheng, et al.
Published: (2024) -
Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
by: Shen, Guobin, et al.
Published: (2025) -
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
by: Han, Bing, et al.
Published: (2025) -
Time Cell Inspired Temporal Codebook in Spiking Neural Networks for Enhanced Image Generation
by: Feng, Linghao, et al.
Published: (2024)