Safety Alignment Depth in Large Language Models: A Markov Chain Perspective
Fuente:
arXiv
Saved in:
| Main Authors: | Kao, Ching-Chia, Yu, Chia-Mu, Lu, Chun-Shien, Chen, Chu-Song |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Great Contradiction Showdown: How Jailbreak and Stealth Wrestle in Vision-Language Models?
by: Kao, Ching-Chia, et al.
Published: (2024)
by: Kao, Ching-Chia, et al.
Published: (2024)
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
by: Hsu, Chia-Yi, et al.
Published: (2024)
by: Hsu, Chia-Yi, et al.
Published: (2024)
Defending Against Repetitive Backdoor Attacks on Semi-supervised Learning through Lens of Rate-Distortion-Perception Trade-off
by: Lee, Cheng-Yi, et al.
Published: (2024)
by: Lee, Cheng-Yi, et al.
Published: (2024)
Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
by: Hsu, Chia-Yi, et al.
Published: (2026)
by: Hsu, Chia-Yi, et al.
Published: (2026)
Counter-Current Learning: A Biologically Plausible Dual Network Approach for Deep Learning
by: Kao, Chia-Hsiang, et al.
Published: (2024)
by: Kao, Chia-Hsiang, et al.
Published: (2024)
Feature Alignment and Representation Transfer in Knowledge Distillation for Large Language Models
by: Yang, Junjie, et al.
Published: (2025)
by: Yang, Junjie, et al.
Published: (2025)
Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models?
by: Tsai, Yu-Lin, et al.
Published: (2023)
by: Tsai, Yu-Lin, et al.
Published: (2023)
Open-Vocabulary Panoptic Segmentation Using BERT Pre-Training of Vision-Language Multiway Transformer Model
by: Chen, Yi-Chia, et al.
Published: (2024)
by: Chen, Yi-Chia, et al.
Published: (2024)
Large Language Models as Markov Chains
by: Zekri, Oussama, et al.
Published: (2024)
by: Zekri, Oussama, et al.
Published: (2024)
Test-time Adversarial Defense with Opposite Adversarial Path and High Attack Time Cost
by: Yeh, Cheng-Han, et al.
Published: (2024)
by: Yeh, Cheng-Han, et al.
Published: (2024)
A Survey of Research in Large Language Models for Electronic Design Automation
by: Pan, Jingyu, et al.
Published: (2025)
by: Pan, Jingyu, et al.
Published: (2025)
The Curse of Depth in Large Language Models
by: Sun, Wenfang, et al.
Published: (2025)
by: Sun, Wenfang, et al.
Published: (2025)
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
by: Lu, Haoran, et al.
Published: (2025)
by: Lu, Haoran, et al.
Published: (2025)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
by: Wu, Junda, et al.
Published: (2024)
by: Wu, Junda, et al.
Published: (2024)
Minimal Cascade Gradient Smoothing for Fast Transferable Preemptive Adversarial Defense
by: Wang, Hanrui, et al.
Published: (2024)
by: Wang, Hanrui, et al.
Published: (2024)
GreedyPixel: Fine-Grained Black-Box Adversarial Attack Via Greedy Algorithm
by: Wang, Hanrui, et al.
Published: (2025)
by: Wang, Hanrui, et al.
Published: (2025)
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
by: Liu, Guozhi, et al.
Published: (2024)
by: Liu, Guozhi, et al.
Published: (2024)
Bridging Compressed Image Latents and Multimodal Large Language Models
by: Kao, Chia-Hao, et al.
Published: (2024)
by: Kao, Chia-Hao, et al.
Published: (2024)
Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
by: Zhang, Jiawei, et al.
Published: (2025)
by: Zhang, Jiawei, et al.
Published: (2025)
Model Reprogramming Demystified: A Neural Tangent Kernel Perspective
by: Chung, Ming-Yu, et al.
Published: (2025)
by: Chung, Ming-Yu, et al.
Published: (2025)
VP-NTK: Exploring the Benefits of Visual Prompting in Differentially Private Data Synthesis
by: Hsu, Chia-Yi, et al.
Published: (2025)
by: Hsu, Chia-Yi, et al.
Published: (2025)
Controlling Exploration-Exploitation in GFlowNets via Markov Chain Perspectives
by: Chen, Lin, et al.
Published: (2026)
by: Chen, Lin, et al.
Published: (2026)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
by: Wang, Zhaoxin, et al.
Published: (2026)
by: Wang, Zhaoxin, et al.
Published: (2026)
Tight Analysis of Decentralized SGD: A Markov Chain Perspective
by: Versini, Lucas, et al.
Published: (2026)
by: Versini, Lucas, et al.
Published: (2026)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
by: Liu, Guozhi, et al.
Published: (2025)
by: Liu, Guozhi, et al.
Published: (2025)
A Probabilistic Perspective on Unlearning and Alignment for Large Language Models
by: Scholten, Yan, et al.
Published: (2024)
by: Scholten, Yan, et al.
Published: (2024)
Rethinking Backdoor Attacks on Dataset Distillation: A Kernel Method Perspective
by: Chung, Ming-Yu, et al.
Published: (2023)
by: Chung, Ming-Yu, et al.
Published: (2023)
BADTV: Unveiling Backdoor Threats in Third-Party Task Vectors
by: Hsu, Chia-Yi, et al.
Published: (2025)
by: Hsu, Chia-Yi, et al.
Published: (2025)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
by: Zhou, Zhanhui, et al.
Published: (2024)
by: Zhou, Zhanhui, et al.
Published: (2024)
Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
by: Zimmer, Matthieu, et al.
Published: (2025)
by: Zimmer, Matthieu, et al.
Published: (2025)
Layer-Aware Task Arithmetic: Disentangling Task-Specific and Instruction-Following Knowledge
by: Chen, Yan-Lun, et al.
Published: (2025)
by: Chen, Yan-Lun, et al.
Published: (2025)
Caduceus: Bi-Directional Equivariant Long-Range DNA Sequence Modeling
by: Schiff, Yair, et al.
Published: (2024)
by: Schiff, Yair, et al.
Published: (2024)
Conformal Tail Risk Control for Large Language Model Alignment
by: Chen, Catherine Yu-Chi, et al.
Published: (2025)
by: Chen, Catherine Yu-Chi, et al.
Published: (2025)
DiffMI: Breaking Face Recognition Privacy via Diffusion-Driven Training-Free Model Inversion
by: Wang, Hanrui, et al.
Published: (2025)
by: Wang, Hanrui, et al.
Published: (2025)
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
by: Chen, Kejia, et al.
Published: (2025)
by: Chen, Kejia, et al.
Published: (2025)
A Modularized Framework for Piecewise-Stationary Restless Bandits
by: Li, Kuan-Ta, et al.
Published: (2026)
by: Li, Kuan-Ta, et al.
Published: (2026)
QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models
by: Kao, Kuei-Chun, et al.
Published: (2025)
by: Kao, Kuei-Chun, et al.
Published: (2025)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
by: Huang, Tiansheng, et al.
Published: (2024)
by: Huang, Tiansheng, et al.
Published: (2024)
Progressive Alignment with VLM-LLM Feature to Augment Defect Classification for the ASE Dataset
by: Hsu, Chih-Chung, et al.
Published: (2024)
by: Hsu, Chih-Chung, et al.
Published: (2024)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
by: Kao, Kuei-Chun, et al.
Published: (2024)
by: Kao, Kuei-Chun, et al.
Published: (2024)
Similar Items
-
The Great Contradiction Showdown: How Jailbreak and Stealth Wrestle in Vision-Language Models?
by: Kao, Ching-Chia, et al.
Published: (2024) -
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
by: Hsu, Chia-Yi, et al.
Published: (2024) -
Defending Against Repetitive Backdoor Attacks on Semi-supervised Learning through Lens of Rate-Distortion-Perception Trade-off
by: Lee, Cheng-Yi, et al.
Published: (2024) -
Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
by: Hsu, Chia-Yi, et al.
Published: (2026) -
Counter-Current Learning: A Biologically Plausible Dual Network Approach for Deep Learning
by: Kao, Chia-Hsiang, et al.
Published: (2024)