Enhancing Safety of Large Language Models via Embedding Space Separation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Xu, Wang, Xiting, Shen, Weiran |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
por: Diao, Muxi, et al.
Publicado: (2024)
por: Diao, Muxi, et al.
Publicado: (2024)
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
por: Zhang, Zhibo, et al.
Publicado: (2025)
por: Zhang, Zhibo, et al.
Publicado: (2025)
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
por: Wang, Pei, et al.
Publicado: (2024)
por: Wang, Pei, et al.
Publicado: (2024)
Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2026)
por: Xu, Zihao, et al.
Publicado: (2026)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
por: Weng, Jiaqi, et al.
Publicado: (2025)
por: Weng, Jiaqi, et al.
Publicado: (2025)
Knowledge Editing on Black-box Large Language Models
por: Song, Xiaoshuai, et al.
Publicado: (2024)
por: Song, Xiaoshuai, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
por: Zhao, Yinzhi, et al.
Publicado: (2026)
por: Zhao, Yinzhi, et al.
Publicado: (2026)
Precision Knowledge Editing: Enhancing Safety in Large Language Models
por: Li, Xuying, et al.
Publicado: (2024)
por: Li, Xuying, et al.
Publicado: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
por: Zong, Xuanjun, et al.
Publicado: (2025)
por: Zong, Xuanjun, et al.
Publicado: (2025)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
por: Zhang, Kang, et al.
Publicado: (2024)
por: Zhang, Kang, et al.
Publicado: (2024)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
por: Jin, Haoran, et al.
Publicado: (2025)
por: Jin, Haoran, et al.
Publicado: (2025)
Demystifying Embedding Spaces using Large Language Models
por: Tennenholtz, Guy, et al.
Publicado: (2023)
por: Tennenholtz, Guy, et al.
Publicado: (2023)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
por: Zhang, Wenjing, et al.
Publicado: (2024)
por: Zhang, Wenjing, et al.
Publicado: (2024)
Developing Healthcare Language Model Embedding Spaces
por: Taylor, Niall, et al.
Publicado: (2024)
por: Taylor, Niall, et al.
Publicado: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
por: Lu, Yida, et al.
Publicado: (2025)
por: Lu, Yida, et al.
Publicado: (2025)
Large Language Model Safety: A Holistic Survey
por: Shi, Dan, et al.
Publicado: (2024)
por: Shi, Dan, et al.
Publicado: (2024)
Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models
por: Tuan, Yi-Lin, et al.
Publicado: (2024)
por: Tuan, Yi-Lin, et al.
Publicado: (2024)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
por: Wang, Hongbo, et al.
Publicado: (2025)
por: Wang, Hongbo, et al.
Publicado: (2025)
Characteristic AI Agents via Large Language Models
por: Wang, Xi, et al.
Publicado: (2024)
por: Wang, Xi, et al.
Publicado: (2024)
Embedding Domain Knowledge for Large Language Models via Reinforcement Learning from Augmented Generation
por: Nie, Chaojun, et al.
Publicado: (2025)
por: Nie, Chaojun, et al.
Publicado: (2025)
The Information of Large Language Model Geometry
por: Tan, Zhiquan, et al.
Publicado: (2024)
por: Tan, Zhiquan, et al.
Publicado: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
por: Wang, Wenxuan, et al.
Publicado: (2023)
por: Wang, Wenxuan, et al.
Publicado: (2023)
Large Language Models for Knowledge Graph Embedding: A Survey
por: Liu, Bingchen, et al.
Publicado: (2025)
por: Liu, Bingchen, et al.
Publicado: (2025)
Towards Context-Invariant Safety Alignment for Large Language Models
por: Wang, Yixu, et al.
Publicado: (2026)
por: Wang, Yixu, et al.
Publicado: (2026)
Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
KG-BiLM: Knowledge Graph Embedding via Bidirectional Language Models
por: Chen, Zirui, et al.
Publicado: (2025)
por: Chen, Zirui, et al.
Publicado: (2025)
ReaLM: Residual Quantization Bridging Knowledge Graph Embeddings and Large Language Models
por: Guo, Wenbin, et al.
Publicado: (2025)
por: Guo, Wenbin, et al.
Publicado: (2025)
Large Language Model Unlearning via Embedding-Corrupted Prompts
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
Dual-Space Knowledge Distillation for Large Language Models
por: Zhang, Songming, et al.
Publicado: (2024)
por: Zhang, Songming, et al.
Publicado: (2024)
Semantic Structure in Large Language Model Embeddings
por: Kozlowski, Austin C., et al.
Publicado: (2025)
por: Kozlowski, Austin C., et al.
Publicado: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
por: Xu, Shicheng, et al.
Publicado: (2024)
por: Xu, Shicheng, et al.
Publicado: (2024)
DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning
por: Wang, Yejie, et al.
Publicado: (2024)
por: Wang, Yejie, et al.
Publicado: (2024)
Knowledge Graph-Enhanced Large Language Models via Path Selection
por: Liu, Haochen, et al.
Publicado: (2024)
por: Liu, Haochen, et al.
Publicado: (2024)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
por: Liu, Zheyuan, et al.
Publicado: (2025)
por: Liu, Zheyuan, et al.
Publicado: (2025)
RKEFino1: A Regulation Knowledge-Enhanced Large Language Model
por: Wang, Yan, et al.
Publicado: (2025)
por: Wang, Yan, et al.
Publicado: (2025)
Recovering Event Probabilities from Large Language Model Embeddings via Axiomatic Constraints
por: Zhu, Jian-Qiao, et al.
Publicado: (2025)
por: Zhu, Jian-Qiao, et al.
Publicado: (2025)
KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning
por: Lv, Qitan, et al.
Publicado: (2026)
por: Lv, Qitan, et al.
Publicado: (2026)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
por: Alssum, Lama, et al.
Publicado: (2025)
por: Alssum, Lama, et al.
Publicado: (2025)
Large Language Model Enhanced Knowledge Representation Learning: A Survey
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Ejemplares similares
-
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
por: Diao, Muxi, et al.
Publicado: (2024) -
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
por: Zhang, Zhibo, et al.
Publicado: (2025) -
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
por: Wang, Pei, et al.
Publicado: (2024) -
Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2026) -
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
por: Weng, Jiaqi, et al.
Publicado: (2025)