MOSAIC: Composable Safety Alignment with Modular Control Tokens
Fuente:
arXiv
Saved in:
| Main Authors: | Peng, Jingyu, Chen, Hongyu, Dong, Jiancheng, Wang, Maolin, Li, Wenxi, Li, Yuchen, Zhang, Kai, Zhao, Xiangyu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression
by: Peng, Jingyu, et al.
Published: (2025)
by: Peng, Jingyu, et al.
Published: (2025)
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
by: Peng, Jingyu, et al.
Published: (2025)
by: Peng, Jingyu, et al.
Published: (2025)
MetaLoRA: Tensor-Enhanced Adaptive Low-Rank Fine-tuning
by: Wang, Maolin, et al.
Published: (2025)
by: Wang, Maolin, et al.
Published: (2025)
MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
by: Bao, Yifan, et al.
Published: (2026)
by: Bao, Yifan, et al.
Published: (2026)
Stepwise Reasoning Error Disruption Attack of LLMs
by: Peng, Jingyu, et al.
Published: (2024)
by: Peng, Jingyu, et al.
Published: (2024)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
by: Zhang, Jingyu, et al.
Published: (2024)
by: Zhang, Jingyu, et al.
Published: (2024)
TMCIR: Token Merge Benefits Composed Image Retrieval
by: Wang, Chaoyang, et al.
Published: (2025)
by: Wang, Chaoyang, et al.
Published: (2025)
LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion
by: Zhou, Guanghao, et al.
Published: (2026)
by: Zhou, Guanghao, et al.
Published: (2026)
Safety Alignment Should Be Made More Than Just a Few Tokens Deep
by: Qi, Xiangyu, et al.
Published: (2024)
by: Qi, Xiangyu, et al.
Published: (2024)
Empowering Denoising Sequential Recommendation with Large Language Model Embeddings
by: Wu, Tongzhou, et al.
Published: (2025)
by: Wu, Tongzhou, et al.
Published: (2025)
Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs
by: Tan, Qitao, et al.
Published: (2026)
by: Tan, Qitao, et al.
Published: (2026)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
by: He, Zongtao, et al.
Published: (2025)
by: He, Zongtao, et al.
Published: (2025)
Automatic Synthetic Data and Fine-grained Adaptive Feature Alignment for Composed Person Retrieval
by: Liu, Delong, et al.
Published: (2023)
by: Liu, Delong, et al.
Published: (2023)
Data Efficient Adaptation in Large Language Models via Continuous Low-Rank Fine-Tuning
by: Han, Xiao, et al.
Published: (2025)
by: Han, Xiao, et al.
Published: (2025)
SafeWorld: Geo-Diverse Safety Alignment
by: Yin, Da, et al.
Published: (2024)
by: Yin, Da, et al.
Published: (2024)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
by: Liu, Jingyu, et al.
Published: (2025)
by: Liu, Jingyu, et al.
Published: (2025)
Dual Relation Alignment for Composed Image Retrieval
by: Jiang, Xintong, et al.
Published: (2023)
by: Jiang, Xintong, et al.
Published: (2023)
Token Alignment via Character Matching for Subword Completion
by: Athiwaratkun, Ben, et al.
Published: (2024)
by: Athiwaratkun, Ben, et al.
Published: (2024)
Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models
by: Wu, Hui, et al.
Published: (2026)
by: Wu, Hui, et al.
Published: (2026)
Large Multimodal Model Compression via Efficient Pruning and Distillation at AntGroup
by: Wang, Maolin, et al.
Published: (2023)
by: Wang, Maolin, et al.
Published: (2023)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
Reimagining Safety Alignment with An Image
by: Xia, Yifan, et al.
Published: (2025)
by: Xia, Yifan, et al.
Published: (2025)
Self-supervised Attribute-aware Dynamic Preference Ranking Alignment
by: Yang, Hongyu, et al.
Published: (2025)
by: Yang, Hongyu, et al.
Published: (2025)
Safety Alignment for Vision Language Models
by: Liu, Zhendong, et al.
Published: (2024)
by: Liu, Zhendong, et al.
Published: (2024)
What Matters For Safety Alignment?
by: Li, Xing, et al.
Published: (2026)
by: Li, Xing, et al.
Published: (2026)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
by: Wu, Di, et al.
Published: (2026)
by: Wu, Di, et al.
Published: (2026)
On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
by: Yin, Bo, et al.
Published: (2026)
by: Yin, Bo, et al.
Published: (2026)
Behavior-Equivalent Token: Single-Token Replacement for Long Prompts in LLMs
by: Dong, Jiancheng, et al.
Published: (2025)
by: Dong, Jiancheng, et al.
Published: (2025)
More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment
by: Wang, Yifan, et al.
Published: (2025)
by: Wang, Yifan, et al.
Published: (2025)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
by: Li, MingSheng, et al.
Published: (2025)
by: Li, MingSheng, et al.
Published: (2025)
Cat-DPO: Category-Adaptive Safety Alignment
by: Yang, Tiankai, et al.
Published: (2026)
by: Yang, Tiankai, et al.
Published: (2026)
Improving Safety Alignment via Balanced Direct Preference Optimization
by: Zhao, Shiji, et al.
Published: (2026)
by: Zhao, Shiji, et al.
Published: (2026)
2D Gaussian Splatting with Semantic Alignment for Image Inpainting
by: Li, Hongyu, et al.
Published: (2025)
by: Li, Hongyu, et al.
Published: (2025)
Tensorized Hypergraph Neural Networks
by: Wang, Maolin, et al.
Published: (2023)
by: Wang, Maolin, et al.
Published: (2023)
MOSAIC: Masked Objective with Selective Adaptation for In-domain Contrastive Learning
by: Pavlova, Vera, et al.
Published: (2025)
by: Pavlova, Vera, et al.
Published: (2025)
Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements
by: Liang, Yiming, et al.
Published: (2025)
by: Liang, Yiming, et al.
Published: (2025)
Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression
by: Luo, Wei, et al.
Published: (2026)
by: Luo, Wei, et al.
Published: (2026)
Towards Linguistically-informed Representations for English as a Second or Foreign Language: Review, Construction and Application
by: Li, Wenxi, et al.
Published: (2026)
by: Li, Wenxi, et al.
Published: (2026)
HPS: Hard Preference Sampling for Human Preference Alignment
by: Zou, Xiandong, et al.
Published: (2025)
by: Zou, Xiandong, et al.
Published: (2025)
Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment
by: Li, Jiajia, et al.
Published: (2026)
by: Li, Jiajia, et al.
Published: (2026)
Similar Items
-
Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression
by: Peng, Jingyu, et al.
Published: (2025) -
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
by: Peng, Jingyu, et al.
Published: (2025) -
MetaLoRA: Tensor-Enhanced Adaptive Low-Rank Fine-tuning
by: Wang, Maolin, et al.
Published: (2025) -
MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
by: Bao, Yifan, et al.
Published: (2026) -
Stepwise Reasoning Error Disruption Attack of LLMs
by: Peng, Jingyu, et al.
Published: (2024)