Controllable Value Alignment in Large Language Models through Neuron-Level Editing
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yonghui, Wang, Yihui, Li, Junwei, Liu, Jilong, Zhu, Fengbin, Huang, Weibiao, Wu, Le, Hong, Richang, Chua, Tat-Seng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
by: Wang, Yihui, et al.
Published: (2026)
by: Wang, Yihui, et al.
Published: (2026)
Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
by: Yang, Yonghui, et al.
Published: (2026)
by: Yang, Yonghui, et al.
Published: (2026)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
by: Wang, Zhaoxin, et al.
Published: (2026)
by: Wang, Zhaoxin, et al.
Published: (2026)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
by: Li, Moxin, et al.
Published: (2024)
by: Li, Moxin, et al.
Published: (2024)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
by: Zhu, Fengbin, et al.
Published: (2026)
by: Zhu, Fengbin, et al.
Published: (2026)
Large Language Models Empowered Personalized Web Agents
by: Cai, Hongru, et al.
Published: (2024)
by: Cai, Hongru, et al.
Published: (2024)
CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment
by: Liu, Jilong, et al.
Published: (2026)
by: Liu, Jilong, et al.
Published: (2026)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
by: Zhu, Fengbin, et al.
Published: (2024)
by: Zhu, Fengbin, et al.
Published: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
by: Qin, Bosheng, et al.
Published: (2023)
by: Qin, Bosheng, et al.
Published: (2023)
Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector
by: Huang, Youcheng, et al.
Published: (2024)
by: Huang, Youcheng, et al.
Published: (2024)
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation
by: Lin, Zijie, et al.
Published: (2025)
by: Lin, Zijie, et al.
Published: (2025)
Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance
by: Shi, Enyi, et al.
Published: (2026)
by: Shi, Enyi, et al.
Published: (2026)
Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons
by: Zhang, Xianhui, et al.
Published: (2026)
by: Zhang, Xianhui, et al.
Published: (2026)
Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering
by: Liu, Jilong, et al.
Published: (2025)
by: Liu, Jilong, et al.
Published: (2025)
Optimizing Knowledge Integration in Retrieval-Augmented Generation with Self-Selection
by: Weng, Yan, et al.
Published: (2025)
by: Weng, Yan, et al.
Published: (2025)
Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text Documents via Semantic-Oriented Hierarchical Graphs
by: Zhu, Fengbin, et al.
Published: (2023)
by: Zhu, Fengbin, et al.
Published: (2023)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
by: Zhu, Fengbin, et al.
Published: (2024)
by: Zhu, Fengbin, et al.
Published: (2024)
MiniRec: Data-Efficient Reinforcement Learning for LLM-based Recommendation
by: Wang, Lin, et al.
Published: (2026)
by: Wang, Lin, et al.
Published: (2026)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
by: Fei, Hao, et al.
Published: (2024)
by: Fei, Hao, et al.
Published: (2024)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
by: Zhao, Yong, et al.
Published: (2025)
by: Zhao, Yong, et al.
Published: (2025)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
by: Zheng, Jingnan, et al.
Published: (2024)
by: Zheng, Jingnan, et al.
Published: (2024)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
by: Fei, Hao, et al.
Published: (2024)
by: Fei, Hao, et al.
Published: (2024)
Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts
by: Zhao, Xiaoyan, et al.
Published: (2025)
by: Zhao, Xiaoyan, et al.
Published: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
by: Jin, Zhe, et al.
Published: (2025)
by: Jin, Zhe, et al.
Published: (2025)
Heterogeneous User Modeling for LLM-based Recommendation
by: Bao, Honghui, et al.
Published: (2025)
by: Bao, Honghui, et al.
Published: (2025)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
by: Li, Shaotian, et al.
Published: (2026)
by: Li, Shaotian, et al.
Published: (2026)
Neuron-Level Sequential Editing for Large Language Models
by: Jiang, Houcheng, et al.
Published: (2024)
by: Jiang, Houcheng, et al.
Published: (2024)
DRC: Enhancing Personalized Image Generation via Disentangled Representation Composition
by: Xu, Yiyan, et al.
Published: (2025)
by: Xu, Yiyan, et al.
Published: (2025)
InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models
by: Zhou, Zhiyuan, et al.
Published: (2024)
by: Zhou, Zhiyuan, et al.
Published: (2024)
ACE-Align: Attribute Causal Effect Alignment for Cultural Values under Varying Persona Granularities
by: Luo, Jiatang, et al.
Published: (2026)
by: Luo, Jiatang, et al.
Published: (2026)
Universal Scene Graph Generation
by: Wu, Shengqiong, et al.
Published: (2025)
by: Wu, Shengqiong, et al.
Published: (2025)
LLM2Rec: Large Language Models Are Powerful Embedding Models for Sequential Recommendation
by: He, Yingzhi, et al.
Published: (2025)
by: He, Yingzhi, et al.
Published: (2025)
Less is More: Information Bottleneck Denoised Multimedia Recommendation
by: Yang, Yonghui, et al.
Published: (2025)
by: Yang, Yonghui, et al.
Published: (2025)
MM-Forecast: A Multimodal Approach to Temporal Event Forecasting with Large Language Models
by: Li, Haoxuan, et al.
Published: (2024)
by: Li, Haoxuan, et al.
Published: (2024)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
by: Deng, Yang, et al.
Published: (2023)
by: Deng, Yang, et al.
Published: (2023)
A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting
by: Chang, He, et al.
Published: (2024)
by: Chang, He, et al.
Published: (2024)
Graph Bottlenecked Social Recommendation
by: Yang, Yonghui, et al.
Published: (2024)
by: Yang, Yonghui, et al.
Published: (2024)
Towards Temporal-Aware Multi-Modal Retrieval Augmented Generation in Finance
by: Zhu, Fengbin, et al.
Published: (2025)
by: Zhu, Fengbin, et al.
Published: (2025)
Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks
by: Xu, Shicheng, et al.
Published: (2023)
by: Xu, Shicheng, et al.
Published: (2023)
Similar Items
-
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
by: Wang, Yihui, et al.
Published: (2026) -
Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
by: Yang, Yonghui, et al.
Published: (2026) -
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
by: Wang, Zhaoxin, et al.
Published: (2026) -
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
by: Li, Moxin, et al.
Published: (2024) -
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
by: Zhu, Fengbin, et al.
Published: (2026)