BarrierSteer: LLM Safety via Learning Barrier Steering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tran, Thanh Q., Verma, Arun, Wong, Kiwan, Low, Bryan Kian Hsiang, Rus, Daniela, Xiao, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
par: Lin, Xiaoqiang, et autres
Publié: (2025)
par: Lin, Xiaoqiang, et autres
Publié: (2025)
Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies
par: Verma, Arun, et autres
Publié: (2024)
par: Verma, Arun, et autres
Publié: (2024)
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents
par: Verma, Arun, et autres
Publié: (2025)
par: Verma, Arun, et autres
Publié: (2025)
Data value estimation on private gradients
par: Zhou, Zijian, et autres
Publié: (2024)
par: Zhou, Zijian, et autres
Publié: (2024)
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
par: Verma, Arun, et autres
Publié: (2024)
par: Verma, Arun, et autres
Publié: (2024)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
par: Wu, Zhaoxuan, et autres
Publié: (2025)
par: Wu, Zhaoxuan, et autres
Publié: (2025)
DETAIL: Task DEmonsTration Attribution for Interpretable In-context Learning
par: Zhou, Zijian, et autres
Publié: (2024)
par: Zhou, Zijian, et autres
Publié: (2024)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
par: Verma, Arun, et autres
Publié: (2025)
par: Verma, Arun, et autres
Publié: (2025)
Prompt Optimization with Human Feedback
par: Lin, Xiaoqiang, et autres
Publié: (2024)
par: Lin, Xiaoqiang, et autres
Publié: (2024)
Dependency Structure Search Bayesian Optimization for Decision Making Models
par: Rajpal, Mohit, et autres
Publié: (2023)
par: Rajpal, Mohit, et autres
Publié: (2023)
DeRDaVa: Deletion-Robust Data Valuation for Machine Learning
par: Tian, Xiao, et autres
Publié: (2023)
par: Tian, Xiao, et autres
Publié: (2023)
MeMo: Memory as a Model
par: Quek, Ryan Wei Heng, et autres
Publié: (2026)
par: Quek, Ryan Wei Heng, et autres
Publié: (2026)
BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks
par: Chew, Ruth Wan Theng, et autres
Publié: (2026)
par: Chew, Ruth Wan Theng, et autres
Publié: (2026)
PoSafeNet: Safe Learning with Poset-Structured Neural Nets
par: Wong, Kiwan, et autres
Publié: (2026)
par: Wong, Kiwan, et autres
Publié: (2026)
The Rogue Scalpel: Activation Steering Compromises LLM Safety
par: Korznikov, Anton, et autres
Publié: (2025)
par: Korznikov, Anton, et autres
Publié: (2025)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
par: Yeon, Jehyeok, et autres
Publié: (2025)
par: Yeon, Jehyeok, et autres
Publié: (2025)
INO-SGD: Addressing Utility Imbalance under Individualized Differential Privacy
par: Tian, Xiao, et autres
Publié: (2026)
par: Tian, Xiao, et autres
Publié: (2026)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
par: Siu, Vincent, et autres
Publié: (2025)
par: Siu, Vincent, et autres
Publié: (2025)
DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks
par: Chen, Zhiliang, et autres
Publié: (2025)
par: Chen, Zhiliang, et autres
Publié: (2025)
Steering LLMs for Formal Theorem Proving
par: Kirtania, Shashank, et autres
Publié: (2025)
par: Kirtania, Shashank, et autres
Publié: (2025)
Incentivizing Truthfulness and Collaborative Fairness in Bayesian Learning
par: Sim, Rachael Hwee Ling, et autres
Publié: (2026)
par: Sim, Rachael Hwee Ling, et autres
Publié: (2026)
Steer Like the LLM: Activation Steering that Mimics Prompting
par: Heyman, Geert, et autres
Publié: (2026)
par: Heyman, Geert, et autres
Publié: (2026)
Paid with Models: Optimal Contract Design for Collaborative Machine Learning
par: Wang, Bingchen, et autres
Publié: (2024)
par: Wang, Bingchen, et autres
Publié: (2024)
Group-robust Sample Reweighting for Subpopulation Shifts via Influence Functions
par: Qiao, Rui, et autres
Publié: (2025)
par: Qiao, Rui, et autres
Publié: (2025)
Steered LLM Activations are Non-Surjective
par: Mishra, Aayush, et autres
Publié: (2026)
par: Mishra, Aayush, et autres
Publié: (2026)
Preemptive Detection and Steering of LLM Misalignment via Latent Reachability
par: Karnik, Sathwik, et autres
Publié: (2025)
par: Karnik, Sathwik, et autres
Publié: (2025)
Helpful or Harmful Data? Fine-tuning-free Shapley Attribution for Explaining Language Model Predictions
par: Wang, Jingtan, et autres
Publié: (2024)
par: Wang, Jingtan, et autres
Publié: (2024)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
par: Jiang, Xinyan, et autres
Publié: (2026)
par: Jiang, Xinyan, et autres
Publié: (2026)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
par: Yu, Zhang Ze, et autres
Publié: (2023)
par: Yu, Zhang Ze, et autres
Publié: (2023)
REFRAG: Rethinking RAG based Decoding
par: Lin, Xiaoqiang, et autres
Publié: (2025)
par: Lin, Xiaoqiang, et autres
Publié: (2025)
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
par: Shu, Yao, et autres
Publié: (2024)
par: Shu, Yao, et autres
Publié: (2024)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
par: Sharma, Kartik, et autres
Publié: (2026)
par: Sharma, Kartik, et autres
Publié: (2026)
Concept Heterogeneity-aware Representation Steering
par: Abdullaev, Laziz U., et autres
Publié: (2026)
par: Abdullaev, Laziz U., et autres
Publié: (2026)
Kernel-Based Learning of Safety Barriers
par: Schön, Oliver, et autres
Publié: (2026)
par: Schön, Oliver, et autres
Publié: (2026)
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
par: Hedström, Anna, et autres
Publié: (2025)
par: Hedström, Anna, et autres
Publié: (2025)
MidSteer: Optimal Affine Framework for Steering Generative Models
par: Gaintseva, Tatiana, et autres
Publié: (2026)
par: Gaintseva, Tatiana, et autres
Publié: (2026)
Steer LLM Latents for Hallucination Detection
par: Park, Seongheon, et autres
Publié: (2025)
par: Park, Seongheon, et autres
Publié: (2025)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
Is Data Shapley Not Better than Random in Data Selection? Ask NASH
par: Tian, Xiao, et autres
Publié: (2026)
par: Tian, Xiao, et autres
Publié: (2026)
Documents similaires
-
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
par: Lin, Xiaoqiang, et autres
Publié: (2025) -
Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies
par: Verma, Arun, et autres
Publié: (2024) -
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents
par: Verma, Arun, et autres
Publié: (2025) -
Data value estimation on private gradients
par: Zhou, Zijian, et autres
Publié: (2024) -
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)