Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Banerjee, Somnath, Layek, Sayan, Chatterjee, Pratyush, Mukherjee, Animesh, Hazra, Rima |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
von: Banerjee, Somnath, et al.
Veröffentlicht: (2025)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2025)
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
von: Hazra, Rima, et al.
Veröffentlicht: (2024)
von: Hazra, Rima, et al.
Veröffentlicht: (2024)
Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages
von: Banerjee, Somnath, et al.
Veröffentlicht: (2026)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2026)
SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models
von: Banerjee, Somnath, et al.
Veröffentlicht: (2025)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2025)
AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
von: Adak, Sayantan, et al.
Veröffentlicht: (2025)
von: Adak, Sayantan, et al.
Veröffentlicht: (2025)
Navigating the Cultural Kaleidoscope: A Hitchhiker's Guide to Sensitivity in Large Language Models
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language Models
von: Hazra, Rima, et al.
Veröffentlicht: (2024)
von: Hazra, Rima, et al.
Veröffentlicht: (2024)
Context Matters: Pushing the Boundaries of Open-Ended Answer Generation with Graph-Structured Knowledge Context
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
Breaking Boundaries: Investigating the Effects of Model Editing on Cross-linguistic Performance
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
MemeSense: An Adaptive In-Context Framework for Social Commonsense Driven Meme Moderation
von: Adak, Sayantan, et al.
Veröffentlicht: (2025)
von: Adak, Sayantan, et al.
Veröffentlicht: (2025)
Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations
von: Banerjee, Somnath, et al.
Veröffentlicht: (2026)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2026)
Redefining Developer Assistance: Through Large Language Models in Software Ecosystem
von: Banerjee, Somnath, et al.
Veröffentlicht: (2023)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2023)
SafeMath: Inference-time Safety improves Math Accuracy
von: Basu, Sagnik, et al.
Veröffentlicht: (2026)
von: Basu, Sagnik, et al.
Veröffentlicht: (2026)
Evaluating the Ebb and Flow: An In-depth Analysis of Question-Answering Trends across Diverse Platforms
von: Hazra, Rima, et al.
Veröffentlicht: (2023)
von: Hazra, Rima, et al.
Veröffentlicht: (2023)
From Fluent to Verifiable: Claim-Level Auditability for Deep Research Agents
von: Rasheed, Razeen A, et al.
Veröffentlicht: (2026)
von: Rasheed, Razeen A, et al.
Veröffentlicht: (2026)
SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems
von: Hazra, Rima, et al.
Veröffentlicht: (2026)
von: Hazra, Rima, et al.
Veröffentlicht: (2026)
DistALANER: Distantly Supervised Active Learning Augmented Named Entity Recognition in the Open Source Software Ecosystem
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)
FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection
von: Bhaskar, Paramananda, et al.
Veröffentlicht: (2026)
von: Bhaskar, Paramananda, et al.
Veröffentlicht: (2026)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
von: Li, Hao, et al.
Veröffentlicht: (2026)
von: Li, Hao, et al.
Veröffentlicht: (2026)
On the Limitations of Steering in Language Model Alignment
von: Niranjan, Chebrolu, et al.
Veröffentlicht: (2025)
von: Niranjan, Chebrolu, et al.
Veröffentlicht: (2025)
Cross-Lingual Activation Steering for Multilingual Language Models
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2026)
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2026)
Causal Language Control in Multilingual Transformers via Sparse Feature Steering
von: Chou, Cheng-Ting, et al.
Veröffentlicht: (2025)
von: Chou, Cheng-Ting, et al.
Veröffentlicht: (2025)
Multilingual Safety Alignment via Self-Distillation
von: Qin, Ruiyang, et al.
Veröffentlicht: (2026)
von: Qin, Ruiyang, et al.
Veröffentlicht: (2026)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
von: Siu, Vincent, et al.
Veröffentlicht: (2025)
von: Siu, Vincent, et al.
Veröffentlicht: (2025)
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
von: Sundar, Anirudh, et al.
Veröffentlicht: (2025)
von: Sundar, Anirudh, et al.
Veröffentlicht: (2025)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
Tradeoffs Between Alignment and Helpfulness in Language Models with Steering Methods
von: Wolf, Yotam, et al.
Veröffentlicht: (2024)
von: Wolf, Yotam, et al.
Veröffentlicht: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
von: Wang, Wenxuan, et al.
Veröffentlicht: (2023)
von: Wang, Wenxuan, et al.
Veröffentlicht: (2023)
Neural FOXP2 -- Language Specific Neuron Steering for Targeted Language Improvement in LLMs
von: Saha, Anusa, et al.
Veröffentlicht: (2026)
von: Saha, Anusa, et al.
Veröffentlicht: (2026)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
von: Wang, Haoran, et al.
Veröffentlicht: (2023)
von: Wang, Haoran, et al.
Veröffentlicht: (2023)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
von: Liu, Zheyuan, et al.
Veröffentlicht: (2025)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2025)
Bridging the Language Gap: Dynamic Learning Strategies for Improving Multilingual Performance in LLMs
von: Kumar, Somnath, et al.
Veröffentlicht: (2023)
von: Kumar, Somnath, et al.
Veröffentlicht: (2023)
The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts
von: Shen, Lingfeng, et al.
Veröffentlicht: (2024)
von: Shen, Lingfeng, et al.
Veröffentlicht: (2024)
Fusion Steering: Prompt-Specific Activation Control
von: Chang, Waldemar, et al.
Veröffentlicht: (2025)
von: Chang, Waldemar, et al.
Veröffentlicht: (2025)
Towards Inference-time Category-wise Safety Steering for Large Language Models
von: Bhattacharjee, Amrita, et al.
Veröffentlicht: (2024)
von: Bhattacharjee, Amrita, et al.
Veröffentlicht: (2024)
CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models
von: Le, Yifan, et al.
Veröffentlicht: (2026)
von: Le, Yifan, et al.
Veröffentlicht: (2026)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
A Survey on Multilingual Large Language Models: Corpora, Alignment, and Bias
von: Xu, Yuemei, et al.
Veröffentlicht: (2024)
von: Xu, Yuemei, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
von: Banerjee, Somnath, et al.
Veröffentlicht: (2025) -
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
von: Hazra, Rima, et al.
Veröffentlicht: (2024) -
Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages
von: Banerjee, Somnath, et al.
Veröffentlicht: (2026) -
SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024) -
How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries
von: Banerjee, Somnath, et al.
Veröffentlicht: (2024)