Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Banerjee, Somnath, Hazra, Rima, Mukherjee, Animesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations
di: Banerjee, Somnath, et al.
Pubblicazione: (2026)
di: Banerjee, Somnath, et al.
Pubblicazione: (2026)
AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
di: Hazra, Rima, et al.
Pubblicazione: (2024)
di: Hazra, Rima, et al.
Pubblicazione: (2024)
SafeMath: Inference-time Safety improves Math Accuracy
di: Basu, Sagnik, et al.
Pubblicazione: (2026)
di: Basu, Sagnik, et al.
Pubblicazione: (2026)
Evaluating the Ebb and Flow: An In-depth Analysis of Question-Answering Trends across Diverse Platforms
di: Hazra, Rima, et al.
Pubblicazione: (2023)
di: Hazra, Rima, et al.
Pubblicazione: (2023)
DistALANER: Distantly Supervised Active Learning Augmented Named Entity Recognition in the Open Source Software Ecosystem
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
Context Matters: Pushing the Boundaries of Open-Ended Answer Generation with Graph-Structured Knowledge Context
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
Breaking Boundaries: Investigating the Effects of Model Editing on Cross-linguistic Performance
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language Models
di: Hazra, Rima, et al.
Pubblicazione: (2024)
di: Hazra, Rima, et al.
Pubblicazione: (2024)
Navigating the Cultural Kaleidoscope: A Hitchhiker's Guide to Sensitivity in Large Language Models
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
MemeSense: An Adaptive In-Context Framework for Social Commonsense Driven Meme Moderation
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems
di: Hazra, Rima, et al.
Pubblicazione: (2026)
di: Hazra, Rima, et al.
Pubblicazione: (2026)
From Fluent to Verifiable: Claim-Level Auditability for Deep Research Agents
di: Rasheed, Razeen A, et al.
Pubblicazione: (2026)
di: Rasheed, Razeen A, et al.
Pubblicazione: (2026)
InfFeed: Influence Functions as a Feedback to Improve the Performance of Subjective Tasks
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
di: Banerjee, Somnath, et al.
Pubblicazione: (2024)
The Multilingual Divide and Its Impact on Global AI Safety
di: Peppin, Aidan, et al.
Pubblicazione: (2025)
di: Peppin, Aidan, et al.
Pubblicazione: (2025)
Duplicate Question Retrieval and Confirmation Time Prediction in Software Communities
di: Hazra, Rima, et al.
Pubblicazione: (2023)
di: Hazra, Rima, et al.
Pubblicazione: (2023)
Tutoring Large Language Models to be Domain-adaptive, Precise, and Safe
di: Banerjee, Somnath
Pubblicazione: (2026)
di: Banerjee, Somnath
Pubblicazione: (2026)
Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture
di: Song, Jiayang, et al.
Pubblicazione: (2024)
di: Song, Jiayang, et al.
Pubblicazione: (2024)
Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2025)
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2025)
Multilinguality at the Edge: Developing Language Models for the Global South
di: Miranda, Lester James V., et al.
Pubblicazione: (2026)
di: Miranda, Lester James V., et al.
Pubblicazione: (2026)
CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications
di: Joshi, Raviraj, et al.
Pubblicazione: (2025)
di: Joshi, Raviraj, et al.
Pubblicazione: (2025)
Efficient Continual Pre-training of LLMs for Low-resource Languages
di: Nag, Arijit, et al.
Pubblicazione: (2024)
di: Nag, Arijit, et al.
Pubblicazione: (2024)
Bridging the Language Gap: Dynamic Learning Strategies for Improving Multilingual Performance in LLMs
di: Kumar, Somnath, et al.
Pubblicazione: (2023)
di: Kumar, Somnath, et al.
Pubblicazione: (2023)
RA-MTR: A Retrieval Augmented Multi-Task Reader based Approach for Inspirational Quote Extraction from Long Documents
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models
di: Zhang, Binchi, et al.
Pubblicazione: (2026)
di: Zhang, Binchi, et al.
Pubblicazione: (2026)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation
di: Mukherjee, Arka, et al.
Pubblicazione: (2025)
di: Mukherjee, Arka, et al.
Pubblicazione: (2025)
CARE: Multilingual Human Preference Learning for Cultural Awareness
di: Guo, Geyang, et al.
Pubblicazione: (2025)
di: Guo, Geyang, et al.
Pubblicazione: (2025)
Cost-Performance Optimization for Processing Low-Resource Language Tasks Using Commercial LLMs
di: Nag, Arijit, et al.
Pubblicazione: (2024)
di: Nag, Arijit, et al.
Pubblicazione: (2024)
Multilingual Safety Alignment via Self-Distillation
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
TEXT2AFFORD: Probing Object Affordance Prediction abilities of Language Models solely from Text
di: Adak, Sayantan, et al.
Pubblicazione: (2024)
di: Adak, Sayantan, et al.
Pubblicazione: (2024)
Local Obfuscation by GLINER for Impartial Context Aware Lineage: Development and evaluation of PII Removal system
di: Shivaprakash, Prakrithi, et al.
Pubblicazione: (2025)
di: Shivaprakash, Prakrithi, et al.
Pubblicazione: (2025)
Exploring Safety-Utility Trade-Offs in Personalized Language Models
di: Vijjini, Anvesh Rao, et al.
Pubblicazione: (2024)
di: Vijjini, Anvesh Rao, et al.
Pubblicazione: (2024)
Language Model Alignment in Multilingual Trolley Problems
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
di: Banerjee, Somnath, et al.
Pubblicazione: (2025) -
SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models
di: Banerjee, Somnath, et al.
Pubblicazione: (2024) -
Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations
di: Banerjee, Somnath, et al.
Pubblicazione: (2026) -
AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
di: Adak, Sayantan, et al.
Pubblicazione: (2025) -
ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)