CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer
Fuente:
arXiv
Guardado en:
| Autores principales: | Bansal, Lavish, Mishra, Naman |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Universal Cross-Lingual Text Classification
por: Savant, Riya, et al.
Publicado: (2024)
por: Savant, Riya, et al.
Publicado: (2024)
Zero-Shot Morphological Discovery in Low-Resource Bantu Languages via Cross-Lingual Transfer and Unsupervised Clustering
por: Mutisya, Hillary, et al.
Publicado: (2026)
por: Mutisya, Hillary, et al.
Publicado: (2026)
Bypassing Safety Guardrails in LLMs Using Humor
por: Cisneros-Velarde, Pedro
Publicado: (2025)
por: Cisneros-Velarde, Pedro
Publicado: (2025)
Measuring Catastrophic Forgetting in Cross-Lingual Transfer Paradigms: Exploring Tuning Strategies
por: Koloski, Boshko, et al.
Publicado: (2023)
por: Koloski, Boshko, et al.
Publicado: (2023)
Improving Zero-Shot Cross-Lingual Transfer via Progressive Code-Switching
por: Li, Zhuoran, et al.
Publicado: (2024)
por: Li, Zhuoran, et al.
Publicado: (2024)
Language-specific Neurons Do Not Facilitate Cross-Lingual Transfer
por: Mondal, Soumen Kumar, et al.
Publicado: (2025)
por: Mondal, Soumen Kumar, et al.
Publicado: (2025)
Can Embedding Similarity Predict Cross-Lingual Transfer? A Systematic Study on African Languages
por: Idris, Tewodros Kederalah, et al.
Publicado: (2026)
por: Idris, Tewodros Kederalah, et al.
Publicado: (2026)
Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models
por: Rajaee, Sara, et al.
Publicado: (2024)
por: Rajaee, Sara, et al.
Publicado: (2024)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
por: Oh, Sejoon, et al.
Publicado: (2024)
por: Oh, Sejoon, et al.
Publicado: (2024)
Why Do Safety Guardrails Degrade Across Languages?
por: Zhang, Max, et al.
Publicado: (2026)
por: Zhang, Max, et al.
Publicado: (2026)
Layer Swapping for Zero-Shot Cross-Lingual Transfer in Large Language Models
por: Bandarkar, Lucas, et al.
Publicado: (2024)
por: Bandarkar, Lucas, et al.
Publicado: (2024)
MKA: Leveraging Cross-Lingual Consensus for Model Abstention
por: Duwal, Sharad
Publicado: (2025)
por: Duwal, Sharad
Publicado: (2025)
Auto-Tuning Safety Guardrails for Black-Box Large Language Models
por: Abdulkadir, Perry
Publicado: (2025)
por: Abdulkadir, Perry
Publicado: (2025)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
por: Shahani, Prithviraj Singh, et al.
Publicado: (2025)
por: Shahani, Prithviraj Singh, et al.
Publicado: (2025)
Few-Shot Cross-Lingual Transfer for Prompting Large Language Models in Low-Resource Languages
por: Toukmaji, Christopher
Publicado: (2024)
por: Toukmaji, Christopher
Publicado: (2024)
Identifying the Correlation Between Language Distance and Cross-Lingual Transfer in a Multilingual Representation Space
por: Philippy, Fred, et al.
Publicado: (2023)
por: Philippy, Fred, et al.
Publicado: (2023)
The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs
por: Bandarkar, Lucas, et al.
Publicado: (2025)
por: Bandarkar, Lucas, et al.
Publicado: (2025)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
por: Ilin, Aleksei, et al.
Publicado: (2025)
por: Ilin, Aleksei, et al.
Publicado: (2025)
Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment
por: Krishna, Kundan, et al.
Publicado: (2025)
por: Krishna, Kundan, et al.
Publicado: (2025)
BhashaSetu: Cross-Lingual Knowledge Transfer from High-Resource to Extreme Low-Resource Languages
por: Maji, Subhadip, et al.
Publicado: (2026)
por: Maji, Subhadip, et al.
Publicado: (2026)
Implicit Word Reordering with Knowledge Distillation for Cross-Lingual Dependency Parsing
por: Li, Zhuoran, et al.
Publicado: (2025)
por: Li, Zhuoran, et al.
Publicado: (2025)
Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy
por: Sattigeri, Sarthak
Publicado: (2026)
por: Sattigeri, Sarthak
Publicado: (2026)
On a Novel Application of Wasserstein-Procrustes for Unsupervised Cross-Lingual Learning
por: Ramírez, Guillem, et al.
Publicado: (2020)
por: Ramírez, Guillem, et al.
Publicado: (2020)
Zero-Shot Cross-Lingual Transfer using Prefix-Based Adaptation
por: A, Snegha, et al.
Publicado: (2025)
por: A, Snegha, et al.
Publicado: (2025)
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
por: Abouzahir, Chaimae, et al.
Publicado: (2026)
por: Abouzahir, Chaimae, et al.
Publicado: (2026)
Evaluating the Robustness and Accuracy of Text Watermarking Under Real-World Cross-Lingual Manipulations
por: Ghanim, Mansour Al, et al.
Publicado: (2025)
por: Ghanim, Mansour Al, et al.
Publicado: (2025)
Speaker Style-Aware Phoneme Anchoring for Improved Cross-Lingual Speech Emotion Recognition
por: Upadhyay, Shreya G., et al.
Publicado: (2025)
por: Upadhyay, Shreya G., et al.
Publicado: (2025)
CONSCENDI: A Contrastive and Scenario-Guided Distillation Approach to Guardrail Models for Virtual Assistants
por: Sun, Albert Yu, et al.
Publicado: (2023)
por: Sun, Albert Yu, et al.
Publicado: (2023)
DeFTX: Denoised Sparse Fine-Tuning for Zero-Shot Cross-Lingual Transfer
por: Simon, Sona Elza, et al.
Publicado: (2025)
por: Simon, Sona Elza, et al.
Publicado: (2025)
Languages are Modalities: Cross-Lingual Alignment via Encoder Injection
por: Agarwal, Rajan, et al.
Publicado: (2025)
por: Agarwal, Rajan, et al.
Publicado: (2025)
A comprehensive study of on-device NLP applications -- VQA, automated Form filling, Smart Replies for Linguistic Codeswitching
por: Goyal, Naman
Publicado: (2024)
por: Goyal, Naman
Publicado: (2024)
Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages
por: R, Swastik
Publicado: (2026)
por: R, Swastik
Publicado: (2026)
Maximizing Data Efficiency for Cross-Lingual TTS Adaptation by Self-Supervised Representation Mixing and Embedding Initialization
por: Huang, Wei-Ping, et al.
Publicado: (2024)
por: Huang, Wei-Ping, et al.
Publicado: (2024)
Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation
por: Gueorguieva, Anna-Maria, et al.
Publicado: (2025)
por: Gueorguieva, Anna-Maria, et al.
Publicado: (2025)
A New Method for Cross-Lingual-based Semantic Role Labeling
por: Ebrahimi, Mohammad, et al.
Publicado: (2024)
por: Ebrahimi, Mohammad, et al.
Publicado: (2024)
Knowledge Localization in Mixture-of-Experts LLMs Using Cross-Lingual Inconsistency
por: Bandarkar, Lucas, et al.
Publicado: (2026)
por: Bandarkar, Lucas, et al.
Publicado: (2026)
A Data Selection Approach for Enhancing Low Resource Machine Translation Using Cross-Lingual Sentence Representations
por: Kowtal, Nidhi, et al.
Publicado: (2024)
por: Kowtal, Nidhi, et al.
Publicado: (2024)
Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment
por: Rad, Melissa Kazemi, et al.
Publicado: (2025)
por: Rad, Melissa Kazemi, et al.
Publicado: (2025)
Customize Multi-modal RAI Guardrails with Precedent-based predictions
por: Yang, Cheng-Fu, et al.
Publicado: (2025)
por: Yang, Cheng-Fu, et al.
Publicado: (2025)
JNLP at SemEval-2025 Task 11: Cross-Lingual Multi-Label Emotion Detection Using Generative Models
por: Xue, Jieying, et al.
Publicado: (2025)
por: Xue, Jieying, et al.
Publicado: (2025)
Ejemplares similares
-
Universal Cross-Lingual Text Classification
por: Savant, Riya, et al.
Publicado: (2024) -
Zero-Shot Morphological Discovery in Low-Resource Bantu Languages via Cross-Lingual Transfer and Unsupervised Clustering
por: Mutisya, Hillary, et al.
Publicado: (2026) -
Bypassing Safety Guardrails in LLMs Using Humor
por: Cisneros-Velarde, Pedro
Publicado: (2025) -
Measuring Catastrophic Forgetting in Cross-Lingual Transfer Paradigms: Exploring Tuning Strategies
por: Koloski, Boshko, et al.
Publicado: (2023) -
Improving Zero-Shot Cross-Lingual Transfer via Progressive Code-Switching
por: Li, Zhuoran, et al.
Publicado: (2024)