TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
Fuente:
arXiv
Saved in:
| Main Authors: | Akinode, Victor, Li, Senyu, Hamidouche, Wassim, Zamir, Waqas, Becker-Reshef, Inbal, Adelani, David Ifeoluwa |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AI Diffusion in Low Resource Language Countries
by: Misra, Amit, et al.
Published: (2025)
by: Misra, Amit, et al.
Published: (2025)
Natural language processing for African languages
by: Adelani, David Ifeoluwa
Published: (2025)
by: Adelani, David Ifeoluwa
Published: (2025)
AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages
by: Yu, Hao, et al.
Published: (2026)
by: Yu, Hao, et al.
Published: (2026)
BYOL: Bring Your Own Language Into LLMs
by: Zamir, Syed Waqas, et al.
Published: (2026)
by: Zamir, Syed Waqas, et al.
Published: (2026)
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
by: Ojo, Jessica, et al.
Published: (2025)
by: Ojo, Jessica, et al.
Published: (2025)
AfroBench: How Good are Large Language Models on African Languages?
by: Ojo, Jessica, et al.
Published: (2023)
by: Ojo, Jessica, et al.
Published: (2023)
Lugha-Llama: Adapting Large Language Models for African Languages
by: Buzaaba, Happy, et al.
Published: (2025)
by: Buzaaba, Happy, et al.
Published: (2025)
ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model
by: Quinjica, Osvaldo Luamba, et al.
Published: (2024)
by: Quinjica, Osvaldo Luamba, et al.
Published: (2024)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
by: Schmidt, Fabian David, et al.
Published: (2025)
by: Schmidt, Fabian David, et al.
Published: (2025)
Warmup Generations: A Task-Agnostic Approach for Guiding Sequence-to-Sequence Learning with Unsupervised Initial State Generation
by: Li, Senyu, et al.
Published: (2025)
by: Li, Senyu, et al.
Published: (2025)
SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
by: Li, Senyu, et al.
Published: (2025)
by: Li, Senyu, et al.
Published: (2025)
IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models
by: Adelani, David Ifeoluwa, et al.
Published: (2024)
by: Adelani, David Ifeoluwa, et al.
Published: (2024)
AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages
by: Uemura, Kosei, et al.
Published: (2025)
by: Uemura, Kosei, et al.
Published: (2025)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
by: Choi, Dasol, et al.
Published: (2026)
by: Choi, Dasol, et al.
Published: (2026)
Ibom NLP: A Step Toward Inclusive Natural Language Processing for Nigeria's Minority Languages
by: Kalejaiye, Oluwadara, et al.
Published: (2025)
by: Kalejaiye, Oluwadara, et al.
Published: (2025)
Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models
by: Benkirane, Kenza, et al.
Published: (2024)
by: Benkirane, Kenza, et al.
Published: (2024)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
by: Dong, Nguyen Tien, et al.
Published: (2025)
by: Dong, Nguyen Tien, et al.
Published: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
AfriHG: News headline generation for African Languages
by: Ogunremi, Toyib, et al.
Published: (2024)
by: Ogunremi, Toyib, et al.
Published: (2024)
Translation as a Scalable Proxy for Multilingual Evaluation
by: Issaka, Sheriff, et al.
Published: (2026)
by: Issaka, Sheriff, et al.
Published: (2026)
Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstition
by: Kim, Kyuhee, et al.
Published: (2025)
by: Kim, Kyuhee, et al.
Published: (2025)
OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
by: Ding, Deming, et al.
Published: (2026)
by: Ding, Deming, et al.
Published: (2026)
IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages
by: Hanif, Ikhlasul Akmal, et al.
Published: (2026)
by: Hanif, Ikhlasul Akmal, et al.
Published: (2026)
CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming
by: Chiu, Yu Ying, et al.
Published: (2024)
by: Chiu, Yu Ying, et al.
Published: (2024)
CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks
by: Lin, Peiqin, et al.
Published: (2026)
by: Lin, Peiqin, et al.
Published: (2026)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024)
by: Cui, Justin, et al.
Published: (2024)
MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation
by: Xu, Tianyi, et al.
Published: (2026)
by: Xu, Tianyi, et al.
Published: (2026)
IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages
by: Pattnayak, Priyaranjan, et al.
Published: (2026)
by: Pattnayak, Priyaranjan, et al.
Published: (2026)
Generating Benchmarks for Factuality Evaluation of Language Models
by: Muhlgay, Dor, et al.
Published: (2023)
by: Muhlgay, Dor, et al.
Published: (2023)
Generative AI for Immersive Communication: The Next Frontier in Internet-of-Senses Through 6G
by: Sehad, Nassim, et al.
Published: (2024)
by: Sehad, Nassim, et al.
Published: (2024)
AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models
by: Kang, Hankun, et al.
Published: (2026)
by: Kang, Hankun, et al.
Published: (2026)
Improving Multilingual Math Reasoning for African Languages
by: Ogundepo, Odunayo, et al.
Published: (2025)
by: Ogundepo, Odunayo, et al.
Published: (2025)
Merging Improves Self-Critique Against Jailbreak Attacks
by: Gallego, Victor
Published: (2024)
by: Gallego, Victor
Published: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
by: Zhou, Weikang, et al.
Published: (2024)
by: Zhou, Weikang, et al.
Published: (2024)
TaskBench: Benchmarking Large Language Models for Task Automation
by: Shen, Yongliang, et al.
Published: (2023)
by: Shen, Yongliang, et al.
Published: (2023)
Jailbreaking to Jailbreak
by: Kritz, Jeremy, et al.
Published: (2025)
by: Kritz, Jeremy, et al.
Published: (2025)
GraphicBench: A Planning Benchmark for Graphic Design with Language Agents
by: Ki, Dayeon, et al.
Published: (2025)
by: Ki, Dayeon, et al.
Published: (2025)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
by: Toraman, Çağrı, et al.
Published: (2026)
by: Toraman, Çağrı, et al.
Published: (2026)
JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models
by: Geng, Saibo, et al.
Published: (2025)
by: Geng, Saibo, et al.
Published: (2025)
Towards Geo-Culturally Grounded LLM Generations
by: Lertvittayakumjorn, Piyawat, et al.
Published: (2025)
by: Lertvittayakumjorn, Piyawat, et al.
Published: (2025)
Similar Items
-
AI Diffusion in Low Resource Language Countries
by: Misra, Amit, et al.
Published: (2025) -
Natural language processing for African languages
by: Adelani, David Ifeoluwa
Published: (2025) -
AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages
by: Yu, Hao, et al.
Published: (2026) -
BYOL: Bring Your Own Language Into LLMs
by: Zamir, Syed Waqas, et al.
Published: (2026) -
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
by: Ojo, Jessica, et al.
Published: (2025)