Saved in:
| Main Author: | Dahir, Khalid Yusuf |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2605.25420 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark
by: Dahir, Khalid Yusuf
Published: (2026)
by: Dahir, Khalid Yusuf
Published: (2026)
Large Language Model (LLM) Bias Index -- LLMBI
by: Oketunji, Abiodun Finbarrs, et al.
Published: (2023)
by: Oketunji, Abiodun Finbarrs, et al.
Published: (2023)
Leveraging Large Language Models for Accurate Sign Language Translation in Low-Resource Scenarios
by: Bulla, Luana, et al.
Published: (2025)
by: Bulla, Luana, et al.
Published: (2025)
Conceptual Engineering Using Large Language Models
by: Allen, Bradley P.
Published: (2023)
by: Allen, Bradley P.
Published: (2023)
Critical Foreign Policy Decisions (CFPD)-Benchmark: Measuring Diplomatic Preferences in Large Language Models
by: Jensen, Benjamin, et al.
Published: (2025)
by: Jensen, Benjamin, et al.
Published: (2025)
AustroTox: A Dataset for Target-Based Austrian German Offensive Language Detection
by: Pachinger, Pia, et al.
Published: (2024)
by: Pachinger, Pia, et al.
Published: (2024)
AI-Powered Detection of Inappropriate Language in Medical School Curricula
by: Salavati, Chiman, et al.
Published: (2025)
by: Salavati, Chiman, et al.
Published: (2025)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
by: Paech, Samuel J.
Published: (2023)
by: Paech, Samuel J.
Published: (2023)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
by: Ovcharov, Volodymyr
Published: (2026)
by: Ovcharov, Volodymyr
Published: (2026)
Fane at SemEval-2025 Task 10: Zero-Shot Entity Framing with Large Language Models
by: Fane, Enfa, et al.
Published: (2025)
by: Fane, Enfa, et al.
Published: (2025)
The Generation Gap: Exploring Age Bias in the Value Systems of Large Language Models
by: Liu, Siyang, et al.
Published: (2024)
by: Liu, Siyang, et al.
Published: (2024)
GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models
by: Bandooni, Ashutosh, et al.
Published: (2025)
by: Bandooni, Ashutosh, et al.
Published: (2025)
Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
by: Li, Bobo, et al.
Published: (2026)
by: Li, Bobo, et al.
Published: (2026)
A Study on the Vulnerability of Test Questions against ChatGPT-based Cheating
by: Ram, Shanker, et al.
Published: (2024)
by: Ram, Shanker, et al.
Published: (2024)
PerCul: A Story-Driven Cultural Evaluation of LLMs in Persian
by: Monazzah, Erfan Moosavi, et al.
Published: (2025)
by: Monazzah, Erfan Moosavi, et al.
Published: (2025)
The Democratic Paradox in Large Language Models' Underestimation of Press Freedom
by: Loaiza, I., et al.
Published: (2025)
by: Loaiza, I., et al.
Published: (2025)
The Need for Guardrails with Large Language Models in Medical Safety-Critical Settings: An Artificial Intelligence Application in the Pharmacovigilance Ecosystem
by: Hakim, Joe B, et al.
Published: (2024)
by: Hakim, Joe B, et al.
Published: (2024)
Rejected Dialects: Biases Against African American Language in Reward Models
by: Mire, Joel, et al.
Published: (2025)
by: Mire, Joel, et al.
Published: (2025)
ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection
by: Delaval, Axel, et al.
Published: (2025)
by: Delaval, Axel, et al.
Published: (2025)
Many LLMs Are More Utilitarian Than One
by: Keshmirian, Anita, et al.
Published: (2025)
by: Keshmirian, Anita, et al.
Published: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
by: Peters, Sydney, et al.
Published: (2025)
by: Peters, Sydney, et al.
Published: (2025)
Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models
by: Young, Richard J.
Published: (2026)
by: Young, Richard J.
Published: (2026)
Model Misalignment and Language Change: Traces of AI-Associated Language in Unscripted Spoken English
by: Anderson, Bryce, et al.
Published: (2025)
by: Anderson, Bryce, et al.
Published: (2025)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
by: Fadli, Samih
Published: (2025)
by: Fadli, Samih
Published: (2025)
ExpressivityBench: Can LLMs Communicate Implicitly?
by: Tint, Joshua, et al.
Published: (2024)
by: Tint, Joshua, et al.
Published: (2024)
Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasks
by: Uenal, Fatih
Published: (2026)
by: Uenal, Fatih
Published: (2026)
PetKaz at SemEval-2024 Task 8: Can Linguistics Capture the Specifics of LLM-generated Text?
by: Petukhova, Kseniia, et al.
Published: (2024)
by: Petukhova, Kseniia, et al.
Published: (2024)
USTCCTSU at SemEval-2024 Task 1: Reducing Anisotropy for Cross-lingual Semantic Textual Relatedness Task
by: Li, Jianjian, et al.
Published: (2024)
by: Li, Jianjian, et al.
Published: (2024)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
by: Saji, Alan, et al.
Published: (2025)
by: Saji, Alan, et al.
Published: (2025)
ACCORD: Closing the Commonsense Measurability Gap
by: Roewer-Després, François, et al.
Published: (2024)
by: Roewer-Després, François, et al.
Published: (2024)
University of Indonesia at SemEval-2025 Task 11: Evaluating State-of-the-Art Encoders for Multi-Label Emotion Detection
by: Hanif, Ikhlasul Akmal, et al.
Published: (2025)
by: Hanif, Ikhlasul Akmal, et al.
Published: (2025)
PetKaz at SemEval-2024 Task 3: Advancing Emotion Classification with an LLM for Emotion-Cause Pair Extraction in Conversations
by: Kazakov, Roman, et al.
Published: (2024)
by: Kazakov, Roman, et al.
Published: (2024)
Self-Anchored Attention Model for Sample-Efficient Classification of Prosocial Text Chat
by: Li, Zhuofang, et al.
Published: (2025)
by: Li, Zhuofang, et al.
Published: (2025)
Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models
by: Salla, Rohit Kumar, et al.
Published: (2025)
by: Salla, Rohit Kumar, et al.
Published: (2025)
MemeCraft: Contextual and Stance-Driven Multimodal Meme Generation
by: Wang, Han, et al.
Published: (2024)
by: Wang, Han, et al.
Published: (2024)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
by: Chen, Chen, et al.
Published: (2025)
by: Chen, Chen, et al.
Published: (2025)
PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI
by: Mukhopadhyay, Srija, et al.
Published: (2025)
by: Mukhopadhyay, Srija, et al.
Published: (2025)
Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment
by: Burleigh, Tyler
Published: (2026)
by: Burleigh, Tyler
Published: (2026)
Fairness Certification for Natural Language Processing and Large Language Models
by: Freiberger, Vincent, et al.
Published: (2024)
by: Freiberger, Vincent, et al.
Published: (2024)
From Guessing to Asking: An Approach to Resolving the Persona Knowledge Gap in LLMs during Multi-Turn Conversations
by: Baskar, Sarvesh, et al.
Published: (2025)
by: Baskar, Sarvesh, et al.
Published: (2025)
Similar Items
-
SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark
by: Dahir, Khalid Yusuf
Published: (2026) -
Large Language Model (LLM) Bias Index -- LLMBI
by: Oketunji, Abiodun Finbarrs, et al.
Published: (2023) -
Leveraging Large Language Models for Accurate Sign Language Translation in Low-Resource Scenarios
by: Bulla, Luana, et al.
Published: (2025) -
Conceptual Engineering Using Large Language Models
by: Allen, Bradley P.
Published: (2023) -
Critical Foreign Policy Decisions (CFPD)-Benchmark: Measuring Diplomatic Preferences in Large Language Models
by: Jensen, Benjamin, et al.
Published: (2025)