ALPS: A Diagnostic Challenge Set for Arabic Linguistic & Pragmatic Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Al-Olimat, Hussein S., Alshareef, Ahmad |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ALARB: An Arabic Legal Argument Reasoning Benchmark
von: Shairah, Harethah Abu, et al.
Veröffentlicht: (2025)
von: Shairah, Harethah Abu, et al.
Veröffentlicht: (2025)
Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs
von: Alwajih, Fakhraddin, et al.
Veröffentlicht: (2025)
von: Alwajih, Fakhraddin, et al.
Veröffentlicht: (2025)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
von: Hijazi, Faris, et al.
Veröffentlicht: (2024)
von: Hijazi, Faris, et al.
Veröffentlicht: (2024)
Poem Meter Classification of Recited Arabic Poetry: Integrating High-Resource Systems for a Low-Resource Task
von: Al-Shaibani, Maged S., et al.
Veröffentlicht: (2025)
von: Al-Shaibani, Maged S., et al.
Veröffentlicht: (2025)
Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models
von: Chun, Jon, et al.
Veröffentlicht: (2026)
von: Chun, Jon, et al.
Veröffentlicht: (2026)
AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects
von: Mustapha, Ahmad, et al.
Veröffentlicht: (2024)
von: Mustapha, Ahmad, et al.
Veröffentlicht: (2024)
Benchmarking the Legal Reasoning of LLMs in Arabic Islamic Inheritance Cases
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2025)
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2025)
A Survey of Large Language Models for Arabic Language and its Dialects
von: Mashaabi, Malak, et al.
Veröffentlicht: (2024)
von: Mashaabi, Malak, et al.
Veröffentlicht: (2024)
SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning
von: Elbadry, Rania, et al.
Veröffentlicht: (2026)
von: Elbadry, Rania, et al.
Veröffentlicht: (2026)
Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German
von: Abdoli, Sajjad, et al.
Veröffentlicht: (2026)
von: Abdoli, Sajjad, et al.
Veröffentlicht: (2026)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2025)
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2025)
The Qiyas Benchmark: Measuring ChatGPT Mathematical and Language Understanding in Arabic
von: Al-Khalifa, Shahad, et al.
Veröffentlicht: (2024)
von: Al-Khalifa, Shahad, et al.
Veröffentlicht: (2024)
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
von: Chen, Hao, et al.
Veröffentlicht: (2025)
von: Chen, Hao, et al.
Veröffentlicht: (2025)
SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation
von: Khalil, Mohammad Amer, et al.
Veröffentlicht: (2026)
von: Khalil, Mohammad Amer, et al.
Veröffentlicht: (2026)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
von: Zbeeb, Mohammad, et al.
Veröffentlicht: (2025)
von: Zbeeb, Mohammad, et al.
Veröffentlicht: (2025)
Ar-Spider: Text-to-SQL in Arabic
von: Almohaimeed, Saleh, et al.
Veröffentlicht: (2024)
von: Almohaimeed, Saleh, et al.
Veröffentlicht: (2024)
BengaliFig: A Low-Resource Challenge for Figurative and Culturally Grounded Reasoning in Bengali
von: Sefat, Abdullah Al
Veröffentlicht: (2025)
von: Sefat, Abdullah Al
Veröffentlicht: (2025)
Pragmatic Reasoning improves LLM Code Generation
von: Cao, Zhuchen, et al.
Veröffentlicht: (2025)
von: Cao, Zhuchen, et al.
Veröffentlicht: (2025)
Fanar 2.0: Arabic Generative AI Stack
von: FANAR TEAM, et al.
Veröffentlicht: (2026)
von: FANAR TEAM, et al.
Veröffentlicht: (2026)
The Arabic AI Fingerprint: Stylometric Analysis and Detection of Large Language Models Text
von: Al-Shaibani, Maged S., et al.
Veröffentlicht: (2025)
von: Al-Shaibani, Maged S., et al.
Veröffentlicht: (2025)
Inductive Linguistic Reasoning with Large Language Models
von: Ramji, Raghav, et al.
Veröffentlicht: (2024)
von: Ramji, Raghav, et al.
Veröffentlicht: (2024)
A comprehensive survey of contemporary Arabic sentiment analysis: Methods, Challenges, and Future Directions
von: Shi, Zhiqiang, et al.
Veröffentlicht: (2025)
von: Shi, Zhiqiang, et al.
Veröffentlicht: (2025)
Pragmatic Inference Chain (PIC) Improving LLMs' Reasoning of Authentic Implicit Toxic Language
von: Chen, Xi, et al.
Veröffentlicht: (2025)
von: Chen, Xi, et al.
Veröffentlicht: (2025)
AraTable: Benchmarking LLMs' Reasoning and Understanding of Arabic Tabular Data
von: Alshaikh, Rana, et al.
Veröffentlicht: (2025)
von: Alshaikh, Rana, et al.
Veröffentlicht: (2025)
BALSAM: A Platform for Benchmarking Arabic Large Language Models
von: Al-Matham, Rawan, et al.
Veröffentlicht: (2025)
von: Al-Matham, Rawan, et al.
Veröffentlicht: (2025)
ALLaM: Large Language Models for Arabic and English
von: Bari, M Saiful, et al.
Veröffentlicht: (2024)
von: Bari, M Saiful, et al.
Veröffentlicht: (2024)
From Human Annotation to Automation: LLM-in-the-Loop Active Learning for Arabic Sentiment Analysis
von: Refai, Dania, et al.
Veröffentlicht: (2025)
von: Refai, Dania, et al.
Veröffentlicht: (2025)
Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs
von: Cheng, Myra, et al.
Veröffentlicht: (2026)
von: Cheng, Myra, et al.
Veröffentlicht: (2026)
Sadeed: Advancing Arabic Diacritization Through Small Language Model
von: Aldallal, Zeina, et al.
Veröffentlicht: (2025)
von: Aldallal, Zeina, et al.
Veröffentlicht: (2025)
Can Linguistically Related Languages Guide LLM Translation in Low-Resource Settings?
von: Ramasethu, Aishwarya, et al.
Veröffentlicht: (2026)
von: Ramasethu, Aishwarya, et al.
Veröffentlicht: (2026)
The Arabic Generality Score: Another Dimension of Modeling Arabic Dialectness
von: Shaban, Sanad, et al.
Veröffentlicht: (2025)
von: Shaban, Sanad, et al.
Veröffentlicht: (2025)
JEEM: Vision-Language Understanding in Four Arabic Dialects
von: Kadaoui, Karima, et al.
Veröffentlicht: (2025)
von: Kadaoui, Karima, et al.
Veröffentlicht: (2025)
A New Benchmark for Evaluating Automatic Speech Recognition in the Arabic Call Domain
von: Obaidah, Qusai Abo, et al.
Veröffentlicht: (2024)
von: Obaidah, Qusai Abo, et al.
Veröffentlicht: (2024)
Kuwain 1.5B: An Arabic SLM via Language Injection
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
Arabic Little STT: Arabic Children Speech Recognition Dataset
von: Alkadri, Mouhand, et al.
Veröffentlicht: (2025)
von: Alkadri, Mouhand, et al.
Veröffentlicht: (2025)
AraModernBERT: Transtokenized Initialization and Long-Context Encoder Modeling for Arabic
von: Elshehy, Omar, et al.
Veröffentlicht: (2026)
von: Elshehy, Omar, et al.
Veröffentlicht: (2026)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
von: Alhumud, Anas, et al.
Veröffentlicht: (2026)
von: Alhumud, Anas, et al.
Veröffentlicht: (2026)
Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
von: Yang, Wen, et al.
Veröffentlicht: (2025)
von: Yang, Wen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ALARB: An Arabic Legal Argument Reasoning Benchmark
von: Shairah, Harethah Abu, et al.
Veröffentlicht: (2025) -
Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs
von: Alwajih, Fakhraddin, et al.
Veröffentlicht: (2025) -
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
von: Hijazi, Faris, et al.
Veröffentlicht: (2024) -
Poem Meter Classification of Recited Arabic Poetry: Integrating High-Resource Systems for a Low-Resource Task
von: Al-Shaibani, Maged S., et al.
Veröffentlicht: (2025) -
Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)