AraHalluEval: A Fine-grained Hallucination Evaluation Framework for Arabic LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Alansari, Aisha, Luqman, Hamzah |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HalluScore: Large Language Model Hallucination Question Answering Benchmark
di: Alansari, Aisha, et al.
Pubblicazione: (2026)
di: Alansari, Aisha, et al.
Pubblicazione: (2026)
AraReasoner: Evaluating Reasoning-Based LLMs for Arabic NLP
di: Hasanaath, Ahmed, et al.
Pubblicazione: (2025)
di: Hasanaath, Ahmed, et al.
Pubblicazione: (2025)
Multi-task Learning with Active Learning for Arabic Offensive Speech Detection
di: Alansari, Aisha, et al.
Pubblicazione: (2025)
di: Alansari, Aisha, et al.
Pubblicazione: (2025)
Large Language Models Hallucination: A Comprehensive Survey
di: Alansari, Aisha, et al.
Pubblicazione: (2025)
di: Alansari, Aisha, et al.
Pubblicazione: (2025)
AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic
di: Alghamdi, Emad A., et al.
Pubblicazione: (2024)
di: Alghamdi, Emad A., et al.
Pubblicazione: (2024)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
HalluClean: A Unified Framework to Combat Hallucinations in LLMs
di: Zhao, Yaxin, et al.
Pubblicazione: (2025)
di: Zhao, Yaxin, et al.
Pubblicazione: (2025)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
A Comparative Study of Continuous Sign Language Recognition Techniques
di: Alyami, Sarah, et al.
Pubblicazione: (2024)
di: Alyami, Sarah, et al.
Pubblicazione: (2024)
AraFinNews: Arabic Financial Summarisation with Domain-Adapted LLMs
di: El-Haj, Mo, et al.
Pubblicazione: (2025)
di: El-Haj, Mo, et al.
Pubblicazione: (2025)
PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions
di: Niazi, Ruhallah, et al.
Pubblicazione: (2026)
di: Niazi, Ruhallah, et al.
Pubblicazione: (2026)
DSC2025 -- ViHallu Challenge: Detecting Hallucination in Vietnamese LLMs
di: Nguyen, Anh Thi-Hoang, et al.
Pubblicazione: (2026)
di: Nguyen, Anh Thi-Hoang, et al.
Pubblicazione: (2026)
AraTable: Benchmarking LLMs' Reasoning and Understanding of Arabic Tabular Data
di: Alshaikh, Rana, et al.
Pubblicazione: (2025)
di: Alshaikh, Rana, et al.
Pubblicazione: (2025)
HalluSearch at SemEval-2025 Task 3: A Search-Enhanced RAG Pipeline for Hallucination Detection
di: Abdallah, Mohamed A., et al.
Pubblicazione: (2025)
di: Abdallah, Mohamed A., et al.
Pubblicazione: (2025)
HalluLens: LLM Hallucination Benchmark
di: Bang, Yejin, et al.
Pubblicazione: (2025)
di: Bang, Yejin, et al.
Pubblicazione: (2025)
Ara-HOPE: Human-Centric Post-Editing Evaluation for Dialectal Arabic to Modern Standard Arabic Translation
di: Alabdullah, Abdullah, et al.
Pubblicazione: (2025)
di: Alabdullah, Abdullah, et al.
Pubblicazione: (2025)
HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
di: Luo, Wen, et al.
Pubblicazione: (2024)
di: Luo, Wen, et al.
Pubblicazione: (2024)
HalluShift: Measuring Distribution Shifts towards Hallucination Detection in LLMs
di: Dasgupta, Sharanya, et al.
Pubblicazione: (2025)
di: Dasgupta, Sharanya, et al.
Pubblicazione: (2025)
AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects
di: Mustapha, Ahmad, et al.
Pubblicazione: (2024)
di: Mustapha, Ahmad, et al.
Pubblicazione: (2024)
HalluZig: Hallucination Detection using Zigzag Persistence
di: Samaga, Shreyas N., et al.
Pubblicazione: (2026)
di: Samaga, Shreyas N., et al.
Pubblicazione: (2026)
HalluCana: Fixing LLM Hallucination with A Canary Lookahead
di: Li, Tianyi, et al.
Pubblicazione: (2024)
di: Li, Tianyi, et al.
Pubblicazione: (2024)
AraS2P: Arabic Speech-to-Phonemes System
di: Matar, Bassam, et al.
Pubblicazione: (2025)
di: Matar, Bassam, et al.
Pubblicazione: (2025)
Ara-Best-RQ: Multi Dialectal Arabic SSL
di: Elleuch, Haroun, et al.
Pubblicazione: (2026)
di: Elleuch, Haroun, et al.
Pubblicazione: (2026)
AraSpot: Arabic Spoken Command Spotting
di: Salhab, Mahmoud, et al.
Pubblicazione: (2023)
di: Salhab, Mahmoud, et al.
Pubblicazione: (2023)
HalluCounter: Reference-free LLM Hallucination Detection in the Wild!
di: Urlana, Ashok, et al.
Pubblicazione: (2025)
di: Urlana, Ashok, et al.
Pubblicazione: (2025)
HalluEntity: Benchmarking and Understanding Entity-Level Hallucination Detection
di: Yeh, Min-Hsuan, et al.
Pubblicazione: (2025)
di: Yeh, Min-Hsuan, et al.
Pubblicazione: (2025)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
di: Khatun, Aisha, et al.
Pubblicazione: (2024)
di: Khatun, Aisha, et al.
Pubblicazione: (2024)
BUSTED at AraGenEval Shared Task: A Comparative Study of Transformer-Based Models for Arabic AI-Generated Text Detection
di: Zain, Ali, et al.
Pubblicazione: (2025)
di: Zain, Ali, et al.
Pubblicazione: (2025)
HalluHard: A Hard Multi-Turn Hallucination Benchmark
di: Fan, Dongyang, et al.
Pubblicazione: (2026)
di: Fan, Dongyang, et al.
Pubblicazione: (2026)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
di: Tang, Liyan, et al.
Pubblicazione: (2024)
di: Tang, Liyan, et al.
Pubblicazione: (2024)
AraSpider: Democratizing Arabic-to-SQL
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
di: Liu, Xuannan, et al.
Pubblicazione: (2026)
di: Liu, Xuannan, et al.
Pubblicazione: (2026)
HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs
di: Cherif, Ahmed
Pubblicazione: (2026)
di: Cherif, Ahmed
Pubblicazione: (2026)
AraSpell: A Deep Learning Approach for Arabic Spelling Correction
di: Salhab, Mahmoud, et al.
Pubblicazione: (2024)
di: Salhab, Mahmoud, et al.
Pubblicazione: (2024)
HalluDetect: Detecting, Mitigating, and Benchmarking Hallucinations in Conversational Systems in the Legal Domain
di: Anaokar, Spandan, et al.
Pubblicazione: (2025)
di: Anaokar, Spandan, et al.
Pubblicazione: (2025)
AraFinNLP 2024: The First Arabic Financial NLP Shared Task
di: Malaysha, Sanad, et al.
Pubblicazione: (2024)
di: Malaysha, Sanad, et al.
Pubblicazione: (2024)
A Large and Balanced Corpus for Fine-grained Arabic Readability Assessment
di: Elmadani, Khalid N., et al.
Pubblicazione: (2025)
di: Elmadani, Khalid N., et al.
Pubblicazione: (2025)
Guidelines for Fine-grained Sentence-level Arabic Readability Annotation
di: Habash, Nizar, et al.
Pubblicazione: (2024)
di: Habash, Nizar, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HalluScore: Large Language Model Hallucination Question Answering Benchmark
di: Alansari, Aisha, et al.
Pubblicazione: (2026) -
AraReasoner: Evaluating Reasoning-Based LLMs for Arabic NLP
di: Hasanaath, Ahmed, et al.
Pubblicazione: (2025) -
Multi-task Learning with Active Learning for Arabic Offensive Speech Detection
di: Alansari, Aisha, et al.
Pubblicazione: (2025) -
Large Language Models Hallucination: A Comprehensive Survey
di: Alansari, Aisha, et al.
Pubblicazione: (2025) -
AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic
di: Alghamdi, Emad A., et al.
Pubblicazione: (2024)