PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Hosseini, Mohammad, Hosseini, Kimia, Bali, Shayan, Zanjani, Zahra, Momtazi, Saeedeh |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language
by: Hosseini, Faezeh, et al.
Published: (2026)
by: Hosseini, Faezeh, et al.
Published: (2026)
MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
by: Farsi, Farhan, et al.
Published: (2025)
by: Farsi, Farhan, et al.
Published: (2025)
Hybrid Dialogue State Tracking for Persian Chatbots: A Language Model-Based Approach
by: Aghabagher, Samin Mahdipour, et al.
Published: (2025)
by: Aghabagher, Samin Mahdipour, et al.
Published: (2025)
FarsiMCQGen: a Persian Multiple-choice Question Generation Framework
by: Rad, Mohammad Heydari, et al.
Published: (2025)
by: Rad, Mohammad Heydari, et al.
Published: (2025)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
by: Adib, Shefayat E Shams, et al.
Published: (2026)
by: Adib, Shefayat E Shams, et al.
Published: (2026)
HalluScore: Large Language Model Hallucination Question Answering Benchmark
by: Alansari, Aisha, et al.
Published: (2026)
by: Alansari, Aisha, et al.
Published: (2026)
E2TP: Element to Tuple Prompting Improves Aspect Sentiment Tuple Prediction
by: Mohammadkhani, Mohammad Ghiasvand, et al.
Published: (2024)
by: Mohammadkhani, Mohammad Ghiasvand, et al.
Published: (2024)
PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models
by: Farsi, Farhan, et al.
Published: (2025)
by: Farsi, Farhan, et al.
Published: (2025)
AraHalluEval: A Fine-grained Hallucination Evaluation Framework for Arabic LLMs
by: Alansari, Aisha, et al.
Published: (2025)
by: Alansari, Aisha, et al.
Published: (2025)
EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models
by: Mirbagheri, Mohammad Reza, et al.
Published: (2025)
by: Mirbagheri, Mohammad Reza, et al.
Published: (2025)
PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions
by: Niazi, Ruhallah, et al.
Published: (2026)
by: Niazi, Ruhallah, et al.
Published: (2026)
HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
by: Luo, Wen, et al.
Published: (2024)
by: Luo, Wen, et al.
Published: (2024)
Large Language Models for Persian $ \leftrightarrow $ English Idiom Translation
by: Rezaeimanesh, Sara, et al.
Published: (2024)
by: Rezaeimanesh, Sara, et al.
Published: (2024)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
by: Jamali, Naghmeh, et al.
Published: (2025)
by: Jamali, Naghmeh, et al.
Published: (2025)
HalluLens: LLM Hallucination Benchmark
by: Bang, Yejin, et al.
Published: (2025)
by: Bang, Yejin, et al.
Published: (2025)
PersianRAG: A Retrieval-Augmented Generation System for Persian Language
by: Hosseini, Hossein, et al.
Published: (2024)
by: Hosseini, Hossein, et al.
Published: (2024)
TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
by: Iranmanesh, Reihaneh, et al.
Published: (2026)
by: Iranmanesh, Reihaneh, et al.
Published: (2026)
Neural Isomorphic Fields: A Transformer-based Algebraic Numerical Embedding
by: Sadeghi, Hamidreza, et al.
Published: (2026)
by: Sadeghi, Hamidreza, et al.
Published: (2026)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
by: Pandit, Shrey, et al.
Published: (2025)
by: Pandit, Shrey, et al.
Published: (2025)
HalluEntity: Benchmarking and Understanding Entity-Level Hallucination Detection
by: Yeh, Min-Hsuan, et al.
Published: (2025)
by: Yeh, Min-Hsuan, et al.
Published: (2025)
AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
by: Liu, Xuannan, et al.
Published: (2026)
by: Liu, Xuannan, et al.
Published: (2026)
HalluSAE: Detecting Hallucinations in Large Language Models via Sparse Auto-Encoders
by: Chen, Boshui, et al.
Published: (2026)
by: Chen, Boshui, et al.
Published: (2026)
HalluHard: A Hard Multi-Turn Hallucination Benchmark
by: Fan, Dongyang, et al.
Published: (2026)
by: Fan, Dongyang, et al.
Published: (2026)
Distributive Fairness in Large Language Models: Evaluating Alignment with Human Values
by: Hosseini, Hadi, et al.
Published: (2025)
by: Hosseini, Hadi, et al.
Published: (2025)
HalluDetect: Detecting, Mitigating, and Benchmarking Hallucinations in Conversational Systems in the Legal Domain
by: Anaokar, Spandan, et al.
Published: (2025)
by: Anaokar, Spandan, et al.
Published: (2025)
OnionEval: An Unified Evaluation of Fact-conflicting Hallucination for Small-Large Language Models
by: Sun, Chongren, et al.
Published: (2025)
by: Sun, Chongren, et al.
Published: (2025)
HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
by: Liu, Emmy, et al.
Published: (2026)
by: Liu, Emmy, et al.
Published: (2026)
HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild
by: Zhu, Zhiying, et al.
Published: (2024)
by: Zhu, Zhiying, et al.
Published: (2024)
RFBES at SemEval-2024 Task 8: Investigating Syntactic and Semantic Features for Distinguishing AI-Generated and Human-Written Texts
by: Rad, Mohammad Heydari, et al.
Published: (2024)
by: Rad, Mohammad Heydari, et al.
Published: (2024)
HalluSearch at SemEval-2025 Task 3: A Search-Enhanced RAG Pipeline for Hallucination Detection
by: Abdallah, Mohamed A., et al.
Published: (2025)
by: Abdallah, Mohamed A., et al.
Published: (2025)
Old wine in old glasses: Comparing computational and qualitative methods in identifying incivility on Persian Twitter during the #MahsaAmini movement
by: Kermani, Hossein, et al.
Published: (2026)
by: Kermani, Hossein, et al.
Published: (2026)
HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
by: Abdaljalil, Samir, et al.
Published: (2025)
by: Abdaljalil, Samir, et al.
Published: (2025)
HalluZig: Hallucination Detection using Zigzag Persistence
by: Samaga, Shreyas N., et al.
Published: (2026)
by: Samaga, Shreyas N., et al.
Published: (2026)
HalluCounter: Reference-free LLM Hallucination Detection in the Wild!
by: Urlana, Ashok, et al.
Published: (2025)
by: Urlana, Ashok, et al.
Published: (2025)
HalluClean: A Unified Framework to Combat Hallucinations in LLMs
by: Zhao, Yaxin, et al.
Published: (2025)
by: Zhao, Yaxin, et al.
Published: (2025)
HalluCana: Fixing LLM Hallucination with A Canary Lookahead
by: Li, Tianyi, et al.
Published: (2024)
by: Li, Tianyi, et al.
Published: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
by: Shen, Tianhao, et al.
Published: (2023)
by: Shen, Tianhao, et al.
Published: (2023)
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
by: Kumar, Mahesh, et al.
Published: (2026)
by: Kumar, Mahesh, et al.
Published: (2026)
HalluMix: A Task-Agnostic, Multi-Domain Benchmark for Real-World Hallucination Detection
by: Emery, Deanna, et al.
Published: (2025)
by: Emery, Deanna, et al.
Published: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
Similar Items
-
FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language
by: Hosseini, Faezeh, et al.
Published: (2026) -
MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
by: Farsi, Farhan, et al.
Published: (2025) -
Hybrid Dialogue State Tracking for Persian Chatbots: A Language Model-Based Approach
by: Aghabagher, Samin Mahdipour, et al.
Published: (2025) -
FarsiMCQGen: a Persian Multiple-choice Question Generation Framework
by: Rad, Mohammad Heydari, et al.
Published: (2025) -
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
by: Adib, Shefayat E Shams, et al.
Published: (2026)