TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Iranmanesh, Reihaneh, Davoudi, Saeedeh, Abrishamchian, Pasha, Frieder, Ophir, Goharian, Nazli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis
di: Davoudi, Saeedeh, et al.
Pubblicazione: (2026)
di: Davoudi, Saeedeh, et al.
Pubblicazione: (2026)
Genetic Approach to Mitigate Hallucination in Generative IR
di: Kulkarni, Hrishikesh, et al.
Pubblicazione: (2024)
di: Kulkarni, Hrishikesh, et al.
Pubblicazione: (2024)
Intercept Cancer: Cancer Pre-Screening with Large Scale Healthcare Foundation Models
di: Sun, Liwen, et al.
Pubblicazione: (2025)
di: Sun, Liwen, et al.
Pubblicazione: (2025)
Learning to Rank Salient Content for Query-focused Summarization
di: Sotudeh, Sajad, et al.
Pubblicazione: (2024)
di: Sotudeh, Sajad, et al.
Pubblicazione: (2024)
ASAG2024: A Combined Benchmark for Short Answer Grading
di: Meyer, Gérôme, et al.
Pubblicazione: (2024)
di: Meyer, Gérôme, et al.
Pubblicazione: (2024)
LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMs
di: Davoodi, Arash Gholami, et al.
Pubblicazione: (2024)
di: Davoodi, Arash Gholami, et al.
Pubblicazione: (2024)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
Explicit Diversity Conditions for Effective Question Answer Generation with Large Language Models
di: Yadav, Vikas, et al.
Pubblicazione: (2024)
di: Yadav, Vikas, et al.
Pubblicazione: (2024)
Benchmarking Large Language Models for Persian: A Preliminary Study Focusing on ChatGPT
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition
di: Yao, Siyang, et al.
Pubblicazione: (2026)
di: Yao, Siyang, et al.
Pubblicazione: (2026)
LexBoost: Improving Lexical Document Retrieval with Nearest Neighbors
di: Kulkarni, Hrishikesh, et al.
Pubblicazione: (2024)
di: Kulkarni, Hrishikesh, et al.
Pubblicazione: (2024)
Question-Answer Extraction from Scientific Articles Using Knowledge Graphs and Large Language Models
di: Azarbonyad, Hosein, et al.
Pubblicazione: (2025)
di: Azarbonyad, Hosein, et al.
Pubblicazione: (2025)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models
di: Davoodi, Arash Gholami, et al.
Pubblicazione: (2026)
di: Davoodi, Arash Gholami, et al.
Pubblicazione: (2026)
Persian Slang Text Conversion to Formal and Deep Learning of Persian Short Texts on Social Media for Sentiment Classification
di: Khazeni, Mohsen, et al.
Pubblicazione: (2024)
di: Khazeni, Mohsen, et al.
Pubblicazione: (2024)
Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering
di: Müller, Philip, et al.
Pubblicazione: (2026)
di: Müller, Philip, et al.
Pubblicazione: (2026)
Generating Text from Uniform Meaning Representation
di: Markle, Emma, et al.
Pubblicazione: (2025)
di: Markle, Emma, et al.
Pubblicazione: (2025)
A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian
di: Rogoz, Ana-Cristina, et al.
Pubblicazione: (2025)
di: Rogoz, Ana-Cristina, et al.
Pubblicazione: (2025)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
di: Yu, Zhou, et al.
Pubblicazione: (2023)
di: Yu, Zhou, et al.
Pubblicazione: (2023)
FaMTEB: Massive Text Embedding Benchmark in Persian Language
di: Zinvandi, Erfan, et al.
Pubblicazione: (2025)
di: Zinvandi, Erfan, et al.
Pubblicazione: (2025)
Are Large Language Models Good Temporal Graph Learners?
di: Huang, Shenyang, et al.
Pubblicazione: (2025)
di: Huang, Shenyang, et al.
Pubblicazione: (2025)
Student Answer Forecasting: Transformer-Driven Answer Choice Prediction for Language Learning
di: Gado, Elena Grazia, et al.
Pubblicazione: (2024)
di: Gado, Elena Grazia, et al.
Pubblicazione: (2024)
CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models
di: Wang, Song, et al.
Pubblicazione: (2024)
di: Wang, Song, et al.
Pubblicazione: (2024)
Large Language Models for Mathematicians
di: Frieder, Simon, et al.
Pubblicazione: (2023)
di: Frieder, Simon, et al.
Pubblicazione: (2023)
MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
di: Farsi, Farhan, et al.
Pubblicazione: (2025)
di: Farsi, Farhan, et al.
Pubblicazione: (2025)
Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition
di: Uddin, Mohammed Mudassir, et al.
Pubblicazione: (2026)
di: Uddin, Mohammed Mudassir, et al.
Pubblicazione: (2026)
CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question Answering
di: Liu, Yu, et al.
Pubblicazione: (2026)
di: Liu, Yu, et al.
Pubblicazione: (2026)
Do LLMs Find Human Answers To Fact-Driven Questions Perplexing? A Case Study on Reddit
di: Seegmiller, Parker, et al.
Pubblicazione: (2024)
di: Seegmiller, Parker, et al.
Pubblicazione: (2024)
Statistical Comparative Analysis of Semantic Similarities and Model Transferability Across Datasets for Short Answer Grading
di: Bonthu, Sridevi, et al.
Pubblicazione: (2025)
di: Bonthu, Sridevi, et al.
Pubblicazione: (2025)
Language Models Entangle Language and Culture
di: Jain, Shourya, et al.
Pubblicazione: (2026)
di: Jain, Shourya, et al.
Pubblicazione: (2026)
Correlating and Predicting Human Evaluations of Language Models from Natural Language Processing Benchmarks
di: Schaeffer, Rylan, et al.
Pubblicazione: (2025)
di: Schaeffer, Rylan, et al.
Pubblicazione: (2025)
When Not to Answer: Evaluating Prompts on GPT Models for Effective Abstention in Unanswerable Math Word Problems
di: Saadat, Asir, et al.
Pubblicazione: (2024)
di: Saadat, Asir, et al.
Pubblicazione: (2024)
Neural Isomorphic Fields: A Transformer-based Algebraic Numerical Embedding
di: Sadeghi, Hamidreza, et al.
Pubblicazione: (2026)
di: Sadeghi, Hamidreza, et al.
Pubblicazione: (2026)
On the Robustness of Answer Formats in Medical Reasoning Models
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023)
di: Liu, Yixin, et al.
Pubblicazione: (2023)
Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions
di: Li, Ruizhe, et al.
Pubblicazione: (2024)
di: Li, Ruizhe, et al.
Pubblicazione: (2024)
The Challenge of Achieving Attributability in Multilingual Table-to-Text Generation with Question-Answer Blueprints
di: Haussmann, Aden
Pubblicazione: (2025)
di: Haussmann, Aden
Pubblicazione: (2025)
Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models
di: Park, Jean, et al.
Pubblicazione: (2024)
di: Park, Jean, et al.
Pubblicazione: (2024)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
di: Romero, David, et al.
Pubblicazione: (2024)
di: Romero, David, et al.
Pubblicazione: (2024)
Calibrated Large Language Models for Binary Question Answering
di: Giovannotti, Patrizio, et al.
Pubblicazione: (2024)
di: Giovannotti, Patrizio, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis
di: Davoudi, Saeedeh, et al.
Pubblicazione: (2026) -
Genetic Approach to Mitigate Hallucination in Generative IR
di: Kulkarni, Hrishikesh, et al.
Pubblicazione: (2024) -
Intercept Cancer: Cancer Pre-Screening with Large Scale Healthcare Foundation Models
di: Sun, Liwen, et al.
Pubblicazione: (2025) -
Learning to Rank Salient Content for Query-focused Summarization
di: Sotudeh, Sajad, et al.
Pubblicazione: (2024) -
ASAG2024: A Combined Benchmark for Short Answer Grading
di: Meyer, Gérôme, et al.
Pubblicazione: (2024)