Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghahroodi, Omid, Nouri, Marzia, Sanian, Mohammad Vali, Sahebi, Alireza, Dastgheib, Doratossadat, Asgari, Ehsaneddin, Baghshah, Mahdieh Soleymani, Rohban, Mohammad Hossein |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MEENA (PersianMMMU): Multimodal-Multilingual Educational Exams for N-level Assessment
di: Ghahroodi, Omid, et al.
Pubblicazione: (2025)
di: Ghahroodi, Omid, et al.
Pubblicazione: (2025)
The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation
di: Marioriyad, Arash, et al.
Pubblicazione: (2026)
di: Marioriyad, Arash, et al.
Pubblicazione: (2026)
Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing
di: Marioriyad, Arash, et al.
Pubblicazione: (2026)
di: Marioriyad, Arash, et al.
Pubblicazione: (2026)
The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge
di: Marioriyad, Arash, et al.
Pubblicazione: (2025)
di: Marioriyad, Arash, et al.
Pubblicazione: (2025)
Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP Models
di: Abbasi, Reza, et al.
Pubblicazione: (2024)
di: Abbasi, Reza, et al.
Pubblicazione: (2024)
Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
ELAB: Extensive LLM Alignment Benchmark in Persian Language
di: Pourbahman, Zahra, et al.
Pubblicazione: (2025)
di: Pourbahman, Zahra, et al.
Pubblicazione: (2025)
Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
di: Abbasi, Reza, et al.
Pubblicazione: (2024)
di: Abbasi, Reza, et al.
Pubblicazione: (2024)
Persian MusicGen: A Large-Scale Dataset and Culturally-Aware Generative Model for Persian Music
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2026)
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2026)
Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models
di: Rezaei, Parham, et al.
Pubblicazione: (2025)
di: Rezaei, Parham, et al.
Pubblicazione: (2025)
Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
Persian Musical Instruments Classification Using Polyphonic Data Augmentation
di: Esfangereh, Diba Hadi, et al.
Pubblicazione: (2025)
di: Esfangereh, Diba Hadi, et al.
Pubblicazione: (2025)
Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
Limits and Gains of Test-Time Scaling in Vision-Language Reasoning
di: Ahmadpour, Mohammadjavad, et al.
Pubblicazione: (2025)
di: Ahmadpour, Mohammadjavad, et al.
Pubblicazione: (2025)
Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2025)
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2025)
No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2025)
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2025)
Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2026)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2026)
Khayyam Offline Persian Handwriting Dataset
di: Jafarzadeh, Pourya, et al.
Pubblicazione: (2024)
di: Jafarzadeh, Pourya, et al.
Pubblicazione: (2024)
ADAM: A Diverse Archive of Mankind for Evaluating and Enhancing LLMs in Biographical Reasoning
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
Large Language Models for Scientific Idea Generation: A Creativity-Centered Survey
di: Shahhosseini, Fatemeh, et al.
Pubblicazione: (2025)
di: Shahhosseini, Fatemeh, et al.
Pubblicazione: (2025)
SUSD: Structured Unsupervised Skill Discovery through State Factorization
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2026)
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2026)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
LibraGrad: Balancing Gradient Flow for Universally Better Vision Transformer Attributions
di: Mehri, Faridoun, et al.
Pubblicazione: (2024)
di: Mehri, Faridoun, et al.
Pubblicazione: (2024)
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2024)
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2024)
ParsiPy: NLP Toolkit for Historical Persian Texts in Python
di: Farsi, Farhan, et al.
Pubblicazione: (2025)
di: Farsi, Farhan, et al.
Pubblicazione: (2025)
CER: Confidence Enhanced Reasoning in LLMs
di: Razghandi, Ali, et al.
Pubblicazione: (2025)
di: Razghandi, Ali, et al.
Pubblicazione: (2025)
Efficient Adversarial Attacks on High-dimensional Offline Bandits
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2026)
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2026)
VQEL: Enabling Self-Play in Emergent Language Games via Agent-Internal Vector Quantization
di: Paqaleh, Mohammad Mahdi Samiei, et al.
Pubblicazione: (2025)
di: Paqaleh, Mohammad Mahdi Samiei, et al.
Pubblicazione: (2025)
Unspoken Hints: Accuracy Without Acknowledgement in LLM Reasoning
di: Marioriyad, Arash, et al.
Pubblicazione: (2025)
di: Marioriyad, Arash, et al.
Pubblicazione: (2025)
RODEO: Robust Outlier Detection via Exposing Adaptive Out-of-Distribution Samples
di: Mirzaei, Hossein, et al.
Pubblicazione: (2025)
di: Mirzaei, Hossein, et al.
Pubblicazione: (2025)
CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
Dilated Balanced Cross Entropy Loss for Medical Image Segmentation
di: Hosseini, Seyed Mohsen, et al.
Pubblicazione: (2024)
di: Hosseini, Seyed Mohsen, et al.
Pubblicazione: (2024)
Evaluation of optical depth from MODIS satellite imagery in the Persian Gulf
di: Soleimany, Arezoo, et al.
Pubblicazione: (2016)
di: Soleimany, Arezoo, et al.
Pubblicazione: (2016)
PersianRAG: A Retrieval-Augmented Generation System for Persian Language
di: Hosseini, Hossein, et al.
Pubblicazione: (2024)
di: Hosseini, Hossein, et al.
Pubblicazione: (2024)
LRW-Persian: Lip-reading in the Wild Dataset for Persian Language
di: Taghizadeh, Zahra, et al.
Pubblicazione: (2025)
di: Taghizadeh, Zahra, et al.
Pubblicazione: (2025)
Validation of aerosol optical depth using AERONET ground stations in marine areas (Case Study: Persian Gulf)
di: Farhadi, Saeid, et al.
Pubblicazione: (2018)
di: Farhadi, Saeid, et al.
Pubblicazione: (2018)
GABInsight: Exploring Gender-Activity Binding Bias in Vision-Language Models
di: Abdollahi, Ali, et al.
Pubblicazione: (2024)
di: Abdollahi, Ali, et al.
Pubblicazione: (2024)
LLM-Agent-Controller: A Universal Multi-Agent Large Language Model System as a Control Engineer
di: Zahedifar, Rasoul, et al.
Pubblicazione: (2025)
di: Zahedifar, Rasoul, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MEENA (PersianMMMU): Multimodal-Multilingual Educational Exams for N-level Assessment
di: Ghahroodi, Omid, et al.
Pubblicazione: (2025) -
The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation
di: Marioriyad, Arash, et al.
Pubblicazione: (2026) -
Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing
di: Marioriyad, Arash, et al.
Pubblicazione: (2026) -
The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge
di: Marioriyad, Arash, et al.
Pubblicazione: (2025) -
Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP Models
di: Abbasi, Reza, et al.
Pubblicazione: (2024)