A Statistical Analysis of LLMs' Self-Evaluation Using Proverbs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sonoda, Ryosuke, Srinivasan, Ramya |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Zero-Shot AI-Generated Image Detection
par: Sonoda, Ryosuke, et autres
Publié: (2026)
par: Sonoda, Ryosuke, et autres
Publié: (2026)
Fair and Interpretable Deepfake Detection in Videos
par: Yoshii, Akihito, et autres
Publié: (2025)
par: Yoshii, Akihito, et autres
Publié: (2025)
Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Model
par: Wang, Minghan, et autres
Publié: (2025)
par: Wang, Minghan, et autres
Publié: (2025)
From Words to Proverbs: Evaluating LLMs Linguistic and Cultural Competence in Saudi Dialects with Absher
par: Al-Monef, Renad, et autres
Publié: (2025)
par: Al-Monef, Renad, et autres
Publié: (2025)
Are Multilingual LLMs Culturally-Diverse Reasoners? An Investigation into Multicultural Proverbs and Sayings
par: Liu, Chen Cecilia, et autres
Publié: (2023)
par: Liu, Chen Cecilia, et autres
Publié: (2023)
MasalBench: A Benchmark for Contextual and Cross-Cultural Understanding of Persian Proverbs in LLMs
par: Kalhor, Ghazal, et autres
Publié: (2026)
par: Kalhor, Ghazal, et autres
Publié: (2026)
ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language Understanding
par: Azime, Israel Abebe, et autres
Publié: (2024)
par: Azime, Israel Abebe, et autres
Publié: (2024)
Proverbs or Pythian Oracles? Sentiments and Emotions in Greek Sayings
par: Korre, Katerina, et autres
Publié: (2025)
par: Korre, Katerina, et autres
Publié: (2025)
Jawaher: A Multidialectal Dataset of Arabic Proverbs for LLM Benchmarking
par: Magdy, Samar M., et autres
Publié: (2025)
par: Magdy, Samar M., et autres
Publié: (2025)
FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language
par: Hosseini, Faezeh, et autres
Publié: (2026)
par: Hosseini, Faezeh, et autres
Publié: (2026)
A Closer Look at Logical Reasoning with LLMs: The Choice of Tool Matters
par: Lam, Long Hei Matthew, et autres
Publié: (2024)
par: Lam, Long Hei Matthew, et autres
Publié: (2024)
The Rarity Blind Spot: A Framework for Evaluating Statistical Reasoning in LLMs
par: Maekawa, Seiji, et autres
Publié: (2025)
par: Maekawa, Seiji, et autres
Publié: (2025)
Strategies for Improving NL-to-FOL Translation with LLMs: Data Generation, Incremental Fine-Tuning, and Verification
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2024)
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2024)
Automated Analysis of Learning Outcomes and Exam Questions Based on Bloom's Taxonomy
par: Kumar, Ramya, et autres
Publié: (2025)
par: Kumar, Ramya, et autres
Publié: (2025)
SLIM-LLMs: Modeling of Style-Sensory Language RelationshipsThrough Low-Dimensional Representations
par: Khalid, Osama, et autres
Publié: (2025)
par: Khalid, Osama, et autres
Publié: (2025)
The Statistical Signature of LLMs
par: Hadad, Ortal, et autres
Publié: (2026)
par: Hadad, Ortal, et autres
Publié: (2026)
Self-Distillation as a Performance Recovery Mechanism for LLMs: Counteracting Compression and Catastrophic Forgetting
par: Liu, Chi, et autres
Publié: (2026)
par: Liu, Chi, et autres
Publié: (2026)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
Advancing NLP Security by Leveraging LLMs as Adversarial Engines
par: Srinivasan, Sudarshan, et autres
Publié: (2024)
par: Srinivasan, Sudarshan, et autres
Publié: (2024)
Exploring Database Normalization Effects on SQL Generation
par: Kohita, Ryosuke
Publié: (2025)
par: Kohita, Ryosuke
Publié: (2025)
Bayesian Statistical Modeling with Predictors from LLMs
par: Franke, Michael, et autres
Publié: (2024)
par: Franke, Michael, et autres
Publié: (2024)
FactEHR: A Dataset for Evaluating Factuality in Clinical Notes Using LLMs
par: Munnangi, Monica, et autres
Publié: (2024)
par: Munnangi, Monica, et autres
Publié: (2024)
Compare without Despair: Reliable Preference Evaluation with Generation Separability
par: Ghosh, Sayan, et autres
Publié: (2024)
par: Ghosh, Sayan, et autres
Publié: (2024)
Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
DMDTEval: An Evaluation and Analysis of LLMs on Disambiguation in Multi-domain Translation
par: Man, Zhibo, et autres
Publié: (2025)
par: Man, Zhibo, et autres
Publié: (2025)
Exploring the Potential of LLMs as Personalized Assistants: Dataset, Evaluation, and Analysis
par: Mok, Jisoo, et autres
Publié: (2025)
par: Mok, Jisoo, et autres
Publié: (2025)
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
par: Liu, Zhiwei, et autres
Publié: (2025)
par: Liu, Zhiwei, et autres
Publié: (2025)
Relationship Detection on Tabular Data Using Statistical Analysis and Large Language Models
par: Koletsis, Panagiotis, et autres
Publié: (2025)
par: Koletsis, Panagiotis, et autres
Publié: (2025)
TaxoBell: Gaussian Box Embeddings for Self-Supervised Taxonomy Expansion
par: Mishra, Sahil, et autres
Publié: (2026)
par: Mishra, Sahil, et autres
Publié: (2026)
Comparative Analysis of Different Efficient Fine Tuning Methods of Large Language Models (LLMs) in Low-Resource Setting
par: Srinivasan, Krishna Prasad Varadarajan, et autres
Publié: (2024)
par: Srinivasan, Krishna Prasad Varadarajan, et autres
Publié: (2024)
Augmenting Bias Detection in LLMs Using Topological Data Analysis
par: Varadarajan, Keshav, et autres
Publié: (2025)
par: Varadarajan, Keshav, et autres
Publié: (2025)
JADS: A Framework for Self-supervised Joint Aspect Discovery and Summarization
par: Guo, Xiaobo, et autres
Publié: (2024)
par: Guo, Xiaobo, et autres
Publié: (2024)
SELT: Self-Evaluation Tree Search for LLMs with Task Decomposition
par: Wu, Mengsong, et autres
Publié: (2025)
par: Wu, Mengsong, et autres
Publié: (2025)
Cascaded Self-Evaluation Augmented Training for Lightweight Multimodal LLMs
par: Lv, Zheqi, et autres
Publié: (2025)
par: Lv, Zheqi, et autres
Publié: (2025)
Comprehensive Reassessment of Large-Scale Evaluation Outcomes in LLMs: A Multifaceted Statistical Approach
par: Sun, Kun, et autres
Publié: (2024)
par: Sun, Kun, et autres
Publié: (2024)
Emotionally Numb or Empathetic? Evaluating How LLMs Feel Using EmotionBench
par: Huang, Jen-tse, et autres
Publié: (2023)
par: Huang, Jen-tse, et autres
Publié: (2023)
Towards Self-Referential Analytic Assessment: A Profile-Based Approach to L2 Writing Evaluation with LLMs
par: Bannò, Stefano, et autres
Publié: (2026)
par: Bannò, Stefano, et autres
Publié: (2026)
Improving the Distributional Alignment of LLMs using Supervision
par: Kambhatla, Gauri, et autres
Publié: (2025)
par: Kambhatla, Gauri, et autres
Publié: (2025)
When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
par: Xu, Wenda, et autres
Publié: (2025)
par: Xu, Wenda, et autres
Publié: (2025)
A Step Towards Mixture of Grader: Statistical Analysis of Existing Automatic Evaluation Metrics
par: Soh, Yun Joon, et autres
Publié: (2024)
par: Soh, Yun Joon, et autres
Publié: (2024)
Documents similaires
-
Efficient Zero-Shot AI-Generated Image Detection
par: Sonoda, Ryosuke, et autres
Publié: (2026) -
Fair and Interpretable Deepfake Detection in Videos
par: Yoshii, Akihito, et autres
Publié: (2025) -
Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Model
par: Wang, Minghan, et autres
Publié: (2025) -
From Words to Proverbs: Evaluating LLMs Linguistic and Cultural Competence in Saudi Dialects with Absher
par: Al-Monef, Renad, et autres
Publié: (2025) -
Are Multilingual LLMs Culturally-Diverse Reasoners? An Investigation into Multicultural Proverbs and Sayings
par: Liu, Chen Cecilia, et autres
Publié: (2023)