LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Davoodi, Arash Gholami, Davoudi, Seyed Pouyan Mousavi, Pezeshkpour, Pouya |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models
par: Davoodi, Arash Gholami, et autres
Publié: (2026)
par: Davoodi, Arash Gholami, et autres
Publié: (2026)
Collective Reasoning Among LLMs: A Framework for Answer Validation Without Ground Truth
par: Davoudi, Seyed Pouyan Mousavi, et autres
Publié: (2025)
par: Davoudi, Seyed Pouyan Mousavi, et autres
Publié: (2025)
uTeBC-NLP at SemEval-2024 Task 9: Can LLMs be Lateral Thinkers?
par: Sadeghi, Pouya, et autres
Publié: (2024)
par: Sadeghi, Pouya, et autres
Publié: (2024)
Insight-RAG: Enhancing LLMs with Insight-Driven Augmentation
par: Pezeshkpour, Pouya, et autres
Publié: (2025)
par: Pezeshkpour, Pouya, et autres
Publié: (2025)
Learning Beyond the Surface: How Far Can Continual Pre-Training with LoRA Enhance LLMs' Domain-Specific Insight Learning?
par: Pezeshkpour, Pouya, et autres
Publié: (2025)
par: Pezeshkpour, Pouya, et autres
Publié: (2025)
Equal Access, Unequal Interaction: A Counterfactual Audit of LLM Fairness
par: Amiri-Margavi, Alireza, et autres
Publié: (2026)
par: Amiri-Margavi, Alireza, et autres
Publié: (2026)
Vertex-Softmax: Tight Transformer Verification via Exact Softmax Optimization
par: Rezazadeh, Navid, et autres
Publié: (2026)
par: Rezazadeh, Navid, et autres
Publié: (2026)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
par: Hao, Yuren, et autres
Publié: (2025)
par: Hao, Yuren, et autres
Publié: (2025)
Enhancing Answer Reliability Through Inter-Model Consensus of Large Language Models
par: Amiri-Margavi, Alireza, et autres
Publié: (2024)
par: Amiri-Margavi, Alireza, et autres
Publié: (2024)
A Comprehensive Evaluation framework of Alignment Techniques for LLMs
par: Azmat, Muneeza, et autres
Publié: (2025)
par: Azmat, Muneeza, et autres
Publié: (2025)
Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models
par: Islam, Mohammed Saidul, et autres
Publié: (2026)
par: Islam, Mohammed Saidul, et autres
Publié: (2026)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Certifying Knowledge Comprehension in LLMs
par: Chaudhary, Isha, et autres
Publié: (2024)
par: Chaudhary, Isha, et autres
Publié: (2024)
TopicTag: Automatic Annotation of NMF Topic Models Using Chain of Thought and Prompt Tuning with LLMs
par: Wanna, Selma, et autres
Publié: (2024)
par: Wanna, Selma, et autres
Publié: (2024)
Evaluating the Generalization Ability of Quantized LLMs: Benchmark, Analysis, and Toolbox
par: Liu, Yijun, et autres
Publié: (2024)
par: Liu, Yijun, et autres
Publié: (2024)
Data Doping or True Intelligence? Evaluating the Transferability of Injected Knowledge in LLMs
par: Jan, Essa, et autres
Publié: (2025)
par: Jan, Essa, et autres
Publié: (2025)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks
par: Wang, Jianghui, et autres
Publié: (2025)
par: Wang, Jianghui, et autres
Publié: (2025)
AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs
par: Pezeshkpour, Pouya, et autres
Publié: (2026)
par: Pezeshkpour, Pouya, et autres
Publié: (2026)
From Task Solving to Robust Real-World Adaptation in LLM Agents
par: Pezeshkpour, Pouya, et autres
Publié: (2026)
par: Pezeshkpour, Pouya, et autres
Publié: (2026)
Multi-Conditional Ranking with Large Language Models
par: Pezeshkpour, Pouya, et autres
Publié: (2024)
par: Pezeshkpour, Pouya, et autres
Publié: (2024)
Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency
par: Smith, Matthew L., et autres
Publié: (2026)
par: Smith, Matthew L., et autres
Publié: (2026)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025)
par: Batra, Hunar, et autres
Publié: (2025)
Comprehensive Reassessment of Large-Scale Evaluation Outcomes in LLMs: A Multifaceted Statistical Approach
par: Sun, Kun, et autres
Publié: (2024)
par: Sun, Kun, et autres
Publié: (2024)
Efficient Exploration for LLMs
par: Dwaracherla, Vikranth, et autres
Publié: (2024)
par: Dwaracherla, Vikranth, et autres
Publié: (2024)
Learning Beyond Pattern Matching? Assaying Mathematical Understanding in LLMs
par: Guo, Siyuan, et autres
Publié: (2024)
par: Guo, Siyuan, et autres
Publié: (2024)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
par: Yu, Erxin, et autres
Publié: (2025)
par: Yu, Erxin, et autres
Publié: (2025)
ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
tinyBenchmarks: evaluating LLMs with fewer examples
par: Polo, Felipe Maia, et autres
Publié: (2024)
par: Polo, Felipe Maia, et autres
Publié: (2024)
Evaluating Prompt Engineering Techniques for Accuracy and Confidence Elicitation in Medical LLMs
par: Naderi, Nariman, et autres
Publié: (2025)
par: Naderi, Nariman, et autres
Publié: (2025)
WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia
par: Hou, Yufang, et autres
Publié: (2024)
par: Hou, Yufang, et autres
Publié: (2024)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
Time-R1: Towards Comprehensive Temporal Reasoning in LLMs
par: Liu, Zijia, et autres
Publié: (2025)
par: Liu, Zijia, et autres
Publié: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
AgentBench: Evaluating LLMs as Agents
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
Forget What You Know about LLMs Evaluations -- LLMs are Like a Chameleon
par: Cohen-Inger, Nurit, et autres
Publié: (2025)
par: Cohen-Inger, Nurit, et autres
Publié: (2025)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
par: Dang, John, et autres
Publié: (2024)
par: Dang, John, et autres
Publié: (2024)
From Blind Solvers to Logical Thinkers: Benchmarking LLMs' Logical Integrity on Faulty Mathematical Problems
par: Rahman, A M Muntasir, et autres
Publié: (2024)
par: Rahman, A M Muntasir, et autres
Publié: (2024)
PLANET: A Collection of Benchmarks for Evaluating LLMs' Planning Capabilities
par: Li, Haoming, et autres
Publié: (2025)
par: Li, Haoming, et autres
Publié: (2025)
Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows
par: Xu, Wanghan, et autres
Publié: (2025)
par: Xu, Wanghan, et autres
Publié: (2025)
Documents similaires
-
Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models
par: Davoodi, Arash Gholami, et autres
Publié: (2026) -
Collective Reasoning Among LLMs: A Framework for Answer Validation Without Ground Truth
par: Davoudi, Seyed Pouyan Mousavi, et autres
Publié: (2025) -
uTeBC-NLP at SemEval-2024 Task 9: Can LLMs be Lateral Thinkers?
par: Sadeghi, Pouya, et autres
Publié: (2024) -
Insight-RAG: Enhancing LLMs with Insight-Driven Augmentation
par: Pezeshkpour, Pouya, et autres
Publié: (2025) -
Learning Beyond the Surface: How Far Can Continual Pre-Training with LoRA Enhance LLMs' Domain-Specific Insight Learning?
par: Pezeshkpour, Pouya, et autres
Publié: (2025)