GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jiaxin, Li, Zhongzhi, Zhang, Mingliang, Yin, Fei, Liu, Chenglin, Moshfeghi, Yashar |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GOLD: Geometry Problem Solver with Natural Language Description
par: Zhang, Jiaxin, et autres
Publié: (2024)
par: Zhang, Jiaxin, et autres
Publié: (2024)
GAPS: Geometry-Aware Problem Solver
par: Zhang, Jiaxin, et autres
Publié: (2024)
par: Zhang, Jiaxin, et autres
Publié: (2024)
PRISM: A Methodology for Auditing Biases in Large Language Models
par: Azzopardi, Leif, et autres
Publié: (2024)
par: Azzopardi, Leif, et autres
Publié: (2024)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
par: Zhang, Mengyuan, et autres
Publié: (2024)
par: Zhang, Mengyuan, et autres
Publié: (2024)
Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving
par: Zhou, Yuxuan, et autres
Publié: (2025)
par: Zhou, Yuxuan, et autres
Publié: (2025)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
par: Shu, Lei, et autres
Publié: (2023)
par: Shu, Lei, et autres
Publié: (2023)
MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model
par: Yang, Zhen, et autres
Publié: (2024)
par: Yang, Zhen, et autres
Publié: (2024)
Teaching LLMs According to Their Aptitude: Adaptive Reasoning for Mathematical Problem Solving
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
par: Fang, Meng, et autres
Publié: (2024)
par: Fang, Meng, et autres
Publié: (2024)
Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
par: Zheng, Shunfeng, et autres
Publié: (2025)
par: Zheng, Shunfeng, et autres
Publié: (2025)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
par: Krechetova, Varvara, et autres
Publié: (2025)
par: Krechetova, Varvara, et autres
Publié: (2025)
RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs
par: Huang, Zhongzhan, et autres
Publié: (2025)
par: Huang, Zhongzhan, et autres
Publié: (2025)
EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving
par: Fu, Daocheng, et autres
Publié: (2025)
par: Fu, Daocheng, et autres
Publié: (2025)
Multi-Head RAG: Solving Multi-Aspect Problems with LLMs
par: Besta, Maciej, et autres
Publié: (2024)
par: Besta, Maciej, et autres
Publié: (2024)
Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Enhancing the Geometric Problem-Solving Ability of Multimodal LLMs via Symbolic-Neural Integration
par: Pan, Yicheng, et autres
Publié: (2025)
par: Pan, Yicheng, et autres
Publié: (2025)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
par: Jubair, Sheikh, et autres
Publié: (2025)
par: Jubair, Sheikh, et autres
Publié: (2025)
Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark
par: Choi, Minje, et autres
Publié: (2023)
par: Choi, Minje, et autres
Publié: (2023)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
par: Tang, Liyan, et autres
Publié: (2024)
par: Tang, Liyan, et autres
Publié: (2024)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
par: Li, Zhong-Zhi, et autres
Publié: (2024)
par: Li, Zhong-Zhi, et autres
Publié: (2024)
From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning
par: Dinucu-Jianu, David, et autres
Publié: (2025)
par: Dinucu-Jianu, David, et autres
Publié: (2025)
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
par: Yang, Jialin, et autres
Publié: (2025)
par: Yang, Jialin, et autres
Publié: (2025)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
par: Lee, Yuho, et autres
Publié: (2024)
par: Lee, Yuho, et autres
Publié: (2024)
MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
par: Pombal, José, et autres
Publié: (2025)
par: Pombal, José, et autres
Publié: (2025)
Learning to Plan Before Answering: Self-Teaching LLMs to Learn Abstract Plans for Problem Solving
par: Zhang, Jin, et autres
Publié: (2025)
par: Zhang, Jin, et autres
Publié: (2025)
PLANET: A Collection of Benchmarks for Evaluating LLMs' Planning Capabilities
par: Li, Haoming, et autres
Publié: (2025)
par: Li, Haoming, et autres
Publié: (2025)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
par: Liu, Zhiqiang, et autres
Publié: (2025)
par: Liu, Zhiqiang, et autres
Publié: (2025)
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
par: Li, Chuhan, et autres
Publié: (2024)
par: Li, Chuhan, et autres
Publié: (2024)
NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark
par: Mikhailov, Vladislav, et autres
Publié: (2025)
par: Mikhailov, Vladislav, et autres
Publié: (2025)
Unveiling the Competitive Dynamics: A Comparative Evaluation of American and Chinese LLMs
par: Jiang, Zhenhui, et autres
Publié: (2024)
par: Jiang, Zhenhui, et autres
Publié: (2024)
EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs
par: Xu, Wanghan, et autres
Publié: (2025)
par: Xu, Wanghan, et autres
Publié: (2025)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
Agent KB: Leveraging Cross-Domain Experience for Agentic Problem Solving
par: Tang, Xiangru, et autres
Publié: (2025)
par: Tang, Xiangru, et autres
Publié: (2025)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
par: Zhang, Yongheng, et autres
Publié: (2025)
par: Zhang, Yongheng, et autres
Publié: (2025)
Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
WebWalker: Benchmarking LLMs in Web Traversal
par: Wu, Jialong, et autres
Publié: (2025)
par: Wu, Jialong, et autres
Publié: (2025)
Documents similaires
-
GOLD: Geometry Problem Solver with Natural Language Description
par: Zhang, Jiaxin, et autres
Publié: (2024) -
GAPS: Geometry-Aware Problem Solver
par: Zhang, Jiaxin, et autres
Publié: (2024) -
PRISM: A Methodology for Auditing Biases in Large Language Models
par: Azzopardi, Leif, et autres
Publié: (2024) -
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
par: Zhang, Mengyuan, et autres
Publié: (2024) -
Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving
par: Zhou, Yuxuan, et autres
Publié: (2025)