Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hong, Zijin, Wu, Hao, Dong, Su, Dong, Junnan, Xiao, Yilin, Zhang, Yujing, Wang, Zhu, Huang, Feiran, Li, Linyi, Yang, Hongxia, Huang, Xiao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
par: Hong, Zijin, et autres
Publié: (2024)
par: Hong, Zijin, et autres
Publié: (2024)
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
Structure Guided Large Language Model for SQL Generation
par: Zhang, Qinggang, et autres
Publié: (2024)
par: Zhang, Qinggang, et autres
Publié: (2024)
Knowledge-to-SQL: Enhancing SQL Generation with Data Expert LLM
par: Hong, Zijin, et autres
Publié: (2024)
par: Hong, Zijin, et autres
Publié: (2024)
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
Knapsack Optimization-based Schema Linking for LLM-based Text-to-SQL Generation
par: Yuan, Zheng, et autres
Publié: (2025)
par: Yuan, Zheng, et autres
Publié: (2025)
Cost-efficient Knowledge-based Question Answering with Large Language Models
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
LAG: Logic-Augmented Generation from a Cartesian Perspective
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models
par: Zhang, Qinggang, et autres
Publié: (2025)
par: Zhang, Qinggang, et autres
Publié: (2025)
ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement
par: Hong, Zijin, et autres
Publié: (2026)
par: Hong, Zijin, et autres
Publié: (2026)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
MCEval: A Dynamic Framework for Fair Multilingual Cultural Evaluation of LLMs
par: Huang, Shulin, et autres
Publié: (2025)
par: Huang, Shulin, et autres
Publié: (2025)
Towards Better Question Generation in QA-based Event Extraction
par: Hong, Zijin, et autres
Publié: (2024)
par: Hong, Zijin, et autres
Publié: (2024)
Use Graph When It Needs: Efficiently and Adaptively Integrating Retrieval-Augmented Generation with Graphs
par: Dong, Su, et autres
Publié: (2026)
par: Dong, Su, et autres
Publié: (2026)
HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs
par: Ospanov, Azim, et autres
Publié: (2025)
par: Ospanov, Azim, et autres
Publié: (2025)
KnowGPT: Knowledge Graph based Prompting for Large Language Models
par: Zhang, Qinggang, et autres
Publié: (2023)
par: Zhang, Qinggang, et autres
Publié: (2023)
ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering
par: Wei, Jingxuan, et autres
Publié: (2025)
par: Wei, Jingxuan, et autres
Publié: (2025)
LinearRAG: Linear Graph Retrieval Augmented Generation on Large-scale Corpora
par: Zhuang, Luyao, et autres
Publié: (2025)
par: Zhuang, Luyao, et autres
Publié: (2025)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
par: Hao, Yuren, et autres
Publié: (2025)
par: Hao, Yuren, et autres
Publié: (2025)
When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation
par: Xiang, Zhishang, et autres
Publié: (2025)
par: Xiang, Zhishang, et autres
Publié: (2025)
Unconstrained Model Merging for Enhanced LLM Reasoning
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Evaluating LLMs' Mathematical Reasoning in Financial Document Question Answering
par: Srivastava, Pragya, et autres
Publié: (2024)
par: Srivastava, Pragya, et autres
Publié: (2024)
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
par: Monteiro, Joao, et autres
Publié: (2024)
par: Monteiro, Joao, et autres
Publié: (2024)
Reliable Reasoning Path: Distilling Effective Guidance for LLM Reasoning with Knowledge Graphs
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
GenDec: A robust generative Question-decomposition method for Multi-hop reasoning
par: Wu, Jian, et autres
Publié: (2024)
par: Wu, Jian, et autres
Publié: (2024)
Entity Alignment with Noisy Annotations from Large Language Models
par: Chen, Shengyuan, et autres
Publié: (2024)
par: Chen, Shengyuan, et autres
Publié: (2024)
Quantization Meets Reasoning: Exploring LLM Low-Bit Quantization Degradation for Mathematical Reasoning
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
HNCSE: Advancing Sentence Embeddings via Hybrid Contrastive Learning with Hard Negatives
par: Liu, Wenxiao, et autres
Publié: (2024)
par: Liu, Wenxiao, et autres
Publié: (2024)
ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering
par: Jia, Caijun, et autres
Publié: (2025)
par: Jia, Caijun, et autres
Publié: (2025)
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
par: Zhu, Junnan, et autres
Publié: (2025)
par: Zhu, Junnan, et autres
Publié: (2025)
LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation
par: Xiao, Yilin, et autres
Publié: (2026)
par: Xiao, Yilin, et autres
Publié: (2026)
CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning
par: He, Zheqi, et autres
Publié: (2024)
par: He, Zheqi, et autres
Publié: (2024)
Are Your LLMs Capable of Stable Reasoning?
par: Liu, Junnan, et autres
Publié: (2024)
par: Liu, Junnan, et autres
Publié: (2024)
Each Graph is a New Language: Graph Learning with LLMs
par: Zhou, Huachi, et autres
Publié: (2025)
par: Zhou, Huachi, et autres
Publié: (2025)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Reasoning as State Transition: A Representational Analysis of Reasoning Evolution in Large Language Models
par: Zhang, Siyuan, et autres
Publié: (2026)
par: Zhang, Siyuan, et autres
Publié: (2026)
STAIR: Improving Safety Alignment with Introspective Reasoning
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025)
par: Wei, Jianhui, et autres
Publié: (2025)
Documents similaires
-
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
par: Hong, Zijin, et autres
Publié: (2024) -
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
par: Dong, Junnan, et autres
Publié: (2024) -
Structure Guided Large Language Model for SQL Generation
par: Zhang, Qinggang, et autres
Publié: (2024) -
Knowledge-to-SQL: Enhancing SQL Generation with Data Expert LLM
par: Hong, Zijin, et autres
Publié: (2024) -
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
par: Xiao, Yilin, et autres
Publié: (2025)