TreeCut: A Synthetic Unanswerable Math Word Problem Dataset for LLM Hallucination Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Ouyang, Jialin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Augmenting Math Word Problems via Iterative Question Composing
par: Liu, Haoxiong, et autres
Publié: (2024)
par: Liu, Haoxiong, et autres
Publié: (2024)
When Not to Answer: Evaluating Prompts on GPT Models for Effective Abstention in Unanswerable Math Word Problems
par: Saadat, Asir, et autres
Publié: (2024)
par: Saadat, Asir, et autres
Publié: (2024)
Fill in the Blank: Exploring and Enhancing LLM Capabilities for Backward Reasoning in Math Word Problems
par: Deb, Aniruddha, et autres
Publié: (2023)
par: Deb, Aniruddha, et autres
Publié: (2023)
Empowering Bengali Education with AI: Solving Bengali Math Word Problems through Transformer Models
par: Era, Jalisha Jashim, et autres
Publié: (2025)
par: Era, Jalisha Jashim, et autres
Publié: (2025)
MathGAP: Out-of-Distribution Evaluation on Problems with Arbitrarily Complex Proofs
par: Opedal, Andreas, et autres
Publié: (2024)
par: Opedal, Andreas, et autres
Publié: (2024)
Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination
par: Agnimo, Yedidia, et autres
Publié: (2026)
par: Agnimo, Yedidia, et autres
Publié: (2026)
Investigating Bias: A Multilingual Pipeline for Generating, Solving, and Evaluating Math Problems with LLMs
par: Mahran, Mariam, et autres
Publié: (2025)
par: Mahran, Mariam, et autres
Publié: (2025)
OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset
par: Toshniwal, Shubham, et autres
Publié: (2024)
par: Toshniwal, Shubham, et autres
Publié: (2024)
Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
par: Mahabadi, Rabeeh Karimi, et autres
Publié: (2025)
par: Mahabadi, Rabeeh Karimi, et autres
Publié: (2025)
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
par: Albalak, Alon, et autres
Publié: (2025)
par: Albalak, Alon, et autres
Publié: (2025)
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
par: Mahdavi, Sadegh, et autres
Publié: (2025)
par: Mahdavi, Sadegh, et autres
Publié: (2025)
GraphEval: A Knowledge-Graph Based LLM Hallucination Evaluation Framework
par: Sansford, Hannah, et autres
Publié: (2024)
par: Sansford, Hannah, et autres
Publié: (2024)
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
Decomposing Elements of Problem Solving: What "Math" Does RL Teach?
par: Qin, Tian, et autres
Publié: (2025)
par: Qin, Tian, et autres
Publié: (2025)
Executable Functional Abstractions: Inferring Generative Programs for Advanced Math Problems
par: Khan, Zaid, et autres
Publié: (2025)
par: Khan, Zaid, et autres
Publié: (2025)
Steer LLM Latents for Hallucination Detection
par: Park, Seongheon, et autres
Publié: (2025)
par: Park, Seongheon, et autres
Publié: (2025)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
par: Wang, Zengzhi, et autres
Publié: (2023)
par: Wang, Zengzhi, et autres
Publié: (2023)
Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection
par: Kulkarni, Atharva, et autres
Publié: (2025)
par: Kulkarni, Atharva, et autres
Publié: (2025)
MegaMath: Pushing the Limits of Open Math Corpora
par: Zhou, Fan, et autres
Publié: (2025)
par: Zhou, Fan, et autres
Publié: (2025)
A Synthetic Dataset for Personal Attribute Inference
par: Yukhymenko, Hanna, et autres
Publié: (2024)
par: Yukhymenko, Hanna, et autres
Publié: (2024)
Mitigating LLM Hallucinations via Conformal Abstention
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
On Mitigating Code LLM Hallucinations with API Documentation
par: Jain, Nihal, et autres
Publié: (2024)
par: Jain, Nihal, et autres
Publié: (2024)
A Dataset for Evaluating LLM-based Evaluation Functions for Research Question Extraction Task
par: Fujisaki, Yuya, et autres
Publié: (2024)
par: Fujisaki, Yuya, et autres
Publié: (2024)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
par: Sun, Yuhong, et autres
Publié: (2024)
par: Sun, Yuhong, et autres
Publié: (2024)
MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors
par: Macina, Jakub, et autres
Publié: (2025)
par: Macina, Jakub, et autres
Publié: (2025)
DefAn: Definitive Answer Dataset for LLMs Hallucination Evaluation
par: Rahman, A B M Ashikur, et autres
Publié: (2024)
par: Rahman, A B M Ashikur, et autres
Publié: (2024)
Explaining Datasets in Words: Statistical Models with Natural Language Parameters
par: Zhong, Ruiqi, et autres
Publié: (2024)
par: Zhong, Ruiqi, et autres
Publié: (2024)
MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning
par: Li, Chengpeng, et autres
Publié: (2023)
par: Li, Chengpeng, et autres
Publié: (2023)
ControlMath: Controllable Data Generation Promotes Math Generalist Models
par: Chen, Nuo, et autres
Publié: (2024)
par: Chen, Nuo, et autres
Publié: (2024)
Beyond Next Word Prediction: Developing Comprehensive Evaluation Frameworks for measuring LLM performance on real world applications
par: Agrawal, Vishakha, et autres
Publié: (2025)
par: Agrawal, Vishakha, et autres
Publié: (2025)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
par: Liu, Zihan, et autres
Publié: (2024)
par: Liu, Zihan, et autres
Publié: (2024)
Adversarial Math Word Problem Generation
par: Xie, Roy, et autres
Publié: (2024)
par: Xie, Roy, et autres
Publié: (2024)
Measuring and Reducing LLM Hallucination without Gold-Standard Answers
par: Wei, Jiaheng, et autres
Publié: (2024)
par: Wei, Jiaheng, et autres
Publié: (2024)
Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers
par: Miyai, Atsuyuki, et autres
Publié: (2026)
par: Miyai, Atsuyuki, et autres
Publié: (2026)
Confucius3-Math: A Lightweight High-Performance Reasoning LLM for Chinese K-12 Mathematics Learning
par: Wu, Lixin, et autres
Publié: (2025)
par: Wu, Lixin, et autres
Publié: (2025)
OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
par: Qiang, Zhangcheng, et autres
Publié: (2025)
par: Qiang, Zhangcheng, et autres
Publié: (2025)
MathBridge: A Large Corpus Dataset for Translating Spoken Mathematical Expressions into $LaTeX$ Formulas for Improved Readability
par: Jung, Kyudan, et autres
Publié: (2024)
par: Jung, Kyudan, et autres
Publié: (2024)
Large Language Models are Skeptics: False Negative Problem of Input-conflicting Hallucination
par: Song, Jongyoon, et autres
Publié: (2024)
par: Song, Jongyoon, et autres
Publié: (2024)
Physics of Language Models: Part 2.2, How to Learn From Mistakes on Grade-School Math Problems
par: Ye, Tian, et autres
Publié: (2024)
par: Ye, Tian, et autres
Publié: (2024)
KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding
par: Xu, Zhangchen, et autres
Publié: (2025)
par: Xu, Zhangchen, et autres
Publié: (2025)
Documents similaires
-
Augmenting Math Word Problems via Iterative Question Composing
par: Liu, Haoxiong, et autres
Publié: (2024) -
When Not to Answer: Evaluating Prompts on GPT Models for Effective Abstention in Unanswerable Math Word Problems
par: Saadat, Asir, et autres
Publié: (2024) -
Fill in the Blank: Exploring and Enhancing LLM Capabilities for Backward Reasoning in Math Word Problems
par: Deb, Aniruddha, et autres
Publié: (2023) -
Empowering Bengali Education with AI: Solving Bengali Math Word Problems through Transformer Models
par: Era, Jalisha Jashim, et autres
Publié: (2025) -
MathGAP: Out-of-Distribution Evaluation on Problems with Arbitrarily Complex Proofs
par: Opedal, Andreas, et autres
Publié: (2024)