ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Boyang, Zhu, Qi, Wang, Rui, Wang, Sheng, Wang, Hongru, Hu, Minda, Mi, Fei, Wang, Yasheng, Shang, Lifeng, Liu, Qun, Wong, Kam-Fai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DAST: Difficulty-Aware Self-Training on Large Language Models
par: Xue, Boyang, et autres
Publié: (2025)
par: Xue, Boyang, et autres
Publié: (2025)
UniRetriever: Multi-task Candidates Selection for Various Context-Adaptive Conversational Retrieval
par: Wang, Hongru, et autres
Publié: (2024)
par: Wang, Hongru, et autres
Publié: (2024)
UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models
par: Xue, Boyang, et autres
Publié: (2024)
par: Xue, Boyang, et autres
Publié: (2024)
Enhancing Large Language Models Against Inductive Instructions with Dual-critique Prompting
par: Wang, Rui, et autres
Publié: (2023)
par: Wang, Rui, et autres
Publié: (2023)
Role Prompting Guided Domain Adaptation with General Capability Preserve for Large Language Models
par: Wang, Rui, et autres
Publié: (2024)
par: Wang, Rui, et autres
Publié: (2024)
Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models
par: Xue, Boyang, et autres
Publié: (2024)
par: Xue, Boyang, et autres
Publié: (2024)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
par: Wang, Zezhong, et autres
Publié: (2025)
par: Wang, Zezhong, et autres
Publié: (2025)
MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models
par: Xue, Boyang, et autres
Publié: (2024)
par: Xue, Boyang, et autres
Publié: (2024)
Teaching Large Reasoning Models Effective Reflection
par: Wang, Hanbin, et autres
Publié: (2026)
par: Wang, Hanbin, et autres
Publié: (2026)
ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue Synthesis
par: Wang, Zezhong, et autres
Publié: (2024)
par: Wang, Zezhong, et autres
Publié: (2024)
Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
par: Wang, Zezhong, et autres
Publié: (2024)
par: Wang, Zezhong, et autres
Publié: (2024)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
par: Yu, Erxin, et autres
Publié: (2025)
par: Yu, Erxin, et autres
Publié: (2025)
M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2023)
par: Kwan, Wai-Chung, et autres
Publié: (2023)
AppBench: Planning of Multiple APIs from Various APPs for Complex User Instruction
par: Wang, Hongru, et autres
Publié: (2024)
par: Wang, Hongru, et autres
Publié: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2024)
par: Kwan, Wai-Chung, et autres
Publié: (2024)
VLEU: a Method for Automatic Evaluation for Generalizability of Text-to-Image Models
par: Cao, Jingtao, et autres
Publié: (2024)
par: Cao, Jingtao, et autres
Publié: (2024)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
par: Gao, Fan, et autres
Publié: (2025)
par: Gao, Fan, et autres
Publié: (2025)
UniMS-RAG: A Unified Multi-source Retrieval-Augmented Generation for Personalized Dialogue Systems
par: Wang, Hongru, et autres
Publié: (2024)
par: Wang, Hongru, et autres
Publié: (2024)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
par: Liu, Chengwu, et autres
Publié: (2025)
par: Liu, Chengwu, et autres
Publié: (2025)
OSPC: Detecting Harmful Memes with Large Language Model as a Catalyst
par: Cao, Jingtao, et autres
Publié: (2024)
par: Cao, Jingtao, et autres
Publié: (2024)
Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents
par: Du, Yiming, et autres
Publié: (2025)
par: Du, Yiming, et autres
Publié: (2025)
Self-DC: When to Reason and When to Act? Self Divide-and-Conquer for Compositional Unknown Questions
par: Wang, Hongru, et autres
Publié: (2024)
par: Wang, Hongru, et autres
Publié: (2024)
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generation
par: Hu, Minda, et autres
Publié: (2024)
par: Hu, Minda, et autres
Publié: (2024)
Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary
par: Wang, Hongru, et autres
Publié: (2025)
par: Wang, Hongru, et autres
Publié: (2025)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
par: Zeng, Xingshan, et autres
Publié: (2025)
par: Zeng, Xingshan, et autres
Publié: (2025)
Teaching LLMs According to Their Aptitude: Adaptive Reasoning for Mathematical Problem Solving
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalyst
par: Wang, Hongru, et autres
Publié: (2025)
par: Wang, Hongru, et autres
Publié: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
NILE: Internal Consistency Alignment in Large Language Models
par: Hu, Minda, et autres
Publié: (2024)
par: Hu, Minda, et autres
Publié: (2024)
Data Management For Training Large Language Models: A Survey
par: Wang, Zige, et autres
Publié: (2023)
par: Wang, Zige, et autres
Publié: (2023)
DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities
par: Zhuang, Tianyi, et autres
Publié: (2025)
par: Zhuang, Tianyi, et autres
Publié: (2025)
A Survey of the Evolution of Language Model-Based Dialogue Systems: Data, Task and Models
par: Wang, Hongru, et autres
Publié: (2023)
par: Wang, Hongru, et autres
Publié: (2023)
VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs
par: Li, Can, et autres
Publié: (2025)
par: Li, Can, et autres
Publié: (2025)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
par: Jiang, Yuxin, et autres
Publié: (2023)
par: Jiang, Yuxin, et autres
Publié: (2023)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
Group Pattern Selection Optimization: Let LRMs Pick the Right Pattern for Reasoning
par: Wang, Hanbin, et autres
Publié: (2026)
par: Wang, Hanbin, et autres
Publié: (2026)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
YODA: Teacher-Student Progressive Learning for Language Models
par: Lu, Jianqiao, et autres
Publié: (2024)
par: Lu, Jianqiao, et autres
Publié: (2024)
Documents similaires
-
DAST: Difficulty-Aware Self-Training on Large Language Models
par: Xue, Boyang, et autres
Publié: (2025) -
UniRetriever: Multi-task Candidates Selection for Various Context-Adaptive Conversational Retrieval
par: Wang, Hongru, et autres
Publié: (2024) -
UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models
par: Xue, Boyang, et autres
Publié: (2024) -
Enhancing Large Language Models Against Inductive Instructions with Dual-critique Prompting
par: Wang, Rui, et autres
Publié: (2023) -
Role Prompting Guided Domain Adaptation with General Capability Preserve for Large Language Models
par: Wang, Rui, et autres
Publié: (2024)