Examining False Positives under Inference Scaling for Mathematical Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yu, Yang, Nan, Wang, Liang, Wei, Furu, Feng, Fuli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
di: Li, Xiaoyuan, et al.
Pubblicazione: (2024)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2024)
Little Giants: Synthesizing High-Quality Embedding Data at Scale
di: Chen, Haonan, et al.
Pubblicazione: (2024)
di: Chen, Haonan, et al.
Pubblicazione: (2024)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
di: He, Zhiwei, et al.
Pubblicazione: (2025)
di: He, Zhiwei, et al.
Pubblicazione: (2025)
From Calculation to Adjudication: Examining LLM judges on Mathematical Reasoning Tasks
di: Stephan, Andreas, et al.
Pubblicazione: (2024)
di: Stephan, Andreas, et al.
Pubblicazione: (2024)
From Implicit to Explicit: Token-Efficient Logical Supervision for Mathematical Reasoning in LLMs
di: Wang, Shaojie, et al.
Pubblicazione: (2026)
di: Wang, Shaojie, et al.
Pubblicazione: (2026)
A Survey on Large Language Models for Mathematical Reasoning
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance
di: Liang, Weida, et al.
Pubblicazione: (2026)
di: Liang, Weida, et al.
Pubblicazione: (2026)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic Reasoning
di: Zhang, Yadong, et al.
Pubblicazione: (2024)
di: Zhang, Yadong, et al.
Pubblicazione: (2024)
OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2023)
di: Yu, Fei, et al.
Pubblicazione: (2023)
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
di: Fang, Yi, et al.
Pubblicazione: (2026)
di: Fang, Yi, et al.
Pubblicazione: (2026)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
di: Zeng, Liang, et al.
Pubblicazione: (2024)
di: Zeng, Liang, et al.
Pubblicazione: (2024)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
Extended Inductive Reasoning for Personalized Preference Inference from Behavioral Signals
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations
di: Luo, Wen, et al.
Pubblicazione: (2026)
di: Luo, Wen, et al.
Pubblicazione: (2026)
Generative Representational Instruction Tuning
di: Muennighoff, Niklas, et al.
Pubblicazione: (2024)
di: Muennighoff, Niklas, et al.
Pubblicazione: (2024)
Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
di: Paliotta, Daniele, et al.
Pubblicazione: (2025)
di: Paliotta, Daniele, et al.
Pubblicazione: (2025)
Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text Documents via Semantic-Oriented Hierarchical Graphs
di: Zhu, Fengbin, et al.
Pubblicazione: (2023)
di: Zhu, Fengbin, et al.
Pubblicazione: (2023)
MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
di: Chen, Haonan, et al.
Pubblicazione: (2025)
di: Chen, Haonan, et al.
Pubblicazione: (2025)
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
di: Chen, Haonan, et al.
Pubblicazione: (2025)
di: Chen, Haonan, et al.
Pubblicazione: (2025)
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
Quantization Meets Reasoning: Exploring LLM Low-Bit Quantization Degradation for Mathematical Reasoning
di: Li, Zhen, et al.
Pubblicazione: (2025)
di: Li, Zhen, et al.
Pubblicazione: (2025)
Language Models as Inductive Reasoners
di: Yang, Zonglin, et al.
Pubblicazione: (2022)
di: Yang, Zonglin, et al.
Pubblicazione: (2022)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
Scaling LLM Inference with Optimized Sample Compute Allocation
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
di: Wang, Yuquan, et al.
Pubblicazione: (2025)
di: Wang, Yuquan, et al.
Pubblicazione: (2025)
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
di: Huang, Yiming, et al.
Pubblicazione: (2024)
di: Huang, Yiming, et al.
Pubblicazione: (2024)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
di: Ma, Wenhan, et al.
Pubblicazione: (2025)
di: Ma, Wenhan, et al.
Pubblicazione: (2025)
OptScale: Probabilistic Optimality for Inference-time Scaling
di: Wang, Youkang, et al.
Pubblicazione: (2025)
di: Wang, Youkang, et al.
Pubblicazione: (2025)
Markov Chain of Thought for Efficient Mathematical Reasoning
di: Yang, Wen, et al.
Pubblicazione: (2024)
di: Yang, Wen, et al.
Pubblicazione: (2024)
BPP-Search: Enhancing Tree of Thought Reasoning for Mathematical Modeling Problem Solving
di: Wang, Teng, et al.
Pubblicazione: (2024)
di: Wang, Teng, et al.
Pubblicazione: (2024)
Medical Reasoning with Large Language Models: A Survey and MR-Bench
di: Ren, Xiaohan, et al.
Pubblicazione: (2026)
di: Ren, Xiaohan, et al.
Pubblicazione: (2026)
Distilling Mathematical Reasoning Capabilities into Small Language Models
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
di: Wang, Qibin, et al.
Pubblicazione: (2025)
di: Wang, Qibin, et al.
Pubblicazione: (2025)
PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models
di: Yu, Ye, et al.
Pubblicazione: (2025)
di: Yu, Ye, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
di: Tang, Zhengyang, et al.
Pubblicazione: (2024) -
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
di: Yang, Wenkai, et al.
Pubblicazione: (2025) -
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
di: Li, Xiaoyuan, et al.
Pubblicazione: (2024) -
Little Giants: Synthesizing High-Quality Embedding Data at Scale
di: Chen, Haonan, et al.
Pubblicazione: (2024) -
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
di: He, Zhiwei, et al.
Pubblicazione: (2025)