Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Fei, Li, Yingru, Wang, Benyou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robust Search with Uncertainty-Aware Value Models for Language Model Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2025)
di: Yu, Fei, et al.
Pubblicazione: (2025)
OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2023)
di: Yu, Fei, et al.
Pubblicazione: (2023)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
di: He, Zhiwei, et al.
Pubblicazione: (2025)
di: He, Zhiwei, et al.
Pubblicazione: (2025)
FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research
di: Recchia, Gabriel, et al.
Pubblicazione: (2025)
di: Recchia, Gabriel, et al.
Pubblicazione: (2025)
SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation
di: Nezhad, Sina Bagheri, et al.
Pubblicazione: (2025)
di: Nezhad, Sina Bagheri, et al.
Pubblicazione: (2025)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
di: Chen, Ding, et al.
Pubblicazione: (2025)
di: Chen, Ding, et al.
Pubblicazione: (2025)
LLMs for Mathematical Modeling: Towards Bridging the Gap between Natural and Mathematical Languages
di: Huang, Xuhan, et al.
Pubblicazione: (2024)
di: Huang, Xuhan, et al.
Pubblicazione: (2024)
PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
di: Wang, Xiangfeng, et al.
Pubblicazione: (2026)
di: Wang, Xiangfeng, et al.
Pubblicazione: (2026)
Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision
di: Sun, Lingzhuang, et al.
Pubblicazione: (2026)
di: Sun, Lingzhuang, et al.
Pubblicazione: (2026)
InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
di: Li, Peiji, et al.
Pubblicazione: (2025)
di: Li, Peiji, et al.
Pubblicazione: (2025)
Verifier-Backed Hard Problem Generation for Mathematical Reasoning
di: Lai, Yuhang, et al.
Pubblicazione: (2026)
di: Lai, Yuhang, et al.
Pubblicazione: (2026)
Examining False Positives under Inference Scaling for Mathematical Reasoning
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
di: Chen, Jiangjie, et al.
Pubblicazione: (2025)
di: Chen, Jiangjie, et al.
Pubblicazione: (2025)
Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning
di: Deng, Jie, et al.
Pubblicazione: (2026)
di: Deng, Jie, et al.
Pubblicazione: (2026)
Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning
di: Wu, Muling, et al.
Pubblicazione: (2025)
di: Wu, Muling, et al.
Pubblicazione: (2025)
rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset
di: Liu, Yifei, et al.
Pubblicazione: (2025)
di: Liu, Yifei, et al.
Pubblicazione: (2025)
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
di: Sun, Linzhuang, et al.
Pubblicazione: (2024)
di: Sun, Linzhuang, et al.
Pubblicazione: (2024)
QFFT, Question-Free Fine-Tuning for Adaptive Reasoning
di: Liu, Wanlong, et al.
Pubblicazione: (2025)
di: Liu, Wanlong, et al.
Pubblicazione: (2025)
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
di: Shao, Zhihong, et al.
Pubblicazione: (2025)
di: Shao, Zhihong, et al.
Pubblicazione: (2025)
Model Unlearning via Sparse Autoencoder Subspace Guided Projections
di: Wang, Xu, et al.
Pubblicazione: (2025)
di: Wang, Xu, et al.
Pubblicazione: (2025)
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
Toward Automated Robustness Evaluation of Mathematical Reasoning
di: Hou, Yutao, et al.
Pubblicazione: (2025)
di: Hou, Yutao, et al.
Pubblicazione: (2025)
Evaluating the Role of Verifiers in Test-Time Scaling for Legal Reasoning Tasks
di: Romano, Davide, et al.
Pubblicazione: (2025)
di: Romano, Davide, et al.
Pubblicazione: (2025)
Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
Entropy-Guided Reasoning Compression
di: Zhu, Hourun, et al.
Pubblicazione: (2025)
di: Zhu, Hourun, et al.
Pubblicazione: (2025)
Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoning
di: Cao, Lang, et al.
Pubblicazione: (2024)
di: Cao, Lang, et al.
Pubblicazione: (2024)
Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection
di: Ahuja, Kabir, et al.
Pubblicazione: (2025)
di: Ahuja, Kabir, et al.
Pubblicazione: (2025)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
BPP-Search: Enhancing Tree of Thought Reasoning for Mathematical Modeling Problem Solving
di: Wang, Teng, et al.
Pubblicazione: (2024)
di: Wang, Teng, et al.
Pubblicazione: (2024)
Biased or Flawed? Mitigating Stereotypes in Generative Language Models by Addressing Task-Specific Flaws
di: Jha, Akshita, et al.
Pubblicazione: (2024)
di: Jha, Akshita, et al.
Pubblicazione: (2024)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
Review of Inference-Time Scaling Strategies: Reasoning, Search and RAG
di: Wang, Zhichao, et al.
Pubblicazione: (2025)
di: Wang, Zhichao, et al.
Pubblicazione: (2025)
The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks
di: Uzunoglu, Arda, et al.
Pubblicazione: (2025)
di: Uzunoglu, Arda, et al.
Pubblicazione: (2025)
CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents
di: Tang, Yihong, et al.
Pubblicazione: (2026)
di: Tang, Yihong, et al.
Pubblicazione: (2026)
Reinforcing General Reasoning without Verifiers
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
di: Liu, Junteng, et al.
Pubblicazione: (2025)
di: Liu, Junteng, et al.
Pubblicazione: (2025)
How We Refute Claims: Automatic Fact-Checking through Flaw Identification and Explanation
di: Kao, Wei-Yu, et al.
Pubblicazione: (2024)
di: Kao, Wei-Yu, et al.
Pubblicazione: (2024)
LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback
di: Gao, Bofei, et al.
Pubblicazione: (2024)
di: Gao, Bofei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Robust Search with Uncertainty-Aware Value Models for Language Model Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2025) -
OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2023) -
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
di: Tang, Zhengyang, et al.
Pubblicazione: (2024) -
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
di: He, Zhiwei, et al.
Pubblicazione: (2025) -
FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research
di: Recchia, Gabriel, et al.
Pubblicazione: (2025)