SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ai, Zhengyang, Shan, Zikang, Ai, Xiaodong, Tang, Jingxian, Hu, Hangkai, Lu, Pinyan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
par: Maheswaran, Monishwaran, et autres
Publié: (2025)
par: Maheswaran, Monishwaran, et autres
Publié: (2025)
Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning
par: Zhang, Xiaoyun, et autres
Publié: (2025)
par: Zhang, Xiaoyun, et autres
Publié: (2025)
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
par: Shan, Zikang, et autres
Publié: (2026)
par: Shan, Zikang, et autres
Publié: (2026)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
par: Yang, Ling, et autres
Publié: (2025)
par: Yang, Ling, et autres
Publié: (2025)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024)
par: Tang, Zhengyang, et autres
Publié: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
par: Deng, Xun, et autres
Publié: (2025)
par: Deng, Xun, et autres
Publié: (2025)
Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation
par: Bi, Zhen, et autres
Publié: (2025)
par: Bi, Zhen, et autres
Publié: (2025)
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
par: Li, Sijia, et autres
Publié: (2026)
par: Li, Sijia, et autres
Publié: (2026)
Efficient Long-distance Latent Relation-aware Graph Neural Network for Multi-modal Emotion Recognition in Conversations
par: Shou, Yuntao, et autres
Publié: (2024)
par: Shou, Yuntao, et autres
Publié: (2024)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
par: Wu, Junkang, et autres
Publié: (2025)
par: Wu, Junkang, et autres
Publié: (2025)
HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
par: Xiong, Feng, et autres
Publié: (2025)
par: Xiong, Feng, et autres
Publié: (2025)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
par: Pavlenko, Kirill, et autres
Publié: (2026)
par: Pavlenko, Kirill, et autres
Publié: (2026)
Unveiling Memorization-Generalization Coexistence: A Case Study on Arithmetic Tasks with Label Noise
par: Liu, Linyu, et autres
Publié: (2026)
par: Liu, Linyu, et autres
Publié: (2026)
Graph Counselor: Adaptive Graph Exploration via Multi-Agent Synergy to Enhance LLM Reasoning
par: Gao, Junqi, et autres
Publié: (2025)
par: Gao, Junqi, et autres
Publié: (2025)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
par: Le, Thanh-Long V., et autres
Publié: (2025)
par: Le, Thanh-Long V., et autres
Publié: (2025)
Better LLM Reasoning via Dual-Play
par: Zhang, Zhengxin, et autres
Publié: (2025)
par: Zhang, Zhengxin, et autres
Publié: (2025)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
par: Feng, Guhao, et autres
Publié: (2024)
par: Feng, Guhao, et autres
Publié: (2024)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
par: Chen, Guanxu, et autres
Publié: (2025)
par: Chen, Guanxu, et autres
Publié: (2025)
MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining
par: Wen, Bingbing, et autres
Publié: (2026)
par: Wen, Bingbing, et autres
Publié: (2026)
Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning
par: Huang, Bingning, et autres
Publié: (2025)
par: Huang, Bingning, et autres
Publié: (2025)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026)
par: Ono, Shinnosuke, et autres
Publié: (2026)
RelayLLM: Efficient Reasoning via Collaborative Decoding
par: Huang, Chengsong, et autres
Publié: (2026)
par: Huang, Chengsong, et autres
Publié: (2026)
Advancing LLM Reasoning Generalists with Preference Trees
par: Yuan, Lifan, et autres
Publié: (2024)
par: Yuan, Lifan, et autres
Publié: (2024)
Option-ID Based Elimination For Multiple Choice Questions
par: Zhu, Zhenhao, et autres
Publié: (2025)
par: Zhu, Zhenhao, et autres
Publié: (2025)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
CoRT: Code-integrated Reasoning within Thinking
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
par: Jiang, Xitai, et autres
Publié: (2026)
par: Jiang, Xitai, et autres
Publié: (2026)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
par: Liu, Chengwu, et autres
Publié: (2025)
par: Liu, Chengwu, et autres
Publié: (2025)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
par: Shi, Zhenning, et autres
Publié: (2026)
par: Shi, Zhenning, et autres
Publié: (2026)
Assessing LLM Reasoning Steps via Principal Knowledge Grounding
par: Hwang, Hyeon, et autres
Publié: (2025)
par: Hwang, Hyeon, et autres
Publié: (2025)
GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization
par: Zhao, Zhengyang, et autres
Publié: (2026)
par: Zhao, Zhengyang, et autres
Publié: (2026)
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025)
par: Zhu, Xuekai, et autres
Publié: (2025)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
CosmicFish-HRM: Adaptive Reasoning via Hierarchical Recurrent Mechanisms in Compact Language Models
par: Lakkapragada, Venkat Akhil
Publié: (2026)
par: Lakkapragada, Venkat Akhil
Publié: (2026)
GraphDancer: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training
par: Bai, Yuyang, et autres
Publié: (2026)
par: Bai, Yuyang, et autres
Publié: (2026)
Stable Adaptive Thinking via Advantage Shaping and Length-Aware Gradient Regulation
par: Xu, Zihang, et autres
Publié: (2026)
par: Xu, Zihang, et autres
Publié: (2026)
LiteStage: Latency-aware Layer Skipping for Multi-stage Reasoning
par: Kang, Beomseok, et autres
Publié: (2025)
par: Kang, Beomseok, et autres
Publié: (2025)
ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning
par: Potamitis, Nearchos, et autres
Publié: (2025)
par: Potamitis, Nearchos, et autres
Publié: (2025)
DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
par: Wang, Yaxuan, et autres
Publié: (2025)
par: Wang, Yaxuan, et autres
Publié: (2025)
Documents similaires
-
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
par: Maheswaran, Monishwaran, et autres
Publié: (2025) -
Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning
par: Zhang, Xiaoyun, et autres
Publié: (2025) -
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
par: Shan, Zikang, et autres
Publié: (2026) -
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
par: Yang, Ling, et autres
Publié: (2025) -
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024)