Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Shuzhang, Huang, Haochen, Qiu, Shengxuan, Zuo, Pengfei, Wang, Runsheng, Li, Meng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction
par: Qiu, Shengxuan, et autres
Publié: (2026)
par: Qiu, Shengxuan, et autres
Publié: (2026)
DualSpec: Accelerating Deep Research Agents via Dual-Process Action Speculation
par: Zhong, Shuzhang, et autres
Publié: (2026)
par: Zhong, Shuzhang, et autres
Publié: (2026)
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
par: Zhong, Shuzhang, et autres
Publié: (2024)
par: Zhong, Shuzhang, et autres
Publié: (2024)
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
par: Zhong, Shuzhang, et autres
Publié: (2024)
par: Zhong, Shuzhang, et autres
Publié: (2024)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
par: Wei, Linye, et autres
Publié: (2025)
par: Wei, Linye, et autres
Publié: (2025)
HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
par: Zhong, Shuzhang, et autres
Publié: (2025)
par: Zhong, Shuzhang, et autres
Publié: (2025)
MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning
par: Zhi, Weihai, et autres
Publié: (2025)
par: Zhi, Weihai, et autres
Publié: (2025)
Continuous Chain of Thought Enables Parallel Exploration and Reasoning
par: Gozeten, Halil Alperen, et autres
Publié: (2025)
par: Gozeten, Halil Alperen, et autres
Publié: (2025)
Accelerated Diffusion Models via Speculative Sampling
par: De Bortoli, Valentin, et autres
Publié: (2025)
par: De Bortoli, Valentin, et autres
Publié: (2025)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
par: Yang, Rubing, et autres
Publié: (2025)
par: Yang, Rubing, et autres
Publié: (2025)
SRT: Accelerating Reinforcement Learning via Speculative Rollout with Tree-Structured Cache
par: Chang, Chi-Chih, et autres
Publié: (2026)
par: Chang, Chi-Chih, et autres
Publié: (2026)
Accelerating LLM Reasoning via Early Rejection with Partial Reward Modeling
par: Cheshmi, Seyyed Saeid, et autres
Publié: (2025)
par: Cheshmi, Seyyed Saeid, et autres
Publié: (2025)
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning
par: Jiang, Yan, et autres
Publié: (2026)
par: Jiang, Yan, et autres
Publié: (2026)
Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning
par: Zabounidis, Renos, et autres
Publié: (2025)
par: Zabounidis, Renos, et autres
Publié: (2025)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
par: Sun, Shuoyang, et autres
Publié: (2026)
par: Sun, Shuoyang, et autres
Publié: (2026)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
par: Zhao, Yilong, et autres
Publié: (2025)
par: Zhao, Yilong, et autres
Publié: (2025)
TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration
par: Li, Ye, et autres
Publié: (2025)
par: Li, Ye, et autres
Publié: (2025)
Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models
par: Wei, Linye, et autres
Publié: (2025)
par: Wei, Linye, et autres
Publié: (2025)
From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards
par: Chen, Ziyu, et autres
Publié: (2024)
par: Chen, Ziyu, et autres
Publié: (2024)
Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs
par: Huang, Ruiquan, et autres
Publié: (2026)
par: Huang, Ruiquan, et autres
Publié: (2026)
Few-shot Knowledge Graph Relational Reasoning via Subgraph Adaptation
par: Liu, Haochen, et autres
Publié: (2024)
par: Liu, Haochen, et autres
Publié: (2024)
Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts
par: Ahmed, Ammar, et autres
Publié: (2025)
par: Ahmed, Ammar, et autres
Publié: (2025)
STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMs
par: Dong, Peijie, et autres
Publié: (2024)
par: Dong, Peijie, et autres
Publié: (2024)
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
par: Wu, Junda, et autres
Publié: (2025)
par: Wu, Junda, et autres
Publié: (2025)
Improved Bounds for Reward-Agnostic and Reward-Free Exploration
par: Ridel, Oran, et autres
Publié: (2026)
par: Ridel, Oran, et autres
Publié: (2026)
Quasar: Quantized Self-Speculative Acceleration for Rapid Inference via Memory-Efficient Verification
par: Huang, Guang, et autres
Publié: (2026)
par: Huang, Guang, et autres
Publié: (2026)
Breaking the Tuning Barrier: Zero-Hyperparameters Yield Multi-Corner Analysis Via Learned Priors
par: Xing, Wei W., et autres
Publié: (2026)
par: Xing, Wei W., et autres
Publié: (2026)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse
par: Fu, Zizhuo, et autres
Publié: (2026)
par: Fu, Zizhuo, et autres
Publié: (2026)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
par: Iso, Hayate, et autres
Publié: (2026)
par: Iso, Hayate, et autres
Publié: (2026)
Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models
par: Williams, Jonathan, et autres
Publié: (2026)
par: Williams, Jonathan, et autres
Publié: (2026)
SSR: Speculative Parallel Scaling Reasoning in Test-time
par: Chu, Yuanlin, et autres
Publié: (2025)
par: Chu, Yuanlin, et autres
Publié: (2025)
FastFT: Accelerating Reinforced Feature Transformation via Advanced Exploration Strategies
par: He, Tianqi, et autres
Publié: (2025)
par: He, Tianqi, et autres
Publié: (2025)
Breaking the Factorization Barrier in Diffusion Language Models
par: Li, Ian, et autres
Publié: (2026)
par: Li, Ian, et autres
Publié: (2026)
Accelerating Time Series Foundation Models with Speculative Decoding
par: Subbaraman, Pranav, et autres
Publié: (2025)
par: Subbaraman, Pranav, et autres
Publié: (2025)
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025)
par: Xu, Yuhui, et autres
Publié: (2025)
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025)
par: Zhong, Yiwu, et autres
Publié: (2025)
SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
par: Zhang, Xichen, et autres
Publié: (2025)
par: Zhang, Xichen, et autres
Publié: (2025)
Documents similaires
-
HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction
par: Qiu, Shengxuan, et autres
Publié: (2026) -
DualSpec: Accelerating Deep Research Agents via Dual-Process Action Speculation
par: Zhong, Shuzhang, et autres
Publié: (2026) -
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
par: Zhong, Shuzhang, et autres
Publié: (2024) -
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
par: Zhong, Shuzhang, et autres
Publié: (2024) -
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
par: Wei, Linye, et autres
Publié: (2025)