A Single Revision Step Improves Token-Efficient LLM Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yingchuan, Ma, Terry, Zhong, Wenxuan, Ma, Ping |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring Time-Step Size in Reinforcement Learning for Sepsis Treatment
by: Sun, Yingchuan, et al.
Published: (2025)
by: Sun, Yingchuan, et al.
Published: (2025)
Wahkon: A Statistically Principled Deep RKHS Superposition Network
by: Chen, Yongkai, et al.
Published: (2026)
by: Chen, Yongkai, et al.
Published: (2026)
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
by: Liu, Hanbing, et al.
Published: (2025)
by: Liu, Hanbing, et al.
Published: (2025)
Token-Efficient RL for LLM Reasoning
by: Lee, Alan, et al.
Published: (2025)
by: Lee, Alan, et al.
Published: (2025)
Token-Budget-Aware LLM Reasoning
by: Han, Tingxu, et al.
Published: (2024)
by: Han, Tingxu, et al.
Published: (2024)
NeuroMAS: Multi-Agent Systems as Neural Networks with Joint Reinforcement Learning
by: Lu, Haoran, et al.
Published: (2026)
by: Lu, Haoran, et al.
Published: (2026)
Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal
by: Zeng, Wenhao, et al.
Published: (2025)
by: Zeng, Wenhao, et al.
Published: (2025)
Step-wise Rubric Rewards for LLM Reasoning
by: Xie, Weichu, et al.
Published: (2026)
by: Xie, Weichu, et al.
Published: (2026)
Step-by-Step Reasoning for Math Problems via Twisted Sequential Monte Carlo
by: Feng, Shengyu, et al.
Published: (2024)
by: Feng, Shengyu, et al.
Published: (2024)
Multi-Teacher Knowledge Distillation via Teacher-Informed Mixture Priors
by: Fang, Luyang, et al.
Published: (2026)
by: Fang, Luyang, et al.
Published: (2026)
Efficiently Scaling LLM Reasoning with Certaindex
by: Fu, Yichao, et al.
Published: (2024)
by: Fu, Yichao, et al.
Published: (2024)
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
by: Yang, Zhicheng, et al.
Published: (2026)
by: Yang, Zhicheng, et al.
Published: (2026)
Semantic Step Prediction: Multi-Step Latent Forecasting in LLM Reasoning Trajectories via Step Sampling
by: Yuan, Yidi
Published: (2026)
by: Yuan, Yidi
Published: (2026)
One-Token Verification for Reasoning Correctness Estimation
by: Zhuang, Zhan, et al.
Published: (2026)
by: Zhuang, Zhan, et al.
Published: (2026)
TrafficGPT: Breaking the Token Barrier for Efficient Long Traffic Analysis and Generation
by: Qu, Jian, et al.
Published: (2024)
by: Qu, Jian, et al.
Published: (2024)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
by: Liu, Xiaogeng, et al.
Published: (2026)
by: Liu, Xiaogeng, et al.
Published: (2026)
Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning
by: Gai, Jingchu, et al.
Published: (2025)
by: Gai, Jingchu, et al.
Published: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
by: Rezaei, Mohammad, et al.
Published: (2026)
by: Rezaei, Mohammad, et al.
Published: (2026)
BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens
by: Wen, Hao, et al.
Published: (2025)
by: Wen, Hao, et al.
Published: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
by: Wang, Huaijie, et al.
Published: (2024)
by: Wang, Huaijie, et al.
Published: (2024)
Single-Step Consistent Diffusion Samplers
by: Jutras-Dubé, Pascal, et al.
Published: (2025)
by: Jutras-Dubé, Pascal, et al.
Published: (2025)
Token-Efficient Change Detection in LLM APIs
by: Chauvin, Timothée, et al.
Published: (2026)
by: Chauvin, Timothée, et al.
Published: (2026)
Embedding Perturbation may Better Reflect Intermediate-Step Uncertainty in LLM Reasoning
by: Wen, Qihao, et al.
Published: (2026)
by: Wen, Qihao, et al.
Published: (2026)
Meaningless Tokens, Meaningful Gains: How Activation Shifts Enhance LLM Reasoning
by: Shi, Zeru, et al.
Published: (2025)
by: Shi, Zeru, et al.
Published: (2025)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
by: Wang, Han, et al.
Published: (2026)
by: Wang, Han, et al.
Published: (2026)
Scaling Laws for Data-Efficient Visual Transfer Learning
by: Yang, Wenxuan, et al.
Published: (2025)
by: Yang, Wenxuan, et al.
Published: (2025)
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
by: Zhang, Junjie, et al.
Published: (2026)
by: Zhang, Junjie, et al.
Published: (2026)
Efficient Ensembles Improve Training Data Attribution
by: Deng, Junwei, et al.
Published: (2024)
by: Deng, Junwei, et al.
Published: (2024)
Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning
by: Koirala, Prajwal, et al.
Published: (2025)
by: Koirala, Prajwal, et al.
Published: (2025)
Thought Anchors: Which LLM Reasoning Steps Matter?
by: Bogdan, Paul C., et al.
Published: (2025)
by: Bogdan, Paul C., et al.
Published: (2025)
ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning
by: Zeng, Yuchen, et al.
Published: (2025)
by: Zeng, Yuchen, et al.
Published: (2025)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
by: Sun, Lihao, et al.
Published: (2026)
by: Sun, Lihao, et al.
Published: (2026)
SWIFT: Mapping Sub-series with Wavelet Decomposition Improves Time Series Forecasting
by: Xie, Wenxuan, et al.
Published: (2025)
by: Xie, Wenxuan, et al.
Published: (2025)
Token-Hungry, Yet Precise: DeepSeek R1 Highlights the Need for Multi-Step Reasoning Over Speed in MATH
by: Evstafev, Evgenii
Published: (2025)
by: Evstafev, Evgenii
Published: (2025)
CAD-Tokenizer: Towards Text-based CAD Prototyping via Modality-Specific Tokenization
by: Wang, Ruiyu, et al.
Published: (2025)
by: Wang, Ruiyu, et al.
Published: (2025)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
by: He, Yinhan, et al.
Published: (2026)
by: He, Yinhan, et al.
Published: (2026)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
by: Lin, Zicheng, et al.
Published: (2024)
by: Lin, Zicheng, et al.
Published: (2024)
ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization
by: Deekeswar, Harshavardhanan
Published: (2026)
by: Deekeswar, Harshavardhanan
Published: (2026)
Inverse Design in Distributed Circuits Using Single-Step Reinforcement Learning
by: Li, Jiayu, et al.
Published: (2025)
by: Li, Jiayu, et al.
Published: (2025)
Active Evaluation Acquisition for Efficient LLM Benchmarking
by: Li, Yang, et al.
Published: (2024)
by: Li, Yang, et al.
Published: (2024)
Similar Items
-
Exploring Time-Step Size in Reinforcement Learning for Sepsis Treatment
by: Sun, Yingchuan, et al.
Published: (2025) -
Wahkon: A Statistically Principled Deep RKHS Superposition Network
by: Chen, Yongkai, et al.
Published: (2026) -
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
by: Liu, Hanbing, et al.
Published: (2025) -
Token-Efficient RL for LLM Reasoning
by: Lee, Alan, et al.
Published: (2025) -
Token-Budget-Aware LLM Reasoning
by: Han, Tingxu, et al.
Published: (2024)