NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Huayu, Zheng, Kaiwen, Zhang, Qinsheng, Cui, Ganqu, Yuan, Lifan, Cui, Yin, Ye, Haotian, Lin, Tsung-Yi, Liu, Ming-Yu, Zhu, Jun, Wang, Haoxiang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DiffusionNFT: Online Diffusion Reinforcement with Forward Process
by: Zheng, Kaiwen, et al.
Published: (2025)
by: Zheng, Kaiwen, et al.
Published: (2025)
Noise Contrastive Alignment of Language Models with Explicit Rewards
by: Chen, Huayu, et al.
Published: (2024)
by: Chen, Huayu, et al.
Published: (2024)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator
by: Zheng, Kaiwen, et al.
Published: (2025)
by: Zheng, Kaiwen, et al.
Published: (2025)
Free Process Rewards without Process Labels
by: Yuan, Lifan, et al.
Published: (2024)
by: Yuan, Lifan, et al.
Published: (2024)
Data-regularized Reinforcement Learning for Diffusion Models at Scale
by: Ye, Haotian, et al.
Published: (2025)
by: Ye, Haotian, et al.
Published: (2025)
TTRL: Test-Time Reinforcement Learning
by: Zuo, Yuxin, et al.
Published: (2025)
by: Zuo, Yuxin, et al.
Published: (2025)
Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling
by: Zheng, Kaiwen, et al.
Published: (2024)
by: Zheng, Kaiwen, et al.
Published: (2024)
Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control
by: Chen, Huayu, et al.
Published: (2024)
by: Chen, Huayu, et al.
Published: (2024)
Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
by: Yuan, Wenzhen, et al.
Published: (2025)
by: Yuan, Wenzhen, et al.
Published: (2025)
Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
by: Zheng, Kaiwen, et al.
Published: (2025)
by: Zheng, Kaiwen, et al.
Published: (2025)
From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
by: Yuan, Lifan, et al.
Published: (2025)
by: Yuan, Lifan, et al.
Published: (2025)
Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning
by: Wang, Futing, et al.
Published: (2026)
by: Wang, Futing, et al.
Published: (2026)
Learning to Reason under Off-Policy Guidance
by: Yan, Jianhao, et al.
Published: (2025)
by: Yan, Jianhao, et al.
Published: (2025)
Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning
by: Cui, Peng, et al.
Published: (2026)
by: Cui, Peng, et al.
Published: (2026)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
by: Zhang, Chi, et al.
Published: (2025)
by: Zhang, Chi, et al.
Published: (2025)
CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision
by: Wang, Pengcheng, et al.
Published: (2026)
by: Wang, Pengcheng, et al.
Published: (2026)
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
by: Ying, Chengyang, et al.
Published: (2025)
by: Ying, Chengyang, et al.
Published: (2025)
WirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement Learning
by: Li, Xin, et al.
Published: (2025)
by: Li, Xin, et al.
Published: (2025)
LIPM-Guided Reinforcement Learning for Stable and Perceptive Locomotion in Bipedal Robots
by: Su, Haokai, et al.
Published: (2025)
by: Su, Haokai, et al.
Published: (2025)
OwMatch: Conditional Self-Labeling with Consistency for Open-World Semi-Supervised Learning
by: Niu, Shengjie, et al.
Published: (2024)
by: Niu, Shengjie, et al.
Published: (2024)
UltraFeedback: Boosting Language Models with Scaled AI Feedback
by: Cui, Ganqu, et al.
Published: (2023)
by: Cui, Ganqu, et al.
Published: (2023)
Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
by: Mukherjee, Sagnik, et al.
Published: (2025)
by: Mukherjee, Sagnik, et al.
Published: (2025)
Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models
by: Ding, Ning, et al.
Published: (2024)
by: Ding, Ning, et al.
Published: (2024)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
by: Lu, Yao, et al.
Published: (2026)
by: Lu, Yao, et al.
Published: (2026)
A Survey of Reinforcement Learning for Large Reasoning Models
by: Zhang, Kaiyan, et al.
Published: (2025)
by: Zhang, Kaiyan, et al.
Published: (2025)
Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Advancing LLM Reasoning Generalists with Preference Trees
by: Yuan, Lifan, et al.
Published: (2024)
by: Yuan, Lifan, et al.
Published: (2024)
$π$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAs
by: Wang, Siting, et al.
Published: (2026)
by: Wang, Siting, et al.
Published: (2026)
Enhancing Efficiency and Propulsion in Bio-mimetic Robotic Fish through End-to-End Deep Reinforcement Learning
by: Cui, Xinyu, et al.
Published: (2025)
by: Cui, Xinyu, et al.
Published: (2025)
Visual Generation Without Guidance
by: Chen, Huayu, et al.
Published: (2025)
by: Chen, Huayu, et al.
Published: (2025)
Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks?
by: He, Xuan, et al.
Published: (2024)
by: He, Xuan, et al.
Published: (2024)
Consistency Diffusion Bridge Models
by: He, Guande, et al.
Published: (2024)
by: He, Guande, et al.
Published: (2024)
Diffusion Bridge Implicit Models
by: Zheng, Kaiwen, et al.
Published: (2024)
by: Zheng, Kaiwen, et al.
Published: (2024)
MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning
by: Li, Chengpeng, et al.
Published: (2023)
by: Li, Chengpeng, et al.
Published: (2023)
Learning Lie Group Generators from Trajectories
by: Hu, Lifan
Published: (2025)
by: Hu, Lifan
Published: (2025)
SemiNFT: Learning to Transfer Presets from Imitation to Appreciation via Hybrid-Sample Reinforcement Learning
by: Yang, Melany, et al.
Published: (2026)
by: Yang, Melany, et al.
Published: (2026)
On the Tradeoff between Privacy Preservation and Byzantine-Robustness in Decentralized Learning
by: Ye, Haoxiang, et al.
Published: (2023)
by: Ye, Haoxiang, et al.
Published: (2023)
Teaching Large Reasoning Models Effective Reflection
by: Wang, Hanbin, et al.
Published: (2026)
by: Wang, Hanbin, et al.
Published: (2026)
Similar Items
-
DiffusionNFT: Online Diffusion Reinforcement with Forward Process
by: Zheng, Kaiwen, et al.
Published: (2025) -
Noise Contrastive Alignment of Language Models with Explicit Rewards
by: Chen, Huayu, et al.
Published: (2024) -
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
by: Cui, Ganqu, et al.
Published: (2025) -
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator
by: Zheng, Kaiwen, et al.
Published: (2025) -
Free Process Rewards without Process Labels
by: Yuan, Lifan, et al.
Published: (2024)