Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Tong, Liu, Yang, Bai, Jun, Jia, Zixia, Zhang, Shuyi, Lin, Ziyong, Wang, Yanting, Zhu, Song-Chun, Zheng, Zilong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding and Leveraging the Expert Specialization of Context Faithfulness in Mixture-of-Experts LLMs
par: Bai, Jun, et autres
Publié: (2025)
par: Bai, Jun, et autres
Publié: (2025)
LangSuitE: Planning, Controlling and Interacting with Large Language Models in Embodied Text Environments
par: Jia, Zixia, et autres
Publié: (2024)
par: Jia, Zixia, et autres
Publié: (2024)
A Survey on Parallel Reasoning
par: Wang, Ziqi, et autres
Publié: (2025)
par: Wang, Ziqi, et autres
Publié: (2025)
TongSearch-QR: Reinforced Query Reasoning for Retrieval
par: Qin, Xubo, et autres
Publié: (2025)
par: Qin, Xubo, et autres
Publié: (2025)
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
par: Li, Hengli, et autres
Publié: (2025)
par: Li, Hengli, et autres
Publié: (2025)
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
par: Wang, Qibin, et autres
Publié: (2025)
par: Wang, Qibin, et autres
Publié: (2025)
Learning to Reason Across Parallel Samples for LLM Reasoning
par: Qi, Jianing, et autres
Publié: (2025)
par: Qi, Jianing, et autres
Publié: (2025)
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
par: Zheng, Tong, et autres
Publié: (2025)
par: Zheng, Tong, et autres
Publié: (2025)
Combining Supervised Learning and Reinforcement Learning for Multi-Label Classification Tasks with Partial Labels
par: Jia, Zixia, et autres
Publié: (2024)
par: Jia, Zixia, et autres
Publié: (2024)
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
par: Zhao, Andrew, et autres
Publié: (2025)
par: Zhao, Andrew, et autres
Publié: (2025)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
TokenSwift: Lossless Acceleration of Ultra Long Sequence Generation
par: Wu, Tong, et autres
Publié: (2025)
par: Wu, Tong, et autres
Publié: (2025)
RLKD: Distilling LLMs' Reasoning via Reinforcement Learning
par: Xu, Shicheng, et autres
Publié: (2025)
par: Xu, Shicheng, et autres
Publié: (2025)
A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
par: Wang, Ziqi, et autres
Publié: (2025)
par: Wang, Ziqi, et autres
Publié: (2025)
$V_1$: Unifying Generation and Self-Verification for Parallel Reasoners
par: Singh, Harman, et autres
Publié: (2026)
par: Singh, Harman, et autres
Publié: (2026)
Learning Adaptive Parallel Reasoning with Language Models
par: Pan, Jiayi, et autres
Publié: (2025)
par: Pan, Jiayi, et autres
Publié: (2025)
Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers
par: Lou, Chao, et autres
Publié: (2024)
par: Lou, Chao, et autres
Publié: (2024)
Parallel-Probe: Towards Efficient Parallel Thinking via 2D Probing
par: Zheng, Tong, et autres
Publié: (2026)
par: Zheng, Tong, et autres
Publié: (2026)
Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning
par: Song, Mingyang, et autres
Publié: (2025)
par: Song, Mingyang, et autres
Publié: (2025)
DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
par: Gao, Ziyuan, et autres
Publié: (2025)
par: Gao, Ziyuan, et autres
Publié: (2025)
Accelerate Parallelizable Reasoning via Parallel Decoding within One Sequence
par: Yu, Yijiong
Publié: (2025)
par: Yu, Yijiong
Publié: (2025)
Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki
par: Ming, Haoliang, et autres
Publié: (2026)
par: Ming, Haoliang, et autres
Publié: (2026)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
par: Jia, Sheng, et autres
Publié: (2025)
par: Jia, Sheng, et autres
Publié: (2025)
Adaptive Preference Optimization with Uncertainty-aware Utility Anchor
par: Wang, Xiaobo, et autres
Publié: (2025)
par: Wang, Xiaobo, et autres
Publié: (2025)
Learning to Reason via Mixture-of-Thought for Logical Reasoning
par: Zheng, Tong, et autres
Publié: (2025)
par: Zheng, Tong, et autres
Publié: (2025)
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
par: Zhang, Yong, et autres
Publié: (2025)
par: Zhang, Yong, et autres
Publié: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
par: Zhang, Xue, et autres
Publié: (2025)
par: Zhang, Xue, et autres
Publié: (2025)
Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation
par: Zhang, Ruiqi, et autres
Publié: (2026)
par: Zhang, Ruiqi, et autres
Publié: (2026)
Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning
par: Lin, Jiacheng, et autres
Publié: (2025)
par: Lin, Jiacheng, et autres
Publié: (2025)
Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
par: Yang, Wen, et autres
Publié: (2025)
par: Yang, Wen, et autres
Publié: (2025)
Revealing the Parallel Multilingual Learning within Large Language Models
par: Mu, Yongyu, et autres
Publié: (2024)
par: Mu, Yongyu, et autres
Publié: (2024)
Scaling Reasoning Tokens via RL and Parallel Thinking: Evidence From Competitive Programming
par: Zhang, Qianfan, et autres
Publié: (2026)
par: Zhang, Qianfan, et autres
Publié: (2026)
Explore Data Left Behind in Reinforcement Learning for Reasoning Language Models
par: Liu, Chenxi, et autres
Publié: (2025)
par: Liu, Chenxi, et autres
Publié: (2025)
Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
par: Bi, Jiaxi, et autres
Publié: (2026)
par: Bi, Jiaxi, et autres
Publié: (2026)
LLM-Guided Knowledge Distillation for Temporal Knowledge Graph Reasoning
par: Xing, Wang, et autres
Publié: (2026)
par: Xing, Wang, et autres
Publié: (2026)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning
par: Jin, Song, et autres
Publié: (2025)
par: Jin, Song, et autres
Publié: (2025)
Parallel Test-Time Scaling for Latent Reasoning Models
par: You, Runyang, et autres
Publié: (2025)
par: You, Runyang, et autres
Publié: (2025)
Gumbel Distillation for Parallel Text Generation
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
Documents similaires
-
Understanding and Leveraging the Expert Specialization of Context Faithfulness in Mixture-of-Experts LLMs
par: Bai, Jun, et autres
Publié: (2025) -
LangSuitE: Planning, Controlling and Interacting with Large Language Models in Embodied Text Environments
par: Jia, Zixia, et autres
Publié: (2024) -
A Survey on Parallel Reasoning
par: Wang, Ziqi, et autres
Publié: (2025) -
TongSearch-QR: Reinforced Query Reasoning for Retrieval
par: Qin, Xubo, et autres
Publié: (2025) -
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
par: Li, Hengli, et autres
Publié: (2025)