Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hu, Jingcheng, Zhang, Yinmin, Han, Qi, Jiang, Daxin, Zhang, Xiangyu, Shum, Heung-Yeung |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multi-matrix Factorization Attention
von: Hu, Jingcheng, et al.
Veröffentlicht: (2024)
von: Hu, Jingcheng, et al.
Veröffentlicht: (2024)
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
von: Hu, Jingcheng, et al.
Veröffentlicht: (2026)
von: Hu, Jingcheng, et al.
Veröffentlicht: (2026)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
von: Wei, Yana, et al.
Veröffentlicht: (2025)
von: Wei, Yana, et al.
Veröffentlicht: (2025)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
von: Yu, Qiying, et al.
Veröffentlicht: (2025)
von: Yu, Qiying, et al.
Veröffentlicht: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
NoiseAR: AutoRegressing Initial Noise Prior for Diffusion Models
von: Li, Zeming, et al.
Veröffentlicht: (2025)
von: Li, Zeming, et al.
Veröffentlicht: (2025)
SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
von: Zeng, Weihao, et al.
Veröffentlicht: (2025)
von: Zeng, Weihao, et al.
Veröffentlicht: (2025)
Open-RAG: Enhanced Retrieval-Augmented Reasoning with Open-Source Large Language Models
von: Islam, Shayekh Bin, et al.
Veröffentlicht: (2024)
von: Islam, Shayekh Bin, et al.
Veröffentlicht: (2024)
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
von: DeepSeek-AI, et al.
Veröffentlicht: (2024)
von: DeepSeek-AI, et al.
Veröffentlicht: (2024)
Scaling Open-Ended Reasoning to Predict the Future
von: Chandak, Nikhil, et al.
Veröffentlicht: (2025)
von: Chandak, Nikhil, et al.
Veröffentlicht: (2025)
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
von: Yin, Shangjian, et al.
Veröffentlicht: (2026)
von: Yin, Shangjian, et al.
Veröffentlicht: (2026)
CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics
von: Nagar, Aishik, et al.
Veröffentlicht: (2026)
von: Nagar, Aishik, et al.
Veröffentlicht: (2026)
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
von: Wang, Xiangfeng, et al.
Veröffentlicht: (2026)
von: Wang, Xiangfeng, et al.
Veröffentlicht: (2026)
Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach
von: Li, Haolin, et al.
Veröffentlicht: (2026)
von: Li, Haolin, et al.
Veröffentlicht: (2026)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
OpenAutoNLU: Open Source AutoML Library for NLU
von: Arshinov, Grigory, et al.
Veröffentlicht: (2026)
von: Arshinov, Grigory, et al.
Veröffentlicht: (2026)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
von: Yang, Ziqing, et al.
Veröffentlicht: (2024)
von: Yang, Ziqing, et al.
Veröffentlicht: (2024)
Open Deep Search: Democratizing Search with Open-source Reasoning Agents
von: Alzubi, Salaheddin, et al.
Veröffentlicht: (2025)
von: Alzubi, Salaheddin, et al.
Veröffentlicht: (2025)
Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
von: Wu, Donghang, et al.
Veröffentlicht: (2025)
von: Wu, Donghang, et al.
Veröffentlicht: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
von: Kim, Joongwon, et al.
Veröffentlicht: (2024)
von: Kim, Joongwon, et al.
Veröffentlicht: (2024)
7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement
von: Zhao, Pu, et al.
Veröffentlicht: (2024)
von: Zhao, Pu, et al.
Veröffentlicht: (2024)
Fox-1: Open Small Language Model for Cloud and Edge
von: Hu, Zijian, et al.
Veröffentlicht: (2024)
von: Hu, Zijian, et al.
Veröffentlicht: (2024)
Large Investment Model
von: Guo, Jian, et al.
Veröffentlicht: (2024)
von: Guo, Jian, et al.
Veröffentlicht: (2024)
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
Skywork Open Reasoner 1 Technical Report
von: He, Jujie, et al.
Veröffentlicht: (2025)
von: He, Jujie, et al.
Veröffentlicht: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
Personalised Distillation: Empowering Open-Sourced LLMs with Adaptive Learning for Code Generation
von: Chen, Hailin, et al.
Veröffentlicht: (2023)
von: Chen, Hailin, et al.
Veröffentlicht: (2023)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
von: Shao, Zhihong, et al.
Veröffentlicht: (2024)
von: Shao, Zhihong, et al.
Veröffentlicht: (2024)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
von: Wang, Jun, et al.
Veröffentlicht: (2024)
von: Wang, Jun, et al.
Veröffentlicht: (2024)
The Open Source Advantage in Large Language Models (LLMs)
von: Manchanda, Jiya, et al.
Veröffentlicht: (2024)
von: Manchanda, Jiya, et al.
Veröffentlicht: (2024)
Comparative Analysis of Open-Source Language Models in Summarizing Medical Text Data
von: Chen, Yuhao, et al.
Veröffentlicht: (2024)
von: Chen, Yuhao, et al.
Veröffentlicht: (2024)
LOLA -- An Open-Source Massively Multilingual Large Language Model
von: Srivastava, Nikit, et al.
Veröffentlicht: (2024)
von: Srivastava, Nikit, et al.
Veröffentlicht: (2024)
Mars: Situated Inductive Reasoning in an Open-World Environment
von: Tang, Xiaojuan, et al.
Veröffentlicht: (2024)
von: Tang, Xiaojuan, et al.
Veröffentlicht: (2024)
R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging
von: Lai, Yanlin, et al.
Veröffentlicht: (2026)
von: Lai, Yanlin, et al.
Veröffentlicht: (2026)
Orion-14B: Open-source Multilingual Large Language Models
von: Chen, Du, et al.
Veröffentlicht: (2024)
von: Chen, Du, et al.
Veröffentlicht: (2024)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
von: Zhao, Siyan, et al.
Veröffentlicht: (2025)
von: Zhao, Siyan, et al.
Veröffentlicht: (2025)
MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
von: Nguyen, Huu, et al.
Veröffentlicht: (2025)
von: Nguyen, Huu, et al.
Veröffentlicht: (2025)
Rethinking Scale: The Efficacy of Fine-Tuned Open-Source LLMs in Large-Scale Reproducible Social Science Research
von: Carammia, Marcello, et al.
Veröffentlicht: (2024)
von: Carammia, Marcello, et al.
Veröffentlicht: (2024)
Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge Graph
von: Sun, Jiashuo, et al.
Veröffentlicht: (2023)
von: Sun, Jiashuo, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Multi-matrix Factorization Attention
von: Hu, Jingcheng, et al.
Veröffentlicht: (2024) -
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
von: Hu, Jingcheng, et al.
Veröffentlicht: (2026) -
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
von: Wei, Yana, et al.
Veröffentlicht: (2025) -
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
von: Yu, Qiying, et al.
Veröffentlicht: (2025) -
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)