Skywork Open Reasoner 1 Technical Report
Fuente:
arXiv
Saved in:
| Main Authors: | He, Jujie, Liu, Jiacai, Liu, Chris Yuhao, Yan, Rui, Wang, Chaojie, Cheng, Peng, Zhang, Xiaoyu, Zhang, Fuxiang, Xu, Jiacheng, Shen, Wei, Li, Siyuan, Zeng, Liang, Wei, Tianwen, Cheng, Cheng, An, Bo, Liu, Yang, Zhou, Yahui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
by: Liu, Chris Yuhao, et al.
Published: (2025)
by: Liu, Chris Yuhao, et al.
Published: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
by: Liu, Chris Yuhao, et al.
Published: (2024)
by: Liu, Chris Yuhao, et al.
Published: (2024)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
by: Zeng, Liang, et al.
Published: (2024)
by: Zeng, Liang, et al.
Published: (2024)
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
by: Zeng, Liang, et al.
Published: (2025)
by: Zeng, Liang, et al.
Published: (2025)
Skywork-R1V3 Technical Report
by: Shen, Wei, et al.
Published: (2025)
by: Shen, Wei, et al.
Published: (2025)
Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models
by: Wei, Tianwen, et al.
Published: (2024)
by: Wei, Tianwen, et al.
Published: (2024)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
by: Liu, Jiacai, et al.
Published: (2024)
by: Liu, Jiacai, et al.
Published: (2024)
LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models
by: Zhao, Liang, et al.
Published: (2024)
by: Zhao, Liang, et al.
Published: (2024)
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
by: Wang, Peiyu, et al.
Published: (2025)
by: Wang, Peiyu, et al.
Published: (2025)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
by: Wang, Xiaokun, et al.
Published: (2025)
by: Wang, Xiaokun, et al.
Published: (2025)
Incentivizing LLMs to Self-Verify Their Answers
by: Zhang, Fuxiang, et al.
Published: (2025)
by: Zhang, Fuxiang, et al.
Published: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
by: Peng, Yi, et al.
Published: (2025)
by: Peng, Yi, et al.
Published: (2025)
Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning
by: Wang, Chaojie, et al.
Published: (2024)
by: Wang, Chaojie, et al.
Published: (2024)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
by: Wang, Peiyu, et al.
Published: (2025)
by: Wang, Peiyu, et al.
Published: (2025)
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
by: Wei, Hongyang, et al.
Published: (2026)
by: Wei, Hongyang, et al.
Published: (2026)
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch
by: Zhang, Yifan, et al.
Published: (2025)
by: Zhang, Yifan, et al.
Published: (2025)
Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
by: Wei, Hongyang, et al.
Published: (2025)
by: Wei, Hongyang, et al.
Published: (2025)
Efficient Reasoning via Reward Model
by: Wang, Yuhao, et al.
Published: (2025)
by: Wang, Yuhao, et al.
Published: (2025)
OpenOneRec Technical Report
by: Zhou, Guorui, et al.
Published: (2025)
by: Zhou, Guorui, et al.
Published: (2025)
Elementary Analysis of Policy Gradient Methods
by: Liu, Jiacai, et al.
Published: (2024)
by: Liu, Jiacai, et al.
Published: (2024)
On the Convergence of Policy Mirror Descent with Temporal Difference Evaluation
by: Liu, Jiacai, et al.
Published: (2025)
by: Liu, Jiacai, et al.
Published: (2025)
CodeShell Technical Report
by: Xie, Rui, et al.
Published: (2024)
by: Xie, Rui, et al.
Published: (2024)
Staged Specification Logic for Verifying Higher-Order Imperative Programs (Technical Report)
by: Foo, Darius, et al.
Published: (2023)
by: Foo, Darius, et al.
Published: (2023)
PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasks
by: Liu, Yunuo, et al.
Published: (2025)
by: Liu, Yunuo, et al.
Published: (2025)
DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
by: Wang, Yaxuan, et al.
Published: (2025)
by: Wang, Yaxuan, et al.
Published: (2025)
On the Convergence of Projected Policy Gradient for Any Constant Step Sizes
by: Liu, Jiacai, et al.
Published: (2023)
by: Liu, Jiacai, et al.
Published: (2023)
Policy Mirror Descent with Temporal Difference Learning: Sample Complexity under Online Markov Data
by: Li, Wenye, et al.
Published: (2025)
by: Li, Wenye, et al.
Published: (2025)
NeuroClaw Technical Report
by: Wang, Cheng, et al.
Published: (2026)
by: Wang, Cheng, et al.
Published: (2026)
The Grothendieck Theorem in Bergman Spaces
by: Liu, Yutao, et al.
Published: (2025)
by: Liu, Yutao, et al.
Published: (2025)
Technical Report: Quantifying and Analyzing the Generalization Power of a DNN
by: He, Yuxuan, et al.
Published: (2025)
by: He, Yuxuan, et al.
Published: (2025)
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
by: Cheng, Siyuan, et al.
Published: (2026)
by: Cheng, Siyuan, et al.
Published: (2026)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
by: Liu, Shujun, et al.
Published: (2025)
by: Liu, Shujun, et al.
Published: (2025)
Fish Audio S2 Technical Report
by: Liao, Shijia, et al.
Published: (2026)
by: Liao, Shijia, et al.
Published: (2026)
PaddleOCR 3.0 Technical Report
by: Cui, Cheng, et al.
Published: (2025)
by: Cui, Cheng, et al.
Published: (2025)
Failures of enterprise-level unionization in China: implications for coalmine safety and beyond
by: Chaojie Liu
Published: (2011)
by: Chaojie Liu
Published: (2011)
Las carencias de los sindicatos de empresa de China afectan a la seguridad de la minería del carbón
by: Chaojie Liu
Published: (2011)
by: Chaojie Liu
Published: (2011)
Défaillances du syndicalisme d'entreprise en Chine: conséquences sur la sécurité dans les houillères, et au-delà
by: Chaojie Liu
Published: (2011)
by: Chaojie Liu
Published: (2011)
NorwAI's Large Language Models: Technical Report
by: Gulla, Jon Atle, et al.
Published: (2026)
by: Gulla, Jon Atle, et al.
Published: (2026)
Full-State Prescribed Performance-Based Consensus of Double-Integrator Multi-Agent Systems with Jointly Connected Topologies
by: Hou, Yahui, et al.
Published: (2024)
by: Hou, Yahui, et al.
Published: (2024)
Beyond endoscopy for $\mathsf{GL}_2$ over $\mathbb{Q}$ with ramification 4: contribution of non-elliptic parts
by: Cheng, Yuhao
Published: (2026)
by: Cheng, Yuhao
Published: (2026)
Similar Items
-
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
by: Liu, Chris Yuhao, et al.
Published: (2025) -
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
by: Liu, Chris Yuhao, et al.
Published: (2024) -
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
by: Zeng, Liang, et al.
Published: (2024) -
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
by: Zeng, Liang, et al.
Published: (2025) -
Skywork-R1V3 Technical Report
by: Shen, Wei, et al.
Published: (2025)