Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Chris Yuhao, Zeng, Liang, Xiao, Yuzhen, He, Jujie, Liu, Jiacai, Wang, Chaojie, Yan, Rui, Shen, Wei, Zhang, Fuxiang, Xu, Jiacheng, Liu, Yang, Zhou, Yahui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
par: Liu, Chris Yuhao, et autres
Publié: (2024)
par: Liu, Chris Yuhao, et autres
Publié: (2024)
Skywork Open Reasoner 1 Technical Report
par: He, Jujie, et autres
Publié: (2025)
par: He, Jujie, et autres
Publié: (2025)
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
par: Zeng, Liang, et autres
Publié: (2025)
par: Zeng, Liang, et autres
Publié: (2025)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
par: Zeng, Liang, et autres
Publié: (2024)
par: Zeng, Liang, et autres
Publié: (2024)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
par: Liu, Jiacai, et autres
Publié: (2024)
par: Liu, Jiacai, et autres
Publié: (2024)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
par: Wang, Xiaokun, et autres
Publié: (2025)
par: Wang, Xiaokun, et autres
Publié: (2025)
Skywork-R1V3 Technical Report
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
par: Wang, Peiyu, et autres
Publié: (2025)
par: Wang, Peiyu, et autres
Publié: (2025)
Incentivizing LLMs to Self-Verify Their Answers
par: Zhang, Fuxiang, et autres
Publié: (2025)
par: Zhang, Fuxiang, et autres
Publié: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
par: Peng, Yi, et autres
Publié: (2025)
par: Peng, Yi, et autres
Publié: (2025)
LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models
par: Zhao, Liang, et autres
Publié: (2024)
par: Zhao, Liang, et autres
Publié: (2024)
Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning
par: Wang, Chaojie, et autres
Publié: (2024)
par: Wang, Chaojie, et autres
Publié: (2024)
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
par: Wei, Hongyang, et autres
Publié: (2026)
par: Wei, Hongyang, et autres
Publié: (2026)
Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
par: Wei, Hongyang, et autres
Publié: (2025)
par: Wei, Hongyang, et autres
Publié: (2025)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
par: Wang, Peiyu, et autres
Publié: (2025)
par: Wang, Peiyu, et autres
Publié: (2025)
Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models
par: Wei, Tianwen, et autres
Publié: (2024)
par: Wei, Tianwen, et autres
Publié: (2024)
From Demonstrations to Rewards: Alignment Without Explicit Human Preferences
par: Zeng, Siliang, et autres
Publié: (2025)
par: Zeng, Siliang, et autres
Publié: (2025)
Robustifying Safety-Aligned Large Language Models through Clean Data Curation
par: Liu, Xiaoqun, et autres
Publié: (2024)
par: Liu, Xiaoqun, et autres
Publié: (2024)
Multimodal Human-AI Synergy for Medical Imaging Quality Control: A Hybrid Intelligence Framework with Adaptive Dataset Curation and Closed-Loop Evaluation
par: Qin, Zhi, et autres
Publié: (2025)
par: Qin, Zhi, et autres
Publié: (2025)
AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
The Grothendieck Theorem in Bergman Spaces
par: Liu, Yutao, et autres
Publié: (2025)
par: Liu, Yutao, et autres
Publié: (2025)
Failures of enterprise-level unionization in China: implications for coalmine safety and beyond
par: Chaojie Liu
Publié: (2011)
par: Chaojie Liu
Publié: (2011)
Las carencias de los sindicatos de empresa de China afectan a la seguridad de la minería del carbón
par: Chaojie Liu
Publié: (2011)
par: Chaojie Liu
Publié: (2011)
Défaillances du syndicalisme d'entreprise en Chine: conséquences sur la sécurité dans les houillères, et au-delà
par: Chaojie Liu
Publié: (2011)
par: Chaojie Liu
Publié: (2011)
Phosphor‐in‐Ceramic‐Converted Laser‐Driven Near‐Infrared Light Sources for Multiple Intelligent Spectroscopy Applications
par: Weibin Chen, et autres
Publié: (2024)
par: Weibin Chen, et autres
Publié: (2024)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
par: Zhu, Wenhong, et autres
Publié: (2024)
par: Zhu, Wenhong, et autres
Publié: (2024)
RewardDance: Reward Scaling in Visual Generation
par: Wu, Jie, et autres
Publié: (2025)
par: Wu, Jie, et autres
Publié: (2025)
Incorporating Human Flexibility through Reward Preferences in Human-AI Teaming
par: Bhambri, Siddhant, et autres
Publié: (2023)
par: Bhambri, Siddhant, et autres
Publié: (2023)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
par: Liu, Biao, et autres
Publié: (2026)
par: Liu, Biao, et autres
Publié: (2026)
CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
par: Xu, Ruiyao, et autres
Publié: (2026)
par: Xu, Ruiyao, et autres
Publié: (2026)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
par: Liu, Xiaoqun, et autres
Publié: (2024)
par: Liu, Xiaoqun, et autres
Publié: (2024)
DiffusionReward: Enhancing Blind Face Restoration through Reward Feedback Learning
par: Wu, Bin, et autres
Publié: (2025)
par: Wu, Bin, et autres
Publié: (2025)
Efficient Reasoning via Reward Model
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
DreamReward: Text-to-3D Generation with Human Preference
par: Ye, Junliang, et autres
Publié: (2024)
par: Ye, Junliang, et autres
Publié: (2024)
Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
par: Li, Yingru, et autres
Publié: (2025)
par: Li, Yingru, et autres
Publié: (2025)
Elementary Analysis of Policy Gradient Methods
par: Liu, Jiacai, et autres
Publié: (2024)
par: Liu, Jiacai, et autres
Publié: (2024)
On the Convergence of Policy Mirror Descent with Temporal Difference Evaluation
par: Liu, Jiacai, et autres
Publié: (2025)
par: Liu, Jiacai, et autres
Publié: (2025)
Reward Learning From Preference With Ties
par: Liu, Jinsong, et autres
Publié: (2024)
par: Liu, Jinsong, et autres
Publié: (2024)
Documents similaires
-
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
par: Liu, Chris Yuhao, et autres
Publié: (2024) -
Skywork Open Reasoner 1 Technical Report
par: He, Jujie, et autres
Publié: (2025) -
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
par: Zeng, Liang, et autres
Publié: (2025) -
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
par: Zeng, Liang, et autres
Publié: (2024) -
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
par: Liu, Jiacai, et autres
Publié: (2024)