DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Chan, Chi-Min, Hajiramezanali, Ehsan, Li, Xiner, De Brouwer, Edward, Edwards, Carl, Xue, Wei, Han, Sirui, Guo, Yike, Scalia, Gabriele
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!