Positive-Unlabeled Reinforcement Learning Distillation for On-Premise Small Models

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Kou, Zhiqiang, Chen, Junyang, Cai, Xin-Qiang, Xia, Xiaobo, Xie, Ming-Kun, Wu, Dong-Dong, Liu, Biao, Jia, Yuheng, Geng, Xin, Sugiyama, Masashi, Chua, Tat-Seng
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!