Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wu, Mingqi, Zhang, Zhihao, Dong, Qiaole, Xi, Zhiheng, Zhao, Jun, Jin, Senjie, Fan, Xiaoran, Zhou, Yuhao, Lv, Huijie, Zhang, Ming, Fu, Yanwei, Liu, Qin, Zhang, Songyang, Zhang, Qi
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi