Yixuan, D., & Xiaoqiang, J. (2025). Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data.
Citazione stile Chigago Style (17a edizione)Yixuan, Deng, e Ji Xiaoqiang. Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data. 2025.
Citatione MLA (9a ed.)Yixuan, Deng, e Ji Xiaoqiang. Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data. 2025.
Attenzione: Queste citazioni potrebbero non essere precise al 100%.