Maity, D. (2026). SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF).
Cita Chicago Style (17a ed.)Maity, Dipan. SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF). 2026.
Cita MLA (9a ed.)Maity, Dipan. SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF). 2026.
Precaución: Estas citas no son 100% exactas.