Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data
Fuente:
arXiv
Guardado en:
| Autores principales: | Yixuan, Deng, Xiaoqiang, Ji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment
por: Tang, Yixuan, et al.
Publicado: (2025)
por: Tang, Yixuan, et al.
Publicado: (2025)
Safety-Aware Fine-Tuning of Large Language Models
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
Dynamics of Instruction Fine-Tuning for Chinese Large Language Models
por: Song, Chiyu, et al.
Publicado: (2023)
por: Song, Chiyu, et al.
Publicado: (2023)
Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data
por: Guo, Siqi, et al.
Publicado: (2025)
por: Guo, Siqi, et al.
Publicado: (2025)
An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language Models
por: Zhou, Xiongtao, et al.
Publicado: (2024)
por: Zhou, Xiongtao, et al.
Publicado: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
por: Cheng, Bo, et al.
Publicado: (2025)
por: Cheng, Bo, et al.
Publicado: (2025)
Structure-Learnable Adapter Fine-Tuning for Parameter-Efficient Large Language Models
por: Gong, Ming, et al.
Publicado: (2025)
por: Gong, Ming, et al.
Publicado: (2025)
You Only Fine-tune Once: Many-Shot In-Context Fine-Tuning for Large Language Models
por: He, Wenchong, et al.
Publicado: (2025)
por: He, Wenchong, et al.
Publicado: (2025)
Improving Generalization in Intent Detection: GRPO with Reward-Based Curriculum Sampling
por: Feng, Zihao, et al.
Publicado: (2025)
por: Feng, Zihao, et al.
Publicado: (2025)
Fine-Tuning Large Language Models for Scientific Text Classification: A Comparative Study
por: Rostam, Zhyar Rzgar K, et al.
Publicado: (2024)
por: Rostam, Zhyar Rzgar K, et al.
Publicado: (2024)
Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning
por: Liu, Jinlong, et al.
Publicado: (2025)
por: Liu, Jinlong, et al.
Publicado: (2025)
LiFT: Does Instruction Fine-Tuning Improve In-Context Learning for Longitudinal Modelling by Large Language Models?
por: Ali, Iqra, et al.
Publicado: (2026)
por: Ali, Iqra, et al.
Publicado: (2026)
A Study of Large Language Models for Patient Information Extraction: Model Architecture, Fine-Tuning Strategy, and Multi-task Instruction Tuning
por: Peng, Cheng, et al.
Publicado: (2025)
por: Peng, Cheng, et al.
Publicado: (2025)
HFT: Half Fine-Tuning for Large Language Models
por: Hui, Tingfeng, et al.
Publicado: (2024)
por: Hui, Tingfeng, et al.
Publicado: (2024)
Efficient Fine-Tuning of Large Language Models for Automated Medical Documentation
por: Leong, Hui Yi, et al.
Publicado: (2024)
por: Leong, Hui Yi, et al.
Publicado: (2024)
Mixture-of-Skills: Learning to Optimize Data Usage for Fine-Tuning Large Language Models
por: Wu, Minghao, et al.
Publicado: (2024)
por: Wu, Minghao, et al.
Publicado: (2024)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
por: Wang, Zhichao
Publicado: (2025)
por: Wang, Zhichao
Publicado: (2025)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
por: Chen, Zixiang, et al.
Publicado: (2024)
por: Chen, Zixiang, et al.
Publicado: (2024)
Exploring Fine-Tuning for In-Context Retrieval and Efficient KV-Caching in Long-Context Language Models
por: Molfese, Francesco Maria, et al.
Publicado: (2026)
por: Molfese, Francesco Maria, et al.
Publicado: (2026)
Memorization in Fine-Tuned Large Language Models
por: Savine, Danil
Publicado: (2025)
por: Savine, Danil
Publicado: (2025)
Efficiently Seeking Flat Minima for Better Generalization in Fine-Tuning Large Language Models and Beyond
por: Deng, Jiaxin, et al.
Publicado: (2025)
por: Deng, Jiaxin, et al.
Publicado: (2025)
Introducing Bode: A Fine-Tuned Large Language Model for Portuguese Prompt-Based Task
por: Garcia, Gabriel Lino, et al.
Publicado: (2024)
por: Garcia, Gabriel Lino, et al.
Publicado: (2024)
Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?
por: Zhu, Dawei, et al.
Publicado: (2024)
por: Zhu, Dawei, et al.
Publicado: (2024)
Fine-Tuning A Large Language Model for Systematic Review Screening
por: Yamoah, Kweku, et al.
Publicado: (2026)
por: Yamoah, Kweku, et al.
Publicado: (2026)
Assessing and Mitigating Data Memorization Risks in Fine-Tuned Large Language Models
por: Ramakrishnan, Badrinath, et al.
Publicado: (2025)
por: Ramakrishnan, Badrinath, et al.
Publicado: (2025)
Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models
por: Liu, Ziche, et al.
Publicado: (2024)
por: Liu, Ziche, et al.
Publicado: (2024)
Unveiling the Generalization Power of Fine-Tuned Large Language Models
por: Yang, Haoran, et al.
Publicado: (2024)
por: Yang, Haoran, et al.
Publicado: (2024)
MMICT: Boosting Multi-Modal Fine-Tuning with In-Context Examples
por: Chen, Tao, et al.
Publicado: (2023)
por: Chen, Tao, et al.
Publicado: (2023)
FlowerTune: A Cross-Domain Benchmark for Federated Fine-Tuning of Large Language Models
por: Gao, Yan, et al.
Publicado: (2025)
por: Gao, Yan, et al.
Publicado: (2025)
Automated Data Curation for Robust Language Model Fine-Tuning
por: Chen, Jiuhai, et al.
Publicado: (2024)
por: Chen, Jiuhai, et al.
Publicado: (2024)
Parameter-Efficient Fine-Tuning of Large Language Models using Semantic Knowledge Tuning
por: Prottasha, Nusrat Jahan, et al.
Publicado: (2024)
por: Prottasha, Nusrat Jahan, et al.
Publicado: (2024)
The Effect of Language Diversity When Fine-Tuning Large Language Models for Translation
por: Stap, David, et al.
Publicado: (2025)
por: Stap, David, et al.
Publicado: (2025)
Exploring Continual Fine-Tuning for Enhancing Language Ability in Large Language Model
por: Aggarwal, Divyanshu, et al.
Publicado: (2024)
por: Aggarwal, Divyanshu, et al.
Publicado: (2024)
Phased Instruction Fine-Tuning for Large Language Models
por: Pang, Wei, et al.
Publicado: (2024)
por: Pang, Wei, et al.
Publicado: (2024)
Dissecting Fine-Tuning Unlearning in Large Language Models
por: Hong, Yihuai, et al.
Publicado: (2024)
por: Hong, Yihuai, et al.
Publicado: (2024)
Towards Better Chinese-centric Neural Machine Translation for Low-resource Languages
por: Li, Bin, et al.
Publicado: (2022)
por: Li, Bin, et al.
Publicado: (2022)
Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO
por: Pappone, Francesco, et al.
Publicado: (2025)
por: Pappone, Francesco, et al.
Publicado: (2025)
AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPO
por: Dao, Alan, et al.
Publicado: (2025)
por: Dao, Alan, et al.
Publicado: (2025)
Dynamic Adaptive Optimization for Effective Sentiment Analysis Fine-Tuning on Large Language Models
por: Ding, Hongcheng, et al.
Publicado: (2024)
por: Ding, Hongcheng, et al.
Publicado: (2024)
Ejemplares similares
-
SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment
por: Tang, Yixuan, et al.
Publicado: (2025) -
Safety-Aware Fine-Tuning of Large Language Models
por: Choi, Hyeong Kyu, et al.
Publicado: (2024) -
Dynamics of Instruction Fine-Tuning for Chinese Large Language Models
por: Song, Chiyu, et al.
Publicado: (2023) -
Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data
por: Guo, Siqi, et al.
Publicado: (2025) -
An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language Models
por: Zhou, Xiongtao, et al.
Publicado: (2024)