Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Yueqin, Yang, Shentao, Xie, Yujia, Yang, Ziyi, Sun, Yuting, Awadalla, Hany, Chen, Weizhu, Zhou, Mingyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
Scaling Laws of Synthetic Data for Language Models
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding
di: Xu, Zhangchen, et al.
Pubblicazione: (2025)
di: Xu, Zhangchen, et al.
Pubblicazione: (2025)
Diffusion-RPO: Aligning Diffusion Models through Relative Preference Optimization
di: Gu, Yi, et al.
Pubblicazione: (2024)
di: Gu, Yi, et al.
Pubblicazione: (2024)
A Dense Reward View on Aligning Text-to-Image Diffusion with Preference
di: Yang, Shentao, et al.
Pubblicazione: (2024)
di: Yang, Shentao, et al.
Pubblicazione: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
di: Chen, Yanjun, et al.
Pubblicazione: (2024)
di: Chen, Yanjun, et al.
Pubblicazione: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
di: Lu, Taiming, et al.
Pubblicazione: (2024)
di: Lu, Taiming, et al.
Pubblicazione: (2024)
Reward-Robust RLHF in LLMs
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
How to Evaluate Reward Models for RLHF
di: Frick, Evan, et al.
Pubblicazione: (2024)
di: Frick, Evan, et al.
Pubblicazione: (2024)
Reward Generalization in RLHF: A Topological Perspective
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
di: Chen, Lichang, et al.
Pubblicazione: (2024)
di: Chen, Lichang, et al.
Pubblicazione: (2024)
Reward Model Overoptimisation in Iterated RLHF
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
Prototypical Reward Network for Data-Efficient RLHF
di: Zhang, Jinghan, et al.
Pubblicazione: (2024)
di: Zhang, Jinghan, et al.
Pubblicazione: (2024)
Quantile Regression for Distributional Reward Models in RLHF
di: Dorka, Nicolai
Pubblicazione: (2024)
di: Dorka, Nicolai
Pubblicazione: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
Preference-grounded Token-level Guidance for Language Model Fine-tuning
di: Yang, Shentao, et al.
Pubblicazione: (2023)
di: Yang, Shentao, et al.
Pubblicazione: (2023)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
di: Du, Yuhao, et al.
Pubblicazione: (2025)
di: Du, Yuhao, et al.
Pubblicazione: (2025)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
di: Ye, Ziyi, et al.
Pubblicazione: (2024)
di: Ye, Ziyi, et al.
Pubblicazione: (2024)
Reward Difference Optimization For Sample Reweighting In Offline RLHF
di: Wang, Shiqi, et al.
Pubblicazione: (2024)
di: Wang, Shiqi, et al.
Pubblicazione: (2024)
Information-Theoretic Reward Decomposition for Generalizable RLHF
di: Mao, Liyuan, et al.
Pubblicazione: (2025)
di: Mao, Liyuan, et al.
Pubblicazione: (2025)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
di: Zhu, Yu, et al.
Pubblicazione: (2024)
di: Zhu, Yu, et al.
Pubblicazione: (2024)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Efficiently Editing Mixture-of-Experts Models with Compressed Experts
di: He, Yifei, et al.
Pubblicazione: (2025)
di: He, Yifei, et al.
Pubblicazione: (2025)
Leveraging Human Revisions for Improving Text-to-Layout Models
di: Xie, Amber, et al.
Pubblicazione: (2024)
di: Xie, Amber, et al.
Pubblicazione: (2024)
Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
di: Song, Junjie, et al.
Pubblicazione: (2025)
di: Song, Junjie, et al.
Pubblicazione: (2025)
Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment
di: Zhang, Hongbin, et al.
Pubblicazione: (2025)
di: Zhang, Hongbin, et al.
Pubblicazione: (2025)
A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models
di: Xu, Haoran, et al.
Pubblicazione: (2023)
di: Xu, Haoran, et al.
Pubblicazione: (2023)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
di: Ono, Shinnosuke, et al.
Pubblicazione: (2026)
di: Ono, Shinnosuke, et al.
Pubblicazione: (2026)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
Benchmarking Open-Source Large Language Models on Healthcare Text Classification Tasks
di: Guo, Yuting, et al.
Pubblicazione: (2025)
di: Guo, Yuting, et al.
Pubblicazione: (2025)
Automatic Instruction Evolving for Large Language Models
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
Improving Attributed Text Generation of Large Language Models via Preference Learning
di: Li, Dongfang, et al.
Pubblicazione: (2024)
di: Li, Dongfang, et al.
Pubblicazione: (2024)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
Sequential Decision-Making for Inline Text Autocomplete
di: Chitnis, Rohan, et al.
Pubblicazione: (2024)
di: Chitnis, Rohan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
di: Yin, Yueqin, et al.
Pubblicazione: (2024) -
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024) -
Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts
di: Yin, Yueqin, et al.
Pubblicazione: (2024) -
SciAgent: Tool-augmented Language Models for Scientific Reasoning
di: Ma, Yubo, et al.
Pubblicazione: (2024) -
Scaling Laws of Synthetic Data for Language Models
di: Qin, Zeyu, et al.
Pubblicazione: (2025)