Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Nuo, Zhao, Jun, Zu, Can, Li, Sixian, Chen, Lu, Zhang, Zhihao, Zheng, Rui, Dou, Shihan, Qin, Wenjuan, Gui, Tao, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
Unveiling Linguistic Regions in Large Language Models
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
di: Zhao, Jun, et al.
Pubblicazione: (2024)
di: Zhao, Jun, et al.
Pubblicazione: (2024)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
di: Liu, Boyang, et al.
Pubblicazione: (2025)
di: Liu, Boyang, et al.
Pubblicazione: (2025)
Secrets of RLHF in Large Language Models Part II: Reward Modeling
di: Wang, Binghai, et al.
Pubblicazione: (2024)
di: Wang, Binghai, et al.
Pubblicazione: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2024)
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2024)
Steering LLMs via Scalable Interactive Oversight
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
LongAgent: Scaling Language Models to 128k Context through Multi-Agent Collaboration
di: Zhao, Jun, et al.
Pubblicazione: (2024)
di: Zhao, Jun, et al.
Pubblicazione: (2024)
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
LLM-DA: Data Augmentation via Large Language Models for Few-Shot Named Entity Recognition
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
MetaRM: Shifted Distributions Alignment via Meta-Learning
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
di: Gao, Songyang, et al.
Pubblicazione: (2024)
di: Gao, Songyang, et al.
Pubblicazione: (2024)
Domain Generalization via Causal Adjustment for Cross-Domain Sentiment Analysis
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
di: Zheng, Rui, et al.
Pubblicazione: (2024)
di: Zheng, Rui, et al.
Pubblicazione: (2024)
Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric
di: Yang, Yuming, et al.
Pubblicazione: (2025)
di: Yang, Yuming, et al.
Pubblicazione: (2025)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
di: Li, Peng, et al.
Pubblicazione: (2026)
di: Li, Peng, et al.
Pubblicazione: (2026)
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
di: Zhang, Ming, et al.
Pubblicazione: (2024)
di: Zhang, Ming, et al.
Pubblicazione: (2024)
Towards Federated RLHF with Aggregated Client Preference for LLMs
di: Wu, Feijie, et al.
Pubblicazione: (2024)
di: Wu, Feijie, et al.
Pubblicazione: (2024)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
Regularized Online RLHF with Generalized Bilinear Preferences
di: Lee, Junghyun, et al.
Pubblicazione: (2026)
di: Lee, Junghyun, et al.
Pubblicazione: (2026)
Boosting Deductive Reasoning with Step Signals In RLHF
di: Li, Jialian, et al.
Pubblicazione: (2024)
di: Li, Jialian, et al.
Pubblicazione: (2024)
Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control
di: Jiang, Changhao, et al.
Pubblicazione: (2026)
di: Jiang, Changhao, et al.
Pubblicazione: (2026)
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
di: Shen, Yujiong, et al.
Pubblicazione: (2026)
di: Shen, Yujiong, et al.
Pubblicazione: (2026)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
WPO: Enhancing RLHF with Weighted Preference Optimization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
Machine-assisted writing evaluation: Exploring pre-trained language models in analyzing argumentative moves
di: Qin, Wenjuan, et al.
Pubblicazione: (2025)
di: Qin, Wenjuan, et al.
Pubblicazione: (2025)
CCTU: A Benchmark for Tool Use under Complex Constraints
di: Ye, Junjie, et al.
Pubblicazione: (2026)
di: Ye, Junjie, et al.
Pubblicazione: (2026)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges
di: Li, Hui, et al.
Pubblicazione: (2025)
di: Li, Hui, et al.
Pubblicazione: (2025)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
Effective Length Extrapolation via Dimension-Wise Positional Embeddings Manipulation
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025) -
Unveiling Linguistic Regions in Large Language Models
di: Zhang, Zhihao, et al.
Pubblicazione: (2024) -
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
di: Ye, Junjie, et al.
Pubblicazione: (2024) -
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
di: Zhao, Jun, et al.
Pubblicazione: (2024) -
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
di: Liu, Boyang, et al.
Pubblicazione: (2025)