MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Feng, Zhaopeng, Ren, Jiahan, Su, Jiayuan, Zheng, Jiamei, Wang, Hongwei, Liu, Zuozhu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
M-MAD: Multidimensional Multi-Agent Debate for Advanced Machine Translation Evaluation
by: Feng, Zhaopeng, et al.
Published: (2024)
by: Feng, Zhaopeng, et al.
Published: (2024)
MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
by: Feng, Zhaopeng, et al.
Published: (2025)
by: Feng, Zhaopeng, et al.
Published: (2025)
MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning
by: Feng, Zhaopeng, et al.
Published: (2025)
by: Feng, Zhaopeng, et al.
Published: (2025)
Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next Level
by: Feng, Zhaopeng, et al.
Published: (2024)
by: Feng, Zhaopeng, et al.
Published: (2024)
EC-Guide: A Comprehensive E-Commerce Guide for Instruction Tuning and Quantization
by: Feng, Zhaopeng, et al.
Published: (2024)
by: Feng, Zhaopeng, et al.
Published: (2024)
CP-Router: An Uncertainty-Aware Router Between LLM and LRM
by: Su, Jiayuan, et al.
Published: (2025)
by: Su, Jiayuan, et al.
Published: (2025)
Improving Machine Translation with Human Feedback: An Exploration of Quality Estimation as a Reward Model
by: He, Zhiwei, et al.
Published: (2024)
by: He, Zhiwei, et al.
Published: (2024)
TEaR: Improving LLM-based Machine Translation with Systematic Self-Refinement
by: Feng, Zhaopeng, et al.
Published: (2024)
by: Feng, Zhaopeng, et al.
Published: (2024)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
by: Zhou, Enyu, et al.
Published: (2024)
by: Zhou, Enyu, et al.
Published: (2024)
GRRM: Group Relative Reward Modeling for Machine Translation
by: Yang, Sen, et al.
Published: (2026)
by: Yang, Sen, et al.
Published: (2026)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
by: Su, Yi, et al.
Published: (2025)
by: Su, Yi, et al.
Published: (2025)
CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards
by: Liu, Cheng, et al.
Published: (2025)
by: Liu, Cheng, et al.
Published: (2025)
DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs
by: Meng, Zijie, et al.
Published: (2024)
by: Meng, Zijie, et al.
Published: (2024)
RewardBench 2: Advancing Reward Model Evaluation
by: Malik, Saumya, et al.
Published: (2025)
by: Malik, Saumya, et al.
Published: (2025)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
by: Yang, Wenjie, et al.
Published: (2025)
by: Yang, Wenjie, et al.
Published: (2025)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
by: Jiang, Songtao, et al.
Published: (2025)
by: Jiang, Songtao, et al.
Published: (2025)
Remedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modeling
by: Tan, Shaomu, et al.
Published: (2025)
by: Tan, Shaomu, et al.
Published: (2025)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
by: Cui, Guofeng, et al.
Published: (2025)
by: Cui, Guofeng, et al.
Published: (2025)
MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine Translation
by: Lu, Zhixiang, et al.
Published: (2026)
by: Lu, Zhixiang, et al.
Published: (2026)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
by: Hu, Ziyou, et al.
Published: (2025)
by: Hu, Ziyou, et al.
Published: (2025)
RRM: Robust Reward Model Training Mitigates Reward Hacking
by: Liu, Tianqi, et al.
Published: (2024)
by: Liu, Tianqi, et al.
Published: (2024)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
by: Wang, Hao, et al.
Published: (2025)
by: Wang, Hao, et al.
Published: (2025)
Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment
by: Liu, Zixuan, et al.
Published: (2025)
by: Liu, Zixuan, et al.
Published: (2025)
ReflectMT: Internalizing Reflection for Efficient and High-Quality Machine Translation
by: Li, Kunquan, et al.
Published: (2026)
by: Li, Kunquan, et al.
Published: (2026)
The Bidirectional Process Reward Model
by: Zhang, Lingyin, et al.
Published: (2025)
by: Zhang, Lingyin, et al.
Published: (2025)
Enhancing LLM Reasoning with Reward-guided Tree Search
by: Jiang, Jinhao, et al.
Published: (2024)
by: Jiang, Jinhao, et al.
Published: (2024)
Small Reward Models via Backward Inference
by: Wang, Yike, et al.
Published: (2026)
by: Wang, Yike, et al.
Published: (2026)
Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings
by: Ramos, Miguel Moura, et al.
Published: (2024)
by: Ramos, Miguel Moura, et al.
Published: (2024)
Reward-Based Online LLM Routing via NeuralUCB
by: Tsai, Ming-Hua, et al.
Published: (2026)
by: Tsai, Ming-Hua, et al.
Published: (2026)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
by: Fan, Zhiting, et al.
Published: (2024)
by: Fan, Zhiting, et al.
Published: (2024)
Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations
by: Yang, Xinyi, et al.
Published: (2025)
by: Yang, Xinyi, et al.
Published: (2025)
Agent-SiMT: Agent-assisted Simultaneous Machine Translation with Large Language Models
by: Guo, Shoutao, et al.
Published: (2024)
by: Guo, Shoutao, et al.
Published: (2024)
Revisiting the Markov Property for Machine Translation
by: Du, Cunxiao, et al.
Published: (2024)
by: Du, Cunxiao, et al.
Published: (2024)
Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
by: Zeng, Xia, et al.
Published: (2025)
by: Zeng, Xia, et al.
Published: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
by: Liu, Chris Yuhao, et al.
Published: (2024)
by: Liu, Chris Yuhao, et al.
Published: (2024)
Better Language Model-Based Judging Reward Modeling through Scaling Comprehension Boundaries
by: Ning, Meiling, et al.
Published: (2025)
by: Ning, Meiling, et al.
Published: (2025)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
by: Hu, Xinyu, et al.
Published: (2026)
by: Hu, Xinyu, et al.
Published: (2026)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
by: Elle
Published: (2025)
by: Elle
Published: (2025)
Likelihood-Based Reward Designs for General LLM Reasoning
by: Kwiatkowski, Ariel, et al.
Published: (2026)
by: Kwiatkowski, Ariel, et al.
Published: (2026)
Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model
by: Liu, Runheng, et al.
Published: (2026)
by: Liu, Runheng, et al.
Published: (2026)
Similar Items
-
M-MAD: Multidimensional Multi-Agent Debate for Advanced Machine Translation Evaluation
by: Feng, Zhaopeng, et al.
Published: (2024) -
MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
by: Feng, Zhaopeng, et al.
Published: (2025) -
MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning
by: Feng, Zhaopeng, et al.
Published: (2025) -
Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next Level
by: Feng, Zhaopeng, et al.
Published: (2024) -
EC-Guide: A Comprehensive E-Commerce Guide for Instruction Tuning and Quantization
by: Feng, Zhaopeng, et al.
Published: (2024)