GRRM: Group Relative Reward Modeling for Machine Translation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Sen, Cheng, Shanbo, Xu, Lu, Zhang, Jianbing, Huang, Shujian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
von: Li, Jiahuan, et al.
Veröffentlicht: (2024)
von: Li, Jiahuan, et al.
Veröffentlicht: (2024)
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
von: Yang, Sen, et al.
Veröffentlicht: (2025)
von: Yang, Sen, et al.
Veröffentlicht: (2025)
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
von: Zou, Wei, et al.
Veröffentlicht: (2025)
von: Zou, Wei, et al.
Veröffentlicht: (2025)
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
von: Li, Jiahuan, et al.
Veröffentlicht: (2023)
von: Li, Jiahuan, et al.
Veröffentlicht: (2023)
G-DIG: Towards Gradient-based Diverse and High-quality Instruction Data Selection for Machine Translation
von: Pan, Xingyuan, et al.
Veröffentlicht: (2024)
von: Pan, Xingyuan, et al.
Veröffentlicht: (2024)
SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation
von: Xu, Ting, et al.
Veröffentlicht: (2025)
von: Xu, Ting, et al.
Veröffentlicht: (2025)
From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition
von: Wang, Tianduo, et al.
Veröffentlicht: (2025)
von: Wang, Tianduo, et al.
Veröffentlicht: (2025)
Extend Adversarial Policy Against Neural Machine Translation via Unknown Token
von: Zou, Wei, et al.
Veröffentlicht: (2025)
von: Zou, Wei, et al.
Veröffentlicht: (2025)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
von: Huang, Xu, et al.
Veröffentlicht: (2024)
von: Huang, Xu, et al.
Veröffentlicht: (2024)
Self-Evolution Knowledge Distillation for LLM-based Machine Translation
von: Song, Yuncheng, et al.
Veröffentlicht: (2024)
von: Song, Yuncheng, et al.
Veröffentlicht: (2024)
Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality Estimation
von: Geng, Xiang, et al.
Veröffentlicht: (2025)
von: Geng, Xiang, et al.
Veröffentlicht: (2025)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
von: Cheng, Shanbo, et al.
Veröffentlicht: (2024)
von: Cheng, Shanbo, et al.
Veröffentlicht: (2024)
DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
von: She, Shuaijie, et al.
Veröffentlicht: (2025)
von: She, Shuaijie, et al.
Veröffentlicht: (2025)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
von: Zhu, Wenhao, et al.
Veröffentlicht: (2023)
von: Zhu, Wenhao, et al.
Veröffentlicht: (2023)
PEGRL: Improving Machine Translation by Post-Editing Guided Reinforcement Learning
von: Shen, Yunzhi, et al.
Veröffentlicht: (2026)
von: Shen, Yunzhi, et al.
Veröffentlicht: (2026)
TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning
von: Huang, Xu, et al.
Veröffentlicht: (2026)
von: Huang, Xu, et al.
Veröffentlicht: (2026)
R-PRM: Reasoning-Driven Process Reward Modeling
von: She, Shuaijie, et al.
Veröffentlicht: (2025)
von: She, Shuaijie, et al.
Veröffentlicht: (2025)
Multi-Candidate Speculative Decoding
von: Yang, Sen, et al.
Veröffentlicht: (2024)
von: Yang, Sen, et al.
Veröffentlicht: (2024)
Process-based Self-Rewarding Language Models
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
LLaMAX2: Your Translation-Enhanced Model also Performs Well in Reasoning
von: Gao, Changjiang, et al.
Veröffentlicht: (2025)
von: Gao, Changjiang, et al.
Veröffentlicht: (2025)
The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights
von: Zhu, Wenhao, et al.
Veröffentlicht: (2024)
von: Zhu, Wenhao, et al.
Veröffentlicht: (2024)
Cobra Effect in Reference-Free Image Captioning Metrics
von: Ma, Zheng, et al.
Veröffentlicht: (2024)
von: Ma, Zheng, et al.
Veröffentlicht: (2024)
MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine Translation
von: Lu, Zhixiang, et al.
Veröffentlicht: (2026)
von: Lu, Zhixiang, et al.
Veröffentlicht: (2026)
Remedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modeling
von: Tan, Shaomu, et al.
Veröffentlicht: (2025)
von: Tan, Shaomu, et al.
Veröffentlicht: (2025)
EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling
von: Zhang, Shimao, et al.
Veröffentlicht: (2024)
von: Zhang, Shimao, et al.
Veröffentlicht: (2024)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
von: Wang, Hao, et al.
Veröffentlicht: (2025)
von: Wang, Hao, et al.
Veröffentlicht: (2025)
Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMs
von: Cao, Zhiwei, et al.
Veröffentlicht: (2024)
von: Cao, Zhiwei, et al.
Veröffentlicht: (2024)
Question Translation Training for Better Multilingual Reasoning
von: Zhu, Wenhao, et al.
Veröffentlicht: (2024)
von: Zhu, Wenhao, et al.
Veröffentlicht: (2024)
MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models
von: Li, Wenzhe, et al.
Veröffentlicht: (2025)
von: Li, Wenzhe, et al.
Veröffentlicht: (2025)
Improving Machine Translation with Human Feedback: An Exploration of Quality Estimation as a Reward Model
von: He, Zhiwei, et al.
Veröffentlicht: (2024)
von: He, Zhiwei, et al.
Veröffentlicht: (2024)
T-REG: Preference Optimization with Token-Level Reward Regularization
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
von: Cui, Guofeng, et al.
Veröffentlicht: (2025)
von: Cui, Guofeng, et al.
Veröffentlicht: (2025)
Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning
von: Dang, Renfei, et al.
Veröffentlicht: (2026)
von: Dang, Renfei, et al.
Veröffentlicht: (2026)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2025)
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2025)
Seed-X: Building Strong Multilingual Translation LLM with 7B Parameters
von: Cheng, Shanbo, et al.
Veröffentlicht: (2025)
von: Cheng, Shanbo, et al.
Veröffentlicht: (2025)
The Comparison of Translationese in Machine Translation and Human Transation in terms of Translation Relations
von: Zhou, Fan
Veröffentlicht: (2024)
von: Zhou, Fan
Veröffentlicht: (2024)
Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings
von: Ramos, Miguel Moura, et al.
Veröffentlicht: (2024)
von: Ramos, Miguel Moura, et al.
Veröffentlicht: (2024)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
von: Yang, Wenjie, et al.
Veröffentlicht: (2025)
von: Yang, Wenjie, et al.
Veröffentlicht: (2025)
SiLLM: Large Language Models for Simultaneous Machine Translation
von: Guo, Shoutao, et al.
Veröffentlicht: (2024)
von: Guo, Shoutao, et al.
Veröffentlicht: (2024)
Evolving Knowledge Distillation for Lightweight Neural Machine Translation
von: Zhang, Xuewen, et al.
Veröffentlicht: (2026)
von: Zhang, Xuewen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
von: Li, Jiahuan, et al.
Veröffentlicht: (2024) -
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
von: Yang, Sen, et al.
Veröffentlicht: (2025) -
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
von: Zou, Wei, et al.
Veröffentlicht: (2025) -
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
von: Li, Jiahuan, et al.
Veröffentlicht: (2023) -
G-DIG: Towards Gradient-based Diverse and High-quality Instruction Data Selection for Machine Translation
von: Pan, Xingyuan, et al.
Veröffentlicht: (2024)