Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Jiang, Zhao, Xiaohu, Wu, Xinwei, Dong, Tianyu, Wang, Hao, Liu, Yangyang, Liu, Heng, Xu, Linlong, Wang, Longyue, Luo, Weihua, Xiong, Deyi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
von: Wu, Xinwei, et al.
Veröffentlicht: (2026)
von: Wu, Xinwei, et al.
Veröffentlicht: (2026)
From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2026)
von: Shi, Ling, et al.
Veröffentlicht: (2026)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
von: Wang, Hao, et al.
Veröffentlicht: (2025)
von: Wang, Hao, et al.
Veröffentlicht: (2025)
Challenging Multilingual LLMs: A New Taxonomy and Benchmark for Unraveling Hallucination in Translation
von: Wu, Xinwei, et al.
Veröffentlicht: (2025)
von: Wu, Xinwei, et al.
Veröffentlicht: (2025)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
von: Wang, Xintong, et al.
Veröffentlicht: (2025)
von: Wang, Xintong, et al.
Veröffentlicht: (2025)
Marco-LLM: Bridging Languages via Massive Multilingual Training for Cross-Lingual Enhancement
von: Ming, Lingfeng, et al.
Veröffentlicht: (2024)
von: Ming, Lingfeng, et al.
Veröffentlicht: (2024)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
von: Wen, Xumeng, et al.
Veröffentlicht: (2025)
von: Wen, Xumeng, et al.
Veröffentlicht: (2025)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation
von: Pan, Jingheng, et al.
Veröffentlicht: (2026)
von: Pan, Jingheng, et al.
Veröffentlicht: (2026)
New Trends for Modern Machine Translation with Large Reasoning Models
von: Liu, Sinuo, et al.
Veröffentlicht: (2025)
von: Liu, Sinuo, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
The Box is in the Pen: Evaluating Commonsense Reasoning in Neural Machine Translation
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts
von: Wu, Minghao, et al.
Veröffentlicht: (2024)
von: Wu, Minghao, et al.
Veröffentlicht: (2024)
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware Neurons
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision
von: Wang, Pengcheng, et al.
Veröffentlicht: (2026)
von: Wang, Pengcheng, et al.
Veröffentlicht: (2026)
TransBench: Benchmarking Machine Translation for Industrial-Scale Applications
von: Li, Haijun, et al.
Veröffentlicht: (2025)
von: Li, Haijun, et al.
Veröffentlicht: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
Incentivizing LLMs to Self-Verify Their Answers
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
von: Gunjal, Anisha, et al.
Veröffentlicht: (2025)
von: Gunjal, Anisha, et al.
Veröffentlicht: (2025)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
Incentivizing Knowledge Transfers
von: Kuang, Zhonghong, et al.
Veröffentlicht: (2025)
von: Kuang, Zhonghong, et al.
Veröffentlicht: (2025)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
von: Yan, Kai, et al.
Veröffentlicht: (2026)
von: Yan, Kai, et al.
Veröffentlicht: (2026)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
von: Li, Hengtao, et al.
Veröffentlicht: (2025)
von: Li, Hengtao, et al.
Veröffentlicht: (2025)
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
An Empirical Study on the Robustness of Massively Multilingual Neural Machine Translation
von: Supryadi, et al.
Veröffentlicht: (2024)
von: Supryadi, et al.
Veröffentlicht: (2024)
Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards
von: Lara, Luis, et al.
Veröffentlicht: (2026)
von: Lara, Luis, et al.
Veröffentlicht: (2026)
DAO-Agent: Zero Knowledge-Verified Incentives for Decentralized Multi-Agent Coordination
von: Xia, Yihan, et al.
Veröffentlicht: (2025)
von: Xia, Yihan, et al.
Veröffentlicht: (2025)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
von: Huang, Guanhua, et al.
Veröffentlicht: (2025)
von: Huang, Guanhua, et al.
Veröffentlicht: (2025)
Reinforcing General Reasoning without Verifiers
von: Zhou, Xiangxin, et al.
Veröffentlicht: (2025)
von: Zhou, Xiangxin, et al.
Veröffentlicht: (2025)
ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
von: Li, Yuanyang, et al.
Veröffentlicht: (2026)
von: Li, Yuanyang, et al.
Veröffentlicht: (2026)
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
von: Wang, Peisong, et al.
Veröffentlicht: (2025)
von: Wang, Peisong, et al.
Veröffentlicht: (2025)
Difficulty-Estimated Policy Optimization
von: Zhao, Yu, et al.
Veröffentlicht: (2026)
von: Zhao, Yu, et al.
Veröffentlicht: (2026)
Translating Malevolence in Popular Culture: From Jinn to Demons in Cross‐Cultural Portrayal of Evil Entities
von: Mir Mohammad Khademnabi
Veröffentlicht: (2025)
von: Mir Mohammad Khademnabi
Veröffentlicht: (2025)
Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation
von: Wu, Qingyu, et al.
Veröffentlicht: (2026)
von: Wu, Qingyu, et al.
Veröffentlicht: (2026)
Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation
von: Bo, Zitong, et al.
Veröffentlicht: (2025)
von: Bo, Zitong, et al.
Veröffentlicht: (2025)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
von: Xu, Ran, et al.
Veröffentlicht: (2026)
von: Xu, Ran, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
von: Wu, Xinwei, et al.
Veröffentlicht: (2026) -
From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2026) -
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
von: Wang, Hao, et al.
Veröffentlicht: (2025) -
Challenging Multilingual LLMs: A New Taxonomy and Benchmark for Unraveling Hallucination in Translation
von: Wu, Xinwei, et al.
Veröffentlicht: (2025) -
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
von: Wang, Xintong, et al.
Veröffentlicht: (2025)