SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Wenjie, Zheng, Mao, Song, Mingyang, Li, Zheng, Wang, Sitong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
por: Zhao, Andrew, et al.
Publicado: (2025)
por: Zhao, Andrew, et al.
Publicado: (2025)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
por: Yang, Wenkai, et al.
Publicado: (2025)
por: Yang, Wenkai, et al.
Publicado: (2025)
MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
por: Feng, Zhaopeng, et al.
Publicado: (2025)
por: Feng, Zhaopeng, et al.
Publicado: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025)
por: Ye, Zhiling, et al.
Publicado: (2025)
SSR: Socratic Self-Refine for Large Language Model Reasoning
por: Shi, Haizhou, et al.
Publicado: (2025)
por: Shi, Haizhou, et al.
Publicado: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
por: Wang, Zhen, et al.
Publicado: (2025)
por: Wang, Zhen, et al.
Publicado: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
por: Fei, Wu, et al.
Publicado: (2025)
por: Fei, Wu, et al.
Publicado: (2025)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
por: Zeng, Weihao, et al.
Publicado: (2025)
por: Zeng, Weihao, et al.
Publicado: (2025)
PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models
por: Song, Mingyang, et al.
Publicado: (2025)
por: Song, Mingyang, et al.
Publicado: (2025)
Reinforcement Learning with Conditional Expectation Reward
por: Xiao, Changyi, et al.
Publicado: (2026)
por: Xiao, Changyi, et al.
Publicado: (2026)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
por: Song, Kefan, et al.
Publicado: (2025)
por: Song, Kefan, et al.
Publicado: (2025)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
por: Cheng, Ruoxi, et al.
Publicado: (2025)
por: Cheng, Ruoxi, et al.
Publicado: (2025)
Structured Document Translation via Format Reinforcement Learning
por: Song, Haiyue, et al.
Publicado: (2025)
por: Song, Haiyue, et al.
Publicado: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
por: Gunjal, Anisha, et al.
Publicado: (2025)
por: Gunjal, Anisha, et al.
Publicado: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
por: Rahman, Salman, et al.
Publicado: (2025)
por: Rahman, Salman, et al.
Publicado: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
por: Zhang, Qingru, et al.
Publicado: (2025)
por: Zhang, Qingru, et al.
Publicado: (2025)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
por: Sun, Zetian, et al.
Publicado: (2025)
por: Sun, Zetian, et al.
Publicado: (2025)
Process Reinforcement through Implicit Rewards
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
Understanding and Mitigating the Uncertainty in Zero-Shot Translation
por: Wang, Wenxuan, et al.
Publicado: (2022)
por: Wang, Wenxuan, et al.
Publicado: (2022)
Self-generated Replay Memories for Continual Neural Machine Translation
por: Resta, Michele, et al.
Publicado: (2024)
por: Resta, Michele, et al.
Publicado: (2024)
PRewrite: Prompt Rewriting with Reinforcement Learning
por: Kong, Weize, et al.
Publicado: (2024)
por: Kong, Weize, et al.
Publicado: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
TAT-R1: Terminology-Aware Translation with Reinforcement Learning and Word Alignment
por: Li, Zheng, et al.
Publicado: (2025)
por: Li, Zheng, et al.
Publicado: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
por: Ma, Zhengzhao, et al.
Publicado: (2026)
por: Ma, Zhengzhao, et al.
Publicado: (2026)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
por: Stojanovski, Zafir, et al.
Publicado: (2025)
por: Stojanovski, Zafir, et al.
Publicado: (2025)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
por: Nguyen, Hieu Trung, et al.
Publicado: (2026)
por: Nguyen, Hieu Trung, et al.
Publicado: (2026)
MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning
por: Feng, Zhaopeng, et al.
Publicado: (2025)
por: Feng, Zhaopeng, et al.
Publicado: (2025)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
por: Yan, Kai, et al.
Publicado: (2026)
por: Yan, Kai, et al.
Publicado: (2026)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
por: Li, Haozhan, et al.
Publicado: (2025)
por: Li, Haozhan, et al.
Publicado: (2025)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
por: Karlekar, Sweta, et al.
Publicado: (2026)
por: Karlekar, Sweta, et al.
Publicado: (2026)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
por: Li, Yanshi, et al.
Publicado: (2024)
por: Li, Yanshi, et al.
Publicado: (2024)
Knowledge Graph Reasoning with Self-supervised Reinforcement Learning
por: Ma, Ying, et al.
Publicado: (2024)
por: Ma, Ying, et al.
Publicado: (2024)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
por: Huang, Chengsong, et al.
Publicado: (2025)
por: Huang, Chengsong, et al.
Publicado: (2025)
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
por: Zhang, Jinghao, et al.
Publicado: (2025)
por: Zhang, Jinghao, et al.
Publicado: (2025)
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
Process Rewards with Learned Reliability
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning
por: Wang, Ru, et al.
Publicado: (2025)
por: Wang, Ru, et al.
Publicado: (2025)
Ejemplares similares
-
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
por: Zhao, Andrew, et al.
Publicado: (2025) -
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
por: Yang, Wenkai, et al.
Publicado: (2025) -
MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
por: Feng, Zhaopeng, et al.
Publicado: (2025) -
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025) -
SSR: Socratic Self-Refine for Large Language Model Reasoning
por: Shi, Haizhou, et al.
Publicado: (2025)