LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Wenkai, Liu, Weijie, Xie, Ruobing, Guo, Yiju, Wu, Lulu, Yang, Saiyong, Lin, Yankai |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
von: Yang, Wenkai, et al.
Veröffentlicht: (2026)
von: Yang, Wenkai, et al.
Veröffentlicht: (2026)
Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification
von: Guo, Yiju, et al.
Veröffentlicht: (2026)
von: Guo, Yiju, et al.
Veröffentlicht: (2026)
Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning
von: Guo, Yiju, et al.
Veröffentlicht: (2025)
von: Guo, Yiju, et al.
Veröffentlicht: (2025)
Exploring Backdoor Vulnerabilities of Chat Models
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2024)
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2024)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
von: Fang, Wenkai, et al.
Veröffentlicht: (2025)
von: Fang, Wenkai, et al.
Veröffentlicht: (2025)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
Self-Distillation for Multi-Token Prediction
von: Zhao, Guoliang, et al.
Veröffentlicht: (2026)
von: Zhao, Guoliang, et al.
Veröffentlicht: (2026)
Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment
von: Guo, Yiju, et al.
Veröffentlicht: (2024)
von: Guo, Yiju, et al.
Veröffentlicht: (2024)
DeepCritic: Deliberate Critique with Large Language Models
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
von: Fei, Wu, et al.
Veröffentlicht: (2025)
von: Fei, Wu, et al.
Veröffentlicht: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
von: Shen, Wei, et al.
Veröffentlicht: (2024)
von: Shen, Wei, et al.
Veröffentlicht: (2024)
Self-Evolved Reward Learning for LLMs
von: Huang, Chenghua, et al.
Veröffentlicht: (2024)
von: Huang, Chenghua, et al.
Veröffentlicht: (2024)
RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
von: Li, Jiahui, et al.
Veröffentlicht: (2024)
von: Li, Jiahui, et al.
Veröffentlicht: (2024)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
von: Yang, Wenjie, et al.
Veröffentlicht: (2025)
von: Yang, Wenjie, et al.
Veröffentlicht: (2025)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
von: Yang, Wenkai, et al.
Veröffentlicht: (2024)
von: Yang, Wenkai, et al.
Veröffentlicht: (2024)
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
von: Tan, Hongze, et al.
Veröffentlicht: (2025)
von: Tan, Hongze, et al.
Veröffentlicht: (2025)
Selective Preference Optimization via Token-Level Reward Function Estimation
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
von: Wen, Xumeng, et al.
Veröffentlicht: (2025)
von: Wen, Xumeng, et al.
Veröffentlicht: (2025)
Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization
von: Yang, Wenkai, et al.
Veröffentlicht: (2024)
von: Yang, Wenkai, et al.
Veröffentlicht: (2024)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
RLMR: Reinforcement Learning with Mixed Rewards for Creative Writing
von: Liao, Jianxing, et al.
Veröffentlicht: (2025)
von: Liao, Jianxing, et al.
Veröffentlicht: (2025)
Language Imbalance Driven Rewarding for Multilingual Self-improving
von: Yang, Wen, et al.
Veröffentlicht: (2024)
von: Yang, Wen, et al.
Veröffentlicht: (2024)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
Exploring the Benefit of Activation Sparsity in Pre-training
von: Zhang, Zhengyan, et al.
Veröffentlicht: (2024)
von: Zhang, Zhengyan, et al.
Veröffentlicht: (2024)
STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens
von: Liu, Shiqi, et al.
Veröffentlicht: (2026)
von: Liu, Shiqi, et al.
Veröffentlicht: (2026)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026)
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
von: Yang, Zixuan, et al.
Veröffentlicht: (2026)
von: Yang, Zixuan, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Token-level Feedback for Controllable Text Generation
von: Li, Wendi, et al.
Veröffentlicht: (2024)
von: Li, Wendi, et al.
Veröffentlicht: (2024)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
von: Wu, Tianyi, et al.
Veröffentlicht: (2026)
von: Wu, Tianyi, et al.
Veröffentlicht: (2026)
Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
von: Liu, Yule, et al.
Veröffentlicht: (2025)
von: Liu, Yule, et al.
Veröffentlicht: (2025)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
von: Rahman, Salman, et al.
Veröffentlicht: (2025)
von: Rahman, Salman, et al.
Veröffentlicht: (2025)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
von: Xu, Tianze, et al.
Veröffentlicht: (2026)
von: Xu, Tianze, et al.
Veröffentlicht: (2026)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
von: Wang, Zhen, et al.
Veröffentlicht: (2025)
von: Wang, Zhen, et al.
Veröffentlicht: (2025)
Table-R1: Region-based Reinforcement Learning for Table Understanding
von: Wu, Zhenhe, et al.
Veröffentlicht: (2025)
von: Wu, Zhenhe, et al.
Veröffentlicht: (2025)
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
von: Wang, Peisong, et al.
Veröffentlicht: (2025)
von: Wang, Peisong, et al.
Veröffentlicht: (2025)
CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models
von: Tan, Zhehao, et al.
Veröffentlicht: (2026)
von: Tan, Zhehao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
von: Yang, Wenkai, et al.
Veröffentlicht: (2026) -
Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification
von: Guo, Yiju, et al.
Veröffentlicht: (2026) -
Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning
von: Guo, Yiju, et al.
Veröffentlicht: (2025) -
Exploring Backdoor Vulnerabilities of Chat Models
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2024) -
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
von: Fang, Wenkai, et al.
Veröffentlicht: (2025)