Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Shiping, Chen, Hongzhan, Quan, Xiaojun, Wang, Qifan, Huang, Lifu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Discriminative Policy Optimization for Token-Level Reward Models
par: Chen, Hongzhan, et autres
Publié: (2025)
par: Chen, Hongzhan, et autres
Publié: (2025)
Stabilizing Policy Optimization via Logits Convexity
par: Chen, Hongzhan, et autres
Publié: (2026)
par: Chen, Hongzhan, et autres
Publié: (2026)
Advantage-Guided Distillation for Preference Alignment in Small Language Models
par: Gao, Shiping, et autres
Publié: (2025)
par: Gao, Shiping, et autres
Publié: (2025)
Weighted-Reward Preference Optimization for Implicit Model Fusion
par: Yang, Ziyi, et autres
Publié: (2024)
par: Yang, Ziyi, et autres
Publié: (2024)
Self-Evolution Fine-Tuning for Policy Optimization
par: Chen, Ruijun, et autres
Publié: (2024)
par: Chen, Ruijun, et autres
Publié: (2024)
Error-driven Data-efficient Large Multimodal Model Tuning
par: Yao, Barry Menglong, et autres
Publié: (2024)
par: Yao, Barry Menglong, et autres
Publié: (2024)
RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
par: Li, Jiahui, et autres
Publié: (2024)
par: Li, Jiahui, et autres
Publié: (2024)
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)
par: Liu, Xiaoqian, et autres
Publié: (2025)
PsyPlay: Personality-Infused Role-Playing Conversational Agents
par: Yang, Tao, et autres
Publié: (2025)
par: Yang, Tao, et autres
Publié: (2025)
Knowledge Distillation of Black-Box Large Language Models
par: Chen, Hongzhan, et autres
Publié: (2024)
par: Chen, Hongzhan, et autres
Publié: (2024)
Debate as Optimization: Adaptive Conformal Prediction and Diverse Retrieval for Event Extraction
par: Wang, Sijia, et autres
Publié: (2024)
par: Wang, Sijia, et autres
Publié: (2024)
EAVE: Efficient Product Attribute Value Extraction via Lightweight Sparse-layer Interaction
par: Yang, Li, et autres
Publié: (2024)
par: Yang, Li, et autres
Publié: (2024)
How Do Large Language Models Learn Concepts During Continual Pre-Training?
par: Yao, Barry Menglong, et autres
Publié: (2026)
par: Yao, Barry Menglong, et autres
Publié: (2026)
Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
par: Shen, Weizhou, et autres
Publié: (2024)
par: Shen, Weizhou, et autres
Publié: (2024)
Detecting Prefix Bias in LLM-based Reward Models
par: Kumar, Ashwin, et autres
Publié: (2025)
par: Kumar, Ashwin, et autres
Publié: (2025)
SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
par: Chen, Hongzhan, et autres
Publié: (2024)
par: Chen, Hongzhan, et autres
Publié: (2024)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
par: Lin, Yong, et autres
Publié: (2024)
par: Lin, Yong, et autres
Publié: (2024)
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
par: Ping, Bowen, et autres
Publié: (2026)
par: Ping, Bowen, et autres
Publié: (2026)
Fine-Grained Detoxification via Instance-Level Prefixes for Large Language Models
par: Yi, Xin, et autres
Publié: (2024)
par: Yi, Xin, et autres
Publié: (2024)
Accelerating Direct Preference Optimization with Prefix Sharing
par: Wang, Franklin, et autres
Publié: (2024)
par: Wang, Franklin, et autres
Publié: (2024)
RoRA-VLM: Robust Retrieval-Augmented Vision Language Models
par: Qi, Jingyuan, et autres
Publié: (2024)
par: Qi, Jingyuan, et autres
Publié: (2024)
LLM-Enhanced Multiple Instance Learning for Joint Rumor and Stance Detection with Social Context Information
par: Yang, Ruichao, et autres
Publié: (2025)
par: Yang, Ruichao, et autres
Publié: (2025)
Probabilistic Token Alignment for Large Language Model Fusion
par: Zeng, Runjia, et autres
Publié: (2025)
par: Zeng, Runjia, et autres
Publié: (2025)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
par: Sun, Yiliu, et autres
Publié: (2025)
par: Sun, Yiliu, et autres
Publié: (2025)
Optimizing Sentence Embedding with Pseudo-Labeling and Model Ensembles: A Hierarchical Framework for Enhanced NLP Tasks
par: Liu, Ziwei, et autres
Publié: (2025)
par: Liu, Ziwei, et autres
Publié: (2025)
Targeted Augmentation for Low-Resource Event Extraction
par: Wang, Sijia, et autres
Publié: (2024)
par: Wang, Sijia, et autres
Publié: (2024)
LLM Braces: Straightening Out LLM Predictions with Relevant Sub-Updates
par: Shen, Ying, et autres
Publié: (2025)
par: Shen, Ying, et autres
Publié: (2025)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
par: Lin, Xingyu, et autres
Publié: (2026)
par: Lin, Xingyu, et autres
Publié: (2026)
PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning
par: Feng, Ruixiang, et autres
Publié: (2026)
par: Feng, Ruixiang, et autres
Publié: (2026)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
par: Lin, Xingyu, et autres
Publié: (2025)
par: Lin, Xingyu, et autres
Publié: (2025)
Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning
par: Du, Bodong, et autres
Publié: (2026)
par: Du, Bodong, et autres
Publié: (2026)
Process Reinforcement through Implicit Rewards
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization
par: Su, Jianghao, et autres
Publié: (2025)
par: Su, Jianghao, et autres
Publié: (2025)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
par: Yang, Wen, et autres
Publié: (2025)
par: Yang, Wen, et autres
Publié: (2025)
AMELI: Enhancing Multimodal Entity Linking with Fine-Grained Attributes
par: Yao, Barry Menglong, et autres
Publié: (2023)
par: Yao, Barry Menglong, et autres
Publié: (2023)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Bootstrapping Language Models with DPO Implicit Rewards
par: Chen, Changyu, et autres
Publié: (2024)
par: Chen, Changyu, et autres
Publié: (2024)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
Documents similaires
-
Discriminative Policy Optimization for Token-Level Reward Models
par: Chen, Hongzhan, et autres
Publié: (2025) -
Stabilizing Policy Optimization via Logits Convexity
par: Chen, Hongzhan, et autres
Publié: (2026) -
Advantage-Guided Distillation for Preference Alignment in Small Language Models
par: Gao, Shiping, et autres
Publié: (2025) -
Weighted-Reward Preference Optimization for Implicit Model Fusion
par: Yang, Ziyi, et autres
Publié: (2024) -
Self-Evolution Fine-Tuning for Policy Optimization
par: Chen, Ruijun, et autres
Publié: (2024)