From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | zhang, Ranxu, li, zeyang, Huang, Jiacheng, Zhang, Rui, Xu, Xiaozhou, zhe, sun, Zhang, Yanyong, Wang, Chao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
by: Zhang, Chenchen
Published: (2026)
by: Zhang, Chenchen
Published: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
by: Liu, Xiaoqian, et al.
Published: (2025)
by: Liu, Xiaoqian, et al.
Published: (2025)
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
by: Ma, Xilai, et al.
Published: (2026)
by: Ma, Xilai, et al.
Published: (2026)
Anyprefer: An Agentic Framework for Preference Data Synthesis
by: Zhou, Yiyang, et al.
Published: (2025)
by: Zhou, Yiyang, et al.
Published: (2025)
DeepTutor: Towards Agentic Personalized Tutoring
by: Zhao, Bingxi, et al.
Published: (2026)
by: Zhao, Bingxi, et al.
Published: (2026)
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
by: Ye, Jing, et al.
Published: (2025)
by: Ye, Jing, et al.
Published: (2025)
Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning
by: Jin, Song, et al.
Published: (2025)
by: Jin, Song, et al.
Published: (2025)
MTA: A Merge-then-Adapt Framework for Personalized Large Language Model
by: Li, Xiaopeng, et al.
Published: (2025)
by: Li, Xiaopeng, et al.
Published: (2025)
DeltaMem: Towards Agentic Memory Management via Reinforcement Learning
by: Zhang, Qi, et al.
Published: (2026)
by: Zhang, Qi, et al.
Published: (2026)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
by: Shen, Jingyan, et al.
Published: (2025)
by: Shen, Jingyan, et al.
Published: (2025)
Preference-Aware Rubric Learning for Personalized Evaluation
by: Qiu, Yilun, et al.
Published: (2026)
by: Qiu, Yilun, et al.
Published: (2026)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
by: Peng, Hao, et al.
Published: (2025)
by: Peng, Hao, et al.
Published: (2025)
TransLLM: A Unified Multi-Task Foundation Framework for Urban Transportation via Learnable Prompting
by: Leng, Jiaming, et al.
Published: (2025)
by: Leng, Jiaming, et al.
Published: (2025)
From Correction to Mastery: Reinforced Distillation of Large Language Model Agents
by: Lyu, Yuanjie, et al.
Published: (2025)
by: Lyu, Yuanjie, et al.
Published: (2025)
Demystifying Reinforcement Learning in Agentic Reasoning
by: Yu, Zhaochen, et al.
Published: (2025)
by: Yu, Zhaochen, et al.
Published: (2025)
Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning
by: Cheng, Mingyue, et al.
Published: (2025)
by: Cheng, Mingyue, et al.
Published: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
by: Zhang, Guibin, et al.
Published: (2025)
by: Zhang, Guibin, et al.
Published: (2025)
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
by: Zhang, Zishuai, et al.
Published: (2025)
by: Zhang, Zishuai, et al.
Published: (2025)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
by: Bai, Fengshuo, et al.
Published: (2024)
by: Bai, Fengshuo, et al.
Published: (2024)
ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship
by: Huang, Zhaopei, et al.
Published: (2026)
by: Huang, Zhaopei, et al.
Published: (2026)
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
by: Wang, Yanbo, et al.
Published: (2025)
by: Wang, Yanbo, et al.
Published: (2025)
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
by: Zhang, Weixu, et al.
Published: (2026)
by: Zhang, Weixu, et al.
Published: (2026)
AFSPP: Agent Framework for Shaping Preference and Personality with Large Language Models
by: He, Zihong, et al.
Published: (2024)
by: He, Zihong, et al.
Published: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
by: Poddar, Sriyash, et al.
Published: (2024)
by: Poddar, Sriyash, et al.
Published: (2024)
AutoForge: Automated Environment Synthesis for Agentic Reinforcement Learning
by: Cai, Shihao, et al.
Published: (2025)
by: Cai, Shihao, et al.
Published: (2025)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
by: Shen, Junhao, et al.
Published: (2026)
by: Shen, Junhao, et al.
Published: (2026)
Agentic Reinforcement Learning for Search is Unsafe
by: Yang, Yushi, et al.
Published: (2025)
by: Yang, Yushi, et al.
Published: (2025)
StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning
by: Li, Shiyang, et al.
Published: (2026)
by: Li, Shiyang, et al.
Published: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning
by: Luo, Haoran, et al.
Published: (2025)
by: Luo, Haoran, et al.
Published: (2025)
MCLMR: A Model-Agnostic Causal Learning Framework for Multi-Behavior Recommendation
by: Zhang, Ranxu, et al.
Published: (2026)
by: Zhang, Ranxu, et al.
Published: (2026)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
by: Xia, Han, et al.
Published: (2024)
by: Xia, Han, et al.
Published: (2024)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
by: Li, Jian, et al.
Published: (2024)
by: Li, Jian, et al.
Published: (2024)
BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
by: Zhao, Yubao, et al.
Published: (2026)
by: Zhao, Yubao, et al.
Published: (2026)
A Unified Agentic Framework for Evaluating Conditional Image Generation
by: Wang, Jifang, et al.
Published: (2025)
by: Wang, Jifang, et al.
Published: (2025)
lizhez/MusicCloud: v1.0
by: li zhe
Published: (2025)
by: li zhe
Published: (2025)
Graph-Driven Multimodal Feature Learning Framework for Apparent Personality Assessment
by: Wang, Kangsheng, et al.
Published: (2025)
by: Wang, Kangsheng, et al.
Published: (2025)
CARL: Criticality-Aware Agentic Reinforcement Learning
by: Shen, Leyang, et al.
Published: (2025)
by: Shen, Leyang, et al.
Published: (2025)
General Preference Reinforcement Learning
by: Umer, Muhammad, et al.
Published: (2026)
by: Umer, Muhammad, et al.
Published: (2026)
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
by: Cao, Zongwan, et al.
Published: (2026)
by: Cao, Zongwan, et al.
Published: (2026)
Similar Items
-
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
by: Zhang, Chenchen
Published: (2026) -
Agentic Reinforcement Learning with Implicit Step Rewards
by: Liu, Xiaoqian, et al.
Published: (2025) -
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
by: Ma, Xilai, et al.
Published: (2026) -
Anyprefer: An Agentic Framework for Preference Data Synthesis
by: Zhou, Yiyang, et al.
Published: (2025) -
DeepTutor: Towards Agentic Personalized Tutoring
by: Zhao, Bingxi, et al.
Published: (2026)