From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | zhang, Ranxu, li, zeyang, Huang, Jiacheng, Zhang, Rui, Xu, Xiaozhou, zhe, sun, Zhang, Yanyong, Wang, Chao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
di: Zhang, Chenchen
Pubblicazione: (2026)
di: Zhang, Chenchen
Pubblicazione: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
di: Ma, Xilai, et al.
Pubblicazione: (2026)
di: Ma, Xilai, et al.
Pubblicazione: (2026)
Anyprefer: An Agentic Framework for Preference Data Synthesis
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
DeepTutor: Towards Agentic Personalized Tutoring
di: Zhao, Bingxi, et al.
Pubblicazione: (2026)
di: Zhao, Bingxi, et al.
Pubblicazione: (2026)
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
di: Ye, Jing, et al.
Pubblicazione: (2025)
di: Ye, Jing, et al.
Pubblicazione: (2025)
Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning
di: Jin, Song, et al.
Pubblicazione: (2025)
di: Jin, Song, et al.
Pubblicazione: (2025)
MTA: A Merge-then-Adapt Framework for Personalized Large Language Model
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
DeltaMem: Towards Agentic Memory Management via Reinforcement Learning
di: Zhang, Qi, et al.
Pubblicazione: (2026)
di: Zhang, Qi, et al.
Pubblicazione: (2026)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
di: Shen, Jingyan, et al.
Pubblicazione: (2025)
di: Shen, Jingyan, et al.
Pubblicazione: (2025)
Preference-Aware Rubric Learning for Personalized Evaluation
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
di: Peng, Hao, et al.
Pubblicazione: (2025)
di: Peng, Hao, et al.
Pubblicazione: (2025)
TransLLM: A Unified Multi-Task Foundation Framework for Urban Transportation via Learnable Prompting
di: Leng, Jiaming, et al.
Pubblicazione: (2025)
di: Leng, Jiaming, et al.
Pubblicazione: (2025)
From Correction to Mastery: Reinforced Distillation of Large Language Model Agents
di: Lyu, Yuanjie, et al.
Pubblicazione: (2025)
di: Lyu, Yuanjie, et al.
Pubblicazione: (2025)
Demystifying Reinforcement Learning in Agentic Reasoning
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning
di: Cheng, Mingyue, et al.
Pubblicazione: (2025)
di: Cheng, Mingyue, et al.
Pubblicazione: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
di: Zhang, Zishuai, et al.
Pubblicazione: (2025)
di: Zhang, Zishuai, et al.
Pubblicazione: (2025)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship
di: Huang, Zhaopei, et al.
Pubblicazione: (2026)
di: Huang, Zhaopei, et al.
Pubblicazione: (2026)
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
di: Zhang, Weixu, et al.
Pubblicazione: (2026)
di: Zhang, Weixu, et al.
Pubblicazione: (2026)
AFSPP: Agent Framework for Shaping Preference and Personality with Large Language Models
di: He, Zihong, et al.
Pubblicazione: (2024)
di: He, Zihong, et al.
Pubblicazione: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
di: Poddar, Sriyash, et al.
Pubblicazione: (2024)
di: Poddar, Sriyash, et al.
Pubblicazione: (2024)
AutoForge: Automated Environment Synthesis for Agentic Reinforcement Learning
di: Cai, Shihao, et al.
Pubblicazione: (2025)
di: Cai, Shihao, et al.
Pubblicazione: (2025)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
di: Shen, Junhao, et al.
Pubblicazione: (2026)
di: Shen, Junhao, et al.
Pubblicazione: (2026)
Agentic Reinforcement Learning for Search is Unsafe
di: Yang, Yushi, et al.
Pubblicazione: (2025)
di: Yang, Yushi, et al.
Pubblicazione: (2025)
StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning
di: Li, Shiyang, et al.
Pubblicazione: (2026)
di: Li, Shiyang, et al.
Pubblicazione: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning
di: Luo, Haoran, et al.
Pubblicazione: (2025)
di: Luo, Haoran, et al.
Pubblicazione: (2025)
MCLMR: A Model-Agnostic Causal Learning Framework for Multi-Behavior Recommendation
di: Zhang, Ranxu, et al.
Pubblicazione: (2026)
di: Zhang, Ranxu, et al.
Pubblicazione: (2026)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
di: Xia, Han, et al.
Pubblicazione: (2024)
di: Xia, Han, et al.
Pubblicazione: (2024)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
di: Zhao, Yubao, et al.
Pubblicazione: (2026)
di: Zhao, Yubao, et al.
Pubblicazione: (2026)
A Unified Agentic Framework for Evaluating Conditional Image Generation
di: Wang, Jifang, et al.
Pubblicazione: (2025)
di: Wang, Jifang, et al.
Pubblicazione: (2025)
lizhez/MusicCloud: v1.0
di: li zhe
Pubblicazione: (2025)
di: li zhe
Pubblicazione: (2025)
Graph-Driven Multimodal Feature Learning Framework for Apparent Personality Assessment
di: Wang, Kangsheng, et al.
Pubblicazione: (2025)
di: Wang, Kangsheng, et al.
Pubblicazione: (2025)
CARL: Criticality-Aware Agentic Reinforcement Learning
di: Shen, Leyang, et al.
Pubblicazione: (2025)
di: Shen, Leyang, et al.
Pubblicazione: (2025)
General Preference Reinforcement Learning
di: Umer, Muhammad, et al.
Pubblicazione: (2026)
di: Umer, Muhammad, et al.
Pubblicazione: (2026)
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
di: Cao, Zongwan, et al.
Pubblicazione: (2026)
di: Cao, Zongwan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
di: Zhang, Chenchen
Pubblicazione: (2026) -
Agentic Reinforcement Learning with Implicit Step Rewards
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025) -
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
di: Ma, Xilai, et al.
Pubblicazione: (2026) -
Anyprefer: An Agentic Framework for Preference Data Synthesis
di: Zhou, Yiyang, et al.
Pubblicazione: (2025) -
DeepTutor: Towards Agentic Personalized Tutoring
di: Zhao, Bingxi, et al.
Pubblicazione: (2026)