Gespeichert in:
| Hauptverfasser: | zhang, Ranxu, li, zeyang, Huang, Jiacheng, Zhang, Rui, Xu, Xiaozhou, zhe, sun, Zhang, Yanyong, Wang, Chao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2605.23382 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Anyprefer: An Agentic Framework for Preference Data Synthesis
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
von: Ma, Xilai, et al.
Veröffentlicht: (2026)
von: Ma, Xilai, et al.
Veröffentlicht: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2025)
DeepTutor: Towards Agentic Personalized Tutoring
von: Zhao, Bingxi, et al.
Veröffentlicht: (2026)
von: Zhao, Bingxi, et al.
Veröffentlicht: (2026)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
von: Zhang, Chenchen
Veröffentlicht: (2026)
von: Zhang, Chenchen
Veröffentlicht: (2026)
MTA: A Merge-then-Adapt Framework for Personalized Large Language Model
von: Li, Xiaopeng, et al.
Veröffentlicht: (2025)
von: Li, Xiaopeng, et al.
Veröffentlicht: (2025)
MCLMR: A Model-Agnostic Causal Learning Framework for Multi-Behavior Recommendation
von: Zhang, Ranxu, et al.
Veröffentlicht: (2026)
von: Zhang, Ranxu, et al.
Veröffentlicht: (2026)
TransLLM: A Unified Multi-Task Foundation Framework for Urban Transportation via Learnable Prompting
von: Leng, Jiaming, et al.
Veröffentlicht: (2025)
von: Leng, Jiaming, et al.
Veröffentlicht: (2025)
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
von: Ye, Jing, et al.
Veröffentlicht: (2025)
von: Ye, Jing, et al.
Veröffentlicht: (2025)
Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning
von: Jin, Song, et al.
Veröffentlicht: (2025)
von: Jin, Song, et al.
Veröffentlicht: (2025)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
von: Shen, Jingyan, et al.
Veröffentlicht: (2025)
von: Shen, Jingyan, et al.
Veröffentlicht: (2025)
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
von: Zhang, Zishuai, et al.
Veröffentlicht: (2025)
von: Zhang, Zishuai, et al.
Veröffentlicht: (2025)
DeltaMem: Towards Agentic Memory Management via Reinforcement Learning
von: Zhang, Qi, et al.
Veröffentlicht: (2026)
von: Zhang, Qi, et al.
Veröffentlicht: (2026)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
von: Peng, Hao, et al.
Veröffentlicht: (2025)
von: Peng, Hao, et al.
Veröffentlicht: (2025)
Preference-Aware Rubric Learning for Personalized Evaluation
von: Qiu, Yilun, et al.
Veröffentlicht: (2026)
von: Qiu, Yilun, et al.
Veröffentlicht: (2026)
From Correction to Mastery: Reinforced Distillation of Large Language Model Agents
von: Lyu, Yuanjie, et al.
Veröffentlicht: (2025)
von: Lyu, Yuanjie, et al.
Veröffentlicht: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
von: Bai, Fengshuo, et al.
Veröffentlicht: (2024)
von: Bai, Fengshuo, et al.
Veröffentlicht: (2024)
lizhez/MusicCloud: v1.0
von: li zhe
Veröffentlicht: (2025)
von: li zhe
Veröffentlicht: (2025)
Demystifying Reinforcement Learning in Agentic Reasoning
von: Yu, Zhaochen, et al.
Veröffentlicht: (2025)
von: Yu, Zhaochen, et al.
Veröffentlicht: (2025)
Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning
von: Cheng, Mingyue, et al.
Veröffentlicht: (2025)
von: Cheng, Mingyue, et al.
Veröffentlicht: (2025)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship
von: Huang, Zhaopei, et al.
Veröffentlicht: (2026)
von: Huang, Zhaopei, et al.
Veröffentlicht: (2026)
AFSPP: Agent Framework for Shaping Preference and Personality with Large Language Models
von: He, Zihong, et al.
Veröffentlicht: (2024)
von: He, Zihong, et al.
Veröffentlicht: (2024)
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
von: Zhang, Weixu, et al.
Veröffentlicht: (2026)
von: Zhang, Weixu, et al.
Veröffentlicht: (2026)
AutoForge: Automated Environment Synthesis for Agentic Reinforcement Learning
von: Cai, Shihao, et al.
Veröffentlicht: (2025)
von: Cai, Shihao, et al.
Veröffentlicht: (2025)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
von: Shen, Junhao, et al.
Veröffentlicht: (2026)
von: Shen, Junhao, et al.
Veröffentlicht: (2026)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
von: Li, Jian, et al.
Veröffentlicht: (2024)
von: Li, Jian, et al.
Veröffentlicht: (2024)
StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning
von: Li, Shiyang, et al.
Veröffentlicht: (2026)
von: Li, Shiyang, et al.
Veröffentlicht: (2026)
Agentic Reinforcement Learning for Search is Unsafe
von: Yang, Yushi, et al.
Veröffentlicht: (2025)
von: Yang, Yushi, et al.
Veröffentlicht: (2025)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning
von: Luo, Haoran, et al.
Veröffentlicht: (2025)
von: Luo, Haoran, et al.
Veröffentlicht: (2025)
A Unified Agentic Framework for Evaluating Conditional Image Generation
von: Wang, Jifang, et al.
Veröffentlicht: (2025)
von: Wang, Jifang, et al.
Veröffentlicht: (2025)
Graph-Driven Multimodal Feature Learning Framework for Apparent Personality Assessment
von: Wang, Kangsheng, et al.
Veröffentlicht: (2025)
von: Wang, Kangsheng, et al.
Veröffentlicht: (2025)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
von: Xia, Han, et al.
Veröffentlicht: (2024)
von: Xia, Han, et al.
Veröffentlicht: (2024)
CARL: Criticality-Aware Agentic Reinforcement Learning
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
On the Role of Preference Variance in Preference Optimization
von: Guo, Jiacheng, et al.
Veröffentlicht: (2025)
von: Guo, Jiacheng, et al.
Veröffentlicht: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
von: Lu, Meng, et al.
Veröffentlicht: (2025)
von: Lu, Meng, et al.
Veröffentlicht: (2025)
From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents
von: Xu, Derong, et al.
Veröffentlicht: (2025)
von: Xu, Derong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Anyprefer: An Agentic Framework for Preference Data Synthesis
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025) -
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
von: Ma, Xilai, et al.
Veröffentlicht: (2026) -
Agentic Reinforcement Learning with Implicit Step Rewards
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2025) -
DeepTutor: Towards Agentic Personalized Tutoring
von: Zhao, Bingxi, et al.
Veröffentlicht: (2026) -
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
von: Zhang, Chenchen
Veröffentlicht: (2026)