UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Feng, Li, Shijia, Zhang, Chunmao, Ma, Zhanyu, Xu, Jun, Gao, Jiuchong, Hao, Jinghua, He, Renqing, Xu, Jingwen, Liu, Han |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
by: Liu, Yan, et al.
Published: (2026)
by: Liu, Yan, et al.
Published: (2026)
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
by: Zhang, Nonghai, et al.
Published: (2026)
by: Zhang, Nonghai, et al.
Published: (2026)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
by: Zou, Wenhao, et al.
Published: (2026)
by: Zou, Wenhao, et al.
Published: (2026)
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
by: Liu, Zihao, et al.
Published: (2026)
by: Liu, Zihao, et al.
Published: (2026)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
by: Ma, Weitao, et al.
Published: (2026)
by: Ma, Weitao, et al.
Published: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
by: Zhang, Jiaying, et al.
Published: (2026)
by: Zhang, Jiaying, et al.
Published: (2026)
State Rank Dynamics in Linear Attention LLMs
by: Sun, Ao, et al.
Published: (2026)
by: Sun, Ao, et al.
Published: (2026)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
by: Shi, Qinglong, et al.
Published: (2026)
by: Shi, Qinglong, et al.
Published: (2026)
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
by: Niu, Wenzhe, et al.
Published: (2026)
by: Niu, Wenzhe, et al.
Published: (2026)
VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series
by: Xu, Pengyu, et al.
Published: (2025)
by: Xu, Pengyu, et al.
Published: (2025)
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
by: Chen, Xinzhu, et al.
Published: (2026)
by: Chen, Xinzhu, et al.
Published: (2026)
PrLM: Learning Explicit Reasoning for Personalized RAG via Contrastive Reward Optimization
by: Zhang, Kepu, et al.
Published: (2025)
by: Zhang, Kepu, et al.
Published: (2025)
R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms
by: Yuan, Xiaowei, et al.
Published: (2025)
by: Yuan, Xiaowei, et al.
Published: (2025)
Towards User-level Private Reinforcement Learning with Human Feedback
by: Zhang, Jiaming, et al.
Published: (2025)
by: Zhang, Jiaming, et al.
Published: (2025)
User-centric Subjective Leaderboard by Customizable Reward Modeling
by: Jia, Qi, et al.
Published: (2025)
by: Jia, Qi, et al.
Published: (2025)
HumanLM: Simulating Users with State Alignment Beats Response Imitation
by: Wu, Shirley, et al.
Published: (2026)
by: Wu, Shirley, et al.
Published: (2026)
Reward-Driven Interaction: Enhancing Proactive Dialogue Agents through User Satisfaction Prediction
by: Shen, Wei, et al.
Published: (2025)
by: Shen, Wei, et al.
Published: (2025)
Harvesting Efficient On-Demand Order Pooling from Skilled Couriers: Enhancing Graph Representation Learning for Refining Real-time Many-to-One Assignments
by: Liang, Yile, et al.
Published: (2024)
by: Liang, Yile, et al.
Published: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
by: Yang, Xu, et al.
Published: (2023)
by: Yang, Xu, et al.
Published: (2023)
MixTex: Unambiguous Recognition Should Not Rely Solely on Real Data
by: Luo, Renqing, et al.
Published: (2024)
by: Luo, Renqing, et al.
Published: (2024)
Reinforcement Learning from User Feedback
by: Han, Eric, et al.
Published: (2025)
by: Han, Eric, et al.
Published: (2025)
RM-R1: Reward Modeling as Reasoning
by: Chen, Xiusi, et al.
Published: (2025)
by: Chen, Xiusi, et al.
Published: (2025)
AccessFixer: Enhancing GUI Accessibility for Low Vision Users With R-GCN Model
by: Zhang, Mengxi, et al.
Published: (2025)
by: Zhang, Mengxi, et al.
Published: (2025)
User Behavior Simulation with Large Language Model based Agents
by: Wang, Lei, et al.
Published: (2023)
by: Wang, Lei, et al.
Published: (2023)
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
by: Zhang, Pinyi, et al.
Published: (2026)
by: Zhang, Pinyi, et al.
Published: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
Reason4Rec: Large Language Models for Recommendation with Deliberative User Preference Alignment
by: Fang, Yi, et al.
Published: (2025)
by: Fang, Yi, et al.
Published: (2025)
Agentic Feedback Loop Modeling Improves Recommendation and User Simulation
by: Cai, Shihao, et al.
Published: (2024)
by: Cai, Shihao, et al.
Published: (2024)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
by: Xu, Shilin, et al.
Published: (2025)
by: Xu, Shilin, et al.
Published: (2025)
MTRec: Learning to Align with User Preferences via Mental Reward Models
by: Zhao, Mengchen, et al.
Published: (2025)
by: Zhao, Mengchen, et al.
Published: (2025)
Data-Driven Online Resource Allocation for User Experience Improvement in Mobile Edge Clouds
by: Fu, Liqun, et al.
Published: (2024)
by: Fu, Liqun, et al.
Published: (2024)
FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models
by: Wang, Yuxuan, et al.
Published: (2025)
by: Wang, Yuxuan, et al.
Published: (2025)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
by: Sun, Zhongxiang, et al.
Published: (2025)
by: Sun, Zhongxiang, et al.
Published: (2025)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
by: Liu, Biao, et al.
Published: (2026)
by: Liu, Biao, et al.
Published: (2026)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
by: Ma, Qiyao, et al.
Published: (2026)
by: Ma, Qiyao, et al.
Published: (2026)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
by: Zang, Yuhang, et al.
Published: (2025)
by: Zang, Yuhang, et al.
Published: (2025)
UOEP: User-Oriented Exploration Policy for Enhancing Long-Term User Experiences in Recommender Systems
by: Zhang, Changshuo, et al.
Published: (2024)
by: Zhang, Changshuo, et al.
Published: (2024)
Reinforced Model Merging
by: Han, Jiaqi, et al.
Published: (2025)
by: Han, Jiaqi, et al.
Published: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
by: Kim, Tae Soo, et al.
Published: (2023)
by: Kim, Tae Soo, et al.
Published: (2023)
Similar Items
-
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
by: Liu, Yan, et al.
Published: (2026) -
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
by: Zhang, Nonghai, et al.
Published: (2026) -
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
by: Zou, Wenhao, et al.
Published: (2026) -
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
by: Liu, Zihao, et al.
Published: (2026) -
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
by: Ma, Weitao, et al.
Published: (2026)