UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Feng, Li, Shijia, Zhang, Chunmao, Ma, Zhanyu, Xu, Jun, Gao, Jiuchong, Hao, Jinghua, He, Renqing, Xu, Jingwen, Liu, Han |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
par: Liu, Yan, et autres
Publié: (2026)
par: Liu, Yan, et autres
Publié: (2026)
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
par: Zhang, Nonghai, et autres
Publié: (2026)
par: Zhang, Nonghai, et autres
Publié: (2026)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
par: Zou, Wenhao, et autres
Publié: (2026)
par: Zou, Wenhao, et autres
Publié: (2026)
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
par: Liu, Zihao, et autres
Publié: (2026)
par: Liu, Zihao, et autres
Publié: (2026)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
par: Ma, Weitao, et autres
Publié: (2026)
par: Ma, Weitao, et autres
Publié: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
par: Zhang, Jiaying, et autres
Publié: (2026)
par: Zhang, Jiaying, et autres
Publié: (2026)
State Rank Dynamics in Linear Attention LLMs
par: Sun, Ao, et autres
Publié: (2026)
par: Sun, Ao, et autres
Publié: (2026)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
par: Shi, Qinglong, et autres
Publié: (2026)
par: Shi, Qinglong, et autres
Publié: (2026)
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
par: Niu, Wenzhe, et autres
Publié: (2026)
par: Niu, Wenzhe, et autres
Publié: (2026)
VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series
par: Xu, Pengyu, et autres
Publié: (2025)
par: Xu, Pengyu, et autres
Publié: (2025)
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
par: Chen, Xinzhu, et autres
Publié: (2026)
par: Chen, Xinzhu, et autres
Publié: (2026)
PrLM: Learning Explicit Reasoning for Personalized RAG via Contrastive Reward Optimization
par: Zhang, Kepu, et autres
Publié: (2025)
par: Zhang, Kepu, et autres
Publié: (2025)
R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms
par: Yuan, Xiaowei, et autres
Publié: (2025)
par: Yuan, Xiaowei, et autres
Publié: (2025)
Towards User-level Private Reinforcement Learning with Human Feedback
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
User-centric Subjective Leaderboard by Customizable Reward Modeling
par: Jia, Qi, et autres
Publié: (2025)
par: Jia, Qi, et autres
Publié: (2025)
HumanLM: Simulating Users with State Alignment Beats Response Imitation
par: Wu, Shirley, et autres
Publié: (2026)
par: Wu, Shirley, et autres
Publié: (2026)
Reward-Driven Interaction: Enhancing Proactive Dialogue Agents through User Satisfaction Prediction
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Harvesting Efficient On-Demand Order Pooling from Skilled Couriers: Enhancing Graph Representation Learning for Refining Real-time Many-to-One Assignments
par: Liang, Yile, et autres
Publié: (2024)
par: Liang, Yile, et autres
Publié: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
par: Yang, Xu, et autres
Publié: (2023)
par: Yang, Xu, et autres
Publié: (2023)
MixTex: Unambiguous Recognition Should Not Rely Solely on Real Data
par: Luo, Renqing, et autres
Publié: (2024)
par: Luo, Renqing, et autres
Publié: (2024)
Reinforcement Learning from User Feedback
par: Han, Eric, et autres
Publié: (2025)
par: Han, Eric, et autres
Publié: (2025)
RM-R1: Reward Modeling as Reasoning
par: Chen, Xiusi, et autres
Publié: (2025)
par: Chen, Xiusi, et autres
Publié: (2025)
AccessFixer: Enhancing GUI Accessibility for Low Vision Users With R-GCN Model
par: Zhang, Mengxi, et autres
Publié: (2025)
par: Zhang, Mengxi, et autres
Publié: (2025)
User Behavior Simulation with Large Language Model based Agents
par: Wang, Lei, et autres
Publié: (2023)
par: Wang, Lei, et autres
Publié: (2023)
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
par: Zhang, Pinyi, et autres
Publié: (2026)
par: Zhang, Pinyi, et autres
Publié: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Reason4Rec: Large Language Models for Recommendation with Deliberative User Preference Alignment
par: Fang, Yi, et autres
Publié: (2025)
par: Fang, Yi, et autres
Publié: (2025)
Agentic Feedback Loop Modeling Improves Recommendation and User Simulation
par: Cai, Shihao, et autres
Publié: (2024)
par: Cai, Shihao, et autres
Publié: (2024)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
par: Xu, Shilin, et autres
Publié: (2025)
par: Xu, Shilin, et autres
Publié: (2025)
MTRec: Learning to Align with User Preferences via Mental Reward Models
par: Zhao, Mengchen, et autres
Publié: (2025)
par: Zhao, Mengchen, et autres
Publié: (2025)
Data-Driven Online Resource Allocation for User Experience Improvement in Mobile Edge Clouds
par: Fu, Liqun, et autres
Publié: (2024)
par: Fu, Liqun, et autres
Publié: (2024)
FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models
par: Wang, Yuxuan, et autres
Publié: (2025)
par: Wang, Yuxuan, et autres
Publié: (2025)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
par: Sun, Zhongxiang, et autres
Publié: (2025)
par: Sun, Zhongxiang, et autres
Publié: (2025)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
par: Liu, Biao, et autres
Publié: (2026)
par: Liu, Biao, et autres
Publié: (2026)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
par: Ma, Qiyao, et autres
Publié: (2026)
par: Ma, Qiyao, et autres
Publié: (2026)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
UOEP: User-Oriented Exploration Policy for Enhancing Long-Term User Experiences in Recommender Systems
par: Zhang, Changshuo, et autres
Publié: (2024)
par: Zhang, Changshuo, et autres
Publié: (2024)
Reinforced Model Merging
par: Han, Jiaqi, et autres
Publié: (2025)
par: Han, Jiaqi, et autres
Publié: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
par: Kim, Tae Soo, et autres
Publié: (2023)
par: Kim, Tae Soo, et autres
Publié: (2023)
Documents similaires
-
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
par: Liu, Yan, et autres
Publié: (2026) -
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
par: Zhang, Nonghai, et autres
Publié: (2026) -
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
par: Zou, Wenhao, et autres
Publié: (2026) -
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
par: Liu, Zihao, et autres
Publié: (2026) -
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
par: Ma, Weitao, et autres
Publié: (2026)