MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels
Fuente:
arXiv
Saved in:
| Main Authors: | Luo, Tianyang, Feng, Tao, Hua, Zhigang, Xie, Yan, Yang, Shuang, Liu, Ge, You, Jiaxuan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ExpGraph: Model-Agnostic Experience Learning with Graph-Structured Memory for LLM Agents
by: Feng, Tao, et al.
Published: (2026)
by: Feng, Tao, et al.
Published: (2026)
ExpWeaver: LLM Agents Learn from Experience via Latent RAG
by: Feng, Tao, et al.
Published: (2026)
by: Feng, Tao, et al.
Published: (2026)
ElasticMem: Latent Memory as a Learnable Resource for LLM Agents
by: Feng, Tao, et al.
Published: (2026)
by: Feng, Tao, et al.
Published: (2026)
LRanker: LLM Ranker for Massive Candidates
by: Feng, Tao, et al.
Published: (2026)
by: Feng, Tao, et al.
Published: (2026)
UniRec: Unified Multimodal Encoding for LLM-Based Recommendations
by: Lei, Zijie, et al.
Published: (2026)
by: Lei, Zijie, et al.
Published: (2026)
R1-Ranker: Teaching LLM Rankers to Reason
by: Feng, Tao, et al.
Published: (2025)
by: Feng, Tao, et al.
Published: (2025)
Mem-T: Densifying Rewards for Long-Horizon Memory Agents
by: Yue, Yanwei, et al.
Published: (2026)
by: Yue, Yanwei, et al.
Published: (2026)
GraphEval: A Lightweight Graph-Based LLM Framework for Idea Evaluation
by: Feng, Tao, et al.
Published: (2025)
by: Feng, Tao, et al.
Published: (2025)
Unified Semantic and ID Representation Learning for Deep Recommenders
by: Lin, Guanyu, et al.
Published: (2025)
by: Lin, Guanyu, et al.
Published: (2025)
RouteProfile: Graph-Based Profiling for Cold-Start LLM Routing
by: Xu, Jingjun, et al.
Published: (2026)
by: Xu, Jingjun, et al.
Published: (2026)
GraphRouter: A Graph-based Router for LLM Selections
by: Feng, Tao, et al.
Published: (2024)
by: Feng, Tao, et al.
Published: (2024)
Reward-Instruct: A Reward-Centric Approach to Fast Photo-Realistic Image Generation
by: Luo, Yihong, et al.
Published: (2025)
by: Luo, Yihong, et al.
Published: (2025)
PersonalizedRouter: Personalized LLM Routing via Graph-based User Preference Modeling
by: Dai, Zhongjie, et al.
Published: (2025)
by: Dai, Zhongjie, et al.
Published: (2025)
GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
by: Feng, Tao, et al.
Published: (2026)
by: Feng, Tao, et al.
Published: (2026)
Thought-Retriever: Don't Just Retrieve Raw Data, Retrieve Thoughts for Memory-Augmented Agentic Systems
by: Feng, Tao, et al.
Published: (2026)
by: Feng, Tao, et al.
Published: (2026)
Rewards as Labels: Revisiting RLVR from a Classification Perspective
by: Zhai, Zepeng, et al.
Published: (2026)
by: Zhai, Zepeng, et al.
Published: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
MemMamba: Rethinking Memory Patterns in State Space Model
by: Wang, Youjin, et al.
Published: (2025)
by: Wang, Youjin, et al.
Published: (2025)
Graph of Records: Boosting Retrieval Augmented Generation for Long-context Summarization with Graphs
by: Zhang, Haozhen, et al.
Published: (2024)
by: Zhang, Haozhen, et al.
Published: (2024)
MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense Rewards
by: Shen, Zhiyu, et al.
Published: (2026)
by: Shen, Zhiyu, et al.
Published: (2026)
Paper Copilot: A Self-Evolving and Efficient LLM System for Personalized Academic Assistance
by: Lin, Guanyu, et al.
Published: (2024)
by: Lin, Guanyu, et al.
Published: (2024)
GMTRouter: Personalized LLM Router over Multi-turn User Interactions
by: Xie, Encheng, et al.
Published: (2025)
by: Xie, Encheng, et al.
Published: (2025)
Self-Aligned Reward: Towards Effective and Efficient Reasoners
by: Han, Peixuan, et al.
Published: (2025)
by: Han, Peixuan, et al.
Published: (2025)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
by: Xu, Yinglun, et al.
Published: (2024)
by: Xu, Yinglun, et al.
Published: (2024)
Reward-Based Online LLM Routing via NeuralUCB
by: Tsai, Ming-Hua, et al.
Published: (2026)
by: Tsai, Ming-Hua, et al.
Published: (2026)
TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
by: Luo, Yihong, et al.
Published: (2026)
by: Luo, Yihong, et al.
Published: (2026)
D-Mem: A Dual-Process Memory System for LLM Agents
by: You, Zhixing, et al.
Published: (2026)
by: You, Zhixing, et al.
Published: (2026)
SimpleMem: Efficient Lifelong Memory for LLM Agents
by: Liu, Jiaqi, et al.
Published: (2026)
by: Liu, Jiaqi, et al.
Published: (2026)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
by: Tang, Zecheng, et al.
Published: (2026)
by: Tang, Zecheng, et al.
Published: (2026)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
by: Feng, Zhaopeng, et al.
Published: (2025)
by: Feng, Zhaopeng, et al.
Published: (2025)
MemCast: Memory-Driven Time Series Forecasting with Experience-Conditioned Reasoning
by: Tao, Xiaoyu, et al.
Published: (2026)
by: Tao, Xiaoyu, et al.
Published: (2026)
SettleFL: Trustless and Scalable Reward Settlement Protocol for Federated Learning on Permissionless Blockchains (Extended version)
by: Liang, Shuang, et al.
Published: (2026)
by: Liang, Shuang, et al.
Published: (2026)
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
by: Yin, Shuyu, et al.
Published: (2024)
by: Yin, Shuyu, et al.
Published: (2024)
DiagramEval: Evaluating LLM-Generated Diagrams via Graphs
by: Liang, Chumeng, et al.
Published: (2025)
by: Liang, Chumeng, et al.
Published: (2025)
Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
by: Zeng, Xia, et al.
Published: (2025)
by: Zeng, Xia, et al.
Published: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
by: Liu, Chris Yuhao, et al.
Published: (2024)
by: Liu, Chris Yuhao, et al.
Published: (2024)
On Designing Effective RL Reward at Training Time for LLM Reasoning
by: Gao, Jiaxuan, et al.
Published: (2024)
by: Gao, Jiaxuan, et al.
Published: (2024)
Enhancing Reinforcement Learning with Label-Sensitive Reward for Natural Language Understanding
by: Liao, Kuo, et al.
Published: (2024)
by: Liao, Kuo, et al.
Published: (2024)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
by: Huang, Yu, et al.
Published: (2026)
by: Huang, Yu, et al.
Published: (2026)
Confidence as a Reward: Transforming LLMs into Reward Models
by: Du, He, et al.
Published: (2025)
by: Du, He, et al.
Published: (2025)
Similar Items
-
ExpGraph: Model-Agnostic Experience Learning with Graph-Structured Memory for LLM Agents
by: Feng, Tao, et al.
Published: (2026) -
ExpWeaver: LLM Agents Learn from Experience via Latent RAG
by: Feng, Tao, et al.
Published: (2026) -
ElasticMem: Latent Memory as a Learnable Resource for LLM Agents
by: Feng, Tao, et al.
Published: (2026) -
LRanker: LLM Ranker for Massive Candidates
by: Feng, Tao, et al.
Published: (2026) -
UniRec: Unified Multimodal Encoding for LLM-Based Recommendations
by: Lei, Zijie, et al.
Published: (2026)