Language Model Personalization via Reward Factorization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shenfeld, Idan, Faltings, Felix, Agrawal, Pulkit, Pacchiano, Aldo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RL's Razor: Why Online Reinforcement Learning Forgets Less
par: Shenfeld, Idan, et autres
Publié: (2025)
par: Shenfeld, Idan, et autres
Publié: (2025)
Value Augmented Sampling for Language Model Alignment and Personalization
par: Han, Seungwook, et autres
Publié: (2024)
par: Han, Seungwook, et autres
Publié: (2024)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
Self-Distillation Enables Continual Learning
par: Shenfeld, Idan, et autres
Publié: (2026)
par: Shenfeld, Idan, et autres
Publié: (2026)
JUICER: Data-Efficient Imitation Learning for Robotic Assembly
par: Ankile, Lars, et autres
Publié: (2024)
par: Ankile, Lars, et autres
Publié: (2024)
TGRL: An Algorithm for Teacher Guided Reinforcement Learning
par: Shenfeld, Idan, et autres
Publié: (2023)
par: Shenfeld, Idan, et autres
Publié: (2023)
From Imitation to Refinement -- Residual RL for Precise Assembly
par: Ankile, Lars, et autres
Publié: (2024)
par: Ankile, Lars, et autres
Publié: (2024)
Curiosity-driven Red-teaming for Large Language Models
par: Hong, Zhang-Wei, et autres
Publié: (2024)
par: Hong, Zhang-Wei, et autres
Publié: (2024)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
par: Afshar, Aida, et autres
Publié: (2025)
par: Afshar, Aida, et autres
Publié: (2025)
Second Order Bounds for Contextual Bandits with Function Approximation
par: Pacchiano, Aldo
Publié: (2024)
par: Pacchiano, Aldo
Publié: (2024)
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
par: Afshar, Aida, et autres
Publié: (2024)
par: Afshar, Aida, et autres
Publié: (2024)
Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms
par: Hu, Xinyi, et autres
Publié: (2025)
par: Hu, Xinyi, et autres
Publié: (2025)
A Theoretical Framework for Partially Observed Reward-States in RLHF
par: Kausik, Chinmaya, et autres
Publié: (2024)
par: Kausik, Chinmaya, et autres
Publié: (2024)
Bayesian Online Model Selection
par: Afshar, Aida, et autres
Publié: (2026)
par: Afshar, Aida, et autres
Publié: (2026)
General Intelligence Requires Reward-based Pretraining
par: Han, Seungwook, et autres
Publié: (2025)
par: Han, Seungwook, et autres
Publié: (2025)
KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity
par: Aminian, Gholamali, et autres
Publié: (2025)
par: Aminian, Gholamali, et autres
Publié: (2025)
Data-Driven Online Model Selection With Regret Guarantees
par: Pacchiano, Aldo, et autres
Publié: (2023)
par: Pacchiano, Aldo, et autres
Publié: (2023)
Multiple-policy Evaluation via Density Estimation
par: Chen, Yilei, et autres
Publié: (2024)
par: Chen, Yilei, et autres
Publié: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
par: Misra, Dipendra, et autres
Publié: (2026)
par: Misra, Dipendra, et autres
Publié: (2026)
Pure Exploration with Feedback Graphs
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Contextual Bandits with Stage-wise Constraints
par: Pacchiano, Aldo, et autres
Publié: (2024)
par: Pacchiano, Aldo, et autres
Publié: (2024)
Training Language Models via Neural Cellular Automata
par: Lee, Dan, et autres
Publié: (2026)
par: Lee, Dan, et autres
Publié: (2026)
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
par: Damani, Mehul, et autres
Publié: (2025)
par: Damani, Mehul, et autres
Publié: (2025)
In-Context Learning for Pure Exploration
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
State-free Reinforcement Learning
par: Chen, Mingyu, et autres
Publié: (2024)
par: Chen, Mingyu, et autres
Publié: (2024)
Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
par: Puri, Isha, et autres
Publié: (2026)
par: Puri, Isha, et autres
Publié: (2026)
Collective Model Intelligence Requires Compatible Specialization
par: Pari, Jyothish, et autres
Publié: (2024)
par: Pari, Jyothish, et autres
Publié: (2024)
Aligning Language Models from User Interactions
par: Buening, Thomas Kleine, et autres
Publié: (2026)
par: Buening, Thomas Kleine, et autres
Publié: (2026)
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
par: Bahlous-Boldi, Ryan, et autres
Publié: (2026)
par: Bahlous-Boldi, Ryan, et autres
Publié: (2026)
On the Hardness of Bandit Learning
par: Brukhim, Nataly, et autres
Publié: (2025)
par: Brukhim, Nataly, et autres
Publié: (2025)
Improving Offline RL by Blending Heuristics
par: Geng, Sinong, et autres
Publié: (2023)
par: Geng, Sinong, et autres
Publié: (2023)
Experiment Planning with Function Approximation
par: Pacchiano, Aldo, et autres
Publié: (2024)
par: Pacchiano, Aldo, et autres
Publié: (2024)
Lazy But Effective: Collaborative Personalized Federated Learning with Heterogeneous Data
par: Rokvic, Ljubomir, et autres
Publié: (2025)
par: Rokvic, Ljubomir, et autres
Publié: (2025)
Self-Adapting Language Models
par: Zweiger, Adam, et autres
Publié: (2025)
par: Zweiger, Adam, et autres
Publié: (2025)
Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis
par: Aminian, Gholamali, et autres
Publié: (2025)
par: Aminian, Gholamali, et autres
Publié: (2025)
H2LooP Spark Preview: Continual Pretraining of Large Language Models for Low-Level Embedded Systems Code
par: Singh, Amit, et autres
Publié: (2026)
par: Singh, Amit, et autres
Publié: (2026)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
par: Baharav, Tavor Z., et autres
Publié: (2025)
par: Baharav, Tavor Z., et autres
Publié: (2025)
Provable Interactive Learning with Hindsight Instruction Feedback
par: Misra, Dipendra, et autres
Publié: (2024)
par: Misra, Dipendra, et autres
Publié: (2024)
LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users
par: Hilel, Almog, et autres
Publié: (2025)
par: Hilel, Almog, et autres
Publié: (2025)
Documents similaires
-
RL's Razor: Why Online Reinforcement Learning Forgets Less
par: Shenfeld, Idan, et autres
Publié: (2025) -
Value Augmented Sampling for Language Model Alignment and Personalization
par: Han, Seungwook, et autres
Publié: (2024) -
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024) -
Self-Distillation Enables Continual Learning
par: Shenfeld, Idan, et autres
Publié: (2026) -
JUICER: Data-Efficient Imitation Learning for Robotic Assembly
par: Ankile, Lars, et autres
Publié: (2024)