LoRe: Personalizing LLMs via Low-Rank Reward Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Bose, Avinandan, Xiong, Zhihan, Chi, Yuejie, Du, Simon Shaolei, Xiao, Lin, Fazel, Maryam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Offline Multi-task Transfer RL with Representational Penalization
por: Bose, Avinandan, et al.
Publicado: (2024)
por: Bose, Avinandan, et al.
Publicado: (2024)
PrefDisco: Benchmarking Proactive Personalized Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2025)
por: Li, Shuyue Stella, et al.
Publicado: (2025)
Cold-Start Personalization via Training-Free Priors from Structured World Models
por: Bose, Avinandan, et al.
Publicado: (2026)
por: Bose, Avinandan, et al.
Publicado: (2026)
Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration
por: Bose, Avinandan, et al.
Publicado: (2024)
por: Bose, Avinandan, et al.
Publicado: (2024)
DQ-LoRe: Dual Queries with Low Rank Approximation Re-ranking for In-Context Learning
por: Xiong, Jing, et al.
Publicado: (2023)
por: Xiong, Jing, et al.
Publicado: (2023)
LoRe: A Programming Model for Verifiably Safe Local-First Software
por: Haas, Julian, et al.
Publicado: (2023)
por: Haas, Julian, et al.
Publicado: (2023)
LoRMA: Low-Rank Multiplicative Adaptation for LLMs
por: Bihany, Harsh, et al.
Publicado: (2025)
por: Bihany, Harsh, et al.
Publicado: (2025)
A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning
por: Jiang, Haozhe, et al.
Publicado: (2023)
por: Jiang, Haozhe, et al.
Publicado: (2023)
DenseLoRA: Dense Low-Rank Adaptation of Large Language Models
por: Mu, Lin, et al.
Publicado: (2025)
por: Mu, Lin, et al.
Publicado: (2025)
Dual Approximation Policy Optimization
por: Xiong, Zhihan, et al.
Publicado: (2024)
por: Xiong, Zhihan, et al.
Publicado: (2024)
Scalable LLM Reasoning Acceleration with Low-rank Distillation
por: Dong, Harry, et al.
Publicado: (2025)
por: Dong, Harry, et al.
Publicado: (2025)
Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning
por: Chen, Yifang, et al.
Publicado: (2024)
por: Chen, Yifang, et al.
Publicado: (2024)
LoRTA: Low Rank Tensor Adaptation of Large Language Models
por: Hounie, Ignacio, et al.
Publicado: (2024)
por: Hounie, Ignacio, et al.
Publicado: (2024)
LoRe: Adaptive Interaction-Evaluation Routing with Per-Step Interaction Budgets for Iterative Graph Solvers
por: Li, Jintao, et al.
Publicado: (2026)
por: Li, Jintao, et al.
Publicado: (2026)
TsqLoRA: Towards Sensitivity and Quality Low-Rank Adaptation for Efficient Fine-Tuning
por: Chen, Yu, et al.
Publicado: (2025)
por: Chen, Yu, et al.
Publicado: (2025)
Keeping up with dynamic attackers: Certifying robustness to adaptive online data poisoning
por: Bose, Avinandan, et al.
Publicado: (2025)
por: Bose, Avinandan, et al.
Publicado: (2025)
LoLCATs: On Low-Rank Linearizing of Large Language Models
por: Zhang, Michael, et al.
Publicado: (2024)
por: Zhang, Michael, et al.
Publicado: (2024)
LoRA+: Efficient Low Rank Adaptation of Large Models
por: Hayou, Soufiane, et al.
Publicado: (2024)
por: Hayou, Soufiane, et al.
Publicado: (2024)
SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMs
por: Ryan, Michael J, et al.
Publicado: (2025)
por: Ryan, Michael J, et al.
Publicado: (2025)
TeamLoRA: Boosting Low-Rank Adaptation with Expert Collaboration and Competition
por: Lin, Tianwei, et al.
Publicado: (2024)
por: Lin, Tianwei, et al.
Publicado: (2024)
LoRE-Merging: Exploring Low-Rank Estimation For Large Language Model Merging
por: Liu, Zehua, et al.
Publicado: (2025)
por: Liu, Zehua, et al.
Publicado: (2025)
Initializing Services in Interactive ML Systems for Diverse Users
por: Bose, Avinandan, et al.
Publicado: (2023)
por: Bose, Avinandan, et al.
Publicado: (2023)
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
por: Dong, Harry, et al.
Publicado: (2024)
por: Dong, Harry, et al.
Publicado: (2024)
Process Reward Model with Q-Value Rankings
por: Li, Wendi, et al.
Publicado: (2024)
por: Li, Wendi, et al.
Publicado: (2024)
LoTR: Low Tensor Rank Weight Adaptation
por: Bershatsky, Daniel, et al.
Publicado: (2024)
por: Bershatsky, Daniel, et al.
Publicado: (2024)
ResLoRA: Identity Residual Mapping in Low-Rank Adaption
por: Shi, Shuhua, et al.
Publicado: (2024)
por: Shi, Shuhua, et al.
Publicado: (2024)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
ShareLoRA: Parameter Efficient and Robust Large Language Model Fine-tuning via Shared Low-Rank Adaptation
por: Song, Yurun, et al.
Publicado: (2024)
por: Song, Yurun, et al.
Publicado: (2024)
LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy
por: Zhang, Rongzhi, et al.
Publicado: (2024)
por: Zhang, Rongzhi, et al.
Publicado: (2024)
Recover-LoRA: Data-Free Accuracy Recovery of Degraded Language Models via Low-Rank Adaptation
por: Das, Devleena, et al.
Publicado: (2025)
por: Das, Devleena, et al.
Publicado: (2025)
LoRA-Pro: Are Low-Rank Adapters Properly Optimized?
por: Wang, Zhengbo, et al.
Publicado: (2024)
por: Wang, Zhengbo, et al.
Publicado: (2024)
LoRA-Gen: Specializing Large Language Model via Online LoRA Generation
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
Self-Evolved Reward Learning for LLMs
por: Huang, Chenghua, et al.
Publicado: (2024)
por: Huang, Chenghua, et al.
Publicado: (2024)
ReCo: Reliable Causal Chain Reasoning via Structural Causal Recurrent Neural Networks
por: Xiong, Kai, et al.
Publicado: (2022)
por: Xiong, Kai, et al.
Publicado: (2022)
SwitchLoRA: Switched Low-Rank Adaptation Can Learn Full-Rank Information
por: Zhou, Kaiye, et al.
Publicado: (2024)
por: Zhou, Kaiye, et al.
Publicado: (2024)
Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs
por: Yang, Rui, et al.
Publicado: (2024)
por: Yang, Rui, et al.
Publicado: (2024)
Low-Rank Quantization-Aware Training for LLMs
por: Bondarenko, Yelysei, et al.
Publicado: (2024)
por: Bondarenko, Yelysei, et al.
Publicado: (2024)
MTL-LoRA: Low-Rank Adaptation for Multi-Task Learning
por: Yang, Yaming, et al.
Publicado: (2024)
por: Yang, Yaming, et al.
Publicado: (2024)
AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation
por: Liu, Ziyun, et al.
Publicado: (2026)
por: Liu, Ziyun, et al.
Publicado: (2026)
Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering
por: Amirizaniani, Maryam, et al.
Publicado: (2026)
por: Amirizaniani, Maryam, et al.
Publicado: (2026)
Ejemplares similares
-
Offline Multi-task Transfer RL with Representational Penalization
por: Bose, Avinandan, et al.
Publicado: (2024) -
PrefDisco: Benchmarking Proactive Personalized Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2025) -
Cold-Start Personalization via Training-Free Priors from Structured World Models
por: Bose, Avinandan, et al.
Publicado: (2026) -
Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration
por: Bose, Avinandan, et al.
Publicado: (2024) -
DQ-LoRe: Dual Queries with Low Rank Approximation Re-ranking for In-Context Learning
por: Xiong, Jing, et al.
Publicado: (2023)