Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
Fuente:
arXiv
Saved in:
| Main Authors: | Zhai, Yuanzhao, Zhang, Han, Lei, Yu, Yu, Yue, Xu, Kele, Feng, Dawei, Ding, Bo, Wang, Huaimin |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Online Self-Preferring Language Models
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
by: Liu, Huanxi, et al.
Published: (2024)
by: Liu, Huanxi, et al.
Published: (2024)
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
by: Liu, Jianmin, et al.
Published: (2025)
by: Liu, Jianmin, et al.
Published: (2025)
LoRA-Ensemble: Efficient Uncertainty Modelling for Self-Attention Networks
by: Mühlematter, Dominik J., et al.
Published: (2024)
by: Mühlematter, Dominik J., et al.
Published: (2024)
A Note on LoRA
by: Fomenko, Vlad, et al.
Published: (2024)
by: Fomenko, Vlad, et al.
Published: (2024)
LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement
by: Bian, Jieming, et al.
Published: (2024)
by: Bian, Jieming, et al.
Published: (2024)
Personalized LoRA for Human-Centered Text Understanding
by: Zhang, You, et al.
Published: (2024)
by: Zhang, You, et al.
Published: (2024)
LoRA-MME: Multi-Model Ensemble of LoRA-Tuned Encoders for Code Comment Classification
by: Haider, Md Akib, et al.
Published: (2026)
by: Haider, Md Akib, et al.
Published: (2026)
pFedLoRA: Model-Heterogeneous Personalized Federated Learning with LoRA Tuning
by: Yi, Liping, et al.
Published: (2023)
by: Yi, Liping, et al.
Published: (2023)
DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models
by: Deng, Guanzhi, et al.
Published: (2026)
by: Deng, Guanzhi, et al.
Published: (2026)
SCALE-LoRA: Auditing Post-Retrieval LoRA Composition with Residual Merging and View Reliability
by: Zhou, Shuaipeng, et al.
Published: (2026)
by: Zhou, Shuaipeng, et al.
Published: (2026)
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
by: Xu, Yixing, et al.
Published: (2025)
by: Xu, Yixing, et al.
Published: (2025)
LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative Tasks
by: Wang, Hanqing, et al.
Published: (2024)
by: Wang, Hanqing, et al.
Published: (2024)
Vision as LoRA
by: Wang, Han, et al.
Published: (2025)
by: Wang, Han, et al.
Published: (2025)
LoRA-Mixer: Coordinate Modular LoRA Experts Through Serial Attention Routing
by: Li, Wenbing, et al.
Published: (2025)
by: Li, Wenbing, et al.
Published: (2025)
LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization
by: Yen, Jui-Nan, et al.
Published: (2024)
by: Yen, Jui-Nan, et al.
Published: (2024)
S-LoRA: Serving Thousands of Concurrent LoRA Adapters
by: Sheng, Ying, et al.
Published: (2023)
by: Sheng, Ying, et al.
Published: (2023)
In-Context LoRA for Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads
by: Zuo, Jingwei, et al.
Published: (2026)
by: Zuo, Jingwei, et al.
Published: (2026)
Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA
by: Wu, Zexi, et al.
Published: (2026)
by: Wu, Zexi, et al.
Published: (2026)
LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion
by: Zhang, Yisu, et al.
Published: (2025)
by: Zhang, Yisu, et al.
Published: (2025)
COPR: Continual Learning Human Preference through Optimal Policy Regularization
by: Zhang, Han, et al.
Published: (2023)
by: Zhang, Han, et al.
Published: (2023)
LoRA-drop: Efficient LoRA Parameter Pruning based on Output Evaluation
by: Zhou, Hongyun, et al.
Published: (2024)
by: Zhou, Hongyun, et al.
Published: (2024)
Rethinking LoRA for Data Heterogeneous Federated Learning: Subspace and State Alignment
by: Peng, Hongyi, et al.
Published: (2026)
by: Peng, Hongyi, et al.
Published: (2026)
Improving LoRA in Privacy-preserving Federated Learning
by: Sun, Youbang, et al.
Published: (2024)
by: Sun, Youbang, et al.
Published: (2024)
Run LoRA Run: Faster and Lighter LoRA Implementations
by: Cherniuk, Daria, et al.
Published: (2023)
by: Cherniuk, Daria, et al.
Published: (2023)
SC-LoRA: Balancing Efficient Fine-tuning and Knowledge Preservation via Subspace-Constrained LoRA
by: Luo, Minrui, et al.
Published: (2025)
by: Luo, Minrui, et al.
Published: (2025)
Enhancing the Aesthetic Appeal of AI-Generated Physical Product Designs through LoRA Fine-Tuning with Human Feedback
by: Liao, Dinuo, et al.
Published: (2025)
by: Liao, Dinuo, et al.
Published: (2025)
Learning in the Fisher Subspace: A Guided Initialization for LoRA Fine-Tuning
by: Feng, Zhi-Quan, et al.
Published: (2026)
by: Feng, Zhi-Quan, et al.
Published: (2026)
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
by: Song, Xue, et al.
Published: (2024)
by: Song, Xue, et al.
Published: (2024)
R-LoRA: Randomized Multi-Head LoRA for Efficient Multi-Task Learning
by: Liu, Jinda, et al.
Published: (2025)
by: Liu, Jinda, et al.
Published: (2025)
Meta-LoRA: Meta-Learning LoRA Components for Domain-Aware ID Personalization
by: Topal, Barış Batuhan, et al.
Published: (2025)
by: Topal, Barış Batuhan, et al.
Published: (2025)
The Impact of Initialization on LoRA Finetuning Dynamics
by: Hayou, Soufiane, et al.
Published: (2024)
by: Hayou, Soufiane, et al.
Published: (2024)
Multi-LoRA Composition for Image Generation
by: Zhong, Ming, et al.
Published: (2024)
by: Zhong, Ming, et al.
Published: (2024)
LoRA as Oracle
by: Arazzi, Marco, et al.
Published: (2026)
by: Arazzi, Marco, et al.
Published: (2026)
FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA
by: Zhang, Haoran, et al.
Published: (2026)
by: Zhang, Haoran, et al.
Published: (2026)
LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference
by: Rajabzadeh, Hossein, et al.
Published: (2026)
by: Rajabzadeh, Hossein, et al.
Published: (2026)
TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts
by: Jeon, Jeimin, et al.
Published: (2026)
by: Jeon, Jeimin, et al.
Published: (2026)
Similar Items
-
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
by: Zhai, Yuanzhao, et al.
Published: (2024) -
Online Self-Preferring Language Models
by: Zhai, Yuanzhao, et al.
Published: (2024) -
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
by: Zhai, Yuanzhao, et al.
Published: (2024) -
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
by: Liu, Huanxi, et al.
Published: (2024) -
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
by: Liu, Jianmin, et al.
Published: (2025)