Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhai, Yuanzhao, Zhang, Han, Lei, Yu, Yu, Yue, Xu, Kele, Feng, Dawei, Ding, Bo, Wang, Huaimin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
Online Self-Preferring Language Models
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
por: Liu, Huanxi, et al.
Publicado: (2024)
por: Liu, Huanxi, et al.
Publicado: (2024)
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
por: Liu, Jianmin, et al.
Publicado: (2025)
por: Liu, Jianmin, et al.
Publicado: (2025)
LoRA-Ensemble: Efficient Uncertainty Modelling for Self-Attention Networks
por: Mühlematter, Dominik J., et al.
Publicado: (2024)
por: Mühlematter, Dominik J., et al.
Publicado: (2024)
A Note on LoRA
por: Fomenko, Vlad, et al.
Publicado: (2024)
por: Fomenko, Vlad, et al.
Publicado: (2024)
LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement
por: Bian, Jieming, et al.
Publicado: (2024)
por: Bian, Jieming, et al.
Publicado: (2024)
Personalized LoRA for Human-Centered Text Understanding
por: Zhang, You, et al.
Publicado: (2024)
por: Zhang, You, et al.
Publicado: (2024)
LoRA-MME: Multi-Model Ensemble of LoRA-Tuned Encoders for Code Comment Classification
por: Haider, Md Akib, et al.
Publicado: (2026)
por: Haider, Md Akib, et al.
Publicado: (2026)
pFedLoRA: Model-Heterogeneous Personalized Federated Learning with LoRA Tuning
por: Yi, Liping, et al.
Publicado: (2023)
por: Yi, Liping, et al.
Publicado: (2023)
DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models
por: Deng, Guanzhi, et al.
Publicado: (2026)
por: Deng, Guanzhi, et al.
Publicado: (2026)
SCALE-LoRA: Auditing Post-Retrieval LoRA Composition with Residual Merging and View Reliability
por: Zhou, Shuaipeng, et al.
Publicado: (2026)
por: Zhou, Shuaipeng, et al.
Publicado: (2026)
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
por: Xu, Yixing, et al.
Publicado: (2025)
por: Xu, Yixing, et al.
Publicado: (2025)
LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative Tasks
por: Wang, Hanqing, et al.
Publicado: (2024)
por: Wang, Hanqing, et al.
Publicado: (2024)
Vision as LoRA
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
LoRA-Mixer: Coordinate Modular LoRA Experts Through Serial Attention Routing
por: Li, Wenbing, et al.
Publicado: (2025)
por: Li, Wenbing, et al.
Publicado: (2025)
LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization
por: Yen, Jui-Nan, et al.
Publicado: (2024)
por: Yen, Jui-Nan, et al.
Publicado: (2024)
S-LoRA: Serving Thousands of Concurrent LoRA Adapters
por: Sheng, Ying, et al.
Publicado: (2023)
por: Sheng, Ying, et al.
Publicado: (2023)
In-Context LoRA for Diffusion Transformers
por: Huang, Lianghua, et al.
Publicado: (2024)
por: Huang, Lianghua, et al.
Publicado: (2024)
ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads
por: Zuo, Jingwei, et al.
Publicado: (2026)
por: Zuo, Jingwei, et al.
Publicado: (2026)
Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA
por: Wu, Zexi, et al.
Publicado: (2026)
por: Wu, Zexi, et al.
Publicado: (2026)
LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion
por: Zhang, Yisu, et al.
Publicado: (2025)
por: Zhang, Yisu, et al.
Publicado: (2025)
COPR: Continual Learning Human Preference through Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2023)
por: Zhang, Han, et al.
Publicado: (2023)
LoRA-drop: Efficient LoRA Parameter Pruning based on Output Evaluation
por: Zhou, Hongyun, et al.
Publicado: (2024)
por: Zhou, Hongyun, et al.
Publicado: (2024)
Rethinking LoRA for Data Heterogeneous Federated Learning: Subspace and State Alignment
por: Peng, Hongyi, et al.
Publicado: (2026)
por: Peng, Hongyi, et al.
Publicado: (2026)
Improving LoRA in Privacy-preserving Federated Learning
por: Sun, Youbang, et al.
Publicado: (2024)
por: Sun, Youbang, et al.
Publicado: (2024)
Run LoRA Run: Faster and Lighter LoRA Implementations
por: Cherniuk, Daria, et al.
Publicado: (2023)
por: Cherniuk, Daria, et al.
Publicado: (2023)
SC-LoRA: Balancing Efficient Fine-tuning and Knowledge Preservation via Subspace-Constrained LoRA
por: Luo, Minrui, et al.
Publicado: (2025)
por: Luo, Minrui, et al.
Publicado: (2025)
Enhancing the Aesthetic Appeal of AI-Generated Physical Product Designs through LoRA Fine-Tuning with Human Feedback
por: Liao, Dinuo, et al.
Publicado: (2025)
por: Liao, Dinuo, et al.
Publicado: (2025)
Learning in the Fisher Subspace: A Guided Initialization for LoRA Fine-Tuning
por: Feng, Zhi-Quan, et al.
Publicado: (2026)
por: Feng, Zhi-Quan, et al.
Publicado: (2026)
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
por: Song, Xue, et al.
Publicado: (2024)
por: Song, Xue, et al.
Publicado: (2024)
R-LoRA: Randomized Multi-Head LoRA for Efficient Multi-Task Learning
por: Liu, Jinda, et al.
Publicado: (2025)
por: Liu, Jinda, et al.
Publicado: (2025)
Meta-LoRA: Meta-Learning LoRA Components for Domain-Aware ID Personalization
por: Topal, Barış Batuhan, et al.
Publicado: (2025)
por: Topal, Barış Batuhan, et al.
Publicado: (2025)
The Impact of Initialization on LoRA Finetuning Dynamics
por: Hayou, Soufiane, et al.
Publicado: (2024)
por: Hayou, Soufiane, et al.
Publicado: (2024)
Multi-LoRA Composition for Image Generation
por: Zhong, Ming, et al.
Publicado: (2024)
por: Zhong, Ming, et al.
Publicado: (2024)
LoRA as Oracle
por: Arazzi, Marco, et al.
Publicado: (2026)
por: Arazzi, Marco, et al.
Publicado: (2026)
FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA
por: Zhang, Haoran, et al.
Publicado: (2026)
por: Zhang, Haoran, et al.
Publicado: (2026)
LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference
por: Rajabzadeh, Hossein, et al.
Publicado: (2026)
por: Rajabzadeh, Hossein, et al.
Publicado: (2026)
TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts
por: Jeon, Jeimin, et al.
Publicado: (2026)
por: Jeon, Jeimin, et al.
Publicado: (2026)
Ejemplares similares
-
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
por: Zhai, Yuanzhao, et al.
Publicado: (2024) -
Online Self-Preferring Language Models
por: Zhai, Yuanzhao, et al.
Publicado: (2024) -
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
por: Zhai, Yuanzhao, et al.
Publicado: (2024) -
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
por: Liu, Huanxi, et al.
Publicado: (2024) -
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
por: Liu, Jianmin, et al.
Publicado: (2025)