Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhai, Yuanzhao, Zhang, Han, Lei, Yu, Yu, Yue, Xu, Kele, Feng, Dawei, Ding, Bo, Wang, Huaimin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
Online Self-Preferring Language Models
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
di: Liu, Huanxi, et al.
Pubblicazione: (2024)
di: Liu, Huanxi, et al.
Pubblicazione: (2024)
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
di: Liu, Jianmin, et al.
Pubblicazione: (2025)
di: Liu, Jianmin, et al.
Pubblicazione: (2025)
LoRA-Ensemble: Efficient Uncertainty Modelling for Self-Attention Networks
di: Mühlematter, Dominik J., et al.
Pubblicazione: (2024)
di: Mühlematter, Dominik J., et al.
Pubblicazione: (2024)
A Note on LoRA
di: Fomenko, Vlad, et al.
Pubblicazione: (2024)
di: Fomenko, Vlad, et al.
Pubblicazione: (2024)
LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement
di: Bian, Jieming, et al.
Pubblicazione: (2024)
di: Bian, Jieming, et al.
Pubblicazione: (2024)
Personalized LoRA for Human-Centered Text Understanding
di: Zhang, You, et al.
Pubblicazione: (2024)
di: Zhang, You, et al.
Pubblicazione: (2024)
LoRA-MME: Multi-Model Ensemble of LoRA-Tuned Encoders for Code Comment Classification
di: Haider, Md Akib, et al.
Pubblicazione: (2026)
di: Haider, Md Akib, et al.
Pubblicazione: (2026)
pFedLoRA: Model-Heterogeneous Personalized Federated Learning with LoRA Tuning
di: Yi, Liping, et al.
Pubblicazione: (2023)
di: Yi, Liping, et al.
Pubblicazione: (2023)
DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models
di: Deng, Guanzhi, et al.
Pubblicazione: (2026)
di: Deng, Guanzhi, et al.
Pubblicazione: (2026)
SCALE-LoRA: Auditing Post-Retrieval LoRA Composition with Residual Merging and View Reliability
di: Zhou, Shuaipeng, et al.
Pubblicazione: (2026)
di: Zhou, Shuaipeng, et al.
Pubblicazione: (2026)
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
di: Xu, Yixing, et al.
Pubblicazione: (2025)
di: Xu, Yixing, et al.
Pubblicazione: (2025)
LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative Tasks
di: Wang, Hanqing, et al.
Pubblicazione: (2024)
di: Wang, Hanqing, et al.
Pubblicazione: (2024)
Vision as LoRA
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
LoRA-Mixer: Coordinate Modular LoRA Experts Through Serial Attention Routing
di: Li, Wenbing, et al.
Pubblicazione: (2025)
di: Li, Wenbing, et al.
Pubblicazione: (2025)
LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization
di: Yen, Jui-Nan, et al.
Pubblicazione: (2024)
di: Yen, Jui-Nan, et al.
Pubblicazione: (2024)
S-LoRA: Serving Thousands of Concurrent LoRA Adapters
di: Sheng, Ying, et al.
Pubblicazione: (2023)
di: Sheng, Ying, et al.
Pubblicazione: (2023)
In-Context LoRA for Diffusion Transformers
di: Huang, Lianghua, et al.
Pubblicazione: (2024)
di: Huang, Lianghua, et al.
Pubblicazione: (2024)
ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads
di: Zuo, Jingwei, et al.
Pubblicazione: (2026)
di: Zuo, Jingwei, et al.
Pubblicazione: (2026)
Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA
di: Wu, Zexi, et al.
Pubblicazione: (2026)
di: Wu, Zexi, et al.
Pubblicazione: (2026)
LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion
di: Zhang, Yisu, et al.
Pubblicazione: (2025)
di: Zhang, Yisu, et al.
Pubblicazione: (2025)
COPR: Continual Learning Human Preference through Optimal Policy Regularization
di: Zhang, Han, et al.
Pubblicazione: (2023)
di: Zhang, Han, et al.
Pubblicazione: (2023)
LoRA-drop: Efficient LoRA Parameter Pruning based on Output Evaluation
di: Zhou, Hongyun, et al.
Pubblicazione: (2024)
di: Zhou, Hongyun, et al.
Pubblicazione: (2024)
Rethinking LoRA for Data Heterogeneous Federated Learning: Subspace and State Alignment
di: Peng, Hongyi, et al.
Pubblicazione: (2026)
di: Peng, Hongyi, et al.
Pubblicazione: (2026)
Improving LoRA in Privacy-preserving Federated Learning
di: Sun, Youbang, et al.
Pubblicazione: (2024)
di: Sun, Youbang, et al.
Pubblicazione: (2024)
Run LoRA Run: Faster and Lighter LoRA Implementations
di: Cherniuk, Daria, et al.
Pubblicazione: (2023)
di: Cherniuk, Daria, et al.
Pubblicazione: (2023)
SC-LoRA: Balancing Efficient Fine-tuning and Knowledge Preservation via Subspace-Constrained LoRA
di: Luo, Minrui, et al.
Pubblicazione: (2025)
di: Luo, Minrui, et al.
Pubblicazione: (2025)
Enhancing the Aesthetic Appeal of AI-Generated Physical Product Designs through LoRA Fine-Tuning with Human Feedback
di: Liao, Dinuo, et al.
Pubblicazione: (2025)
di: Liao, Dinuo, et al.
Pubblicazione: (2025)
Learning in the Fisher Subspace: A Guided Initialization for LoRA Fine-Tuning
di: Feng, Zhi-Quan, et al.
Pubblicazione: (2026)
di: Feng, Zhi-Quan, et al.
Pubblicazione: (2026)
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
di: Song, Xue, et al.
Pubblicazione: (2024)
di: Song, Xue, et al.
Pubblicazione: (2024)
R-LoRA: Randomized Multi-Head LoRA for Efficient Multi-Task Learning
di: Liu, Jinda, et al.
Pubblicazione: (2025)
di: Liu, Jinda, et al.
Pubblicazione: (2025)
Meta-LoRA: Meta-Learning LoRA Components for Domain-Aware ID Personalization
di: Topal, Barış Batuhan, et al.
Pubblicazione: (2025)
di: Topal, Barış Batuhan, et al.
Pubblicazione: (2025)
The Impact of Initialization on LoRA Finetuning Dynamics
di: Hayou, Soufiane, et al.
Pubblicazione: (2024)
di: Hayou, Soufiane, et al.
Pubblicazione: (2024)
Multi-LoRA Composition for Image Generation
di: Zhong, Ming, et al.
Pubblicazione: (2024)
di: Zhong, Ming, et al.
Pubblicazione: (2024)
LoRA as Oracle
di: Arazzi, Marco, et al.
Pubblicazione: (2026)
di: Arazzi, Marco, et al.
Pubblicazione: (2026)
FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference
di: Rajabzadeh, Hossein, et al.
Pubblicazione: (2026)
di: Rajabzadeh, Hossein, et al.
Pubblicazione: (2026)
TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts
di: Jeon, Jeimin, et al.
Pubblicazione: (2026)
di: Jeon, Jeimin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024) -
Online Self-Preferring Language Models
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024) -
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024) -
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
di: Liu, Huanxi, et al.
Pubblicazione: (2024) -
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
di: Liu, Jianmin, et al.
Pubblicazione: (2025)