EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kong, Lingxiao, Yang, Cong, Neufang, Susanne, Beyan, Oya Deniz, Boukhers, Zeyd |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters
von: Kong, Lingxiao, et al.
Veröffentlicht: (2026)
von: Kong, Lingxiao, et al.
Veröffentlicht: (2026)
Autonomous FAIR Digital Objects: From Passive Assertions to Active Knowledge
von: Boukhers, Zeyd, et al.
Veröffentlicht: (2026)
von: Boukhers, Zeyd, et al.
Veröffentlicht: (2026)
Comparison of Feature Learning Methods for Metadata Extraction from PDF Scholarly Documents
von: Boukhers, Zeyd, et al.
Veröffentlicht: (2025)
von: Boukhers, Zeyd, et al.
Veröffentlicht: (2025)
ELMTEX: Fine-Tuning Large Language Models for Structured Clinical Information Extraction. A Case Study on Clinical Reports
von: Guluzade, Aynur, et al.
Veröffentlicht: (2025)
von: Guluzade, Aynur, et al.
Veröffentlicht: (2025)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
Parameter-Efficient Fine-Tuning With Adapters
von: Chen, Keyu, et al.
Veröffentlicht: (2024)
von: Chen, Keyu, et al.
Veröffentlicht: (2024)
Understanding the Performance and Estimating the Cost of LLM Fine-Tuning
von: Xia, Yuchen, et al.
Veröffentlicht: (2024)
von: Xia, Yuchen, et al.
Veröffentlicht: (2024)
CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning
von: Zhu, Wenqiao, et al.
Veröffentlicht: (2025)
von: Zhu, Wenqiao, et al.
Veröffentlicht: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)
von: Sun, Hao
Veröffentlicht: (2024)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
von: Pang, Jinlong, et al.
Veröffentlicht: (2025)
von: Pang, Jinlong, et al.
Veröffentlicht: (2025)
Prior Prompt Engineering for Reinforcement Fine-Tuning
von: Taveekitworachai, Pittawat, et al.
Veröffentlicht: (2025)
von: Taveekitworachai, Pittawat, et al.
Veröffentlicht: (2025)
MSPLoRA: A Multi-Scale Pyramid Low-Rank Adaptation for Efficient Model Fine-Tuning
von: Zhao, Jiancheng, et al.
Veröffentlicht: (2025)
von: Zhao, Jiancheng, et al.
Veröffentlicht: (2025)
Transducer Tuning: Efficient Model Adaptation for Software Tasks Using Code Property Graphs
von: Yusuf, Imam Nur Bani, et al.
Veröffentlicht: (2024)
von: Yusuf, Imam Nur Bani, et al.
Veröffentlicht: (2024)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
von: Cheng, Xiang, et al.
Veröffentlicht: (2025)
von: Cheng, Xiang, et al.
Veröffentlicht: (2025)
Atomic-Probe Governance for Skill Updates in Compositional Robot Policies
von: Qin, Xue, et al.
Veröffentlicht: (2026)
von: Qin, Xue, et al.
Veröffentlicht: (2026)
Falcon 7b for Software Mention Detection in Scholarly Documents
von: Khan, AmeerAli, et al.
Veröffentlicht: (2024)
von: Khan, AmeerAli, et al.
Veröffentlicht: (2024)
Parameter-Efficient Fine-Tuning for Medical Text Summarization: A Comparative Study of Lora, Prompt Tuning, and Full Fine-Tuning
von: Shernazarov, Ulugbek, et al.
Veröffentlicht: (2026)
von: Shernazarov, Ulugbek, et al.
Veröffentlicht: (2026)
From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning
von: Li, Yafu, et al.
Veröffentlicht: (2025)
von: Li, Yafu, et al.
Veröffentlicht: (2025)
Efficient Fine-Tuning of Large Language Models for Automated Medical Documentation
von: Leong, Hui Yi, et al.
Veröffentlicht: (2024)
von: Leong, Hui Yi, et al.
Veröffentlicht: (2024)
Reference-Free Reinforcement Learning Fine-Tuning for MT: A Seq2Seq Perspective
von: Garcia-Estrada, Ernesto, et al.
Veröffentlicht: (2026)
von: Garcia-Estrada, Ernesto, et al.
Veröffentlicht: (2026)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
von: Ning, Yansong, et al.
Veröffentlicht: (2025)
von: Ning, Yansong, et al.
Veröffentlicht: (2025)
RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance
von: Hou, Xianbao, et al.
Veröffentlicht: (2026)
von: Hou, Xianbao, et al.
Veröffentlicht: (2026)
TS-PEFT: Unveiling Token-Level Redundancy in Parameter-Efficient Fine-Tuning
von: Ma, Dabiao, et al.
Veröffentlicht: (2025)
von: Ma, Dabiao, et al.
Veröffentlicht: (2025)
Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
von: Song, Junjie, et al.
Veröffentlicht: (2025)
von: Song, Junjie, et al.
Veröffentlicht: (2025)
InfiMed-Foundation: Pioneering Advanced Multimodal Medical Models with Compute-Efficient Pre-Training and Multi-Stage Fine-Tuning
von: Zhu, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhu, Guanghao, et al.
Veröffentlicht: (2025)
Reversing the Forget-Retain Objectives: An Efficient LLM Unlearning Framework from Logit Difference
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
Reversing Large Language Models for Efficient Training and Fine-Tuning
von: Gal, Eshed, et al.
Veröffentlicht: (2025)
von: Gal, Eshed, et al.
Veröffentlicht: (2025)
ShadowPEFT: Shadow Network for Parameter-Efficient Fine-Tuning
von: Li, Xianming, et al.
Veröffentlicht: (2026)
von: Li, Xianming, et al.
Veröffentlicht: (2026)
PEFT-U: Parameter-Efficient Fine-Tuning for User Personalization
von: Clarke, Christopher, et al.
Veröffentlicht: (2024)
von: Clarke, Christopher, et al.
Veröffentlicht: (2024)
Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement
von: Xie, Guanwen, et al.
Veröffentlicht: (2024)
von: Xie, Guanwen, et al.
Veröffentlicht: (2024)
Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models
von: Jiang, Haitao, et al.
Veröffentlicht: (2026)
von: Jiang, Haitao, et al.
Veröffentlicht: (2026)
When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
von: Yun, Heecheol, et al.
Veröffentlicht: (2025)
von: Yun, Heecheol, et al.
Veröffentlicht: (2025)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
Parameter Efficient Quasi-Orthogonal Fine-Tuning via Givens Rotation
von: Ma, Xinyu, et al.
Veröffentlicht: (2024)
von: Ma, Xinyu, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
von: Wei, Wenda, et al.
Veröffentlicht: (2025)
von: Wei, Wenda, et al.
Veröffentlicht: (2025)
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
von: Tang, Zinan, et al.
Veröffentlicht: (2025)
von: Tang, Zinan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025) -
Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters
von: Kong, Lingxiao, et al.
Veröffentlicht: (2026) -
Autonomous FAIR Digital Objects: From Passive Assertions to Active Knowledge
von: Boukhers, Zeyd, et al.
Veröffentlicht: (2026) -
Comparison of Feature Learning Methods for Metadata Extraction from PDF Scholarly Documents
von: Boukhers, Zeyd, et al.
Veröffentlicht: (2025) -
ELMTEX: Fine-Tuning Large Language Models for Structured Clinical Information Extraction. A Case Study on Clinical Reports
von: Guluzade, Aynur, et al.
Veröffentlicht: (2025)