ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Tianxiang, Zhu, Xiaoyan, Lai, Xin, Wang, Jiayin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Do Papers Tell the Whole Story? A Benchmark and Framework for Uncovering Hidden Implementation Gaps in Bioinformatics
di: Xu, Tianxiang, et al.
Pubblicazione: (2026)
di: Xu, Tianxiang, et al.
Pubblicazione: (2026)
Mosaic Pruning: A Hierarchical Framework for Generalizable Pruning of Mixture-of-Experts Models
di: Hu, Wentao, et al.
Pubblicazione: (2025)
di: Hu, Wentao, et al.
Pubblicazione: (2025)
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
di: Chen, Ruitao, et al.
Pubblicazione: (2024)
di: Chen, Ruitao, et al.
Pubblicazione: (2024)
M3HF: Multi-agent Reinforcement Learning from Multi-phase Human Feedback of Mixed Quality
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
Raising the ClaSS of Streaming Time Series Segmentation
di: Ermshaus, Arik, et al.
Pubblicazione: (2023)
di: Ermshaus, Arik, et al.
Pubblicazione: (2023)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
TimeHF: Billion-Scale Time Series Models Guided by Human Feedback
di: Qi, Yongzhi, et al.
Pubblicazione: (2025)
di: Qi, Yongzhi, et al.
Pubblicazione: (2025)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback
di: Singh, Ashish, et al.
Pubblicazione: (2023)
di: Singh, Ashish, et al.
Pubblicazione: (2023)
Reinforcement Learning from Human Feedback
di: Lambert, Nathan
Pubblicazione: (2025)
di: Lambert, Nathan
Pubblicazione: (2025)
Towards User-level Private Reinforcement Learning with Human Feedback
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
Strategyproof Reinforcement Learning from Human Feedback
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2025)
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2025)
Learning to Schedule Online Tasks with Bandit Feedback
di: Xu, Yongxin, et al.
Pubblicazione: (2024)
di: Xu, Yongxin, et al.
Pubblicazione: (2024)
Reinforcement Learning from Human Feedback: A Statistical Perspective
di: Liu, Pangpang, et al.
Pubblicazione: (2026)
di: Liu, Pangpang, et al.
Pubblicazione: (2026)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework
di: Metz, Yannick, et al.
Pubblicazione: (2024)
di: Metz, Yannick, et al.
Pubblicazione: (2024)
Dual Active Learning for Reinforcement Learning from Human Feedback
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback
di: Li, Derun, et al.
Pubblicazione: (2025)
di: Li, Derun, et al.
Pubblicazione: (2025)
Bresa: Bio-inspired Reflexive Safe Reinforcement Learning for Contact-Rich Robotic Tasks
di: Zhang, Heng, et al.
Pubblicazione: (2025)
di: Zhang, Heng, et al.
Pubblicazione: (2025)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
di: Zhang, Shun, et al.
Pubblicazione: (2024)
di: Zhang, Shun, et al.
Pubblicazione: (2024)
Reinforcement Learning from Multi-level and Episodic Human Feedback
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
Dense Reward for Free in Reinforcement Learning from Human Feedback
di: Chan, Alex J., et al.
Pubblicazione: (2024)
di: Chan, Alex J., et al.
Pubblicazione: (2024)
Multi-turn Reinforcement Learning from Preference Human Feedback
di: Shani, Lior, et al.
Pubblicazione: (2024)
di: Shani, Lior, et al.
Pubblicazione: (2024)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2023)
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2023)
A Survey of Reinforcement Learning from Human Feedback
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
Corruption Robust Offline Reinforcement Learning with Human Feedback
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
di: Lambert, Nathan, et al.
Pubblicazione: (2023)
di: Lambert, Nathan, et al.
Pubblicazione: (2023)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
di: Zhang, Qining, et al.
Pubblicazione: (2025)
di: Zhang, Qining, et al.
Pubblicazione: (2025)
Parameter Efficient Reinforcement Learning from Human Feedback
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
Distributionally Robust Reinforcement Learning with Human Feedback
di: Mandal, Debmalya, et al.
Pubblicazione: (2025)
di: Mandal, Debmalya, et al.
Pubblicazione: (2025)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025)
di: Ye, Kai, et al.
Pubblicazione: (2025)
Quantum-inspired Reinforcement Learning for Synthesizable Drug Design
di: Wang, Dannong, et al.
Pubblicazione: (2024)
di: Wang, Dannong, et al.
Pubblicazione: (2024)
Modeling Output-Level Task Relatedness in Multi-Task Learning with Feedback Mechanism
di: Xi, Xiangming, et al.
Pubblicazione: (2024)
di: Xi, Xiangming, et al.
Pubblicazione: (2024)
Corruption-robust Offline Multi-agent Reinforcement Learning From Human Feedback
di: Nika, Andi, et al.
Pubblicazione: (2026)
di: Nika, Andi, et al.
Pubblicazione: (2026)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
di: Ye, Chenlu, et al.
Pubblicazione: (2024)
di: Ye, Chenlu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Do Papers Tell the Whole Story? A Benchmark and Framework for Uncovering Hidden Implementation Gaps in Bioinformatics
di: Xu, Tianxiang, et al.
Pubblicazione: (2026) -
Mosaic Pruning: A Hierarchical Framework for Generalizable Pruning of Mixture-of-Experts Models
di: Hu, Wentao, et al.
Pubblicazione: (2025) -
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
di: Chen, Ruitao, et al.
Pubblicazione: (2024) -
M3HF: Multi-agent Reinforcement Learning from Multi-phase Human Feedback of Mixed Quality
di: Wang, Ziyan, et al.
Pubblicazione: (2025) -
Raising the ClaSS of Streaming Time Series Segmentation
di: Ermshaus, Arik, et al.
Pubblicazione: (2023)