Enhancing Reinforcement Learning with Label-Sensitive Reward for Natural Language Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Liao, Kuo, Li, Shuang, Zhao, Meng, Liu, Liqun, Xue, Mengge, Hu, Zhenyu, Han, Honglin, Yin, Chengguo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Strengthened Symbol Binding Makes Large Language Models Reliable Multiple-Choice Selectors
por: Xue, Mengge, et al.
Publicado: (2024)
por: Xue, Mengge, et al.
Publicado: (2024)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
Understanding and Tackling Label Errors in Individual-Level Nature Language Understanding
por: Xiao, Yunpeng, et al.
Publicado: (2025)
por: Xiao, Yunpeng, et al.
Publicado: (2025)
ReFusion: Improving Natural Language Understanding with Computation-Efficient Retrieval Representation Fusion
por: Wu, Shangyu, et al.
Publicado: (2024)
por: Wu, Shangyu, et al.
Publicado: (2024)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
por: Wang, Li, et al.
Publicado: (2026)
por: Wang, Li, et al.
Publicado: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
por: Chen, Jianghao, et al.
Publicado: (2025)
por: Chen, Jianghao, et al.
Publicado: (2025)
Natural Language Reinforcement Learning
por: Feng, Xidong, et al.
Publicado: (2024)
por: Feng, Xidong, et al.
Publicado: (2024)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
por: Hu, Ziyou, et al.
Publicado: (2025)
por: Hu, Ziyou, et al.
Publicado: (2025)
Checklists Are Better Than Reward Models For Aligning Language Models
por: Viswanathan, Vijay, et al.
Publicado: (2025)
por: Viswanathan, Vijay, et al.
Publicado: (2025)
Investigating the Impact of Rationales for LLMs on Natural Language Understanding
por: Shi, Wenhang, et al.
Publicado: (2025)
por: Shi, Wenhang, et al.
Publicado: (2025)
KEHRL: Learning Knowledge-Enhanced Language Representations with Hierarchical Reinforcement Learning
por: Li, Dongyang, et al.
Publicado: (2024)
por: Li, Dongyang, et al.
Publicado: (2024)
RLMR: Reinforcement Learning with Mixed Rewards for Creative Writing
por: Liao, Jianxing, et al.
Publicado: (2025)
por: Liao, Jianxing, et al.
Publicado: (2025)
Enhancing Efficiency and Exploration in Reinforcement Learning for LLMs
por: Liao, Mengqi, et al.
Publicado: (2025)
por: Liao, Mengqi, et al.
Publicado: (2025)
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
por: Wang, Ziyan, et al.
Publicado: (2024)
por: Wang, Ziyan, et al.
Publicado: (2024)
Agentic Reinforcement Learning with Implicit Step Rewards
por: Liu, Xiaoqian, et al.
Publicado: (2025)
por: Liu, Xiaoqian, et al.
Publicado: (2025)
Can Large Language Models Understand Preferences in Personalized Recommendation?
por: Tan, Zhaoxuan, et al.
Publicado: (2025)
por: Tan, Zhaoxuan, et al.
Publicado: (2025)
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
por: Weng, Han, et al.
Publicado: (2025)
por: Weng, Han, et al.
Publicado: (2025)
Self-Hinting Language Models Enhance Reinforcement Learning
por: Liao, Baohao, et al.
Publicado: (2026)
por: Liao, Baohao, et al.
Publicado: (2026)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
por: Hu, Bokai, et al.
Publicado: (2024)
por: Hu, Bokai, et al.
Publicado: (2024)
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
por: Zhang, Feng, et al.
Publicado: (2026)
por: Zhang, Feng, et al.
Publicado: (2026)
Natural Language Reinforcement Learning
por: Feng, Xidong, et al.
Publicado: (2024)
por: Feng, Xidong, et al.
Publicado: (2024)
An Information-theoretic Multi-task Representation Learning Framework for Natural Language Understanding
por: Hu, Dou, et al.
Publicado: (2025)
por: Hu, Dou, et al.
Publicado: (2025)
Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning
por: Ahmadi, Arash, et al.
Publicado: (2026)
por: Ahmadi, Arash, et al.
Publicado: (2026)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
por: Tang, Xinyu, et al.
Publicado: (2025)
por: Tang, Xinyu, et al.
Publicado: (2025)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
por: Zhao, Qingfei, et al.
Publicado: (2025)
por: Zhao, Qingfei, et al.
Publicado: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
por: Tang, Xinyu, et al.
Publicado: (2025)
por: Tang, Xinyu, et al.
Publicado: (2025)
LiTEx: A Linguistic Taxonomy of Explanations for Understanding Within-Label Variation in Natural Language Inference
por: Hong, Pingjun, et al.
Publicado: (2025)
por: Hong, Pingjun, et al.
Publicado: (2025)
Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward
por: Soor, Sampriti, et al.
Publicado: (2025)
por: Soor, Sampriti, et al.
Publicado: (2025)
Reward Modeling from Natural Language Human Feedback
por: Wang, Zongqi, et al.
Publicado: (2026)
por: Wang, Zongqi, et al.
Publicado: (2026)
Understanding the Prompt Sensitivity
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
Retrieval-Augmented Generation for Natural Language Processing: A Survey
por: Wu, Shangyu, et al.
Publicado: (2024)
por: Wu, Shangyu, et al.
Publicado: (2024)
CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards
por: Liu, Cheng, et al.
Publicado: (2025)
por: Liu, Cheng, et al.
Publicado: (2025)
HYBRIDMIND: Meta Selection of Natural Language and Symbolic Language for Enhanced LLM Reasoning
por: Han, Simeng, et al.
Publicado: (2024)
por: Han, Simeng, et al.
Publicado: (2024)
Label Distribution Learning-Enhanced Dual-KNN for Text Classification
por: Yuan, Bo, et al.
Publicado: (2025)
por: Yuan, Bo, et al.
Publicado: (2025)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
por: Deng, Wenlong, et al.
Publicado: (2026)
por: Deng, Wenlong, et al.
Publicado: (2026)
Semantic Mastery: Enhancing LLMs with Advanced Natural Language Understanding
por: Hariharan, Mohanakrishnan
Publicado: (2025)
por: Hariharan, Mohanakrishnan
Publicado: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
por: Zhang, Xue, et al.
Publicado: (2025)
por: Zhang, Xue, et al.
Publicado: (2025)
Combining Supervised Learning and Reinforcement Learning for Multi-Label Classification Tasks with Partial Labels
por: Jia, Zixia, et al.
Publicado: (2024)
por: Jia, Zixia, et al.
Publicado: (2024)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
Ejemplares similares
-
Strengthened Symbol Binding Makes Large Language Models Reliable Multiple-Choice Selectors
por: Xue, Mengge, et al.
Publicado: (2024) -
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
por: Cao, Meng, et al.
Publicado: (2024) -
Understanding and Tackling Label Errors in Individual-Level Nature Language Understanding
por: Xiao, Yunpeng, et al.
Publicado: (2025) -
ReFusion: Improving Natural Language Understanding with Computation-Efficient Retrieval Representation Fusion
por: Wu, Shangyu, et al.
Publicado: (2024) -
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
por: Wang, Li, et al.
Publicado: (2026)