Aligning Crowd-sourced Human Feedback for Reinforcement Learning on Code Generation by Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wong, Man Fai, Tan, Chee Wei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Aligning Crowd Feedback via Distributional Preference Reward Modeling
by: Li, Dexun, et al.
Published: (2024)
by: Li, Dexun, et al.
Published: (2024)
HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning
by: Zou, Qingyun, et al.
Published: (2026)
by: Zou, Qingyun, et al.
Published: (2026)
Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
by: Yuan, Wenzhen, et al.
Published: (2025)
by: Yuan, Wenzhen, et al.
Published: (2025)
Aligning Humans and Robots via Reinforcement Learning from Implicit Human Feedback
by: Kim, Suzie, et al.
Published: (2025)
by: Kim, Suzie, et al.
Published: (2025)
Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control
by: Kim, Suzie
Published: (2025)
by: Kim, Suzie
Published: (2025)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
by: Ye, Kai, et al.
Published: (2025)
by: Ye, Kai, et al.
Published: (2025)
MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models
by: Chung, Sangyun, et al.
Published: (2026)
by: Chung, Sangyun, et al.
Published: (2026)
TrumorGPT: Graph-Based Retrieval-Augmented Large Language Model for Fact-Checking
by: Hang, Ching Nam, et al.
Published: (2025)
by: Hang, Ching Nam, et al.
Published: (2025)
Large Language Model for Verilog Generation with Code-Structure-Guided Reinforcement Learning
by: Wang, Ning, et al.
Published: (2024)
by: Wang, Ning, et al.
Published: (2024)
From Code Generation to Software Testing: AI Copilot with Context-Based RAG
by: Wang, Yuchen, et al.
Published: (2025)
by: Wang, Yuchen, et al.
Published: (2025)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
by: Bao, Rong, et al.
Published: (2024)
by: Bao, Rong, et al.
Published: (2024)
Learning to Align Human Code Preferences
by: Yin, Xin, et al.
Published: (2025)
by: Yin, Xin, et al.
Published: (2025)
Nemobot Games: Crafting Strategic AI Gaming Agents for Interactive Learning with Large Language Models
by: Tan, Chee Wei, et al.
Published: (2026)
by: Tan, Chee Wei, et al.
Published: (2026)
Anchor-based Large Language Models
by: Pang, Jianhui, et al.
Published: (2024)
by: Pang, Jianhui, et al.
Published: (2024)
Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models
by: Wang, Rui, et al.
Published: (2025)
by: Wang, Rui, et al.
Published: (2025)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
by: Wang, Jiongxiao, et al.
Published: (2023)
by: Wang, Jiongxiao, et al.
Published: (2023)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
by: Zhang, Wenbo, et al.
Published: (2024)
by: Zhang, Wenbo, et al.
Published: (2024)
Large Language Models are Highly Aligned with Human Ratings of Emotional Stimuli
by: Ogg, Mattson, et al.
Published: (2025)
by: Ogg, Mattson, et al.
Published: (2025)
Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
by: Nguyen, Thanh Thi, et al.
Published: (2025)
by: Nguyen, Thanh Thi, et al.
Published: (2025)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
by: Sharma, Archit, et al.
Published: (2024)
by: Sharma, Archit, et al.
Published: (2024)
Enabling Energy-Efficient Deployment of Large Language Models on Memristor Crossbar: A Synergy of Large and Small
by: Wang, Zhehui, et al.
Published: (2024)
by: Wang, Zhehui, et al.
Published: (2024)
Task Abstention for Large Language Models in Code Generation
by: Zhou, Yanke, et al.
Published: (2026)
by: Zhou, Yanke, et al.
Published: (2026)
Aligning Large Language Model Behavior with Human Citation Preferences
by: Ando, Kenichiro, et al.
Published: (2026)
by: Ando, Kenichiro, et al.
Published: (2026)
Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models?
by: Karkevandi, Mohammad Bahrami, et al.
Published: (2024)
by: Karkevandi, Mohammad Bahrami, et al.
Published: (2024)
Efficiently Aligning Language Models with Online Natural Language Feedback
by: Ye, Christine, et al.
Published: (2026)
by: Ye, Christine, et al.
Published: (2026)
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
by: van Niekerk, Carel, et al.
Published: (2025)
by: van Niekerk, Carel, et al.
Published: (2025)
DrugGen: Advancing Drug Discovery with Large Language Models and Reinforcement Learning Feedback
by: Sheikholeslami, Mahsa, et al.
Published: (2024)
by: Sheikholeslami, Mahsa, et al.
Published: (2024)
Structure-Aware Corpus Construction and User-Perception-Aligned Metrics for Large-Language-Model Code Completion
by: Liu, Dengfeng, et al.
Published: (2025)
by: Liu, Dengfeng, et al.
Published: (2025)
Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
by: Liu, Shang, et al.
Published: (2024)
by: Liu, Shang, et al.
Published: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
by: Bansal, Hritik, et al.
Published: (2023)
by: Bansal, Hritik, et al.
Published: (2023)
Reinforcement Learning with Token-level Feedback for Controllable Text Generation
by: Li, Wendi, et al.
Published: (2024)
by: Li, Wendi, et al.
Published: (2024)
Towards Aligning Language Models with Textual Feedback
by: Lloret, Saüc Abadal, et al.
Published: (2024)
by: Lloret, Saüc Abadal, et al.
Published: (2024)
GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding
by: Zhang, Ziyin, et al.
Published: (2024)
by: Zhang, Ziyin, et al.
Published: (2024)
The Real, the Better: Aligning Large Language Models with Online Human Behaviors
by: Jiang, Guanying, et al.
Published: (2024)
by: Jiang, Guanying, et al.
Published: (2024)
Human-Aligned Procedural Level Generation Reinforcement Learning via Text-Level-Sketch Shared Representation
by: Baek, In-Chang, et al.
Published: (2025)
by: Baek, In-Chang, et al.
Published: (2025)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
by: Shen, Wei, et al.
Published: (2024)
by: Shen, Wei, et al.
Published: (2024)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
by: Tu, Songjun, et al.
Published: (2024)
by: Tu, Songjun, et al.
Published: (2024)
Large Language Model-Enhanced Reinforcement Learning for Generic Bus Holding Control Strategies
by: Yu, Jiajie, et al.
Published: (2024)
by: Yu, Jiajie, et al.
Published: (2024)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
by: Li, Zhaoyan, et al.
Published: (2026)
by: Li, Zhaoyan, et al.
Published: (2026)
Contextual Augmented Multi-Model Programming (CAMP): A Hybrid Local-Cloud Copilot Framework
by: Wang, Yuchen, et al.
Published: (2024)
by: Wang, Yuchen, et al.
Published: (2024)
Similar Items
-
Aligning Crowd Feedback via Distributional Preference Reward Modeling
by: Li, Dexun, et al.
Published: (2024) -
HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning
by: Zou, Qingyun, et al.
Published: (2026) -
Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
by: Yuan, Wenzhen, et al.
Published: (2025) -
Aligning Humans and Robots via Reinforcement Learning from Implicit Human Feedback
by: Kim, Suzie, et al.
Published: (2025) -
Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control
by: Kim, Suzie
Published: (2025)