EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Jiahe, Gao, Zhengqi, Ko, Ching-Yun, Boning, Duane |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
par: Zha, Kaiwen, et autres
Publié: (2025)
par: Zha, Kaiwen, et autres
Publié: (2025)
KirchhoffNet: A Scalable Ultra Fast Analog Neural Network
par: Gao, Zhengqi, et autres
Publié: (2023)
par: Gao, Zhengqi, et autres
Publié: (2023)
REG: Rectified Gradient Guidance for Conditional Diffusion Models
par: Gao, Zhengqi, et autres
Publié: (2025)
par: Gao, Zhengqi, et autres
Publié: (2025)
RDIT: Residual-based Diffusion Implicit Models for Probabilistic Time Series Forecasting
par: Lai, Chih-Yu, et autres
Publié: (2025)
par: Lai, Chih-Yu, et autres
Publié: (2025)
OriGen:Enhancing RTL Code Generation with Code-to-Code Augmentation and Self-Reflection
par: Cui, Fan, et autres
Publié: (2024)
par: Cui, Fan, et autres
Publié: (2024)
Calibration-Aware Policy Optimization for Reasoning LLMs
par: Wang, Ziqi, et autres
Publié: (2026)
par: Wang, Ziqi, et autres
Publié: (2026)
Towards Reliable, Uncertainty-Aware Alignment
par: Banerjee, Debangshu, et autres
Publié: (2025)
par: Banerjee, Debangshu, et autres
Publié: (2025)
SP2RINT: Spatially-Decoupled Physics-Inspired Progressive Inverse Optimization for Scalable, PDE-Constrained Meta-Optical Neural Network Training
par: Ma, Pingchuan, et autres
Publié: (2025)
par: Ma, Pingchuan, et autres
Publié: (2025)
GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
par: Zhao, Yiyang, et autres
Publié: (2025)
par: Zhao, Yiyang, et autres
Publié: (2025)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
par: Zhang, Yiqi, et autres
Publié: (2026)
par: Zhang, Yiqi, et autres
Publié: (2026)
PIC2O-Sim: A Physics-Inspired Causality-Aware Dynamic Convolutional Neural Operator for Ultra-Fast Photonic Device FDTD Simulation
par: Ma, Pingchuan, et autres
Publié: (2024)
par: Ma, Pingchuan, et autres
Publié: (2024)
RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs
par: Hu, Ruike, et autres
Publié: (2025)
par: Hu, Ruike, et autres
Publié: (2025)
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
par: Xu, Haofeng, et autres
Publié: (2026)
par: Xu, Haofeng, et autres
Publié: (2026)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
par: Zhan, Guojian, et autres
Publié: (2025)
par: Zhan, Guojian, et autres
Publié: (2025)
On Entropy Control in LLM-RL Algorithms
par: Shen, Han
Publié: (2025)
par: Shen, Han
Publié: (2025)
SymRTLO: Enhancing RTL Code Optimization with LLMs and Neuron-Inspired Symbolic Reasoning
par: Wang, Yiting, et autres
Publié: (2025)
par: Wang, Yiting, et autres
Publié: (2025)
Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL
par: Cai, Siyang, et autres
Publié: (2026)
par: Cai, Siyang, et autres
Publié: (2026)
ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding
par: Zhoubian, Sining, et autres
Publié: (2025)
par: Zhoubian, Sining, et autres
Publié: (2025)
Make Every Move Count: LLM-based High-Quality RTL Code Generation Using MCTS
par: DeLorenzo, Matthew, et autres
Publié: (2024)
par: DeLorenzo, Matthew, et autres
Publié: (2024)
Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs
par: Chen, Xinzhu, et autres
Publié: (2025)
par: Chen, Xinzhu, et autres
Publié: (2025)
Curiosity & Entropy Driven Unsupervised RL in Multiple Environments
par: Dewan, Shaurya, et autres
Publié: (2024)
par: Dewan, Shaurya, et autres
Publié: (2024)
Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners
par: Muslimani, Calarina, et autres
Publié: (2025)
par: Muslimani, Calarina, et autres
Publié: (2025)
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
par: Li, Huanyu, et autres
Publié: (2026)
par: Li, Huanyu, et autres
Publié: (2026)
Partial Policy Gradients for RL in LLMs
par: Mathur, Puneet, et autres
Publié: (2026)
par: Mathur, Puneet, et autres
Publié: (2026)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
par: Tejaswi, Atula, et autres
Publié: (2026)
par: Tejaswi, Atula, et autres
Publié: (2026)
QiMeng-CodeV-SVA: Training Specialized LLMs for Hardware Assertion Generation via RTL-Grounded Bidirectional Data Synthesis
par: Wu, Yutong, et autres
Publié: (2026)
par: Wu, Yutong, et autres
Publié: (2026)
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
par: Sancaktar, Cansu, et autres
Publié: (2026)
par: Sancaktar, Cansu, et autres
Publié: (2026)
RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs
par: Samineni, Soumya Rani, et autres
Publié: (2025)
par: Samineni, Soumya Rani, et autres
Publié: (2025)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
par: Hung, Kuo-Han, et autres
Publié: (2024)
par: Hung, Kuo-Han, et autres
Publié: (2024)
Multi-Objective Instruction-Aware Representation Learning in Procedural Content Generation RL
par: Kim, Sung-Hyun, et autres
Publié: (2025)
par: Kim, Sung-Hyun, et autres
Publié: (2025)
A Systematic Investigation of The RL-Jailbreaker in LLMs
par: Mohammedalamen, Montaser, et autres
Publié: (2026)
par: Mohammedalamen, Montaser, et autres
Publié: (2026)
Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs
par: Cheng, Ching-An, et autres
Publié: (2024)
par: Cheng, Ching-An, et autres
Publié: (2024)
Dual Alignment Maximin Optimization for Offline Model-based RL
par: Zhou, Chi, et autres
Publié: (2025)
par: Zhou, Chi, et autres
Publié: (2025)
RL-Finetuned LLMs for Privacy-Preserving Synthetic Rewriting
par: Shi, Zhan, et autres
Publié: (2025)
par: Shi, Zhan, et autres
Publié: (2025)
A Synthesizable RTL Implementation of Predictive Coding Networks
par: Oh, Timothy
Publié: (2026)
par: Oh, Timothy
Publié: (2026)
Are LLMs Better GNN Helpers? Rethinking Robust Graph Learning under Deficiencies with Iterative Refinement
par: Wang, Zhaoyan, et autres
Publié: (2025)
par: Wang, Zhaoyan, et autres
Publié: (2025)
Towards Reliable Alignment: Uncertainty-aware RLHF
par: Banerjee, Debangshu, et autres
Publié: (2024)
par: Banerjee, Debangshu, et autres
Publié: (2024)
Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment
par: Chen, Tiejin, et autres
Publié: (2026)
par: Chen, Tiejin, et autres
Publié: (2026)
RL-GPT: Integrating Reinforcement Learning and Code-as-policy
par: Liu, Shaoteng, et autres
Publié: (2024)
par: Liu, Shaoteng, et autres
Publié: (2024)
VeriDispatcher: Multi-Model Dispatching through Pre-Inference Difficulty Prediction for RTL Generation Optimization
par: Wang, Zeng, et autres
Publié: (2025)
par: Wang, Zeng, et autres
Publié: (2025)
Documents similaires
-
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
par: Zha, Kaiwen, et autres
Publié: (2025) -
KirchhoffNet: A Scalable Ultra Fast Analog Neural Network
par: Gao, Zhengqi, et autres
Publié: (2023) -
REG: Rectified Gradient Guidance for Conditional Diffusion Models
par: Gao, Zhengqi, et autres
Publié: (2025) -
RDIT: Residual-based Diffusion Implicit Models for Probabilistic Time Series Forecasting
par: Lai, Chih-Yu, et autres
Publié: (2025) -
OriGen:Enhancing RTL Code Generation with Code-to-Code Augmentation and Self-Reflection
par: Cui, Fan, et autres
Publié: (2024)