Improving HPC Code Generation Capability of LLMs via Online Reinforcement Learning with Real-Machine Benchmark Rewards
Fuente:
arXiv
Saved in:
| Main Authors: | Mikasa, Ryo, Hayashi, Shun-ichiro, Mukunoki, Daichi, Hoshino, Tetsuya, Katagiri, Takahiro |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VibeCodeHPC: An Agent-Based Iterative Prompting Auto-Tuner for HPC Code Generation Using LLMs
by: Hayashi, Shun-ichiro, et al.
Published: (2025)
by: Hayashi, Shun-ichiro, et al.
Published: (2025)
Performance Evaluation of General Purpose Large Language Models for Basic Linear Algebra Subprograms Code Generation
by: Mukunoki, Daichi, et al.
Published: (2025)
by: Mukunoki, Daichi, et al.
Published: (2025)
Layer-wise MoE Routing Locality under Shared-Prefix Code Generation: Token-Identity Decomposition and Compile-Equivalent Fork Redundancy
by: Hayashi, Shun-ichiro, et al.
Published: (2026)
by: Hayashi, Shun-ichiro, et al.
Published: (2026)
3Dify: a Framework for Procedural 3D-CG Generation Assisted by LLMs Using MCP and RAG
by: Hayashi, Shun-ichiro, et al.
Published: (2025)
by: Hayashi, Shun-ichiro, et al.
Published: (2025)
Towards Generalized Parameter Tuning in Coherent Ising Machines: A Portfolio-Based Approach
by: Hanyu, Tatsuro, et al.
Published: (2025)
by: Hanyu, Tatsuro, et al.
Published: (2025)
Learning-Augmented Performance Model for Tensor Product Factorization in High-Order FEM
by: Ren, Xuanzhengbo, et al.
Published: (2026)
by: Ren, Xuanzhengbo, et al.
Published: (2026)
DGEMM without FP64 Arithmetic - Using FP64 Emulation and FP8 Tensor Cores with Ozaki Scheme
by: Mukunoki, Daichi
Published: (2025)
by: Mukunoki, Daichi
Published: (2025)
Performance Evaluation of CMOS Annealing with Support Vector Machine
by: Fukuhara, Ryoga, et al.
Published: (2024)
by: Fukuhara, Ryoga, et al.
Published: (2024)
Sparse Iterative Solvers Using High-Precision Arithmetic with Quasi Multi-Word Algorithms
by: Mukunoki, Daichi, et al.
Published: (2025)
by: Mukunoki, Daichi, et al.
Published: (2025)
Adaptation of XAI to Auto-tuning for Numerical Libraries
by: Aoki, Shota, et al.
Published: (2024)
by: Aoki, Shota, et al.
Published: (2024)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
by: Wu, Tianyi, et al.
Published: (2026)
by: Wu, Tianyi, et al.
Published: (2026)
ppOpen-AT: A Directive-base Auto-tuning Language
by: Katagiri, Takahiro
Published: (2024)
by: Katagiri, Takahiro
Published: (2024)
Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning
by: Bensal, Shelly, et al.
Published: (2025)
by: Bensal, Shelly, et al.
Published: (2025)
Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning
by: Qin, Zhanyue, et al.
Published: (2026)
by: Qin, Zhanyue, et al.
Published: (2026)
Theories of Frege structure equivalent to Feferman's system $\mathsf{T}_0$
by: Hayashi, Daichi
Published: (2024)
by: Hayashi, Daichi
Published: (2024)
IOAgent: Democratizing Trustworthy HPC I/O Performance Diagnosis Capability via LLMs
by: Egersdoerfer, Chris, et al.
Published: (2026)
by: Egersdoerfer, Chris, et al.
Published: (2026)
Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards
by: Lara, Luis, et al.
Published: (2026)
by: Lara, Luis, et al.
Published: (2026)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
by: Cho, Dongkyu Derek, et al.
Published: (2025)
by: Cho, Dongkyu Derek, et al.
Published: (2025)
Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning
by: Zhang, Yimeng, et al.
Published: (2025)
by: Zhang, Yimeng, et al.
Published: (2025)
Second Order Analysis for Joint Source-Channel Coding with Markovian Source
by: Yaguchi, Ryo, et al.
Published: (2017)
by: Yaguchi, Ryo, et al.
Published: (2017)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
by: Zhang, Shun, et al.
Published: (2024)
by: Zhang, Shun, et al.
Published: (2024)
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
by: Katagiri, Takahiro, et al.
Published: (2024)
by: Katagiri, Takahiro, et al.
Published: (2024)
Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards
by: Jolfaei, Erfan Aghadavoodi, et al.
Published: (2026)
by: Jolfaei, Erfan Aghadavoodi, et al.
Published: (2026)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
by: Li, Xin-Ye, et al.
Published: (2026)
by: Li, Xin-Ye, et al.
Published: (2026)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
by: Deng, Wenhao, et al.
Published: (2025)
by: Deng, Wenhao, et al.
Published: (2025)
Design of Reward Function on Reinforcement Learning for Automated Driving
by: Goto, Takeru, et al.
Published: (2025)
by: Goto, Takeru, et al.
Published: (2025)
(Table 1) Physical properties of basalts from DSDP Holes 69-504B and 70-504B
by: Karato, Shun-ichiro
Published: (1983)
by: Karato, Shun-ichiro
Published: (1983)
Massive gauge boson and Higgs boson as the vestiges of non-Fock vacuum
by: Koh, Shun-ichiro
Published: (2024)
by: Koh, Shun-ichiro
Published: (2024)
Wake Not a Sleeping Lion: Free Trade Agreements and Decision Rights in Multinationals
by: Hiroshi Mukunoki, et al.
Published: (2025)
by: Hiroshi Mukunoki, et al.
Published: (2025)
Pushdown Reward Machines for Reinforcement Learning
by: Varricchione, Giovanni, et al.
Published: (2025)
by: Varricchione, Giovanni, et al.
Published: (2025)
Reinforcement Learning with Symbolic Reward Machines
by: Krug, Thomas, et al.
Published: (2026)
by: Krug, Thomas, et al.
Published: (2026)
Reinforcement Learning with Stochastic Reward Machines
by: Corazza, Jan, et al.
Published: (2025)
by: Corazza, Jan, et al.
Published: (2025)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
by: Fan, Lishui, et al.
Published: (2025)
by: Fan, Lishui, et al.
Published: (2025)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
by: Wen, Xumeng, et al.
Published: (2025)
by: Wen, Xumeng, et al.
Published: (2025)
Code as Reward: Empowering Reinforcement Learning with VLMs
by: Venuto, David, et al.
Published: (2024)
by: Venuto, David, et al.
Published: (2024)
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code
by: Hua, Tianyu, et al.
Published: (2025)
by: Hua, Tianyu, et al.
Published: (2025)
TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks
by: Fujii, Ryo, et al.
Published: (2026)
by: Fujii, Ryo, et al.
Published: (2026)
CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs
by: Manh, Dung Nguyen, et al.
Published: (2024)
by: Manh, Dung Nguyen, et al.
Published: (2024)
Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey
by: Wang, Junqiao, et al.
Published: (2024)
by: Wang, Junqiao, et al.
Published: (2024)
SecureCodeRL: Security-Aware Reinforcement Learning for Code Generation with Partial-Credit Rewards
by: Sijwali, Suryansh Singh, et al.
Published: (2026)
by: Sijwali, Suryansh Singh, et al.
Published: (2026)
Similar Items
-
VibeCodeHPC: An Agent-Based Iterative Prompting Auto-Tuner for HPC Code Generation Using LLMs
by: Hayashi, Shun-ichiro, et al.
Published: (2025) -
Performance Evaluation of General Purpose Large Language Models for Basic Linear Algebra Subprograms Code Generation
by: Mukunoki, Daichi, et al.
Published: (2025) -
Layer-wise MoE Routing Locality under Shared-Prefix Code Generation: Token-Identity Decomposition and Compile-Equivalent Fork Redundancy
by: Hayashi, Shun-ichiro, et al.
Published: (2026) -
3Dify: a Framework for Procedural 3D-CG Generation Assisted by LLMs Using MCP and RAG
by: Hayashi, Shun-ichiro, et al.
Published: (2025) -
Towards Generalized Parameter Tuning in Coherent Ising Machines: A Portfolio-Based Approach
by: Hanyu, Tatsuro, et al.
Published: (2025)