OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Ahmad, Wasi Uddin, Ficek, Aleksander, Samadi, Mehrzad, Huang, Jocelyn, Noroozi, Vahid, Majumdar, Somshubra, Ginsburg, Boris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models
di: Majumdar, Somshubra, et al.
Pubblicazione: (2024)
di: Majumdar, Somshubra, et al.
Pubblicazione: (2024)
From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
OpenCodeReasoning: Advancing Data Distillation for Competitive Coding
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
di: Samadi, Mehrzad, et al.
Pubblicazione: (2025)
di: Samadi, Mehrzad, et al.
Pubblicazione: (2025)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
di: Ludwig, Nikolai, et al.
Pubblicazione: (2026)
di: Ludwig, Nikolai, et al.
Pubblicazione: (2026)
Secure-Instruct: An Automated Pipeline for Synthesizing Instruction-Tuning Datasets Using LLMs for Secure Code Generation
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
InstructCoder: Instruction Tuning Large Language Models for Code Editing
di: Li, Kaixin, et al.
Pubblicazione: (2023)
di: Li, Kaixin, et al.
Pubblicazione: (2023)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
di: Noroozi, Vahid, et al.
Pubblicazione: (2024)
di: Noroozi, Vahid, et al.
Pubblicazione: (2024)
InverseCoder: Self-improving Instruction-Tuned Code LLMs with Inverse-Instruct
di: Wu, Yutong, et al.
Pubblicazione: (2024)
di: Wu, Yutong, et al.
Pubblicazione: (2024)
Stateful Conformer with Cache-based Inference for Streaming Automatic Speech Recognition
di: Noroozi, Vahid, et al.
Pubblicazione: (2023)
di: Noroozi, Vahid, et al.
Pubblicazione: (2023)
Repoformer: Selective Retrieval for Repository-Level Code Completion
di: Wu, Di, et al.
Pubblicazione: (2024)
di: Wu, Di, et al.
Pubblicazione: (2024)
Learning Generative Selection for Best-of-N
di: Toshniwal, Shubham, et al.
Pubblicazione: (2026)
di: Toshniwal, Shubham, et al.
Pubblicazione: (2026)
On the Adversarial Robustness of Instruction-Tuned Large Language Models for Code
di: Hossen, Md Imran, et al.
Pubblicazione: (2024)
di: Hossen, Md Imran, et al.
Pubblicazione: (2024)
ASMA-Tune: Unlocking LLMs' Assembly Code Comprehension via Structural-Semantic Instruction Tuning
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation
di: Kuhar, Sachit, et al.
Pubblicazione: (2024)
di: Kuhar, Sachit, et al.
Pubblicazione: (2024)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
ICE-Score: Instructing Large Language Models to Evaluate Code
di: Zhuo, Terry Yue
Pubblicazione: (2023)
di: Zhuo, Terry Yue
Pubblicazione: (2023)
The Impact of Large Language Models (LLMs) on Code Review Process
di: Collante, Antonio, et al.
Pubblicazione: (2025)
di: Collante, Antonio, et al.
Pubblicazione: (2025)
Turbulence: Systematically and Automatically Testing Instruction-Tuned Large Language Models for Code
di: Honarvar, Shahin, et al.
Pubblicazione: (2023)
di: Honarvar, Shahin, et al.
Pubblicazione: (2023)
AutoCoder: Enhancing Code Large Language Model with \textsc{AIEV-Instruct}
di: Lei, Bin, et al.
Pubblicazione: (2024)
di: Lei, Bin, et al.
Pubblicazione: (2024)
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
di: Wang, Yejie, et al.
Pubblicazione: (2024)
di: Wang, Yejie, et al.
Pubblicazione: (2024)
Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2024)
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Code Review
di: Cihan, Umut, et al.
Pubblicazione: (2025)
di: Cihan, Umut, et al.
Pubblicazione: (2025)
Instruction Tuning for Secure Code Generation
di: He, Jingxuan, et al.
Pubblicazione: (2024)
di: He, Jingxuan, et al.
Pubblicazione: (2024)
Magicoder: Empowering Code Generation with OSS-Instruct
di: Wei, Yuxiang, et al.
Pubblicazione: (2023)
di: Wei, Yuxiang, et al.
Pubblicazione: (2023)
Prompt Engineering or Fine-Tuning: An Empirical Assessment of LLMs for Code
di: Shin, Jiho, et al.
Pubblicazione: (2023)
di: Shin, Jiho, et al.
Pubblicazione: (2023)
CodeLSI: Leveraging Foundation Models for Automated Code Generation with Low-Rank Optimization and Domain-Specific Instruction Tuning
di: Le, Huy, et al.
Pubblicazione: (2025)
di: Le, Huy, et al.
Pubblicazione: (2025)
Wild SBOMs: a Large-scale Dataset of Software Bills of Materials from Public Code
di: Soeiro, Luıs, et al.
Pubblicazione: (2025)
di: Soeiro, Luıs, et al.
Pubblicazione: (2025)
An Empirical Study on the Effects of System Prompts in Instruction-Tuned Models for Code Generation
di: Cheng, Zaiyu, et al.
Pubblicazione: (2026)
di: Cheng, Zaiyu, et al.
Pubblicazione: (2026)
Edit, But Verify: An Empirical Audit of Instructed Code-Editing Benchmarks
di: Ebrahimi, Amir M., et al.
Pubblicazione: (2026)
di: Ebrahimi, Amir M., et al.
Pubblicazione: (2026)
LLM Assisted Coding with Metamorphic Specification Mutation Agent
di: Akhond, Mostafijur Rahman, et al.
Pubblicazione: (2025)
di: Akhond, Mostafijur Rahman, et al.
Pubblicazione: (2025)
Is Vibe Coding the Future? An Empirical Assessment of LLM Generated Codes for Construction Safety
di: Uddin, S M Jamil
Pubblicazione: (2026)
di: Uddin, S M Jamil
Pubblicazione: (2026)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
SynthCoder: A Synthetical Strategy to Tune LLMs for Code Completion
di: Yu, Dongjun, et al.
Pubblicazione: (2025)
di: Yu, Dongjun, et al.
Pubblicazione: (2025)
AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans
di: Zi, Yangtian, et al.
Pubblicazione: (2025)
di: Zi, Yangtian, et al.
Pubblicazione: (2025)
WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning
di: Yu, Zhaojian, et al.
Pubblicazione: (2023)
di: Yu, Zhaojian, et al.
Pubblicazione: (2023)
TIT: A Tree-Structured Instruction Tuning Approach for LLM-Based Code Translation
di: Jiang, He, et al.
Pubblicazione: (2025)
di: Jiang, He, et al.
Pubblicazione: (2025)
Trained Without My Consent: Detecting Code Inclusion In Language Models Trained on Code
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models
di: Majumdar, Somshubra, et al.
Pubblicazione: (2024) -
From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025) -
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025) -
OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025) -
OpenCodeReasoning: Advancing Data Distillation for Competitive Coding
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)