How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yejie, He, Keqing, Fu, Dayuan, Gongque, Zhuoma, Xu, Heyang, Chen, Yanxu, Wang, Zhexu, Fu, Yujia, Dong, Guanting, Diao, Muxi, Wang, Jingang, Zhang, Mengdi, Cai, Xunliang, Xu, Weiran |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AgentRefine: Enhancing Agent Generalization through Refinement Tuning
by: Fu, Dayuan, et al.
Published: (2025)
by: Fu, Dayuan, et al.
Published: (2025)
DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning
by: Wang, Yejie, et al.
Published: (2024)
by: Wang, Yejie, et al.
Published: (2024)
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
by: Wang, Pei, et al.
Published: (2024)
by: Wang, Pei, et al.
Published: (2024)
BootTOD: Bootstrap Task-oriented Dialogue Representations by Aligning Diverse Responses
by: Zeng, Weihao, et al.
Published: (2024)
by: Zeng, Weihao, et al.
Published: (2024)
PreAct: Prediction Enhances Agent's Planning Ability
by: Fu, Dayuan, et al.
Published: (2024)
by: Fu, Dayuan, et al.
Published: (2024)
OJBench: A Competition Level Code Benchmark For Large Language Models
by: Wang, Zhexu, et al.
Published: (2025)
by: Wang, Zhexu, et al.
Published: (2025)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
by: Song, Xiaoshuai, et al.
Published: (2024)
by: Song, Xiaoshuai, et al.
Published: (2024)
DivTOD: Unleashing the Power of LLMs for Diversifying Task-Oriented Dialogue Representations
by: Zeng, Weihao, et al.
Published: (2024)
by: Zeng, Weihao, et al.
Published: (2024)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
by: Diao, Muxi, et al.
Published: (2024)
by: Diao, Muxi, et al.
Published: (2024)
Beyond the Known: Investigating LLMs Performance on Out-of-Domain Intent Detection
by: Wang, Pei, et al.
Published: (2024)
by: Wang, Pei, et al.
Published: (2024)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
by: Diao, Muxi, et al.
Published: (2025)
by: Diao, Muxi, et al.
Published: (2025)
APP: Adaptive Prototypical Pseudo-Labeling for Few-shot OOD Detection
by: Wang, Pei, et al.
Published: (2023)
by: Wang, Pei, et al.
Published: (2023)
Knowledge Editing on Black-box Large Language Models
by: Song, Xiaoshuai, et al.
Published: (2024)
by: Song, Xiaoshuai, et al.
Published: (2024)
Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction
by: Xu, Chengzhi, et al.
Published: (2025)
by: Xu, Chengzhi, et al.
Published: (2025)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
by: Diao, Muxi, et al.
Published: (2026)
by: Diao, Muxi, et al.
Published: (2026)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
by: Zhang, Alexander, et al.
Published: (2025)
by: Zhang, Alexander, et al.
Published: (2025)
Scaling Coding Agents via Atomic Skills
by: Ma, Yingwei, et al.
Published: (2026)
by: Ma, Yingwei, et al.
Published: (2026)
We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?
by: Qiao, Runqi, et al.
Published: (2024)
by: Qiao, Runqi, et al.
Published: (2024)
MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making
by: Fu, Dayuan, et al.
Published: (2024)
by: Fu, Dayuan, et al.
Published: (2024)
Efficient and Universal Watermarking for LLM-Generated Code Detection
by: Li, Boquan, et al.
Published: (2024)
by: Li, Boquan, et al.
Published: (2024)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
by: Liu, Jiahao, et al.
Published: (2024)
by: Liu, Jiahao, et al.
Published: (2024)
SCoder: Iterative Self-Distillation for Bootstrapping Small-Scale Data Synthesizers to Empower Code LLMs
by: Zhang, Xinyu, et al.
Published: (2025)
by: Zhang, Xinyu, et al.
Published: (2025)
EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning
by: Li, Zhihao, et al.
Published: (2024)
by: Li, Zhihao, et al.
Published: (2024)
Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow
by: Wang, Fu-Yun, et al.
Published: (2024)
by: Wang, Fu-Yun, et al.
Published: (2024)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
by: Wang, Peiding, et al.
Published: (2025)
by: Wang, Peiding, et al.
Published: (2025)
Copilot-in-the-Loop: Fixing Code Smells in Copilot-Generated Python Code using Copilot
by: Zhang, Beiqi, et al.
Published: (2024)
by: Zhang, Beiqi, et al.
Published: (2024)
ASMA-Tune: Unlocking LLMs' Assembly Code Comprehension via Structural-Semantic Instruction Tuning
by: Wang, Xinyi, et al.
Published: (2025)
by: Wang, Xinyi, et al.
Published: (2025)
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
by: Fu, Lingyue, et al.
Published: (2025)
by: Fu, Lingyue, et al.
Published: (2025)
LLaMA-E: Empowering E-commerce Authoring with Object-Interleaved Instruction Following
by: Shi, Kaize, et al.
Published: (2023)
by: Shi, Kaize, et al.
Published: (2023)
Instruction Tuning for Secure Code Generation
by: He, Jingxuan, et al.
Published: (2024)
by: He, Jingxuan, et al.
Published: (2024)
Show Me Your Code! Kill Code Poisoning: A Lightweight Method Based on Code Naturalness
by: Sun, Weisong, et al.
Published: (2025)
by: Sun, Weisong, et al.
Published: (2025)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
by: Wang, Siqi, et al.
Published: (2024)
by: Wang, Siqi, et al.
Published: (2024)
CodeGraph: Enhancing Graph Reasoning of LLMs with Code
by: Cai, Qiaolong, et al.
Published: (2024)
by: Cai, Qiaolong, et al.
Published: (2024)
An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors
by: Yu, Jiaxin, et al.
Published: (2024)
by: Yu, Jiaxin, et al.
Published: (2024)
InstructCoder: Instruction Tuning Large Language Models for Code Editing
by: Li, Kaixin, et al.
Published: (2023)
by: Li, Kaixin, et al.
Published: (2023)
Semantic HARQ for Intelligent Transportation Systems: Joint Source-Channel Coding-Powered Reliable Retransmissions
by: Li, Yongkang, et al.
Published: (2025)
by: Li, Yongkang, et al.
Published: (2025)
FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training
by: Xu, Liangyu, et al.
Published: (2025)
by: Xu, Liangyu, et al.
Published: (2025)
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
by: Xu, Zhihao, et al.
Published: (2026)
by: Xu, Zhihao, et al.
Published: (2026)
TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection
by: Li, Mengdi, et al.
Published: (2026)
by: Li, Mengdi, et al.
Published: (2026)
Automated Prompt Generation for Code Intelligence: An Empirical study and Experience in WeChat
by: Ji, Kexing, et al.
Published: (2025)
by: Ji, Kexing, et al.
Published: (2025)
Similar Items
-
AgentRefine: Enhancing Agent Generalization through Refinement Tuning
by: Fu, Dayuan, et al.
Published: (2025) -
DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning
by: Wang, Yejie, et al.
Published: (2024) -
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
by: Wang, Pei, et al.
Published: (2024) -
BootTOD: Bootstrap Task-oriented Dialogue Representations by Aligning Diverse Responses
by: Zeng, Weihao, et al.
Published: (2024) -
PreAct: Prediction Enhances Agent's Planning Ability
by: Fu, Dayuan, et al.
Published: (2024)