Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Jiasheng, Cao, Boxi, Yu, Boxi, Zhang, Yuzhong, Cao, Jialun, Lu, Yaojie, Lin, Hongyu, Han, Xianpei, Sun, Le |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2026)
by: Zheng, Jiasheng, et al.
Published: (2026)
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
by: Zhu, Qiming, et al.
Published: (2024)
by: Zhu, Qiming, et al.
Published: (2024)
Across Programming Language Silos: A Study on Cross-Lingual Retrieval-augmented Code Generation
by: Zhu, Qiming, et al.
Published: (2025)
by: Zhu, Qiming, et al.
Published: (2025)
EmbedAgent: Benchmarking Large Language Models in Embedded System Development
by: Xu, Ruiyang, et al.
Published: (2025)
by: Xu, Ruiyang, et al.
Published: (2025)
LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation
by: Xu, Dong, et al.
Published: (2026)
by: Xu, Dong, et al.
Published: (2026)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark
by: Yu, Boxi, et al.
Published: (2026)
by: Yu, Boxi, et al.
Published: (2026)
NoCode-bench: A Benchmark for Evaluating Natural Language-Driven Feature Addition
by: Deng, Le, et al.
Published: (2025)
by: Deng, Le, et al.
Published: (2025)
Rigor, Reliability, and Reproducibility Matter: A Decade-Scale Survey of 572 Code Benchmarks
by: Cao, Jialun, et al.
Published: (2025)
by: Cao, Jialun, et al.
Published: (2025)
The Life Cycle of Knowledge in Big Language Models: A Survey
by: Cao, Boxi, et al.
Published: (2023)
by: Cao, Boxi, et al.
Published: (2023)
Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG
by: Yu, Boxi, et al.
Published: (2026)
by: Yu, Boxi, et al.
Published: (2026)
What Builds Effective In-Context Examples for Code Generation?
by: Li, Dongze, et al.
Published: (2025)
by: Li, Dongze, et al.
Published: (2025)
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench
by: Yu, Boxi, et al.
Published: (2025)
by: Yu, Boxi, et al.
Published: (2025)
Concerned with Data Contamination? Assessing Countermeasures in Code Language Model
by: Cao, Jialun, et al.
Published: (2024)
by: Cao, Jialun, et al.
Published: (2024)
iCoRe: An Iterative Correlation-Aware Retriever for Bug Reproduction Test Generation
by: Wang, Junyi, et al.
Published: (2026)
by: Wang, Junyi, et al.
Published: (2026)
An Empirical Study on Package-Level Deprecation in Python Ecosystem
by: Zhong, Zhiqing, et al.
Published: (2024)
by: Zhong, Zhiqing, et al.
Published: (2024)
When LLMs Meet API Documentation: Can Retrieval Augmentation Aid Code Generation Just as It Helps Developers?
by: Chen, Jingyi, et al.
Published: (2025)
by: Chen, Jingyi, et al.
Published: (2025)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
by: Peng, Xiaoxuan, et al.
Published: (2026)
by: Peng, Xiaoxuan, et al.
Published: (2026)
Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models
by: Yan, Xinru, et al.
Published: (2026)
by: Yan, Xinru, et al.
Published: (2026)
Can Emulating Semantic Translation Help LLMs with Code Translation? A Study Based on Pseudocode
by: Chen, Songqiang, et al.
Published: (2025)
by: Chen, Songqiang, et al.
Published: (2025)
Scaling Coding Agents via Atomic Skills
by: Ma, Yingwei, et al.
Published: (2026)
by: Ma, Yingwei, et al.
Published: (2026)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
by: Dai, Dekun, et al.
Published: (2025)
by: Dai, Dekun, et al.
Published: (2025)
Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation
by: Florian, Le Bronnec, et al.
Published: (2026)
by: Florian, Le Bronnec, et al.
Published: (2026)
From What to How: Bridging User Requirements with Software Development Using Large Language Models
by: He, Xiao, et al.
Published: (2026)
by: He, Xiao, et al.
Published: (2026)
Aletheia: What Makes RLVR For Code Verifiers Tick?
by: Venkatkrishna, Vatsal, et al.
Published: (2026)
by: Venkatkrishna, Vatsal, et al.
Published: (2026)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
by: Wu, Jiarong, et al.
Published: (2025)
by: Wu, Jiarong, et al.
Published: (2025)
SRLCG: Self-Rectified Large-Scale Code Generation with Multidimensional Chain-of-Thought and Dynamic Backtracking
by: Ma, Hongru, et al.
Published: (2025)
by: Ma, Hongru, et al.
Published: (2025)
ReuseDroid: A VLM-empowered Android UI Test Migrator Boosted by Active Feedback
by: Li, Xiaolei, et al.
Published: (2025)
by: Li, Xiaolei, et al.
Published: (2025)
Can Large Language Models Model Programs Formally?
by: Chen, Zhiyong, et al.
Published: (2026)
by: Chen, Zhiyong, et al.
Published: (2026)
Enchanting Program Specification Synthesis by Large Language Models using Static Analysis and Program Verification
by: Wen, Cheng, et al.
Published: (2024)
by: Wen, Cheng, et al.
Published: (2024)
UICopilot: Automating UI Synthesis via Hierarchical Code Generation from Webpage Designs
by: Gui, Yi, et al.
Published: (2025)
by: Gui, Yi, et al.
Published: (2025)
AOCI: Symbolic-Semantic Indexing for Practical Repository-Scale Code Understanding with LLMs
by: Liu, Jinshi, et al.
Published: (2026)
by: Liu, Jinshi, et al.
Published: (2026)
Chart2Code-MoLA: Efficient Multi-Modal Code Generation via Adaptive Expert Routing
by: Wang, Yifei, et al.
Published: (2025)
by: Wang, Yifei, et al.
Published: (2025)
MORepair: Teaching LLMs to Repair Code via Multi-Objective Fine-tuning
by: Yang, Boyang, et al.
Published: (2024)
by: Yang, Boyang, et al.
Published: (2024)
ATLAS: Automated Toolkit for Large-Scale Verified Code Synthesis
by: Baksys, Mantas, et al.
Published: (2025)
by: Baksys, Mantas, et al.
Published: (2025)
Modularization is Better: Effective Code Generation with Modular Prompting
by: Pan, Ruwei, et al.
Published: (2025)
by: Pan, Ruwei, et al.
Published: (2025)
SECRET: Towards Scalable and Efficient Code Retrieval via Segmented Deep Hashing
by: Gu, Wenchao, et al.
Published: (2024)
by: Gu, Wenchao, et al.
Published: (2024)
CodeCoR: An LLM-Based Self-Reflective Multi-Agent Framework for Code Generation
by: Pan, Ruwei, et al.
Published: (2025)
by: Pan, Ruwei, et al.
Published: (2025)
SandCell: Sandboxing Rust Beyond Unsafe Code
by: Zhang, Jialun, et al.
Published: (2025)
by: Zhang, Jialun, et al.
Published: (2025)
Similar Items
-
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024) -
ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2026) -
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
by: Zhu, Qiming, et al.
Published: (2024) -
Across Programming Language Silos: A Study on Cross-Lingual Retrieval-augmented Code Generation
by: Zhu, Qiming, et al.
Published: (2025) -
EmbedAgent: Benchmarking Large Language Models in Embedded System Development
by: Xu, Ruiyang, et al.
Published: (2025)