ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Jiasheng, Zheng, Xin, Cao, Boxi, Wang, Pengbo, Ma, Zhengzhao, Zhu, Qiming, Jiang, Jiazhen, Lu, Yaojie, Lin, Hongyu, Han, Xianpei, Sun, Le |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
by: Zheng, Jiasheng, et al.
Published: (2026)
by: Zheng, Jiasheng, et al.
Published: (2026)
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
by: Zhu, Qiming, et al.
Published: (2024)
by: Zhu, Qiming, et al.
Published: (2024)
Across Programming Language Silos: A Study on Cross-Lingual Retrieval-augmented Code Generation
by: Zhu, Qiming, et al.
Published: (2025)
by: Zhu, Qiming, et al.
Published: (2025)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
by: Zheng, Xin, et al.
Published: (2024)
by: Zheng, Xin, et al.
Published: (2024)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
by: Ma, Zhengzhao, et al.
Published: (2026)
by: Ma, Zhengzhao, et al.
Published: (2026)
EmbedAgent: Benchmarking Large Language Models in Embedded System Development
by: Xu, Ruiyang, et al.
Published: (2025)
by: Xu, Ruiyang, et al.
Published: (2025)
Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models
by: Yan, Xinru, et al.
Published: (2026)
by: Yan, Xinru, et al.
Published: (2026)
Reflective Paper-to-Code Reproduction Enabled by Fine-Grained Verification
by: Zhou, Mingyang, et al.
Published: (2025)
by: Zhou, Mingyang, et al.
Published: (2025)
SRLCG: Self-Rectified Large-Scale Code Generation with Multidimensional Chain-of-Thought and Dynamic Backtracking
by: Ma, Hongru, et al.
Published: (2025)
by: Ma, Hongru, et al.
Published: (2025)
LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation
by: Xu, Dong, et al.
Published: (2026)
by: Xu, Dong, et al.
Published: (2026)
The Life Cycle of Knowledge in Big Language Models: A Survey
by: Cao, Boxi, et al.
Published: (2023)
by: Cao, Boxi, et al.
Published: (2023)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
by: Peng, Xiaoxuan, et al.
Published: (2026)
by: Peng, Xiaoxuan, et al.
Published: (2026)
Code-Survey: An LLM-Driven Methodology for Analyzing Large-Scale Codebases
by: Zheng, Yusheng, et al.
Published: (2024)
by: Zheng, Yusheng, et al.
Published: (2024)
SECRET: Towards Scalable and Efficient Code Retrieval via Segmented Deep Hashing
by: Gu, Wenchao, et al.
Published: (2024)
by: Gu, Wenchao, et al.
Published: (2024)
Can User Feedback Help Issue Detection? An Empirical Study on a One-billion-user Online Service System
by: Jiang, Shuyao, et al.
Published: (2025)
by: Jiang, Shuyao, et al.
Published: (2025)
KVerus: Scalable and Resilient Formal Verification Proof Generation for Rust Code
by: Liu, Yuwei, et al.
Published: (2026)
by: Liu, Yuwei, et al.
Published: (2026)
CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases
by: Hoang, Anh Nguyen, et al.
Published: (2025)
by: Hoang, Anh Nguyen, et al.
Published: (2025)
HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation
by: Zheng, Dewu, et al.
Published: (2024)
by: Zheng, Dewu, et al.
Published: (2024)
SparseCoder: Identifier-Aware Sparse Transformer for File-Level Code Summarization
by: Wang, Yanlin, et al.
Published: (2024)
by: Wang, Yanlin, et al.
Published: (2024)
Rigor, Reliability, and Reproducibility Matter: A Decade-Scale Survey of 572 Code Benchmarks
by: Cao, Jialun, et al.
Published: (2025)
by: Cao, Jialun, et al.
Published: (2025)
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic
by: Zheng, Xin, et al.
Published: (2024)
by: Zheng, Xin, et al.
Published: (2024)
Large Language Model Unlearning for Source Code
by: Jiang, Xue, et al.
Published: (2025)
by: Jiang, Xue, et al.
Published: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
by: Mao, Yingzhi, et al.
Published: (2025)
by: Mao, Yingzhi, et al.
Published: (2025)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
by: Dai, Dekun, et al.
Published: (2025)
by: Dai, Dekun, et al.
Published: (2025)
A Large-Scale Evaluation for Log Parsing Techniques: How Far Are We?
by: Jiang, Zhihan, et al.
Published: (2023)
by: Jiang, Zhihan, et al.
Published: (2023)
A Preliminary Study on the Robustness of Code Generation by Large Language Models
by: Li, Zike, et al.
Published: (2025)
by: Li, Zike, et al.
Published: (2025)
Self-planning Code Generation with Large Language Models
by: Jiang, Xue, et al.
Published: (2023)
by: Jiang, Xue, et al.
Published: (2023)
Grey-Box Fuzzing in Constrained Ultra-Large Systems: Lessons for SE Community
by: Yu, Jiazhao, et al.
Published: (2025)
by: Yu, Jiazhao, et al.
Published: (2025)
Selecting and Combining Large Language Models for Scalable Code Clone Detection
by: Chochlov, Muslim, et al.
Published: (2025)
by: Chochlov, Muslim, et al.
Published: (2025)
A Survey of Large Language Models for Code: Evolution, Benchmarking, and Future Trends
by: Zheng, Zibin, et al.
Published: (2023)
by: Zheng, Zibin, et al.
Published: (2023)
MACAA: Belief-Revision Multi-Agent Reasoning for Code Authorship Verification
by: Ye, Jingwei, et al.
Published: (2026)
by: Ye, Jingwei, et al.
Published: (2026)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
by: Zheng, Dewu, et al.
Published: (2024)
by: Zheng, Dewu, et al.
Published: (2024)
UniCode: Augmenting Evaluation for Code Reasoning
by: Zheng, Xinyue, et al.
Published: (2025)
by: Zheng, Xinyue, et al.
Published: (2025)
Scalable Deductive Verification of Data-Level Parallel Programs
by: Haak, Lars B. van den, et al.
Published: (2026)
by: Haak, Lars B. van den, et al.
Published: (2026)
Efficient Black-Box Fault Localization for System-Level Test Code Using Large Language Models
by: Yaraghi, Ahmadreza Saboor, et al.
Published: (2025)
by: Yaraghi, Ahmadreza Saboor, et al.
Published: (2025)
NoCode-bench: A Benchmark for Evaluating Natural Language-Driven Feature Addition
by: Deng, Le, et al.
Published: (2025)
by: Deng, Le, et al.
Published: (2025)
Automated Repair of AI Code with Large Language Models and Formal Verification
by: Charalambous, Yiannis, et al.
Published: (2024)
by: Charalambous, Yiannis, et al.
Published: (2024)
Modularization is Better: Effective Code Generation with Modular Prompting
by: Pan, Ruwei, et al.
Published: (2025)
by: Pan, Ruwei, et al.
Published: (2025)
Similar Items
-
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024) -
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
by: Zheng, Jiasheng, et al.
Published: (2026) -
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
by: Zhu, Qiming, et al.
Published: (2024) -
Across Programming Language Silos: A Study on Cross-Lingual Retrieval-augmented Code Generation
by: Zhu, Qiming, et al.
Published: (2025) -
Multi-Facet Counterfactual Learning for Content Quality Evaluation
by: Zheng, Jiasheng, et al.
Published: (2024)