BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhuo, Terry Yue, Jin, Xiaolong, Liu, Hange, Jiang, Juyong, Liu, Tianyang, Gong, Chen, Bishnoi, Bhupesh, Mishra, Vaisakhi, Suppa, Marek, Ziems, Noah, Utpala, Saiteja, Xu, Ming, Song, Guangyu, Li, Kaixin, Cao, Yuhan, Liu, Bo, Liu, Zheng, Abdurakhmanova, Sabina, Yu, Wenhao, Jia, Mengzhao, Yao, Jihan, Hamilton, Kenneth, Shridhar, Kumar, Vu, Minh Chien, Wang, Dingmin, Liu, Jiawei, Wang, Zijian, Liu, Qian, Hui, Binyuan, Risdal, Meg, Khaliq, Ahsen, Sood, Atin, Xing, Zhenchang, Ahmad, Wasi Uddin, Grundy, John, Lo, David, Zhu, Banghua, Du, Xiaoning, Scholak, Torsten, von Werra, Leandro |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards a Science of AI Agent Reliability
von: Rabanser, Stephan, et al.
Veröffentlicht: (2026)
von: Rabanser, Stephan, et al.
Veröffentlicht: (2026)
OctoPack: Instruction Tuning Code Large Language Models
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2023)
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2023)
IFEvalCode: Controlled Code Generation
von: Yang, Jian, et al.
Veröffentlicht: (2025)
von: Yang, Jian, et al.
Veröffentlicht: (2025)
SelfCodeAlign: Self-Alignment for Code Generation
von: Wei, Yuxiang, et al.
Veröffentlicht: (2024)
von: Wei, Yuxiang, et al.
Veröffentlicht: (2024)
FAITH, HISTORY, AND EXPERIENCE: MOTIVATIONS FOR VISITING BUKHARA
von: Abdurakhmanova, Zarnigor
Veröffentlicht: (2025)
von: Abdurakhmanova, Zarnigor
Veröffentlicht: (2025)
Evaluating and Achieving Controllable Code Completion in Code LLM
von: Zhang, Jiajun, et al.
Veröffentlicht: (2026)
von: Zhang, Jiajun, et al.
Veröffentlicht: (2026)
Function-Correcting Codes with Homogeneous Distance
von: Liu, Huiying, et al.
Veröffentlicht: (2025)
von: Liu, Huiying, et al.
Veröffentlicht: (2025)
CodingHomo: Bootstrapping Deep Homography With Video Coding
von: Liu, Yike, et al.
Veröffentlicht: (2025)
von: Liu, Yike, et al.
Veröffentlicht: (2025)
Code of MaGIoT
von: Yifan, Liu
Veröffentlicht: (2025)
von: Yifan, Liu
Veröffentlicht: (2025)
Letter: Re‐Examining Seton Efficacy in Perianal Crohn's Disease—Considerations for Outcome Measurement and Clinical Interpretation
von: Dingsheng Liu, et al.
Veröffentlicht: (2025)
von: Dingsheng Liu, et al.
Veröffentlicht: (2025)
Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models
von: Zhuo, Terry Yue, et al.
Veröffentlicht: (2024)
von: Zhuo, Terry Yue, et al.
Veröffentlicht: (2024)
Codes from Goppa codes
von: Liu, Chunlei
Veröffentlicht: (2023)
von: Liu, Chunlei
Veröffentlicht: (2023)
One-Shot Coding and Applications
von: Liu, Yanxiao
Veröffentlicht: (2025)
von: Liu, Yanxiao
Veröffentlicht: (2025)
DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
EMOTIONAL INTELLIGENCE AND SERVICE QUALITY IN ZIYORAT TOURISM HOTELS
von: Abdurakhmanova Nargiza Rustamovna
Veröffentlicht: (2026)
von: Abdurakhmanova Nargiza Rustamovna
Veröffentlicht: (2026)
MASAI: Modular Architecture for Software-engineering AI Agents
von: Arora, Daman, et al.
Veröffentlicht: (2024)
von: Arora, Daman, et al.
Veröffentlicht: (2024)
New Constructions of Optimal Binary LCD Codes
von: Wang, Guodong, et al.
Veröffentlicht: (2023)
von: Wang, Guodong, et al.
Veröffentlicht: (2023)
Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
von: Bao, Keqin, et al.
Veröffentlicht: (2025)
von: Bao, Keqin, et al.
Veröffentlicht: (2025)
SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades
von: Lam, Man Ho, et al.
Veröffentlicht: (2026)
von: Lam, Man Ho, et al.
Veröffentlicht: (2026)
Channel Coding based on Skew Polynomials and Multivariate Polynomials
von: Liu, Hedongliang
Veröffentlicht: (2025)
von: Liu, Hedongliang
Veröffentlicht: (2025)
Twisted Fiber Bundle Codes over Group Algebras
von: Liu, Chaobin
Veröffentlicht: (2026)
von: Liu, Chaobin
Veröffentlicht: (2026)
From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?
von: Ahmad, Wasi Uddin, et al.
Veröffentlicht: (2025)
von: Ahmad, Wasi Uddin, et al.
Veröffentlicht: (2025)
Video Coding with Cross-Component Sample Offset
von: Gao, Han, et al.
Veröffentlicht: (2024)
von: Gao, Han, et al.
Veröffentlicht: (2024)
Lattice Codes for CRYSTALS-Kyber
von: Liu, Shuiyin, et al.
Veröffentlicht: (2023)
von: Liu, Shuiyin, et al.
Veröffentlicht: (2023)
Evaluating LLMs Code Reasoning Under Real-World Context
von: Liu, Changshu
Veröffentlicht: (2026)
von: Liu, Changshu
Veröffentlicht: (2026)
From Context to Intent: Reasoning-Guided Function-Level Code Completion
von: Li, Yanzhou, et al.
Veröffentlicht: (2025)
von: Li, Yanzhou, et al.
Veröffentlicht: (2025)
I3DE: An IDE for Inspecting Inconsistencies in PL/SQL Code
von: Liu, Jiangshan, et al.
Veröffentlicht: (2024)
von: Liu, Jiangshan, et al.
Veröffentlicht: (2024)
CodeMind: Evaluating Large Language Models for Code Reasoning
von: Liu, Changshu, et al.
Veröffentlicht: (2024)
von: Liu, Changshu, et al.
Veröffentlicht: (2024)
Graph-Regularized Learning of Gaussian Mixture Models
von: Abdurakhmanova, Shamsiiat, et al.
Veröffentlicht: (2025)
von: Abdurakhmanova, Shamsiiat, et al.
Veröffentlicht: (2025)
Bridging the Version Gap: Multi-version Training Improves ICD Code Prediction, Especially for Rare Codes
von: Liu, Jinghui, et al.
Veröffentlicht: (2026)
von: Liu, Jinghui, et al.
Veröffentlicht: (2026)
Clean Code In Practice: Challenges and Opportunities
von: Yan, Dapeng, et al.
Veröffentlicht: (2025)
von: Yan, Dapeng, et al.
Veröffentlicht: (2025)
Cautious Optimizers: Improving Training with One Line of Code
von: Liang, Kaizhao, et al.
Veröffentlicht: (2024)
von: Liang, Kaizhao, et al.
Veröffentlicht: (2024)
CodeChemist: Functional Knowledge Transfer for Low-Resource Code Generation via Test-Time Scaling
von: Wang, Kaixin, et al.
Veröffentlicht: (2025)
von: Wang, Kaixin, et al.
Veröffentlicht: (2025)
An Evaluation on the Role of Non-Coding RNA in HIV Transcription and Latency: A Review
von: Liu, Xiangshuai
Veröffentlicht: (2025)
von: Liu, Xiangshuai
Veröffentlicht: (2025)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
von: Zhang, Zhe, et al.
Veröffentlicht: (2025)
von: Zhang, Zhe, et al.
Veröffentlicht: (2025)
CODESTRUCT: Code Agents over Structured Action Spaces
von: Kim, Myeongsoo, et al.
Veröffentlicht: (2026)
von: Kim, Myeongsoo, et al.
Veröffentlicht: (2026)
About the Rankin and Bergé-Martinet Constants from a Coding Theory View Point
von: Oggier, Frédérique, et al.
Veröffentlicht: (2025)
von: Oggier, Frédérique, et al.
Veröffentlicht: (2025)
Automatically Recommend Code Updates: Are We There Yet?
von: Liu, Yue, et al.
Veröffentlicht: (2022)
von: Liu, Yue, et al.
Veröffentlicht: (2022)
Column Twisted Reed-Solomon Codes as MDS Codes
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
Lemur: Harmonizing Natural Language and Code for Language Agents
von: Xu, Yiheng, et al.
Veröffentlicht: (2023)
von: Xu, Yiheng, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Towards a Science of AI Agent Reliability
von: Rabanser, Stephan, et al.
Veröffentlicht: (2026) -
OctoPack: Instruction Tuning Code Large Language Models
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2023) -
IFEvalCode: Controlled Code Generation
von: Yang, Jian, et al.
Veröffentlicht: (2025) -
SelfCodeAlign: Self-Alignment for Code Generation
von: Wei, Yuxiang, et al.
Veröffentlicht: (2024) -
FAITH, HISTORY, AND EXPERIENCE: MOTIVATIONS FOR VISITING BUKHARA
von: Abdurakhmanova, Zarnigor
Veröffentlicht: (2025)