SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Yibo, Zhao, Shuoran, Huang, Jiaming, Fu, Yingjie, Yu, Hao, Huang, Cunjian, Xie, Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RVISmith: Fuzzing Compilers for RVV Intrinsics
par: He, Yibo, et autres
Publié: (2025)
par: He, Yibo, et autres
Publié: (2025)
The First Prompt Counts the Most! An Evaluation of Large Language Models on Iterative Example-Based Code Generation
par: Fu, Yingjie, et autres
Publié: (2024)
par: Fu, Yingjie, et autres
Publié: (2024)
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
par: Li, Linyi, et autres
Publié: (2024)
par: Li, Linyi, et autres
Publié: (2024)
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
par: Guo, Xiaoyu, et autres
Publié: (2025)
par: Guo, Xiaoyu, et autres
Publié: (2025)
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
par: Liu, Chenxu, et autres
Publié: (2026)
par: Liu, Chenxu, et autres
Publié: (2026)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
par: Chou, Jason, et autres
Publié: (2025)
par: Chou, Jason, et autres
Publié: (2025)
BackportBench: A Multilingual Benchmark for Automated Backporting of Patches
par: Zhong, Zhiqing, et autres
Publié: (2025)
par: Zhong, Zhiqing, et autres
Publié: (2025)
DSCodeBench: A Realistic Benchmark for Data Science Code Generation
par: Ouyang, Shuyin, et autres
Publié: (2025)
par: Ouyang, Shuyin, et autres
Publié: (2025)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
par: Huang, Dong, et autres
Publié: (2024)
par: Huang, Dong, et autres
Publié: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
VecIntrinBench: Benchmarking Cross-Architecture Intrinsic Code Migration for RISC-V Vector
par: Han, Liutong, et autres
Publié: (2025)
par: Han, Liutong, et autres
Publié: (2025)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
par: Xie, Yiqing, et autres
Publié: (2024)
par: Xie, Yiqing, et autres
Publié: (2024)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
par: Padwal, Vedant
Publié: (2026)
par: Padwal, Vedant
Publié: (2026)
DeCon: Detecting Incorrect Assertions via Postconditions Generated by a Large Language Model
par: Yu, Hao, et autres
Publié: (2025)
par: Yu, Hao, et autres
Publié: (2025)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
par: Yu, Hao, et autres
Publié: (2023)
par: Yu, Hao, et autres
Publié: (2023)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
par: Peng, Zhiyuan, et autres
Publié: (2025)
par: Peng, Zhiyuan, et autres
Publié: (2025)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
par: Wang, Jiexin, et autres
Publié: (2024)
par: Wang, Jiexin, et autres
Publié: (2024)
Efficient Code Analysis via Graph-Guided Large Language Models
par: Gao, Hang, et autres
Publié: (2026)
par: Gao, Hang, et autres
Publié: (2026)
OSS-Bench: Benchmark Generator for Coding LLMs
par: Jiang, Yuancheng, et autres
Publié: (2025)
par: Jiang, Yuancheng, et autres
Publié: (2025)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
par: Aleithan, Reem, et autres
Publié: (2024)
par: Aleithan, Reem, et autres
Publié: (2024)
Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging
par: Hua, Ziyue, et autres
Publié: (2026)
par: Hua, Ziyue, et autres
Publié: (2026)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
par: Yin, Wenjing, et autres
Publié: (2025)
par: Yin, Wenjing, et autres
Publié: (2025)
Knowledge-Aware Code Generation with Large Language Models
par: Huang, Tao, et autres
Publié: (2024)
par: Huang, Tao, et autres
Publié: (2024)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
par: Wang, Sizhe, et autres
Publié: (2025)
par: Wang, Sizhe, et autres
Publié: (2025)
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Aligning Requirement for Large Language Model's Code Generation
par: Tian, Zhao, et autres
Publié: (2025)
par: Tian, Zhao, et autres
Publié: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
par: Wang, Peiding, et autres
Publié: (2025)
par: Wang, Peiding, et autres
Publié: (2025)
CodeRAG-Bench: Can Retrieval Augment Code Generation?
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
Designing and Implementing a Generator Framework for a SIMD Abstraction Library
par: Pietrzyk, Johannes, et autres
Publié: (2024)
par: Pietrzyk, Johannes, et autres
Publié: (2024)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
SELF-REDRAFT: Eliciting Intrinsic Exploration-Exploitation Balance in Test-Time Scaling for Code Generation
par: Chen, Yixiang, et autres
Publié: (2025)
par: Chen, Yixiang, et autres
Publié: (2025)
TESTEVAL: Benchmarking Large Language Models for Test Case Generation
par: Wang, Wenhan, et autres
Publié: (2024)
par: Wang, Wenhan, et autres
Publié: (2024)
RubberDuckBench: A Benchmark for AI Coding Assistants
par: Mohammed, Ferida, et autres
Publié: (2026)
par: Mohammed, Ferida, et autres
Publié: (2026)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
par: Das, Gunjan, et autres
Publié: (2025)
par: Das, Gunjan, et autres
Publié: (2025)
Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems
par: Wang, Yilun, et autres
Publié: (2026)
par: Wang, Yilun, et autres
Publié: (2026)
AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion Generation
par: Pulavarthi, Vaishnavi, et autres
Publié: (2024)
par: Pulavarthi, Vaishnavi, et autres
Publié: (2024)
JMigBench: A Benchmark for Evaluating LLMs on Source Code Migration (Java 8 to Java 11)
par: Amin, Nishil, et autres
Publié: (2026)
par: Amin, Nishil, et autres
Publié: (2026)
Towards Understanding the Characteristics of Code Generation Errors Made by Large Language Models
par: Wang, Zhijie, et autres
Publié: (2024)
par: Wang, Zhijie, et autres
Publié: (2024)
Can Large Language Models Generate Geospatial Code?
par: Hou, Shuyang, et autres
Publié: (2024)
par: Hou, Shuyang, et autres
Publié: (2024)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
par: Yan, Kaiwen, et autres
Publié: (2025)
par: Yan, Kaiwen, et autres
Publié: (2025)
Documents similaires
-
RVISmith: Fuzzing Compilers for RVV Intrinsics
par: He, Yibo, et autres
Publié: (2025) -
The First Prompt Counts the Most! An Evaluation of Large Language Models on Iterative Example-Based Code Generation
par: Fu, Yingjie, et autres
Publié: (2024) -
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
par: Li, Linyi, et autres
Publié: (2024) -
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
par: Guo, Xiaoyu, et autres
Publié: (2025) -
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
par: Liu, Chenxu, et autres
Publié: (2026)