CUDABench: Benchmarking LLMs for Text-to-CUDA Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Jiace, Chen, Wentao, Fan, Qi, Ren, Zhixing, Wu, Junying, Chai, Xing Zhe, Rungrueangwutthinon, Chotiwit, Ma, Yehan, Zou, An |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
by: Chen, Wentao, et al.
Published: (2025)
by: Chen, Wentao, et al.
Published: (2025)
Path-Consistency with Prefix Enhancement for Efficient Inference in LLMs
by: Zhu, Jiace, et al.
Published: (2024)
by: Zhu, Jiace, et al.
Published: (2024)
TimeBill: Time-Budgeted Inference for Large Language Models
by: Fan, Qi, et al.
Published: (2025)
by: Fan, Qi, et al.
Published: (2025)
From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
by: Gong, Junfeng, et al.
Published: (2025)
by: Gong, Junfeng, et al.
Published: (2025)
When Benchmarks Leak: Inference-Time Decontamination for LLMs
by: Chai, Jianzhe, et al.
Published: (2026)
by: Chai, Jianzhe, et al.
Published: (2026)
KRAL: Knowledge and Reasoning Augmented Learning for LLM-assisted Clinical Antimicrobial Therapy
by: Li, Zhe, et al.
Published: (2025)
by: Li, Zhe, et al.
Published: (2025)
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
by: Dai, Weinan, et al.
Published: (2026)
by: Dai, Weinan, et al.
Published: (2026)
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
by: Lange, Robert Tjarko, et al.
Published: (2025)
by: Lange, Robert Tjarko, et al.
Published: (2025)
Fùxì: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation
by: Zhao, Shangqing, et al.
Published: (2025)
by: Zhao, Shangqing, et al.
Published: (2025)
Text-ADBench: Text Anomaly Detection Benchmark based on LLMs Embedding
by: Xiao, Feng, et al.
Published: (2025)
by: Xiao, Feng, et al.
Published: (2025)
Evaluating LLMs for Text-to-SQL Generation With Complex SQL Workload
by: Ma, Limin, et al.
Published: (2024)
by: Ma, Limin, et al.
Published: (2024)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
by: Wu, Fan, et al.
Published: (2026)
by: Wu, Fan, et al.
Published: (2026)
cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
by: Chen, Jinwu, et al.
Published: (2025)
by: Chen, Jinwu, et al.
Published: (2025)
Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation
by: Chong, Yee Hin, et al.
Published: (2026)
by: Chong, Yee Hin, et al.
Published: (2026)
Evaluating the Generalization Ability of Quantized LLMs: Benchmark, Analysis, and Toolbox
by: Liu, Yijun, et al.
Published: (2024)
by: Liu, Yijun, et al.
Published: (2024)
SINE: SINgle Image Editing with Text-to-Image Diffusion Models
by: Zhang, Zhixing, et al.
Published: (2022)
by: Zhang, Zhixing, et al.
Published: (2022)
Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?
by: Ye, Jing, et al.
Published: (2026)
by: Ye, Jing, et al.
Published: (2026)
GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization
by: Nimase, Ojas, et al.
Published: (2026)
by: Nimase, Ojas, et al.
Published: (2026)
Text-to-Layout: A Generative Workflow for Drafting Architectural Floor Plans Using LLMs
by: Duggempudi, Jayakrishna, et al.
Published: (2025)
by: Duggempudi, Jayakrishna, et al.
Published: (2025)
Text2GQL-Bench: A Text to Graph Query Language Benchmark [Experiment, Analysis & Benchmark]
by: Lyu, Songlin, et al.
Published: (2026)
by: Lyu, Songlin, et al.
Published: (2026)
Kevin: Multi-Turn RL for Generating CUDA Kernels
by: Baronio, Carlo, et al.
Published: (2025)
by: Baronio, Carlo, et al.
Published: (2025)
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
by: Li, Xiaoya, et al.
Published: (2025)
by: Li, Xiaoya, et al.
Published: (2025)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
by: Li, Youquan, et al.
Published: (2024)
by: Li, Youquan, et al.
Published: (2024)
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
by: Yang, Jialin, et al.
Published: (2025)
by: Yang, Jialin, et al.
Published: (2025)
EvoEngineer: Mastering Automated CUDA Kernel Code Evolution with Large Language Models
by: Guo, Ping, et al.
Published: (2025)
by: Guo, Ping, et al.
Published: (2025)
Can LLMs Solve ASP Problems? Insights from a Benchmarking Study (Extended Version)
by: Ren, Lin, et al.
Published: (2025)
by: Ren, Lin, et al.
Published: (2025)
Restoring urban streams to promote Biodiversity, Climate adaptation and to improve Quality of life
by: Wu, Yehan
Published: (2025)
by: Wu, Yehan
Published: (2025)
TextQuests: How Good are LLMs at Text-Based Video Games?
by: Phan, Long, et al.
Published: (2025)
by: Phan, Long, et al.
Published: (2025)
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
by: Hu, Mengkang, et al.
Published: (2025)
by: Hu, Mengkang, et al.
Published: (2025)
GBV-SQL: Guided Generation and SQL2Text Back-Translation Validation for Multi-Agent Text2SQL
by: Chen, Daojun, et al.
Published: (2025)
by: Chen, Daojun, et al.
Published: (2025)
DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis
by: Qi, Ruyi, et al.
Published: (2026)
by: Qi, Ruyi, et al.
Published: (2026)
From Retinal Evidence to Safe Decisions: RETINA-SAFE and ECRT for Hallucination Risk Triage in Medical LLMs
by: Yu, Zhe, et al.
Published: (2026)
by: Yu, Zhe, et al.
Published: (2026)
A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning
by: Wang, Zhe, et al.
Published: (2025)
by: Wang, Zhe, et al.
Published: (2025)
PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning
by: Pham, Hung Manh, et al.
Published: (2026)
by: Pham, Hung Manh, et al.
Published: (2026)
Jingfang: An LLM-Based Multi-Agent System for Precise Medical Consultation and Syndrome Differentiation in Traditional Chinese Medicine
by: Yang, Yehan, et al.
Published: (2025)
by: Yang, Yehan, et al.
Published: (2025)
SynBench: A Benchmark for Differentially Private Text Generation
by: Sun, Yidan, et al.
Published: (2025)
by: Sun, Yidan, et al.
Published: (2025)
SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation
by: Chen, Siqi, et al.
Published: (2025)
by: Chen, Siqi, et al.
Published: (2025)
Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs
by: Zhu, Longyuan, et al.
Published: (2026)
by: Zhu, Longyuan, et al.
Published: (2026)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
by: Zhou, Shijie, et al.
Published: (2025)
by: Zhou, Shijie, et al.
Published: (2025)
SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents
by: Si, Shuzheng, et al.
Published: (2023)
by: Si, Shuzheng, et al.
Published: (2023)
Similar Items
-
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
by: Chen, Wentao, et al.
Published: (2025) -
Path-Consistency with Prefix Enhancement for Efficient Inference in LLMs
by: Zhu, Jiace, et al.
Published: (2024) -
TimeBill: Time-Budgeted Inference for Large Language Models
by: Fan, Qi, et al.
Published: (2025) -
From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
by: Gong, Junfeng, et al.
Published: (2025) -
When Benchmarks Leak: Inference-Time Decontamination for LLMs
by: Chai, Jianzhe, et al.
Published: (2026)