Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Das, Gunjan, Bhattacharya, Paheli, Gupta, Rishabh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Selective Shot Learning for Code Explanation
por: Bhattacharya, Paheli, et al.
Publicado: (2024)
por: Bhattacharya, Paheli, et al.
Publicado: (2024)
ReXCL: A Tool for Requirement Document Extraction and Classification
por: Bhattacharya, Paheli, et al.
Publicado: (2025)
por: Bhattacharya, Paheli, et al.
Publicado: (2025)
Read, Extract, Classify: A Tool for Smarter Requirements Engineering
por: Bhattacharya, Paheli, et al.
Publicado: (2026)
por: Bhattacharya, Paheli, et al.
Publicado: (2026)
A Survey on Evaluating Large Language Models in Code Generation Tasks
por: Chen, Liguo, et al.
Publicado: (2024)
por: Chen, Liguo, et al.
Publicado: (2024)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
por: Dai, Dekun, et al.
Publicado: (2025)
por: Dai, Dekun, et al.
Publicado: (2025)
On the Effectiveness of Large Language Models in Domain-Specific Code Generation
por: Gu, Xiaodong, et al.
Publicado: (2023)
por: Gu, Xiaodong, et al.
Publicado: (2023)
An Evaluation of Context Length Extrapolation in Long Code via Positional Embeddings and Efficient Attention
por: Ghosh, Madhusudan, et al.
Publicado: (2026)
por: Ghosh, Madhusudan, et al.
Publicado: (2026)
Fixing Large Language Models' Specification Misunderstanding for Better Code Generation
por: Tian, Zhao, et al.
Publicado: (2023)
por: Tian, Zhao, et al.
Publicado: (2023)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
por: Xiong, Zhanhang, et al.
Publicado: (2025)
por: Xiong, Zhanhang, et al.
Publicado: (2025)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
por: Ma, Lezhi, et al.
Publicado: (2024)
por: Ma, Lezhi, et al.
Publicado: (2024)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
por: Hu, Xing, et al.
Publicado: (2025)
por: Hu, Xing, et al.
Publicado: (2025)
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
por: Guo, Xiaoyu, et al.
Publicado: (2025)
por: Guo, Xiaoyu, et al.
Publicado: (2025)
From Online User Feedback to Requirements: Evaluating Large Language Models for Classification and Specification Tasks
por: Mallya, Manjeshwar Aniruddh, et al.
Publicado: (2025)
por: Mallya, Manjeshwar Aniruddh, et al.
Publicado: (2025)
Task Abstention for Large Language Models in Code Generation
por: Zhou, Yanke, et al.
Publicado: (2026)
por: Zhou, Yanke, et al.
Publicado: (2026)
Enhancing Cross-Language Code Translation via Task-Specific Embedding Alignment in Retrieval-Augmented Generation
por: Bhattarai, Manish, et al.
Publicado: (2024)
por: Bhattarai, Manish, et al.
Publicado: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
por: Meaden, James, et al.
Publicado: (2025)
por: Meaden, James, et al.
Publicado: (2025)
CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
por: Cheng, Cheng, et al.
Publicado: (2025)
por: Cheng, Cheng, et al.
Publicado: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
por: Padwal, Vedant
Publicado: (2026)
por: Padwal, Vedant
Publicado: (2026)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
por: Li, Yuangang, et al.
Publicado: (2026)
por: Li, Yuangang, et al.
Publicado: (2026)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
por: Peng, Zhiyuan, et al.
Publicado: (2025)
por: Peng, Zhiyuan, et al.
Publicado: (2025)
TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models
por: Tambon, Florian, et al.
Publicado: (2024)
por: Tambon, Florian, et al.
Publicado: (2024)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
por: Feng, Jia, et al.
Publicado: (2024)
por: Feng, Jia, et al.
Publicado: (2024)
Leveraging Design-Aware Context in Large Language Models for Code Comment Generation
por: Mitra, Aritra, et al.
Publicado: (2025)
por: Mitra, Aritra, et al.
Publicado: (2025)
Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern General-Purpose Large Language Models
por: Walczak, Jakub, et al.
Publicado: (2025)
por: Walczak, Jakub, et al.
Publicado: (2025)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
por: Chou, Jason, et al.
Publicado: (2025)
por: Chou, Jason, et al.
Publicado: (2025)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
por: Yan, Kaiwen, et al.
Publicado: (2025)
por: Yan, Kaiwen, et al.
Publicado: (2025)
Evaluating the Impact of Post-Training Quantization on Large Language Models for Code Generation
por: Giagnorio, Alessandro, et al.
Publicado: (2025)
por: Giagnorio, Alessandro, et al.
Publicado: (2025)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
por: Hou, Shuyang, et al.
Publicado: (2024)
por: Hou, Shuyang, et al.
Publicado: (2024)
Automatic Generation of Benchmarks and Reliable LLM Judgment for Code Tasks
por: Farchi, Eitan, et al.
Publicado: (2024)
por: Farchi, Eitan, et al.
Publicado: (2024)
Instructive Code Retriever: Learn from Large Language Model's Feedback for Code Intelligence Tasks
por: Lu, Jiawei, et al.
Publicado: (2024)
por: Lu, Jiawei, et al.
Publicado: (2024)
From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation
por: Xue, Zhantong, et al.
Publicado: (2025)
por: Xue, Zhantong, et al.
Publicado: (2025)
Specification-Driven Code Translation Powered by Large Language Models: How Far Are We?
por: Saha, Soumit Kanti, et al.
Publicado: (2024)
por: Saha, Soumit Kanti, et al.
Publicado: (2024)
ArchBench: Benchmarking Generative-AI for Software Architecture Tasks
por: Adnan, Bassam, et al.
Publicado: (2026)
por: Adnan, Bassam, et al.
Publicado: (2026)
How Effective are Large Language Models in Generating Software Specifications?
por: Xie, Danning, et al.
Publicado: (2023)
por: Xie, Danning, et al.
Publicado: (2023)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
por: Kammakomati, Mehant, et al.
Publicado: (2024)
por: Kammakomati, Mehant, et al.
Publicado: (2024)
Assessing Small Language Models for Code Generation: An Empirical Study with Benchmarks
por: Hasan, Md Mahade, et al.
Publicado: (2025)
por: Hasan, Md Mahade, et al.
Publicado: (2025)
Can Large Language Models Serve as Evaluators for Code Summarization?
por: Wu, Yang, et al.
Publicado: (2024)
por: Wu, Yang, et al.
Publicado: (2024)
Large Language Models for Code Generation: The Practitioners Perspective
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
Aligning Requirement for Large Language Model's Code Generation
por: Tian, Zhao, et al.
Publicado: (2025)
por: Tian, Zhao, et al.
Publicado: (2025)
Ejemplares similares
-
Selective Shot Learning for Code Explanation
por: Bhattacharya, Paheli, et al.
Publicado: (2024) -
ReXCL: A Tool for Requirement Document Extraction and Classification
por: Bhattacharya, Paheli, et al.
Publicado: (2025) -
Read, Extract, Classify: A Tool for Smarter Requirements Engineering
por: Bhattacharya, Paheli, et al.
Publicado: (2026) -
A Survey on Evaluating Large Language Models in Code Generation Tasks
por: Chen, Liguo, et al.
Publicado: (2024) -
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
por: Dai, Dekun, et al.
Publicado: (2025)