Benchmarking Large Language Models with Integer Sequence Generation Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | O'Malley, Daniel, Bhattarai, Manish, Ranasinghe, Nishath Rajiv, Draayer, Erick, Santos, Javier |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Code Translation in Language Models with Few-Shot Learning via Retrieval-Augmented Generation
par: Bhattarai, Manish, et autres
Publié: (2024)
par: Bhattarai, Manish, et autres
Publié: (2024)
Enhancing Cross-Language Code Translation via Task-Specific Embedding Alignment in Retrieval-Augmented Generation
par: Bhattarai, Manish, et autres
Publié: (2024)
par: Bhattarai, Manish, et autres
Publié: (2024)
ARCS: Agentic Retrieval-Augmented Code Synthesis with Iterative Refinement
par: Bhattarai, Manish, et autres
Publié: (2025)
par: Bhattarai, Manish, et autres
Publié: (2025)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
par: Bhattarai, Manish, et autres
Publié: (2026)
par: Bhattarai, Manish, et autres
Publié: (2026)
LLM-Assisted Translation of Legacy FORTRAN Codes to C++: A Cross-Platform Study
par: Ranasinghe, Nishath Rajiv, et autres
Publié: (2025)
par: Ranasinghe, Nishath Rajiv, et autres
Publié: (2025)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
par: Most, Alexander, et autres
Publié: (2025)
par: Most, Alexander, et autres
Publié: (2025)
Task Abstention for Large Language Models in Code Generation
par: Zhou, Yanke, et autres
Publié: (2026)
par: Zhou, Yanke, et autres
Publié: (2026)
TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models
par: Tambon, Florian, et autres
Publié: (2024)
par: Tambon, Florian, et autres
Publié: (2024)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
par: He, Yibo, et autres
Publié: (2025)
par: He, Yibo, et autres
Publié: (2025)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
par: Hou, Shuyang, et autres
Publié: (2024)
par: Hou, Shuyang, et autres
Publié: (2024)
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
par: Meaden, James, et autres
Publié: (2025)
par: Meaden, James, et autres
Publié: (2025)
How Propense Are Large Language Models at Producing Code Smells? A Benchmarking Study
par: Velasco, Alejandro, et autres
Publié: (2024)
par: Velasco, Alejandro, et autres
Publié: (2024)
ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation
par: Xiang, Jiahui, et autres
Publié: (2025)
par: Xiang, Jiahui, et autres
Publié: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
par: Padwal, Vedant
Publié: (2026)
par: Padwal, Vedant
Publié: (2026)
Automated Benchmark Generation for Repository-Level Coding Tasks
par: Vergopoulos, Konstantinos, et autres
Publié: (2025)
par: Vergopoulos, Konstantinos, et autres
Publié: (2025)
A Tertiary Review of Large Language Model-Based Code Generating Tasks: Trends, Challenges, and Future Directions
par: Chochlov, Muslim, et autres
Publié: (2026)
par: Chochlov, Muslim, et autres
Publié: (2026)
Energy-Aware Code Generation with LLMs: Benchmarking Small vs. Large Language Models for Sustainable AI Programming
par: Ashraf, Humza, et autres
Publié: (2025)
par: Ashraf, Humza, et autres
Publié: (2025)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026)
par: Li, Yuangang, et autres
Publié: (2026)
EmbedAgent: Benchmarking Large Language Models in Embedded System Development
par: Xu, Ruiyang, et autres
Publié: (2025)
par: Xu, Ruiyang, et autres
Publié: (2025)
Are Large Language Models Memorizing Bug Benchmarks?
par: Ramos, Daniel, et autres
Publié: (2024)
par: Ramos, Daniel, et autres
Publié: (2024)
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
par: Liu, Jingjing, et autres
Publié: (2025)
par: Liu, Jingjing, et autres
Publié: (2025)
E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
par: Liu, Jingyao, et autres
Publié: (2025)
par: Liu, Jingyao, et autres
Publié: (2025)
Code Red! On the Harmfulness of Applying Off-the-shelf Large Language Models to Programming Tasks
par: Al-Kaswan, Ali, et autres
Publié: (2025)
par: Al-Kaswan, Ali, et autres
Publié: (2025)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
par: Zhang, Tanghaoran, et autres
Publié: (2026)
par: Zhang, Tanghaoran, et autres
Publié: (2026)
Insights from Benchmarking Frontier Language Models on Web App Code Generation
par: Cui, Yi
Publié: (2024)
par: Cui, Yi
Publié: (2024)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
par: Adamenko, Pavel, et autres
Publié: (2025)
par: Adamenko, Pavel, et autres
Publié: (2025)
Personality-Guided Code Generation Using Large Language Models
par: Guo, Yaoqi, et autres
Publié: (2024)
par: Guo, Yaoqi, et autres
Publié: (2024)
Large Language Model Guided Self-Debugging Code Generation
par: Adnan, Muntasir, et autres
Publié: (2025)
par: Adnan, Muntasir, et autres
Publié: (2025)
Guiding Large Language Models to Generate Computer-Parsable Content
par: Wang, Jiaye
Publié: (2024)
par: Wang, Jiaye
Publié: (2024)
Bugs in Large Language Models Generated Code: An Empirical Study
par: Tambon, Florian, et autres
Publié: (2024)
par: Tambon, Florian, et autres
Publié: (2024)
Model-Driven Quantum Code Generation Using Large Language Models and Retrieval-Augmented Generation
par: Siavash, Nazanin, et autres
Publié: (2025)
par: Siavash, Nazanin, et autres
Publié: (2025)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
par: Zheng, Jiasheng, et autres
Publié: (2024)
par: Zheng, Jiasheng, et autres
Publié: (2024)
A Preliminary Study of Multilingual Code Language Models for Code Generation Task Using Translated Benchmarks
par: Dandamudi, Rohit, et autres
Publié: (2024)
par: Dandamudi, Rohit, et autres
Publié: (2024)
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
par: Qiu, Jielin, et autres
Publié: (2025)
par: Qiu, Jielin, et autres
Publié: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
par: Yin, Wenjing, et autres
Publié: (2025)
par: Yin, Wenjing, et autres
Publié: (2025)
Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents
par: Wang, Kaixin, et autres
Publié: (2025)
par: Wang, Kaixin, et autres
Publié: (2025)
Accurate and Consistent Graph Model Generation from Text with Large Language Models
par: Chen, Boqi, et autres
Publié: (2025)
par: Chen, Boqi, et autres
Publié: (2025)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
par: Xiong, Zhanhang, et autres
Publié: (2025)
par: Xiong, Zhanhang, et autres
Publié: (2025)
Large Language Models as Test Case Generators: Performance Evaluation and Enhancement
par: Li, Kefan, et autres
Publié: (2024)
par: Li, Kefan, et autres
Publié: (2024)
Combining Large Language Models with Static Analyzers for Code Review Generation
par: Jaoua, Imen, et autres
Publié: (2025)
par: Jaoua, Imen, et autres
Publié: (2025)
Documents similaires
-
Enhancing Code Translation in Language Models with Few-Shot Learning via Retrieval-Augmented Generation
par: Bhattarai, Manish, et autres
Publié: (2024) -
Enhancing Cross-Language Code Translation via Task-Specific Embedding Alignment in Retrieval-Augmented Generation
par: Bhattarai, Manish, et autres
Publié: (2024) -
ARCS: Agentic Retrieval-Augmented Code Synthesis with Iterative Refinement
par: Bhattarai, Manish, et autres
Publié: (2025) -
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
par: Bhattarai, Manish, et autres
Publié: (2026) -
LLM-Assisted Translation of Legacy FORTRAN Codes to C++: A Cross-Platform Study
par: Ranasinghe, Nishath Rajiv, et autres
Publié: (2025)