Evaluating the Process Modeling Abilities of Large Language Models -- Preliminary Foundations and Results
Fuente:
arXiv
Guardado en:
| Autores principales: | Fettke, Peter, Houy, Constantin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluation and Improvement of Fault Detection for Large Language Models
por: Hu, Qiang, et al.
Publicado: (2024)
por: Hu, Qiang, et al.
Publicado: (2024)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
por: Yang, Rem, et al.
Publicado: (2025)
por: Yang, Rem, et al.
Publicado: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
por: Tong, Weixi, et al.
Publicado: (2024)
por: Tong, Weixi, et al.
Publicado: (2024)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
por: Jain, Naman, et al.
Publicado: (2024)
por: Jain, Naman, et al.
Publicado: (2024)
The Impact of Hyperparameters on Large Language Model Inference Performance: An Evaluation of vLLM and HuggingFace Pipelines
por: Martinez, Matias
Publicado: (2024)
por: Martinez, Matias
Publicado: (2024)
Evaluating Language Models for Efficient Code Generation
por: Liu, Jiawei, et al.
Publicado: (2024)
por: Liu, Jiawei, et al.
Publicado: (2024)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
por: Riddell, Martin, et al.
Publicado: (2024)
por: Riddell, Martin, et al.
Publicado: (2024)
Can It Edit? Evaluating the Ability of Large Language Models to Follow Code Editing Instructions
por: Cassano, Federico, et al.
Publicado: (2023)
por: Cassano, Federico, et al.
Publicado: (2023)
OptLLM: Optimal Assignment of Queries to Large Language Models
por: Liu, Yueyue, et al.
Publicado: (2024)
por: Liu, Yueyue, et al.
Publicado: (2024)
SODBench: A Large Language Model Approach to Documenting Spreadsheet Operations
por: Indika, Amila, et al.
Publicado: (2025)
por: Indika, Amila, et al.
Publicado: (2025)
Exploring Large Language Models for Translating Romanian Computational Problems into English
por: Dumitran, Adrian Marius, et al.
Publicado: (2025)
por: Dumitran, Adrian Marius, et al.
Publicado: (2025)
Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models
por: Jin, Bihui, et al.
Publicado: (2025)
por: Jin, Bihui, et al.
Publicado: (2025)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
por: Haider, Md. Asif, et al.
Publicado: (2024)
por: Haider, Md. Asif, et al.
Publicado: (2024)
Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language Models
por: Weyssow, Martin, et al.
Publicado: (2023)
por: Weyssow, Martin, et al.
Publicado: (2023)
EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming
por: Fang, Sen, et al.
Publicado: (2025)
por: Fang, Sen, et al.
Publicado: (2025)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
por: Abdelaal, Mohamed, et al.
Publicado: (2025)
por: Abdelaal, Mohamed, et al.
Publicado: (2025)
Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
por: Guo, Siyuan, et al.
Publicado: (2025)
por: Guo, Siyuan, et al.
Publicado: (2025)
DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence
por: Guo, Daya, et al.
Publicado: (2024)
por: Guo, Daya, et al.
Publicado: (2024)
Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study
por: Li, Yufei, et al.
Publicado: (2024)
por: Li, Yufei, et al.
Publicado: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
por: Dong, Yihong, et al.
Publicado: (2026)
por: Dong, Yihong, et al.
Publicado: (2026)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
por: Guo, Jiawei, et al.
Publicado: (2024)
por: Guo, Jiawei, et al.
Publicado: (2024)
Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation
por: Ruiz, Fernando Vallecillos, et al.
Publicado: (2024)
por: Ruiz, Fernando Vallecillos, et al.
Publicado: (2024)
CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences
por: Weyssow, Martin, et al.
Publicado: (2024)
por: Weyssow, Martin, et al.
Publicado: (2024)
NExT: Teaching Large Language Models to Reason about Code Execution
por: Ni, Ansong, et al.
Publicado: (2024)
por: Ni, Ansong, et al.
Publicado: (2024)
TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models
por: Park, Chansung, et al.
Publicado: (2026)
por: Park, Chansung, et al.
Publicado: (2026)
WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning
por: Jiang, Juyong, et al.
Publicado: (2026)
por: Jiang, Juyong, et al.
Publicado: (2026)
REFLEX: Reference-Free Evaluation of Log Summarization via Large Language Model Judgment
por: Mudgal, Priyanka
Publicado: (2025)
por: Mudgal, Priyanka
Publicado: (2025)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
por: Wang, Xinchen, et al.
Publicado: (2025)
por: Wang, Xinchen, et al.
Publicado: (2025)
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
por: Jiang, Juyong, et al.
Publicado: (2026)
por: Jiang, Juyong, et al.
Publicado: (2026)
Can OpenSource beat ChatGPT? -- A Comparative Study of Large Language Models for Text-to-Code Generation
por: Mayer, Luis, et al.
Publicado: (2024)
por: Mayer, Luis, et al.
Publicado: (2024)
SIMCOPILOT: Evaluating Large Language Models for Copilot-Style Code Generation
por: Jiang, Mingchao, et al.
Publicado: (2025)
por: Jiang, Mingchao, et al.
Publicado: (2025)
TOSSS: a CVE-based Software Security Benchmark for Large Language Models
por: Damie, Marc, et al.
Publicado: (2026)
por: Damie, Marc, et al.
Publicado: (2026)
Towards Understanding What Code Language Models Learned
por: Ahmed, Toufique, et al.
Publicado: (2023)
por: Ahmed, Toufique, et al.
Publicado: (2023)
Mass-Producing Failures of Multimodal Systems with Language Models
por: Tong, Shengbang, et al.
Publicado: (2023)
por: Tong, Shengbang, et al.
Publicado: (2023)
code_transformed: The Influence of Large Language Models on Code
por: Xu, Yuliang, et al.
Publicado: (2025)
por: Xu, Yuliang, et al.
Publicado: (2025)
CODEMENV: Benchmarking Large Language Models on Code Migration
por: Cheng, Keyuan, et al.
Publicado: (2025)
por: Cheng, Keyuan, et al.
Publicado: (2025)
Neuron Patching: Semantic-based Neuron-level Language Model Repair for Code Generation
por: Gu, Jian, et al.
Publicado: (2023)
por: Gu, Jian, et al.
Publicado: (2023)
Investigating the Efficacy of Large Language Models for Code Clone Detection
por: Khajezade, Mohamad, et al.
Publicado: (2024)
por: Khajezade, Mohamad, et al.
Publicado: (2024)
Applying Large Language Models API to Issue Classification Problem
por: Aracena, Gabriel, et al.
Publicado: (2024)
por: Aracena, Gabriel, et al.
Publicado: (2024)
The Impact of Fine-tuning Large Language Models on Automated Program Repair
por: Macháček, Roman, et al.
Publicado: (2025)
por: Macháček, Roman, et al.
Publicado: (2025)
Ejemplares similares
-
Evaluation and Improvement of Fault Detection for Large Language Models
por: Hu, Qiang, et al.
Publicado: (2024) -
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
por: Yang, Rem, et al.
Publicado: (2025) -
CodeJudge: Evaluating Code Generation with Large Language Models
por: Tong, Weixi, et al.
Publicado: (2024) -
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
por: Jain, Naman, et al.
Publicado: (2024) -
The Impact of Hyperparameters on Large Language Model Inference Performance: An Evaluation of vLLM and HuggingFace Pipelines
por: Martinez, Matias
Publicado: (2024)